光伏大数据平台技术方案
项目概述01
平台建设02
平台规划03
平台特点04
目录
加入星球获取更多更全的数智化解决方案
项目建设背景
日前印发的《关于积极推进“互联网+ ”行动的指导意见》针对“互
联网+智慧能源”专项中指出,“推进能源生产智能化”,“鼓励能源
企业运用大数据技术对设备状态、电能负载等数据进行分析挖掘
与预测,开展精准调度、故障判断和预测性维护,提高能源利用
效率和安全稳定运行水平”;建设分布式能源网络,构建智能化电
力运行监测、管理技术平台,使电力设备和用电终端基于互联网
进行双向通信和智能调控,实现分布式电源的及时有效接入,逐
步建成开放共享的能源网络
政策导向
产业发展
立足陕西、幅射西北,面向全国提供全方位的新能源数据资源服
务,促进新能源产业可持续健康发展。整某省市内现有光伏电站
(大型并网、分布式光伏)以及相关的气象,某著名企业等各类
数据资源,结合新能源产业发展需求,建设支撑光伏新能源资源
评估、电站选址优化、电站建设、生产运营、集中管理决策等业
务的大数据平台,并提供电站运维、电力预测等专业化数据服务
现状和问题
光伏电站
气象部门
配电所电力公司
运维机构 投资商
生产商家
光伏生态体系
缺少具有公信力的光伏能源大数据应用服务平台:目前,
在能源发电领域,无论光伏还是风电发电,在行业内多存
在管理粗放、不够精细化、没有监控、缺少数据分析、气
象应用功能重复建设等问题,不能服务于光伏电站规划、
设计、生产、管理和运行工作,因此,需要将建立一个能
源数据和信息互联网平台,通过统一的标准、统一的语言
对分布式能源进行管理和服务。
光伏电站质量参差不齐是一直困扰着光伏电站交易、融资、
证券化发展的重要问题
项目概述01
平台建设02
平台规划03
平台特点04
目录
平台架构
计
算
存
储
镜
像
测
量
虚拟化
部署管理
任务管理
计
算
存
储
镜
像
测
量
虚拟化
计
算
存
储
镜
像
测
量
虚拟化
计
算
存
储
镜
像
测
量
虚拟化
计
算
存
储
镜
像
测
量
虚拟化
结构化 半结构化 非结构化 实时 批量 手工
数据类型 采集方式
数据统计
OLAP分析
数据挖掘
数据可视
化
机器学习
资源管理
集群监控
即席查询
安全管理
基础资源池
数据采集
数据存储
应用开发
支撑平台
综合管控
NOSQL
计
算
存
储
镜
像
测
量
虚拟化系统管理
与运维
Hadoop
MR 结构化实时流
数据分析
调度管理
MPP SQL
应用开
发接口
大数据应用政府信息管理系统
消息报警
数据仓库
数据抽
取装载
电站远程运维系统 光功率预测系统
本项目基于璞华大数据
公司提供的大数据平台
建设光伏数据存储分析
平台
基于璞华大数据平台提
供数据的存储与计算能
力、数据的维护与管理
能力
基于璞华大数据可视话
分析平台提供分析与可
视化展现能力
数据采集分析
采集内容 采集方式 实时性 更新频率 数据格式
光伏电站信息数据
某著名企业配置数
据
手工、导入 离线 低 静态
光伏电站运营数据 手工、导入、系
统
离线 中 表格
气象数据 数据交换 准实时 高 XML、文本
航拍、监控视频数
据
视频上传 离线 低 视频
电站实时运行数据
某著名企业用户侧
用电数据
系统、协议 实时 高 键值对
Hadoop分布式文件系统
数据采集-实时性
分布式消息队列集群
分布式
采集层、
调度层
采集输入
TCP
TCP
TCP
TCP
hdfs
分布式流计算
串口
智能网关
数
据
转
发
大型并网电站
SCADA系统
小型分布式电站
kafaka
主备
采集前置机升压站
综合自动化系统
数据转发
通信规约
(IEC104)
数据转发
通信规约
(IEC104)
厂站端 大数据平台
数据采集-准实时性
天气
辐照
气象局
生成文件
WebService
服务
SOAP
Hadoop分布式文件系统
SOAP
WSDL WSDL
数据采集-批量
光伏电站信息数据
某著名企业配置数
据
光伏电站运营数据
运营表格文件
航拍监控视频
数据文件模板导入
文件上传
数据库直连
自动文件上传
excel导入
JDBC、
ODBC
手动
FTP
Hadoop分布式文件系统
数据收集网关 - 硬件配置
数据收集网关 - 软件配置
数据收集网关 - 应用功能
数据存储-分布式文件系统
HDFS:分布式文件系统
有较强的容错性
可在x86平台上运行,减少总体成
本
可扩展,能构建大规模的应用
HBase:非结构化NoSQl分布式数据库
基于分布式文件系统HDFS,保证
数据安全
列式存某省市存储空间
提供大数据量的高速读写操作
Hadoop平台提供了海量数据的分布式存储与处理的框架。利用HDFS的海量数据存储能力、灵活扩展能力
将分布式文件系统作为光伏大数据存储与分析平台中的基础数据存储载体,从外部采集过来的数据首先存
储到该文件系统中.并保留源系统的历史信息与数据结构. 做为数据仓库中ODS数据层为后续的汇总、
应用层提供基础的业务数据.同时利用HBASE的高速读写能力可以为前端提供明细级的查询服务
HBase MapReduceHive
HDFS
快速的数
据读取
大数据存
储统计
复杂计算
并行处理
数据存储-MPP数据库
Shared Nothing
代表数据库:GreenPlum
适合大数据量的OLAP应用
缺点
优点
线性扩展:
X86平台高可用性较低
•新型MPP数据库主要构建在x86平台上,为无共享架构(Share Nothing),依靠软件架构上的
创新和数据多副本机制,实现系统的高可用性和可扩展性。负责深度分析、复杂查询、KPI计算、
数据挖掘以及多变的自助分析应用等,支持PB级的数据存储。本项目中的数据仓库可以通过
MPP数据库进行搭建.其对海量数据的处理能力、分级存储的能力对后续的分析、应用、可视
化提供强有力的支持
新型MPP分布式数据库
基于开放平台x86服务器
大规模的并发处理能力
无单点故障,可线性扩展
多副本机制保证数据安全
支撑PB级的数据量
支持SQL,开放灵活
数据存储-分级存储策略
数据分级存储原则 数据压缩模式
按数据血缘按逻辑层次 按业务种类
按设备网络划分 按设备物理地址
在线、近线、
离线
按访问
频度
内存数据库
按响应
及时性 内存数据库
数据生命在线数据对高性能存储的
需求,以及随着数据生命变更,逐
渐向一般性能存储的迁移,是分级
存储管理的一条主线。同时兼顾考
虑其他分级原则,共同作用影响数
据迁移机制。
基于生命
基于访问压力
基于业务用途
基于物理属性
高性能
磁盘库
磁带
光盘库
中低性能
磁盘库
多模式的压缩方式,可以实现根据不同的
数据种类选择压缩方式.实现冷热数据的
差异化管理与应用
很好的随机访问性能
OK表访问
2:1-5:1的压缩率
很差的随机访问性能
非常好的TableScan
5:1-50:1的压缩率
很好的随机访问性能
非常好的TableScan
5:1-50:1的压缩率
数据库块
符号表
Row
1
Row 2
Row 3
行列混合压缩
压缩
包1
C
olum
n 1
C
olum
n 2
C
olum
n 3
C
olum
n 1
C
olum
n 2
C
olum
n 3
压缩
包3
压缩
包2
列数据库
数据仓库建设
Hadoop平台
大数据仓库
报表
数据
挖掘
数据
指标
数据
可视
化
……
信息子层
贴源数据
历史数据
信息子层:报表数据、多维数据、指
标数据等数据来源于汇总层。
汇总层:主题域之间进行关联、汇总
计算。汇总数据服务于信息子层,目
的是为了节约信息子层数据计算成本
和计算时间。
轻度汇总层:主题域基于明细层数据,
进行多维度的、用户级的汇总。
明细数据层:主题域进行拆分、关联。
是对ODS操作型数据按照主题域划分
规则进行的拆分及合并
ODS层:数据来源于各源系统,通过
采集工具、实时流对接口文件数据进
行编码替换和数据清洗转换,不做关
联操作。未来也可用于准实时数据查
询。
明细数据层 (DW)
轻度汇总层(MK)
高度汇总层(MK)
应用库
选址优
化
远程运
维
功率预
测
应用层:应用系统的私有数据,应用
的业务数据。
做为大数据平台的一个上层应用,有
由大数据平台提供数据支撑
数据
开发
接口
SQL
FTP
HSQ
L
API
ETL
数
据
采
集
航拍
监控
非结构化数据非结构化数据
设备
用电
运营
气象
配电所
升压站
结构化数据结构化数据
数据源获取层
1
2
1
2
3
3
4
4
MPP数据库
MPP数据库
平台批量离线计算能力
Sqoop某省市数据
区与数据平台其他
Hadoop数据区的
数据交换
Hadoop 命令、
Hive外部表、MR程
序实现数据平台
Hadoop数据区间
的数据交换
实现技术
Perl程序
数据采集,调用
Perl文件模块相关函
数,轮询指定目录,
获取数据文件
数据核查,Perl执行
文件级数据质量检查
数据加载,调用
Hive Load数据命令,
加载到数据平台临时
数据区的Hive Table
实现技术
批量采集:大数据
源以SFTP协议批量
传输数据文件
在线访问:开发Ja
或C应用,调用大
据源API,或以网络
平台爬虫方式抓取
源系统非结构化、
半结构化数据
实现技术
平台实时流计算能力
• 数据采集方式
– 实时采集方式
• 实时方式
– LMAX,证劵交
泛采用的 泛采
用的 高性能无锁框架
– NIO非阻塞网络收集
– 分布式QUEUE 对接
• 实时计算平台
– 高速率的类事件信息采集, 计算,
存储
– 横向线型扩展能力 – 完整的SQL支
持能力
– 基于分布式队列+分布式内存计算
多维分析、交互式探索分析
• 基于璞华大数据提供的可视化分析平台.采用内存计算技术实现多维分析.提供查询效率、打破原有的
分析字段瓶颈.更灵活、更高效.
• 通过配置界面可以实现联动、钻取等交换的分析功能.不用手写代码大大提高了维护效率与开发效率
机器学习、深度学习
• 通用机器学习算法在海量数据之上
运行
• 绝大部分代码是基于Hadoop编写的
分布式作业
• Mahout目前已支持的算法包括,协
同过滤,推荐算法,聚类算法,分
类算法,LDA, 朴素bayes,随机森
林。上面的算法中,可以通过矩阵
分解后,充分利用MapReduce的并
行计算框架,高效地完成计算任务。
• 有着统计分析功能及强大作图功能
• 无需进行分布式作业,因此可用来做样
本分析
• 拥有大量的数据挖掘算法,包括聚类、
分类、关联、时间序列等
机器学习
2. 算法:采用kmeans算法、卷积神经网络和循环神经网络算法
1. 数据输入:通过传感器采集设备性能数据、系统告警等数据
3. 输出:对数据进行聚类,分类或预测
处理流程
解码视频并
统一帧数
(20FPS)
视
频
流
输
入
使N进行
边界检测
多物体检测
使用LSTM
记忆行为行为分类模型
根据行为分类
结果标记视频
内容
组合图像
使用 CUDA 技术
训练和演算
应用开发支撑平台
集成开发环境:提供大数据应用开发支撑平台,
能够支持标准的SQL、MapReduce、scala等编
程开发
支持各种文件的全量和增量数据抽取;
支持离线数据和实时数据的装载
离线数据导入:
可视化展示平台DART
托拉拽重计算,对统
计的数据进行有效的
提取及整合,赋予数
据新活力,想怎么拖,
就怎么拖,致炫快速
展现你想要的,方便
快捷,简单高效
支持多数据源输入,
数据库多样化
多图多图表联动,值
域漫游,多维查
询,点多面广全
覆盖,分分钟钟
快速展现
PC端
某著名企业端
全面、实时、快速、智能
拖拉拽一键生成报表
应用开发步骤
数据立方体
Dart智能可视化实战案例
基于数据的一体化展示平台,组件丰富,
并提供多维智能分析,图表联动,实时数
据分析等多种服务。
自助式,所见即所得,无需二次开某省市
开发成本。
应用开发—电站远程运维
• 光伏发电运行数据:电压、电流、功率、发电量、电能
质量、逆变器运行数据、设备状态、开关位置信号;
• 故障及报警信息:事故信号、故障信号、重要保护信号
等;
• 实现远程的光伏发电系统的启、停、功率调节及相关操
作与控制。
应用开发—发电功率预测
根据装机容量、气象(、风速、光照强度)、发电量
等历史数据,寻求发电功率与各种相关因素之间的关系,
从而对发电功率曲线进行科学预测。
提供短期发电功率预测(预测1-7天)和超短期发电功
率预测(预测两小时)。
管理与运维-平台能力要求
基于Hadoop生态
圈原理,提炼监
控要素,使得监
控清晰、准确、。
能够实现并存
多个版本或多
个Hadoop集群
的监控。能够
实现不同版本
的参数管理。
整理Hadoop生态
圈成员及组织形
式,使得逻辑清
晰、浅显。
能够深入Hadoop
生态圈运作原理,
结合JA开发环境
的理论知识,提
炼关键指标。实
现秒级监控。
能够提供日常
系统运维的自
动化工具;可
支撑至少5K+的
集群监控和运
维管理能力。
目标 系统管理人员
系统运维人员
故障处理人员
了解大数据中心的整体运转情况
完成日常维护和规划设计
提供得心应手的操作工具
管理与运维-能力架构
知
识
库
服
务 数据核查
性能监控
健康概览
系统备份 预警报警
告警监控 资源统计
自动巡检
系统规划 系统协维 系统代维 系统优化
管理与运维
● 平台整体监控界面:
管理与运维
● 事件监控界面:
● 日志跟踪界面:
项目概述01
平台建设02
平台规划03
平台特点04
目录
平台服务器集群
- 36 -
…
…
…
…
Data Node
Spark hawq
Sle服务器4
Data Node
Spark hawq
Sle服务器5
Data Node
Spark hawq
Sle服务器6
Data Node
Spark hawq
Sle服务器7
NameNode
Zookeeper
Spark hawq
Master服务器1
Hbase主
Zookeeper
Spark Hawq
hive
Master服务器2
Second NameNode
Zookeeper
Spark Hawq
Hbase从
Master服务器3
服务器容量计算公式:
单台服务器(假设服务器包含12个硬盘插口,每个插口插入一块2T硬盘,总容量为12插口*2T = 24 T)
以支持hadoop3份存储高保障为例,可用数据变为24T*1/3=8T
考虑到OS及RAID,一般会做到RAID10,并占用2个插口,剩余10个插口做为数据存储端,做到RAID5 保障数据高可用。用量预
估大概在可用数据的30%,所以计算得12插口*2T*1/3*(1-30%)= ,单台24TB服务器可支持5TB左右的数据量。
基础版 推荐版
14TB 5台(可用容量25T) 7台(可用容量
35T)
备注:以上计算以单台服务器24TB计算
数据量
服务器数量
服务器数量:
集群服务器数量
备注:考虑后期数据量会达到140TB,可动态添加新服务器加入集群。
集群规模大概在20多台服务器左右。
• 处理器(CPU)
• 双路(2*8核)
• 内存:128GB
• Sle节点存储
• 12*2TB SAS 15K RPM, RAID 0,双RAID卡
• Master节点存储
• 12*2TB SAS 15K RPM, RAID 5, 双RAID卡
平台硬件配置
• 网络:dual-port 万兆网卡
• 需要NIC bonding
• 每台机器需外加1个千兆管理网卡
• 交换机:1个24口万兆光口交换机
• 节点数多涉及多级交换机时,保
证任意两节点间带宽大约2GB
• 管理交换机:1个24口千兆交换机
服务器预算
服务器推荐配置:
组件 推荐配置
CPU Intel Xeon E5 双路(2*8核)
内存 128GB/256GB
硬盘 12*2TB JBOD双RAID卡
网络 one-port/dual-port 万兆网卡
交换机 节点数多涉及多级交换机时,保证任意两节点间 带宽大约
2GB
价格:5万-10万
Hadoop软件配置
1 Hdfs 分布式文件系统
2 Yarn 负责Hadoop资源管理与调度
3 Hbase 构建在 Apache Hadoop和 Apache ZooKeeper上的列式数据库
4 Mapreduce Map Reduce分布式计算模型
5 Zookeeper 分布式应用提供一致性服务的软件,提供的功能包括:配置维护、域名服务、分布
式同步、组服务、全局一致性等服务。
6 Sqoop 是一款数据同步工具,主要用于在Hadoop与传统的数据库(mysql、postgresql...)
间进行数据的传递(导入与导出)
7 Kafka 高吞吐量的分布式消息系统
8 spark 快速、通用的大数据并行处理引擎(One stack to rule them all)
9 kerberos Kerberos是一种网络身份认证协议,可以用于身份鉴别以及用户单点登录(访问多
个服务)
项目概述01
平台建设02
平台规划03
平台特点04
目录
平台优势
- 42 -
提供安全设置、审计以及报警,监控等策略保障系统高安
全,高可靠
集群快捷安装部署与扩展
本地开发,自动化打包与部署
性能指标一目了然
多组件多计算服务模型,高性能保障
安全
快捷
高效
平台对比
特性 CAP HDP CDH MapR 其他国产
Hadoop
云原生(Cloud Native) yes no no no no
自动伸缩(auto-scaling) yes no no no no
自愈(self-healing) yes no no no no
快速应用发布迭代 yes no no no no
微服务架构 yes no no no no
SQL标准支持完备性 high (HAWQ-DB) low low low low
NoSQL增强 yes no no no no
可扩展性 high high high high low
快速扩容 yes yes yes yes yes
复杂非结构化数据(流数据及图
数据)
yes yes yes yes yes
机器学习 yes yes yes yes yes
性能比较
HAWQ
Faster
Impala
Faster
2 28 46 66 73 76 79 80 88 90 96
HAWQ
• Faster on 46 of 62 TPC-
DS queriespleted*
• mean g.
• 12 hrs faster total
* Impala supported 74 of 99
queries, 12 crashed mid-run
平台特点:
平台提供结构化、半结构化及非结构化数据的批量及实时采集
分布式文件系统HDFS,对象存储
结构化 半结构化 非结构化
数据收集层
Flume/Kafka/sqoop/应用API接入
文件
文件
文件
文件
日志
日志
日志
日志
信号
信号
信号
信号
指标
指标
指标
指标
… …
… …
… …
… …
平台特点:
平台底层所有数据分散存储在HDFS上,通过HDFS 复制策略及Raid保障系统数
据的完整性。
大规模数据存储及读写服务
快速高效可扩展的生态系统
廉价的商用机器集群
平台特点:
数据处理框架深度整合,提供HDFS,MAP REDUCE,HBASE,YARN,KAFKA,
SPARK等常用组件,并提供强大的sql on hadoop 技术Hawq,支持复杂sql及高性能
处理,提供集成、一体化、自动化、服务化数据平台服务。
提供功能包括:
● 离线处理能力:
提供map reduce,内存计算及压缩算法
● 实时流接入和处理能力:
平台特点:
平台对所有用户及数据统一管理和运维,对不同用户的数据及服务进行权限隔离,通
过安全控制协议及目录权限,实现数据统一安全以及分配管理
多租户及安全能力
● 用户角色管理:
● 权限管理:
平台特点:
多租户及安全能力
● 安全审计:
感