一、客户背景
储能电站连接电池簇、PCS、BMS、温控、消防等多类设备,现场数据既关系到电站运行状态,也直接影响调度、收益和安全管理。美克生能源围绕储能业务建设数字化平台,需要持续接入来自站端的大量遥测、遥信、遥调和遥控数据,并为实时监控、历史分析、设备控制及运维管理提供统一的数据支撑。
储能站具有明显的工业物联网特征:单站通常拥有1000个以上测点,大型站点涉及10万级电芯;遥测数据采集周期约为5—10秒,遥信变位数据频率可低于500毫秒;站点大量通过4G/5G公网连接云端,网络中断情况较为常见。面对不断扩大的站点规模和持续增长的时序数据,美克生能源需要一套能够覆盖边缘接入、云端管理、实时查询、控制下发和历史迁移的数据基础设施。
二、面临挑战
首先,储能设备种类多、数据层级复杂。电站、设备和测点之间具有天然的树形关系,系统需要建立清晰的数据模型,保证不同站点、设备和测点能够统一编码、快速定位和持续扩展。如果数据路径设计不合理,后续查询、聚合、导出及主数据同步都会受到影响。
其次,现场数据具有高频、连续和不稳定网络环境下的接入特点。站端需要在网络短时中断时继续缓存数据,恢复连接后再进行补传;云端则需要完成Base64解码、zlib解压、JSON解析、路径映射和批量写入等处理。数据链路中任一环节出现拥塞,都可能影响数据完整性和实时性。
再次,平台同时承载实时查询、历史分析和控制下发。业务既要获取实时快照,也要查询历史原始值、聚合统计、等距插值和差值分析,并支持CSV导出。控制侧还涉及遥调、遥控、统一回调、失败重试和通信中断告警,对系统的稳定性、可追溯性和高可用运维提出了更高要求。
此外,项目还遇到机房搬迁带来的大规模数据迁移问题。原集群计划停机20天,待迁移数据量约10TB,包含400亿个以上时序点,原有部署为3C3D、单副本架构。如何在停机窗口和资源约束下,将历史数据完整搬迁至新的SSD集群,并验证文件、元数据和业务可用性,是项目必须解决的关键问题。
三、IoTDB解决方案
在数据模型层,平台采用“Station—Device—Point”的树形组织方式,并与Redis主数据同步。系统按照统一路径模板写入IoTDB:
root.{site}.{devicePrefix}_{deviceCode}.{measurement}
这种模型与储能站“站点—设备—测点”的业务层级相匹配,便于按站点、设备和测点进行管理与查询。针对不同数据类型,平台结合数据特征选择DOUBLE+Gorilla、INT32+TS_2DIFF、STRING+DICTIONARY等编码方式,以兼顾存储效率和访问性能。
在接入链路上,边缘网关通过MQTT上报四遥数据,并采用zlib压缩与Base64编码,压缩比约为3:1至8:1。站端保留不少于3天的本地缓存,网络恢复后进行限速补传,降低集中补传对系统的冲击。云端转码服务完成解码、解压、解析、路径映射和批量写入,单批次写入规模达到1万点,并通过SessionPool和多节点Redis缓存减少元数据重复查询。对于告警点,系统进行过滤后转发至对应告警主题。
IoTDB在储能场景中提供高吞吐写入能力,材料显示单站写入规模可达到1.5万点/秒。平台围绕查询服务封装实时快照、历史原始值、聚合统计、等距插值、差值分析和CSV导出等API,并通过线程池并发查询、聚合粒度白名单、按设备分组查询、Redis热点缓存和强制关闭SessionDataSet等机制,提升查询服务的稳定性和资源使用效率。
在控制下发方面,平台支持遥调、遥控和统一回调,遵循“一令一答、单点失败全令失败”的业务规则。控制消息采用AES-256-GCM加密和GZIP压缩,MQTT使用QoS 1,并通过Paho自动重连与业务侧显式重试构成双层重连机制。对于历史补传和507错误,系统设计了重试处理;同时基于站点数据采集时间戳监控通信中断,并通过钉钉发送告警。
针对10TB级集群迁移,项目选择基于TsFile的搬迁方式,保留索引和压缩信息,以提升历史数据搬迁吞吐。整体方案为:站端切换至公有云,在原集群停机期间积累约20天新数据,随后将历史数据搬回新的SSD集群。迁移过程中保持单副本架构,并采用node1到node1的对应迁移方式,结合pigz多线程压缩、xargs并行和scp传输。项目按照元数据、数据量、文件层和业务层四个层次进行验证,确保迁移结果可用。
四、成效与价值
通过IoTDB,美克生能源在储能场景中形成了覆盖“接、管、用、迁”的端到端数据架构。站端数据能够在网络波动环境下缓存和补传,云端可以对多类型时序数据进行统一管理,实时查询、历史分析和控制下发由同一数据链路支撑,减少了数据在不同系统之间重复转换和分散维护的复杂度。
在存储与迁移方面,IoTDB的树形路径模型、TsFile文件机制和高吞吐写入能力,为储能站海量测点数据的持续接入和历史数据管理提供了基础。面对约10TB、400亿个以上时序点的集群迁移,项目形成了一套可执行的TsFile迁移SOP,并通过四层验证方法提升迁移过程的可控性和结果可信度。
在运维管理方面,平台将数据采集、告警过滤、控制重试、通信监控和消息通知纳入统一架构,帮助运维人员更及时地发现链路异常和站点运行问题。项目实践还沉淀了数据模型设计、边缘缓存、批量写入、查询治理和大规模迁移等方法,为后续储能站点扩展及类似工业物联网项目建设提供了参考模板。