首页
>
资源
>

哈尔滨工业大学:基于Apache IoTD研发的云边端一体化时序数据库

一、客户背景

随着工业互联网、新型电力系统、智能制造产业高速发展,大量行业场景同时存在云端中心平台与海量边缘现场设备。工厂车间、风电光伏场站、轨道交通、油气管网等场景,设备分布地域分散,边缘节点数量庞大,既需要边缘侧本地实时处理时序数据,又要求数据向云端汇聚,实现全局统一监控、统计分析、报表归档。传统时序数据库大多分为纯边缘轻量版本或者纯云端集中式版本,很难兼顾边缘有限硬件资源与云端海量存储分析的双重诉求,云边端数据割裂成为行业普遍痛点。

CED-DB 是面向工业场景设计的云边端一体化时序数据库,聚焦解决边缘与云端协同时序数据管理难题。在大量真实工业项目中,边缘硬件配置参差不齐,部分边缘网关 CPU、内存、存储资源有限,无法部署重型数据库;网络条件复杂,公网带宽受限、网络频繁断连;海量设备产生高频时序测点,涵盖设备状态、传感器采集、告警事件、控制指令记录等。

业务诉求呈现多元化:边缘端需要实现本地数据缓存、实时计算、本地告警、短时数据查询,网络不佳的时候业务不能中断;云端承担全量历史数据持久存储、跨边缘节点全局聚合分析、多维报表、数据回溯审计;同时要求边云之间数据同步可靠,支持断点续传、数据过滤、分层分级同步;整套体系要具备统一的 SQL 访问体验,边缘与云端使用一致的使用习惯,降低开发人员学习成本。大量工业客户在数字化转型过程中,亟需一套完整云边端时序底座,打通终端采集边缘处理云端分析全链路,实现边缘自治、云端统筹的架构模式,CED-DB 就在这样的产业背景下开展落地实践。

二、面临挑战

在云边端工业时序业务落地过程中,项目遇到边缘硬件、网络传输、数据同步、开发运维等多维度现实挑战。

第一,边缘侧硬件资源受限。工业现场边缘网关硬件规格差异巨大,很多现场只具备低功耗 ARM 架构硬件,内存、磁盘空间有限。传统大型时序数据库资源开销高,无法直接部署在边缘网关;而极简版轻量数据库能力残缺,缺少时序聚合、窗口计算、压缩存储能力,难以满足边缘本地实时分析、本地告警的业务需求,出现 “重库跑不起来,轻库功能不够用” 的矛盾。

第二,网络环境不稳定带来同步难题。大量工业现场依靠 4G/5G、VPN 公网链路,网络抖动、断网是常态。断网期间边缘设备持续产生海量时序数据,网络恢复后,若全部原始数据一股脑向云端推送,会造成带宽打满、云端写入压力雪崩;同时业务存在分级同步诉求,部分高频原始测点只需要在边缘留存,云端只同步聚合后的指标、告警事件,不需要全量原始点上传,传统数据库缺少灵活的数据筛选、降采样同步策略。

第三,边云割裂,使用体验不统一。很多项目边缘、云端采用两套完全不同的数据库产品,语法、API、数据模型各不相同。开发人员需要维护两套代码逻辑,分别适配边缘和云端,业务开发工作量成倍增加;数据模型很难对齐,边缘本地存储格式和云端存储格式不一致,数据同步过程需要大量转换工作,极易引入数据错误。

第四,海量多边缘节点运维管理困难。一套平台往往对接几十上百个边缘站点,边缘节点分散在全国各地。传统模式下边缘数据库缺少统一运维管控手段,版本升级、参数调整需要逐个现场操作;缺少统一监控视图,很难实时掌握每一个边缘节点的数据写入、同步状态、磁盘占用;故障排查需要登录每一台边缘网关,运维成本居高不下。

第五,数据一致性与可审计挑战。边云架构下,数据会存在边缘副本和云端副本。网络异常、同步中断时,容易出现边缘与云端数据不一致;工业数据需要支持事后审计追溯,要求无论是边缘本地数据还是云端汇聚数据,都具备不可篡改、完整时间序列,能够实现故障发生时的过程回溯。

三、IoTDB 解决方案

CED-DB 基于 IoTDB 内核进行云边端一体化能力拓展,构建 “端侧采集边缘 CED-DB云端 IoTDB 集群” 完整技术架构,实现一套内核适配边缘、云端两种部署形态,打通云边数据协同全流程。

在部署形态上,同一内核拆分两种发布包:边缘侧部署轻量化 CED-DB 版本,针对 ARM 低功耗网关做深度裁剪优化,降低内存、CPU 占用,适配边缘有限硬件资源;云端部署标准 IoTDB 集群,承接来自全部边缘节点汇聚的全量时序数据。边缘 CED-DB 与云端 IoTDB 共用同一套数据模型、同一套 SQL 语法、同一套 API 接口,上层业务代码几乎不需要修改,即可同时访问边缘本地数据库与云端数据库,彻底解决边云产品割裂的痛点。

数据同步方面,依托 IoTDB Pipe 数据同步能力构建边云同步通道。支持断点续传,网络中断之后,恢复连接从同步中断位置继续传输,不会重复全量重传;支持丰富同步策略,可配置过滤规则、降采样规则,实现 “高频原始数据保存在边缘,聚合统计指标、告警事件同步上云”,有效节省公网带宽,降低云端写入压力。边缘断网期间,时序数据持续在 CED-DB 本地持久化存储,保障边缘本地监控、告警、计算业务不受网络中断影响,实现边缘自治。

数据模型层面,沿用 IoTDB 树状层级模型,统一规范root.站点.设备.测点路径体系,边缘和云端保持测点路径完全对齐,数据同步不需要做复杂格式转换。同时支持多种压缩算法,在资源有限的边缘网关依然可以获得较高压缩比,节约边缘磁盘存储空间。

运维管控层面,提供云端统一管控能力,云端可以对分布各地的大量 CED-DB 边缘节点做远程状态采集,监控每个边缘节点写入吞吐量、磁盘使用率、同步链路状态;支持远程下发配置、版本管理;当同步链路发生异常时云端自动触发告警,运维人员无需登录各个现场网关即可定位边云同步故障。

计算能力上,窗口聚合、趋势计算、异常检测 UDTF 函数边缘与云端全部兼容。部分简单实时计算、告警逻辑直接下沉到 CED-DB 边缘完成,只把计算结果上传云端;复杂的跨站点全局统计、长周期历史分析由云端 IoTDB 集群完成,实现计算任务云边合理分工。同时保障数据可审计,边缘原始时序数据只读追加写入,同步到云端的数据保留原始时间戳,支持故障场景下边缘云端双向回溯校验。

四、方案带来的效果与效益

基于 IoTDB 内核打造的 CED-DB 云边端时序数据库,有效化解工业场景边云协同的各类痛点,为分布式工业物联网业务带来多重技术与业务收益。

技术收益方面,实现一套内核云边两用,边缘 CED-DB 轻量化版本可稳定运行在 ARM 低功耗网关,解决边缘硬件资源不足难题;边缘与云端 SQL、API、数据模型完全统一,大幅减少业务代码开发量,降低学习与适配成本。Pipe 边云同步通道支持断点续传、过滤降采样,有效适配公网不稳定环境,既保证断网状态边缘业务自治,又减少公网带宽消耗,规避网络恢复瞬间云端写入雪崩风险。统一运维管控平台实现上百个边缘节点集中监控管理,不用逐个现场操作,运维工作量显著下降。

业务落地价值层面,架构适配风电、光伏、工厂产线、轨道交通、管网监测等大量分布式工业场景。边缘侧完成本地实时监控、告警、短时数据分析,网络好坏都不影响现场业务运行;云端汇聚全站点数据,开展跨区域全局统计、长周期归档、审计回溯,真正做到 “边缘保实时、云端管全局”。时序数据完整留存,发生设备故障时,可以调取边缘原始时序数据开展事故复盘,满足工业业务安全审计的合规要求。

项目实施层面,该一体化方案降低分布式物联网项目实施门槛,不需要为边缘和云端选型两套不同数据库,减少多产品对接联调的工作量,缩短项目交付周期。CED-DB 充分复用 IoTDB 成熟存储引擎、压缩算法、时序计算能力,同时补齐云边协同短板,拓展了 IoTDB 在分布式边缘物联网场景下的应用边界,为新型工业互联网提供一套成熟可复制的云边端时序底座实践方案。