首页
>
资源
>

清华大学软件学院王建民院长:工业时序数智库架构与数据价值魔方

编者按:

8 月 22 日,2026 时序数据技术创新大会在北京成功举办,引发广泛关注。本次大会以「DB × AI」为主题,多位院士专家领衔,超 30 位嘉宾齐聚一堂,共同探讨数据库与人工智能融合发展的新趋势、新技术与新实践。

我们邀请到清华大学软件学院院长王建民教授带来以“工业时序数智库架构与数据价值魔方”为题的主题演讲。他从 AI 时代工业数据的发展趋势讲起,介绍了工业时序数据的特点,以及 Apache TsFile、Apache IoTDB 和 Timer 时序大模型等技术成果。他表示,数据库与 AI 的深度融合,正在推动工业数据从采集、存储走向分析、建模与智能决策。通过构建开放的数据格式、数据库接口和 AI 能力,企业能够进一步激活工业时序数据价值,推动数据从资源沉淀为支撑智能化转型的核心资产。

全文 2 千余字,阅读约需 5 分钟,以下是演讲主要内容:

AI 时代:从工业大数据到工业大模型

王建民院长表示,时间是人工智能的重要变量。他引用李德毅院士的观点,认为物质、能量、结构和时间是人工智能的四个基本要素。

而在工业制造领域,工业企业的运行管理天然以时间为主线,贯穿战略、战术、运作和执行等不同层级:战略层关注年与月的时间单位,战术层关注月与天的时间单位,运作层关注天与小时的时间单位,具体的机器加工过程则需要精确到秒、毫秒甚至微秒。

工业时序数据正是带有时间戳、用于记录物理量变化过程的数据。随着工业互联网快速发展,此类数据正在以前所未有的规模持续产生。

在 AI 时代,工业数据的价值链路不仅包括“端侧采集、边缘汇聚、云端处理”的上行过程还包括“云端建模、边缘推理、终端执行”的下行过程。王院长强调,需要将采集到的工业大数据进一步转化为工业大模型,并依托大模型在边缘侧完成推理,最终由嵌入式系统和终端设备执行。

原科技部高新技术司二级巡视员尉迟坚在《价值魔方:互联网与 e 立方经济》一书中,系统论述了制造业的演进与价值重构。受此启发,王院长的报告以“价值魔方”为题,引入工业时序数据领域。

以上是工业时序数据价值魔方的应用背景,以及数据驱动价值创造的主要场景。

IoTDB :面向 AI 的工业时序数据基础设施创新

王院长指出,面对 AI 时代,软件工程学科亟须持续创新。当前的软件形态已从传统代码扩展至大模型,并进一步衍生出提示词工程、上下文工程、Harness Engineering、Agent Engineering 和 Loop Engineering 等新型工程范式。

AI 不仅正在改变生产力,也在重塑生产关系。就生产力而言,这种影响主要体现在两个方面:一是改变软件的开发方法与开发过程,二是改变软件制品本身,使其逐步演进为智能软件。

在本次报告中,王院长重点讨论了软件制品的变化。他表示,为适应 AI 和 Agent 的应用需求,传统数据库需要向更加开放、智能的“数智库”演进。团队由此提出了一套面向 AI 的 Harness 工程、Agent 工程构建的新型体系架构。

王院长详细介绍了该体系架构如何面向 AI,包括:开放底层文件格式,使 Agent 能够直接写入文件;开放数据库接口,使 Agent 能够直接访问数据库;开放 AI 接口,使其能够调用数据集,并进一步为不同企业和业务领域构建专属的时序大模型。

自 2020 年以来,团队持续推进相关研究,并在文件格式、数据库和时序大模型等方向取得了一系列成果。

在底层文件格式方面,团队设计了时序数据文件格式 TsFile。该格式支持高频写入、长期存储和面向 AI 的快速分析,具备自描述、高压缩和文件内索引等特性。

无论数据处于端、边、云的哪个环节,TsFile 均能通过自描述能力明确数据的结构与含义,并借助文件内索引提升访问效率。

围绕端、边、云不同场景,团队还形成了一套分层压缩技术,从而进一步提高工业时序数据的压缩效率。

在数据库层面,王院长团队以 TsFile 为基础研发了 Apache IoTDB,重点推动 IT 与 OT 的深度融合。

IoTDB 创新性地采用“树表孪生”数据模型,同时支持用户以树模型或表模型进行数据的写入和分析,并在 TsFile 层实现不同数据模型的实时关联与融合。

同时,IoTDB 针对物联网数据可能出现的顺序、乱序写入场景,提供了自适应处理能力。

王院长特别强调,为满足工业场景中的高频、高通量数据接入需求,团队还对数据库的同步与一致性机制进行了创新,通过操作级并行与文件级同步提升系统吞吐率 80% 以上。

凭借这些技术,IoTDB 在相关国际权威性能榜单中取得领先成绩,并通过了中国信通院针对时序数据库的各项测试。基于 IoTDB 打造的 TimechoDB 数次刷新国际权威性能基准测试 TPCx-IoT 榜单记录,并在欧洲数据库性能榜单 benchANT 测试中各项指标同时位列第一。

同时,TimechoDB 也在今年通过了安全可靠测评,成为首批通过测试的时序数据库产品。

DB×AI:时序大模型推动工业智能化升级

王院长表示,AI 时代数据库与人工智能的深度融合,正在形成“DB×AI”的发展模式。时序大模型是这一融合方向的重要组成部分。

其中,清华大学软件学院龙明盛教授带领团队持续开展时序大模型研究,并推出了 Timer 系列模型。

王院长对 Timer 系列模型的发展历程进行了详实的回顾。

其中,Timer 1.0 主要实现了“一个模型多种任务”,使同一个模型能够适配并迁移至多种任务场景。过去,人工智能应用通常需要针对不同任务分别开发模型;大模型出现后,多种任务可以由同一个模型统一处理,从而显著降低应用开发和部署的复杂度。

Timer 2.0 进一步实现了超长上下文处理能力,并在相关评测榜单中取得了较好成绩。

Timer 3.0 将生成式人工智能能力引入时序大模型,推动时序大模型从预测分析进一步向生成式应用拓展。

根据王院长介绍,目前团队正在研发 Timer 4.0,重点突破多变量协同建模和一般非结构化数据建模问题,这对于工业领域复杂场景下的联合分析和预测具有重要意义。

王院长指出,数据集已经成为企业的重要资产。用户对Apache IoTDB、TsFile 中存储的海量时序数据进行治理,能够持续沉淀为企业专属的高质量时序数据集。

高质量数据集是训练时序模型的重要基础。然而,由于这些数据涉及企业核心业务,通常难以直接对外共享,在生产实践中极大制约了企业训练自己的时序模型。

因此,基于 TsFile、Apache IoTDB 和 Timer 时序大模型,天谋科技团队推出了企业时序大模型训练平台,相当于为企业提供了时序大模型后训练的“炼丹炉”。 企业无需将数据传到外部,即可利用自身积累的高质量时序数据集,一键完成面向自身业务的时序大模型训练。

为降低时序大模型的使用和训练门槛,团队还开发了基于 TsFile 的工业时序数据集管理系统。该系统支持多格式转换、TsFile 管理、数据可视化与质量评估、数据加工流水线以及数据标注等功能,覆盖工业时序数据集从整理、加工到训练应用的完整流程。

王院长提出,TsFile 为时序数据的“AI Ready”解决了两大核心问题:一是“存得少”,通过高效压缩降低数据存储成本;二是“算得快”,通过软硬件协同提升模型训练效率。

在 GPU 资源有限且租用成本较高的背景下,时序大模型的高效训练,能帮助企业大幅节约算力资源。

数据价值魔方:拓展工业时序数据的应用边界

王院长指出,数据创造价值的过程可以用“数据价值魔方”来呈现。

时序数据不仅广泛应用于物联网和具身智能,也能够支撑企业信息化、商业智能(BI)、人工智能(AI)及“互联网+”等多类场景。实际应用通常不是单一技术或单一场景的独立落地,而是多个维度相互组合、协同作用,由此形成丰富的数据应用模式,持续拓展工业数据的价值空间。

在报告中,王院长简要地介绍了多个工业数据价值魔方的应用场景。

在物联网场景中,时序数据可以用于石油管网等工业设施的生产状态监测。

在具身智能场景中,需要通过多模态时序数据集统一管理和分析不同类型的感知数据。根据王院长介绍,Apache IoTDB 已具备多模态数据的支持能力。

在钢铁冶炼等生产场景中,时序数据能够支撑生产过程查询,并基于历史数据开展质量分析与追溯。

在商业智能场景中,时序数据既可以支持基于历史数据的统计报表和 BI 分析,也可以用于气象预测、电价预测等时序大模型应用。

王院长特别引用了何友院士的观点,指出气象变化不仅会影响工业生产,还涉及到人们的衣食住行等生活领域,例如与电价等因素产生跨领域耦合。

通过融合气象、能源和工业生产等多源时序数据,可以进一步挖掘不同领域之间的关联,为工业决策与资源优化提供支撑。

王建民院长最后强调,数据已经成为企业的核心资产。随着物联网、具身智能、BI、AI 等技术与业务场景不断融合,工业时序数据价值魔方将持续释放价值,并成为推动工业智能化转型的重要动力。