编者按:
8 月 22 日,2026 时序数据技术创新大会在北京成功举办,天谋科技 CTO、Apache IoTDB PMC Member 乔嘉林博士发表题为《多模态时序数智化软件栈》的主题演讲。
面对图片、文本、音频、视频等数据不断汇聚,时序数据应该如何重新定义?数据库需要扩展哪些能力,又如何兼顾安全、自主与可靠?企业多年积累的数据和领域知识,如何转化为服务真实业务的 Context,并进一步训练专属时序模型?这也是本次演讲的核心。下面,让我们一起走进演讲现场。
过去一年,我们的成绩单
01坚持长期主义,做难而正确的事
据不完全统计,Apache IoTDB 累计下载量突破 1350 万次,全球累计管理数据规模达到百 PB 量级;企业版激活超过 5000 套;Timer 系列模型累计下载量超过 3000 万次。

在国际数据库基准 TPCx-IoT 榜单上,TimechoDB 性能测试纪录已连续两年多保持第一;时序大模型 Timer 的多个版本也数次在 Gift-Eval 等公开基准测评中位居榜首。相关成果今年 3 月,获得日内瓦国际发明展评审团特别嘉许金奖;5 月又作为“开放基础设施数据共同体”被联合国经济和社会事务部收录至“联合国科技创新论坛全球 60 大创新案例” 。中国的数据库技术与时序分析模型,正在获得越来越多的国际认可。

在国内,工业时序数据库 TimechoDB 成为首批通过国家安全可靠测评的时序数据库,也是唯一通过国家首版次软件评测的数据库产品,为工业企业在关键场景中采用自主、可靠的时序数据库提供了更稳妥的选择。
但这些成绩,并不是一蹴而就的。十几年来,从逐行读懂代码,到逐字节核对 TsFile 文件内容,我们始终坚持对技术细节近乎苛刻的打磨。正是这种积累,构成了产品安全、自主、可靠的底气。
02倾听用户,让真实需求推动产品进化
软件好不好用,最终由用户定义。好的软件不仅是“用”出来的,也是在用户一次次提出问题、反馈问题的过程中打磨出来的。

过去一年,用户的需求越来越集中:图片、文本、音频、视频,能否与数值数据一起被 IoTDB 管理?面对高分辨率卫星云图,能否只提取指定区域,而不必把整个文件搬到客户端?底层数据文件格式是否安全,通信链路是否安全?
与此同时,“数据怎么用”也变得更加迫切。企业积累了五年、八年甚至十年的数据,能否用于模型训练?能否在数据不出网的前提下完成训练?数据质量是否达标?模型能否解决真实业务问题,又该如何评估?

围绕“数据怎么管、数据怎么用”,天谋科技形成了以 Apache TsFile 为统一时序数据文件底座、由时序数据库 TimechoDB 和时序大模型服务产品 TimechoAI 共同组成的软件栈,以持续迭代回应用户需求。
数据怎么管:时序不应只有数值
航空试飞场景中的“时标对齐”,让多模态数据管理的难题变得格外具体。
在数据库研发视角中,时标对齐似乎只是时间维度上的关联;但在真实工业场景里,需要对齐的不仅是气压、高度、速度、姿态等传统数值,还包括驾驶舱语音、机载图像和飞行视频。只有将这些多模态数据放到同一时间轴上,企业才能完成完整分析,得出可靠结论。
问题在于,这些数据往往分散在不同系统中:数值在时序数据库,图片和视频在文件系统或对象存储。每次分析都要从多个系统抽取数据、重新拼装,时标对齐的复杂度随之成倍增加。
用户由此提出了一个关键问题:既然所有分析都围绕时间维度展开,音频、视频和图像,是否也应该被称为时序数据?
这些问题推动我们重新思考:时序数据的边界,是否只能由“数值”来定义?
天谋科技的答案是:时序数据的类型,不应该只有数值。这也成为过去一年产品演进的重要突破。
从 Blob 到 Object:让数据库理解数据结构
面对多模态数据管理需求,最直接的思路是使用数据库已有的 Blob 类型。对于几 KB、几十 KB 的小对象,Blob 确实够用,数据可以与时间、数值统一建模和查询。

但随着观测精度不断提升,单张图片或单个对象达到 MB、GB,甚至 TB 级,传统 Blob 逐渐难以承载:一方面,大对象会带来巨大写入压力;另一方面,如果只想提取对象内部的局部特征,仍需将完整对象搬运到客户端,造成大量网络与算力开销。
为此,天谋科技设计了面向 AI 特征提取的 Object 数据类型。它与传统 Blob 的核心区别在于:
数据库能够理解对象结构,按需提取所需特征
适用大对象管理、不影响数值类型读写
与传统时序数值统一建模,支持SQL的表达,具备高可用能力

目前,这些能力已在航空、气象、具身智能等领域落地。在航空试飞场景中,飞机的飞行参数、驾驶舱语音、视频和图像可以在 IoTDB 中统一管理,可以显著减少多套系统之间的数据搬运与业务层拼装复杂度。

在此基础上,我们还从身份鉴别、访问控制、安全审计、数据加密、传输加密、连接管理六个维度强化数据库安全。经过上述扩展,TimechoDB 正式进化为多模态时序数据库产品。
工业智能的下半场,关键是Context
除了数据的管理,我们其实进入到了工业智能的下半场。当基础模型能力发展到新阶段,企业关注的重点已不再只是模型本身的能力,而是它能否真正落地、“能否解决我具体业务场景中的问题”。其中最关键的,是 Context——上下文,也是领域知识。

在大语言模型中,上下文的一些领域知识可能来自人类语言;在工业领域,其实大家已经不仅是分析人说的话,而是设备的状态,它是处于健康还是异常状态、是否即将发生故障,所以机器设备的语言反而不是这些文字,而是时序数据。
这些数据通常不在公开网络上,也没有通用数据集可以替代,它都记录在企业多年积累的工况数据中。它们记录了设备自身、运行环境乃至具体工况的独特特征,往往是企业独有的资产,也是工业模型最重要的上下文来源之一。
随着上下文不断融入模型,时序模型可以分为三个层级:
基础时序大模型:学习切片、变化识别、特征提取等通用规律;
领域时序大模型:融入航空、能源等行业的大规模数据,学习领域基础规律;
场景模型:面向压缩机异常诊断、管道压力预测等具体问题,结合精准场景数据与专家知识,解决真实业务需求。
模型越接近真实场景,所需要的上下文就越精准。
01如何将上下文融入时序模型
企业常以为自己拥有大量数据,但真正可供 AI 使用的数据却未必充足:存储是否靠近算力?线上系统是否配备 GPU?数据治理、清洗和评估会不会影响生产系统?如果离线导出,速度和负载又是否可控?

这些现实约束,让“拥有数据”和“能够使用数据”之间仍有很大距离。
我们的解决方案,是一套AI就绪(AI Ready)的时序数据库架构。目的在于为AI准备高质量数据集。

这套架构的特点在于:
在 IoTDB 体系下,我们的数据库和数据文件是一个分离解耦的架构,AI 所需数据无需通过查询引擎逐条读取,而可以直接通过底层文件复制和传输完成,这种方式是对线上业务系统影响最小的一种模式。
在端侧,C/C++ 版本的 TsFile 也可以将海量数据直接落成文件,再通过高速链路上传,为后续训练和推理准备数据。
02有了上下文,如何落地到具体场景?
围绕这一过程,TimechoAI 提供了一套面向企业专属时序模型持续迭代的能力体系,我们把它叫做企业自己的“模型炼丹炉”,它可以把沉睡的数据转化为可被模型学习的数据资产。通过持续迭代的方式,把原始数据通过数据评估、数据治理、模型训练,模型评估等环节,不断地循环,最终形成专属时序模型。

那上述提到的三类模型需要什么样的工具来把上下文注入其中呢?我们提供完整的模型适配软件栈,主要覆盖两个层次。

第一层是基础模型的后训练工具。它可以将海量行业数据注入基础模型进行后训练,使其具备特定行业的知识与能力,形成领域模型。
第二层是面向具体场景的模型适配。我们进一步结合业务场景,引入更精准的数据和专家知识,训练出能够解决实际问题的专用模型。

在模型训练阶段,效率直接影响模型的成长速度。数据读取次数、处理效率以及训练迭代轮次,都会影响最终的智能化水平。TsFile 已获得 Hugging Face 的支持,目前平台上已有近千个以 TsFile 格式发布的时序数据集。基于 TsFile 进行模型训练,整体速度可提升约 2 至 17 倍。
为了进一步降低使用门槛,我们正在推动软件从“面向人使用”向“面向 AI 和 Agent 使用”演进。在公司内部,除开发人员外,产品、运营和售前人员也可以通过自然语言完成数据库部署、数据管理平台搭建等工作。
由此,天谋科技形成了完整的多模态时序数智化软件栈:
底层:TsFile 数据基座;
中层:多模态时序数据库 TimechoDB,包括数据库内核与工具链;
模型侧:TimechoAI 时序大模型服务平台,覆盖数据集治理、训练、推理与基础模型;
上层:面向智能体的接口与工具。

这套软件栈将采集、存储、治理、训练、推理和应用连成完整链路,让企业沉睡的数据转化为可持续运营、持续学习、持续创造价值的资产。
03独行快,众行远:共建时序智能生态

除了持续完善产品,天谋科技也在建设时序数据智能生态:与合作伙伴和渠道开展代理及项目合作,推进国产生态兼容共生,共创行业解决方案,并与企业、高校共同培养专业人才。
根要扎得深,树要长得高
“根要扎得深,树要长得高”,是天谋科技始终坚持的产品理念。
数据库和 TsFile 负责将海量时序数据汇总、管理起来,再通过 TimechoAI 理解、分析这些数据,并将其转化为企业业务价值。这是我们的产品哲学,也是和用户一起走过的路。

如今,这些能力已提供云服务,大家可以通过 DB 云(db.timecho.com)和 AI 云(ai.timecho.com)非常便捷地体验数据库与 AI 能力。