首页
>
资源
>

昆仑数智:油气化工全产业链生产现场标准化数据采集应用实践

编者按:

8 月 22 日,2026 时序数据技术创新大会在北京成功举办,引发广泛关注。本次大会以「DB × AI」为主题,多位院士专家领衔,超 30 位嘉宾齐聚一堂,共同探讨数据库与人工智能融合发展的新趋势、新技术与新实践。

我们邀请到中国石油昆仑数智科技有限责任公司 数据智能事业部总经理 黄文俊带来以“油气化工全产业链生产现场标准化数据采集应用实践”为题的主题演讲。黄文俊在演讲中,系统分享了 DB × AI 背景下数智化技术在能源化工、油气行业的前沿落地实践。演讲伊始,他便从生产一线的实际需求出发指出,AI 要真正赋能油气化工行业,首先需要解决实时、持续的时序数据如何被完整记录的问题,并进一步将数据与业务语义无缝关联,使大模型能够真正理解和有效利用时序数据。

基于这一核心问题,这场汇报主要围绕三个方面展开:油气化工行业的数据管理背景,标准化数据采集方案,以及 DB × AI 的典型应用成效。

全文约 4 千字,阅读约需 8 分钟,以下是演讲主要内容:

油气化工行业的数据管理复杂性与智能化落地挑战

中国石油天然气集团有限公司(以下简称“中国石油”)已形成九个核心业务领域,业务横向贯通产业链全流程,纵向覆盖总部、专业公司、企业和生产一线。不同业务环节在时序数据采集与应用方面的需求各不相同,生产设备、工序流程和业务活动的差异,也带来了多样化的数据存储类型。

黄文俊首先指出,油气化工行业的数据复杂性高,具有业务链条长、应用场景多、设备异构且安全要求高等特点。

行业数据中既包括大体量的地质数据、类似电商交易的销售数据,也包括专业成果报告等,呈现出来源、粒度、频度和上下文各不相同的特征,数据管理因此成为一项复杂的系统工程。

黄文俊表示,经过多年的数据管理工作沉淀,当前面临的关键问题已经从“有没有数据”,转向数据能否稳定汇聚、统一表达、持续复用,并最终沉淀为集团公司的整体数据资产。

而由于各业务领域的生产特点不同,实时数据自动采集的方式和方法也存在差异,自动化采集率的统计口径并不统一,各领域的数据实时感知能力也存在较大差别。

在实践中,油气化工行业还普遍面临六类常见问题:业务场景复杂;生产设备类型和品牌繁多;野外及临时作业环境下的数据采集难度较高;生产单元和设备数量庞大;基础设施建设水平不均衡;人工填报与信息孤岛问题并存。

油气化工行业的生产单元规模庞大,仅油气水井就达到 30 余万口。同时,不同建设时期形成的采集系统之间也存在互联互通不足的问题。上述因素相互叠加,进一步增加了人工智能在生产一线落地应用的难度。

而针对上述问题,黄文俊表示,核心诉求并不是建设单一的智能应用,而是建立一套从数据源头延伸至价值创造的高质量数据链路闭环,围绕集团高质量发展、生产运营平台统一贯通以及“人工智能+”的行动落地,推动数据真正发挥价值。

在具体建设思路上,首先要将各业务领域采集的数据沉淀为标准目录,并通过标准目录把数据与生产工况、业务语义关联起来,形成统一的物模型。在此基础上,依托工业物联网标准网关汇聚数据,按照生产单元的业务过程形成数据资产,并以数据服务实体的形式对外提供服务,逐步构建以 MCP 为核心、支持多智能体应用的数据基础。

未来,集团还将围绕开发效率、数据完整度和智能化应用能力,持续推进相关建设。

黄文俊指出,生产现场的数据标准化并不是一套孤立的体系,而是集团整体数据体系架构的重要组成部分。目前,中国石油集团已建立起 “1+N+1”的数据体系,由统一管理、三级大数据平台和统一数据基础设施构成。

总部层面基于制度流程、标准规范等开展数据管理,形成覆盖全域的数据架构管控;围绕总部、专业公司、企业和生产现场,构建三级大数据平台体系,支持企业级数据资源的开发利用;底层则通过统一的数据基础设施和一体化数据技术能力,为集团整体建设提供支撑。

在这一体系下,Apache IoTDB 已融入集团数据基础设施,作为标准化的时序数据库组件,为生产现场数据标准化建设提供底层能力。

标准化采集:构建全产业链数据资产体系的七大关键行动

围绕生产运营平台建设,中国石油形成了从持续数据到数据资产的标准化采集路径。该路径主要分为三个步骤:

第一,建立数据采集标准目录。 按照业务流程,对生产过程中产生的数据类别进行统一规范,同时明确物模型及其数据采集内容,为后续标准化采集奠定基础。

第二,开展多模态数据采集与处理。 依据统一的数据目录和物模型标准,以工序这一生产现场的最小业务闭环为单位,采集多模态数据,并在现场完成预处理、时空对齐和数据入库。相关数据既包括从现有业务系统中集成的数据,也包括由现场设备实时产生的大量数据。

第三,推动数据资产化,支撑生产的智能化升级。 数据汇聚后,按照统一的物模型和本体语义模型进行关联组合,在数据实例化之后,并以标准化的形式统一发布,进而将持续数据沉淀为可复用的数据资产。

黄文俊在演讲中介绍道,中国石油构建全产业链数据资产体系重点推进了以下的七项关键行动:

关键行动1:统一设备物模型,推进设备数字化能力标准化。

方案围绕设备基础信息、属性项、事件和服务四个方面定义了油气行业的物模型标准。其中,基础信息包括标识符、名称等,类似于 TsFile 中的规范文件;属性明确各类设备需要采集的核心时序数据,如运行参数、过程参数等;事件用于建立数据与生产工况之间的关联;服务则对应设备操作的相关接口。

通过物模型的定义,生产现场的各类设备单元可以实现标准化实例化,并与企业级统一数据管理体系相连接。

关键行动2:构建三级协同的物模型管理能力。

生产现场完成物模型定义并与设备实例化连接后,采集的数据通过一体化网关接入企业级 IoTDB,再利用 IoTDB 的分层处理能力,对来自生产一线的时序数据进行融合处理。经过处理的数据,按照三级数据架构和上层应用需求逐级汇聚入湖。集团层面则建立统一管理平台,实现服务订阅与运营共享,促进跨单位应用协同,实现了时序数据的全链路管理能力。

关键行动3:推进生产现场数据资源规范化管理。

中国石油按照业务切片对石油行业业务进行划分,并以生产运行单元为基础定义业务对象,再基于业务对象识别物模型、制定物模型标准。目前,相关方案已经形成 28 类核心设备和 762 项时序数据采集标准,为数据标准化采集和质量治理筑牢基础。

关键行动4:建设标准数据采集网关,助力时序数据自动采集与汇聚。

在传统网关的基础上,方案进一步融合油气行业工业协议的自动识别、数据自动映射、设备节点自动注册,以及跨生产网与办公网的数据穿透传输等功能,并结合物模型标准,实现时序数据的逐级向上传递,为数据在集团工业互联网平台上的统一管理与应用提供支撑。

关键行动5:推进工序活动标准化,实现数据与生产工况的语义绑定。

黄文俊指出,从时序数据走向工业智能,关键在于解决时序测点数据与其产生设备、生产工况和业务过程之间的上下文关联问题。通过工序活动标准化,可以将现有时序数据与工况过程数据进行语义绑定,为持续开展大模型训练、支撑相关智能应用奠定基础。

关键行动6:结合物模型和 IoTDB 的数据基座能力,推进边缘层生产数据实时质控与预处理。

数据质量治理需要从数据中心前移至生产一线。为此,方案打通生产现场的数据质控环节,在边缘侧完成时空对齐,通过 IoTDB 的分层聚合能力,对特征数据集进行现场加工和构建,最终为后续智能应用提供高质量、清洁的数据。

关键行动7:建立覆盖全集团的运营机制,保障数据链路持续有效。

为实现数据链路的长期运行,集团建立了覆盖运行监控、数据质量、模型版本和服务调用等环节的运营机制。通过这一机制,IoTDB 不再只是后台存储系统,而是成为连接在工业互联网平台上,负责管理生产单元、行业知识,支撑智能应用的基础设施。由此,数据治理也由一次性的数据清洗,转变为伴随生产运营持续演进的过程。

经过两年的整体推进,中国石油依托标准化采集方案和三级协同架构,已基本建成覆盖油气全产业链的统一、持续数据标准体系,大数据自动化采集率显著提升,时序数据也逐步转化为数据资产,并将进一步支撑各类工业应用。

DB×AI典型应用:以可信时序数据驱动生产决策闭环

基于标准化采集方案,黄文俊进一步总结了 DB×AI 的价值链:从生产现场感知出发,持续汇聚设备、工况、系统和工序活动等多模态数据,并通过物模型与本体对对象、属性、事件和操作进行统一管理,消除数据语义歧义。在边缘侧,利用数据清洗、校验、缺失值补全和指标归一等技术,实现多模态数据的时空对齐;随后依托 IoTDB 的高频写入、压缩存储和分层汇聚能力,推动数据从生产现场逐级汇聚至企业和专业公司,最终沉淀为可信的时序数据资产。

这些数据资产可以进一步形成油气化工行业的专属数据集,一方面为模型训练提供高质量数据支撑,另一方面提升智能体应用的准确性与可信度。

目前,相关能力已在产量预测、钻井和炼化生产三个典型场景中取得应用成效。

在产量预测方面,过去存在部分生产数据缺失、不同单位统计口径不一致,以及数据与工况、设备信息关联不足等问题。通过标准化采集与数据预处理,相关方案已为井组连通性分析、开发指标预测和注采智能调控等应用提供支撑。

在钻井方面,针对钻井现场事故变化快、原因链复杂、研判处置窗口短等问题,昆仑数智承建的 ERSC 系统融合时序数据、专家知识库和事故知识库,构建时序大模型,形成覆盖风险识别、原因分析和处置建议的在线应用闭环。

在炼化生产方面,针对关键指标难以实时获取、异常处置依赖经验、生产数据利用率较低以及判断窗口较短等问题,相关方案通过构建炼化时序大模型,融合生产过程数据、工艺机理和专家知识,持续预测反应参数与产品质量,并识别流体异常。

黄文俊表示,DB×AI 的未来,需要面向生产设备、测点、工况、事件和作业链,构建可理解、可追溯、可治理、可执行的 AI 闭环,并在标准化采集、时序数据资产化、上下文统一、可信智能治理和产业智能闭环等方面持续发力,推动语义、时序与生产过程的一体化表达,实现从感知、认知、决策到评估、优化的完整闭环。

他最后强调,DB×AI 的关键不只是让模型“看见”数据,更要让数据携带语义、工况、过程和证据进入决策闭环。标准化不是终点,而是智能化的起点;IoTDB 数据库也不再是后台存储系统,而是支撑工业智能的重要基础设施;人工智能不是空洞的展示,而是实实在在的生产力。

未来,昆仑数智将继续携手高校、科研机构和生态合作伙伴,以高质量时序数据筑牢 DB×AI 底座,以产业场景牵引技术创新,为油气化工行业高质量发展和国家能源安全贡献更多实践与智慧。