打通数据价值链路 重塑油气行业AI竞争力
[中国石油新闻中心 2026-09-10]
□杨博 数智研究院创新中心数据集业务总监
近日,国家数据局印发《关于推进行业高质量数据集建设行动的实施方案》(以下简称《方案》),紧扣“人工智能+”行动,围绕行业数据集供给、流通、应用等关键环节,部署强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放六大专项行动。该《方案》是对数字时代生产要素演进规律的深刻把握,是对“以数强智、以智用数”发展路径的战略性校准,开启了数据要素与人工智能深度融合的全新格局。
《方案》为油气行业人工智能发展划定新赛道
当前人工智能发展面临结构性拐点:公域数据红利消退,通用大模型陷入“通识有余、专识不足”困境,难以有效支撑行业深度应用,行业私域数据正成为决定模型能力的核心变量。
《方案》将智慧能源列为重点建设领域,为油气行业带来三重战略机遇。一是数据治理规范化带来的基础能力提升。国家首次为行业高质量数据集内涵与外延作出系统界定,为油气行业数据从“自由生长”走向“规范治理”提供了顶层设计。二是链主地位强化带来的资源整合。中国石油作为链主单位可发挥牵引作用,整合勘探、炼化、销售全链条数据资源,推动产业链上下游协同共建。三是价值释放行动带来的商业模式创新。培育为高质量数据付费的市场共识,为AI创新从“项目级投入”走向“企业级运营”提供经济激励。
挑战同样严峻。一是行业数据普遍存在的“有数据无质量、有存量无治理、有资源无流通”的三重困境不容回避。二是油气数据关系国家能源安全,数据安全与共享的深层矛盾亟待破解。三是数据作为新型生产要素,其确权、定价与交易机制缺乏成熟范式。谁能率先破解数据治理、安全与资产化的三重难题,谁就能在油气行业智能化转型中赢得先机。
高质量数据集重塑油气行业AI竞争力
行业高质量数据集是经过深度加工、精准标注、系统治理,能够直接驱动模型训练、支撑场景应用的“高纯燃料”,在战略上已成为油气行业的核心竞争资产。
中国石油按业务领域成立专业语料工作组,采用“四阶八步”工作法,建立“数据—模型—应用—反馈与回流”的闭环,建成油气地震勘探大模型、地下资源地球物理测井等多项行业数据集,入选国务院国资委首批10余个行业30项央企人工智能行业高质量数据集优秀建设成果。中国石化启动“三个1”高质量数据集建设工程,中国海油获DCMM五级认证,国家管网推出行业首个可信数据空间……油气行业高质量数据集建设正从各自探索走向体系推进。
差距不容忽视。当前,行业数据集建设仍处于快速发展的早期阶段,多数企业将其视为“项目级数据准备”的一次性工程,导致其无法持续迭代及跨场景复用。数据集建设不能止步于项目级交付,应成为嵌入企业日常生产经营的“基础设施”,如同油田地质资料、炼厂工艺参数一样,成为每天被调用、持续被更新、不断被优化的核心资产,真正成为发展新质生产力的核心要素。
六大专项行动构成从建设到价值释放的完整闭环
六大专项行动沿着“供给—流通—应用—管理—变现”的数据价值链路依次展开,构成从建设到价值释放的完整闭环。
强基扩容与标注攻坚构成“供给侧双轮”,保障数据“供得出”与“供得精”。前者拓宽多模态数据采集渠道,后者推动标注从人力密集型向知识、智能密集型跃升。油气行业应全面梳理全链条数据资源,形成资源清单与需求清单,建立人机协同建设机制,让专家聚焦标准设计、复杂样本裁决和质量审核。
提质增效与应用赋能构成“需求侧双轮”,推动数据“用得好”与“能闭环”。前者强调数据集质量标准与“一次测评、全国互认”机制,后者打造“数据飞轮”应用闭环。油气行业应将数据集建设与日常业务运营深度耦合,实现更新与生产同步、标准与决策对齐,支撑跨业务单元可信复用。
管理服务与价值释放构成“制度侧双轮”,支撑数据“管得住”与“能变现”。前者落实数据持有权、使用权、经营权“三权”分置制度,后者鼓励资产化创新。油气行业应推动数据从“生产资料”走向“金融资产”,探索合规前提下的多元商业模式。
六大专项行动是环环相扣的系统性工程。供给侧质量决定需求侧效果,需求侧反馈驱动供给侧优化,制度侧提供全程保障。油气行业须建立统筹推进机制,将数据集建设纳入企业战略运营体系。
建立数据、模型与业务场景协同演进的良性循环
《方案》提出“场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值”的“数据飞轮”,核心是建立数据、模型与业务场景协同演进的良性循环。
流程上,以炼化装置运行优化为例。场景牵引数据,以常减压、催化裂化等关键装置操作优化为牵引,反向梳理工艺参数、设备状态、化验分析等数据需求;数据驱动模型,采集DCS实时数据、LIMS化验数据、设备振动监测等多模态数据,经标注对齐形成高质量数据集用于模型训练;模型赋能应用,部署到实际生产中,实时推荐最优操作参数组合,辅助操作人员精准控制,提高目标产品收率、降低能耗物耗;应用创造价值,模型推荐参数与实际操作反馈、装置运行结果比对后,偏差和校正记录回流至数据集,驱动模型持续迭代,使操作优化越做越准,目标产品收率持续提升、能耗物耗不断下降。四环首尾相接、循环往复,每一次旋转都在为下一轮积蓄更强的驱动力。
架构上,昆仑大模型“基础、行业、专业、场景”四层架构是“数据飞轮”逐层加速的组织载体。场景模型数据自上而下沉淀,持续提升行业模型能力;行业模型能力跃升,自下而上为场景模型建设提供更强底座。双向互动,逐层加速。
机制上,场景端建立遴选制度,确保围绕高价值场景旋转;数据端完善贡献考核激励机制,促进主动供数;模型端建立数据需求动态对接机制,加速模型迭代;应用端打造标杆案例,加速规模化落地。四端协同发力,推动“数据飞轮”从理念转化为可操作、可迭代的企业运营机制,让油气行业数据资产在循环中反复淬炼、持续增值,真正成为驱动行业智能化转型的价值引擎。
以统一AI中台为底座 推进高质量数据集建设
油气行业高质量数据集建设落地,应围绕“场景—能力—机制”推进。
以场景为起点,牵引建设方向。重点识别勘探开发、炼油化工、AI4S等核心领域高价值场景,聚焦井控风险、设备故障等低频高危长尾场景,构建“场景-数据”二维映射,确保建设方向与业务对齐。
以能力为支撑,锻造全链条工程化能力。统一AI中台作为六大专项行动落地的“技术底座”,提供贯通需、采、存、管、治、标、评、用全链路流水线,实现数据格式统一、接口标准一致、流程自动衔接、数据集中沉淀,杜绝“各自搭台、互不兼容”的重复建设。以此为基础,还需标准先行固根基,覆盖数据采集、标注、质量评估全流程,推动各环节规范统一;人机协同提效率,构建“机器预标注—专家精校准—模型再迭代”的协作方式,支撑规模化生产与专家精准把关相结合;迭代反馈促循环,通过模型训练反馈指导下一轮采集、增强与标注,支撑质量持续提升,最终形成标准规范、协同高效、持续迭代的完整工程化能力。
以机制为保障,推动长效运营。组织上建立业务主导、多方协同推进机制,明确权责分工;制度上配套全生命周期管理规范,促进数据集建设常态化;人才上组建“领域专家+算法工程师”双核团队,让算法“长”在业务上,而非“悬”在实验室里。三个维度协同发力,推动数据集建设从项目驱动迈向战略驱动。
