正文复制
加快构建适配人工智能发展的高质量数据供给体系
人工智能作为引领新一轮科技革命和产业变革的战略性技术,正在深刻改变人类生产生活方式。“十五五”时期是人工智能技术加速突破和应用广泛扩散的关键期。在人工智能发展的过程中,数据的作用日益凸显,既是决定模型能力上限的重要因素,也是支撑人工智能应用成效的关键变量。加快构建面向人工智能的高质量数据供给体系,是推动我国人工智能跨越式发展和“人工智能+”行动走深走实的关键抓手,对于加速产业智能化升级、推进新型工业化进程具有重要支撑作用。
当前,人工智能技术的蓬勃发展对数据要素提出了一系列新需求。近年来,我国人工智能产业发展取得显著成效,这背后离不开数据要素的坚实支撑。国家数据局统计数据显示,截至2026年3月底,我国日均词元调用量突破140万亿,相比2024年初增长1000多倍。《全国数据资源调查报告(2025年)》显示,2025年我国年度数据生产总量达到52.26泽字节(ZB),同比增长27.28%,占全球数据生产总量的27.44%,连续保持全球领先地位。其中,用于人工智能训练和推理的数据总量达到199.48艾字节(EB),同比增长42.86%;推理数据量首次超过训练数据量,反映出人工智能应用正从模型训练阶段加速迈向规模化落地阶段。截至2026年3月底,全国已建成高质量数据集超过11.6万个、规模超过960拍字节(PB),为我国人工智能突破性发展提供了重要支撑。下一步,人工智能技术加速迈向通用人工智能新阶段,对数据要素将提出新的需求。
模型迭代需要实现“数据+场景”融合。近年来,人工智能基础模型能力快速跃升,多模态理解、复杂推理和工具调用等能力不断增强,智能体逐渐成为主要应用形态,推动生成式人工智能加快向现实生产力转化。前沿模型的复杂任务处理能力已逼近甚至局部超越人类专业水平,应用重心正从“生成内容”加速转向“执行任务”。在这种情况下,传统依赖互联网公开语料的训练路径将难以为继,“数据墙”的制约日益凸显,单纯依靠数据规模扩张的边际收益持续收窄,通用数据已无法支撑模型代际突破。与此同时,人工智能应用落地与能力进化需要深度绑定垂直场景,场景既是技术转化为生产力的载体,也是高质量垂直数据的源头。更核心的是,数据供需的主要矛盾已从量的不足转向供给的体系化支撑缺失。这就要求着眼于人工智能的长远发展,构建自动化、标准化的数据工程体系,持续提升应用过程中的数据自我造血能力。构建数据与场景双向赋能机制,形成“场景沉淀数据、数据优化模型、模型赋能场景”的正向循环,为人工智能持续演进提供关键支撑。
模型训练重心的变化要求更加聚焦动态交互行为。大模型的初期发展高度依赖互联网公开的“静态语料”,以CommonCrawl等为代表的开源语料库汇聚了网络文本、电子书籍等多类公开资源,是大模型预训练阶段构建知识底座的核心支撑。然而,随着模型训练的重心从通用预训练向强化学习变迁,单纯的静态化语料已无法满足智能体自主决策、闭环执行等的高阶需求,模型训练数据的需求结构将随之发生重大转变。推动数据需求从静态知识数据向动态行为数据与交互流数据倾斜,涵盖智能体调用应用程序编程接口(

