近日,国家数据局在相关工作会议上公布最新数据:截至目前,全国已建成高质量数据集达12万个,涵盖工业制造、现代农业、商贸流通、交通运输、金融服务、科技创新、城市治理、医疗健康、绿色低碳等多个重点领域。这一成果标志着我国数据要素市场建设迈入“量质并进”的新阶段,为人工智能大模型训练、数字政府建设以及产业数字化转型提供了关键支撑。

高质量数据集:从“有数据”到“用好数据”

数据集是数据要素市场的基础单元。所谓“高质量数据集”,是指经过清洗、标注、脱敏、结构化处理,具备高精度、高覆盖率、高时效性,并符合特定应用场景需求的数据集合。国家数据局相关负责人指出,当前我国数据资源总量已居全球前列,但此前长期存在“数据孤岛”“数据烟囱”现象,大量数据“沉睡”在政府、企业、机构的服务器中,难以被有效利用。高质量数据集的系统化建设,正是破解这一难题的关键之举。

据悉,这12万个高质量数据集的来源构成呈现多元化特征:约40%来自政府部门在公共服务、社会治理、市场监管中积累的公共数据;35%来自企业生产经营、客户服务、供应链管理等商业数据;20%来自科研机构、高校的学术研究数据;其余5%来自互联网平台、物联网设备等社会数据。经过标准化治理后,这些数据集不仅可供内部使用,更可通过数据交易所、数据开放平台等渠道对外流通,推动数据价值释放。

应用场景持续拓展:赋能大模型与实体经济

当前,高质量数据集的应用价值已初步显现。以人工智能领域为例,训练一个千亿参数级别的通用大模型,通常需要数万亿token(数据单元)的高质量训练数据。此次建成的12万个数据集中,已有超过3万个被用于大模型训练,涵盖中文语料、专业文献、行业知识图谱等类型,有效缓解了我国AI企业在高质量中文数据集方面的“卡脖子”问题。

在工业制造领域,长三角某地建设的高质量工业数据集,收集了超过1000家企业的设备运行数据、质量检测数据和能效数据,通过数据融合分析,帮助企业平均降低设备故障率15%,提升生产效率8%。在医疗健康领域,全国已有多个省份建成覆盖电子病历、医学影像、基因测序等的高质量医疗数据集,支撑了AI辅助诊断模型的研发与验证,推动精准医疗落地。

此外,高质量数据集在金融风控、智慧交通、能源管理、城市应急等领域的应用也在加速。例如,某城市交通部门利用高质量交通流量数据集,优化了信号灯配时方案,使高峰期平均通行时间缩短12%。

制度与安全并重:数据要素市场走向规范

数据集的规模化建设离不开制度保障。国家数据局自2023年正式挂牌成立以来,先后推动出台了《关于构建数据基础制度更好发挥数据要素作用的意见》(“数据二十条”)、《“数据要素×”三年行动计划(2024—2026年)》等纲领性文件,明确了数据资源持有权、数据加工使用权、数据产品经营权等“三权分置”的权属框架,为数据集的确权、流通和交易扫清了制度障碍。

在安全层面,国家数据局强调必须平衡数据利用与隐私保护的关系。所有纳入高质量数据集建设的数据,均需要通过脱敏、匿名化处理,涉及个人信息的须符合《个人信息保护法》要求,涉及国家秘密的则严格隔离。目前,全国已建立数据安全审查、数据出境安全评估等制度,并正在推动建设国家级数据安全监测平台。

未来目标:从12万到百万级

尽管12万个高质量数据集已初具规模,但国家数据局相关负责人坦言,与我国庞大的数据资源总量相比,仍有较大提升空间。预计到2025年底,全国高质量数据集有望突破30万个,到2027年达到百万级规模。下一步,重点将在三方面发力:一是推动更多公共数据有序开放,释放政府数据价值;二是鼓励行业龙头企业牵头建设垂直领域专业数据集,如金融、医疗、能源等;三是构建全国一体化的数据流通基础设施,降低数据集的共享与交易成本。

业内专家指出,高质量数据集的持续建设,将直接拉动数据标注、清洗、治理等数据服务产业发展,预计到2025年,仅数据治理相关市场规模将突破3000亿元。同时,随着数据质量提升,中国在AI大模型、数字孪生、智慧城市等领域的竞争力将显著增强,真正实现“数据要素×”的倍增效应。

数据如水,集则成流。12万个高质量数据集,是中国迈向数据要素强国的一个坚实脚印。当这些数据真正“活起来”“动起来”,其释放的能量或将超乎想象。