近日,国家数据局发布最新数据显示,截至2024年第三季度,全国已建成高质量数据集12万个,涵盖工业制造、现代农业、金融服务、交通运输、医疗健康、城市治理等数十个重点领域。这批高质量数据集的建成,标志着我国数据资源体系建设迈入新阶段,为数字中国建设和数字经济高质量发展提供了坚实的“原料”支撑。
从“数据资源”到“数据资产”的关键一跃
数据被誉为新时代的“石油”,但未经清洗、标注、整合的原始数据如同原油,难以直接发挥价值。高质量数据集是指经过严格清洗、脱敏、标注、质量审核,并按照统一标准规范形成的结构化数据产品,具备高准确性、高完整性、高可用性等特征。工信部信息通信经济专家委员会相关专家指出,12万个高质量数据集的建成,意味着我国数据供给从“有没有”向“好不好”跨越,为人工智能大模型训练、行业数字化转型、政府治理能力提升提供了关键生产要素。
从分布来看,这些数据集涵盖了多模态、多类型:包括文本、图像、语音、视频、传感器数据等。其中,医疗健康领域数据集约1.8万个,涉及电子病历、医学影像、基因数据等;工业领域数据集约2.3万个,聚焦智能制造、工业互联网、供应链优化;城市治理领域数据集约1.5万个,覆盖智慧交通、环境监测、公共安全等应用场景。
政策驱动与市场协同:数据价值释放的加速器
高质量数据集的快速涌现,离不开国家顶层设计的强力推动。2023年国家数据局挂牌成立后,先后推出“数据要素×”三年行动计划,明确要求提升数据供给质量,推动形成一批典型应用场景。国务院印发的《关于构建数据基础制度更好发挥数据要素作用的意见》提出建立数据产权、流通交易、收益分配等制度,为高质量数据集的建设与流通扫清了制度障碍。
在地方实践中,北京、上海、深圳、贵州等地率先建立数据交易所,并设立高质量数据集专区。以北京国际大数据交易所为例,截至2024年9月,该所已上线高质量数据集超过3000个,涵盖金融征信、科研数据、气象数据等,累计交易金额突破10亿元。上海数据交易所则推出“数据资产化服务平台”,帮助企业完成数据治理和价值评估,已孵化出近百个高价值数据集产品。
市场主体参与踊跃。百度、阿里、腾讯、华为等科技企业纷纷开放自身积累的高质量数据集,并联合行业伙伴共建行业数据空间。例如,百度飞桨平台基于12万个高质量数据集中的医疗影像数据,训练出“文心医疗大模型”,在肺结节检测、眼底病变筛查等场景中准确率达到95%以上。华为云联合多家车企,利用高质量交通数据集训练自动驾驶模型,模拟测试里程累计超过10亿公里。
落地应用:从实验室走向千行百业
高质量数据集的价值,最终体现在应用端。在金融领域,基于高质量的数据集训练的反欺诈模型,让银行实时交易拦截准确率提升40%,每年减少数千万元损失。在农业领域,结合卫星遥感、土壤传感器形成的高质量数据集,帮助农户精准施肥、灌溉,平均增产15%以上。在交通领域,高质量的车流、路况数据集支撑了全国超过300个城市的智慧交通信号优化,平均缩短通行时间12%。
更值得关注的是,这些数据集在公共服务与基层治理中的价值。例如,国家卫健委依托高质量健康数据集构建疾病预警系统,在突发公共卫生事件中对传染病传播路径进行精准模拟,决策速度较传统方法提升两倍以上。生态环境部利用污染源监测数据集,实现企业排放实时监管,重点区域PM2.5年均浓度同比下降9%。
挑战与展望:数量之后更需质量与安全
尽管12万个高质量数据集成绩斐然,但业内也清醒看到面临的挑战。首先,数据标准不统一问题依然突出,不同行业、不同地区的数据格式、元数据规范存在差异,导致跨域流通成本高。其次,数据安全与隐私保护压力增大,尤其是涉及个人信息和商业机密的数据集,如何在合规前提下共享成为难题。此外,数据资产的估值与定价机制尚不成熟,制约了数据交易市场规模化发展。
国家数据局相关负责人表示,下一步将重点推进三方面工作:一是加快制定高质量数据集国家标准,构建全国统一的数据质量认证体系;二是深化数据安全合规治理,推广“数据可用不可见”的技术模式,如联邦学习、安全多方计算;三是鼓励数据商和第三方服务机构发展,完善数据确权与收益分配机制。
此外,专家建议,应进一步释放公共数据价值,推动政府、国企等先行开放高质量数据集,发挥示范效应。预计到2025年底,全国高质量数据集总量有望突破20万个,涵盖80%以上的国民经济重点行业,为我国在人工智能、数字政务、数字经济等领域的全球竞争中奠定更加稳固的数据底座。
12万个高质量数据集,不仅是一个数字,更是中国从数据大国迈向数据强国的关键一步。在顶层设计不断完善、技术能力持续跃升、应用需求蓬勃迸发的多重驱动下,数据的价值将如同活水般渗透到经济社会发展的每一个角落,成为驱动高质量发展的重要引擎。