近日,北京经济技术开发区(亦庄)传来重磅消息:北京首座词元(Token)工厂日产能已突破1.4万亿词元,成为全国乃至全球人工智能基础数据服务领域的重要里程碑。北京经开区相关负责人透露,下一步将向日产10万亿词元的远期目标迈进,同步规划建设词元分发调度中枢,并投用全市首个OPC(一人公司)社区,全方位打造“词元经济”产业链。
词元工厂:AI时代的“数字炼油厂”
在人工智能大模型训练中,词元(Token)是最小语义单元,是模型理解、生成语言的核心基础。随着ChatGPT、文心一言等大模型竞相涌现,高质量、海量的词元数据成为稀缺战略资源。北京首座词元工厂位于亦庄核心区,占地约2万平方米,采用全自动化数据标注与合成流水线,集成自然语言处理、多模态标注、数据清洗等模块,24小时不间断产出标准词元。
“1.4万亿词元是什么概念?这相当于每天可以对超过1400亿个中文词语完成高质量标注与结构化处理,足以支撑一个千亿参数级别的大模型全流程训练。”北京经开区科技创新局相关负责人表示,该工厂的投产有效缓解了北京乃至全国大模型企业“词元荒”问题,降低了企业从数据采集到模型训练的综合成本。
据了解,该工厂核心工艺实现了多项突破:智能标注准确率超过99.7%,错误率较传统人工标注降低80%;自动化调度系统可根据模型需求动态调整词元类型比例,实现“按需定制”;同时,工厂采用绿色节能技术,单位词元碳排放下降35%。
三环联动:从工厂到中枢到社区
词元工厂只是亦庄“词元经济”布局的第一环。更宏大的蓝图是构建“生产—调度—应用”全闭环生态。
词元分发调度中枢正在规划建设中。该中枢将搭建成覆盖京津冀乃至全国的词元流通网络,通过区块链技术确保数据溯源与版权保护,采用AI算法实现供需智能匹配。未来,大模型企业无需自行建设词元生产线,只需通过调度中枢即可按需购买高质量词元,实现“即买即用”,极大提升研发效率。
同时,全市首个OPC(One Person Company,一人公司)社区已在亦庄正式投用。该社区面向独立开发者、小型创业团队开放,提供标准化的工作空间、算力资源、词元接口以及工商财税一站式服务。入驻的“一人AI公司”可低成本获取词元数据,快速验证产品创意。据测算,OPC社区将孵化超过200个AI应用项目,带动就业超千人。
“我们正努力让词元像水电一样,成为标准化的AI基础设施。”北京经开区管委会相关负责人强调,“从工厂到调度中枢,再到OPC社区,亦庄希望打造一个可复制的‘词元经济’创新模式。”
专家观点:词元经济或重构AI产业格局
中国人工智能学会副秘书长、北京理工大学教授张立华认为,词元经济的本质是数据要素的标准化与商品化。“过去大模型企业要花大量精力在数据标注和治理上,现在专业化分工出现,词元工厂和调度中枢将重塑产业链,让企业更聚焦于模型算法和应用创新。”
北京智源研究院相关研究员表示,日产能1.4万亿词元虽然可观,但面对未来万亿参数级的大模型训练需求,仍存在缺口。“亦庄提出日产10万亿词元的远期目标,符合行业发展预期。关键在于保证数据质量、多样性以及合规性,避免‘数据偏食’。”
展望:打造全球AI数据枢纽
当前,全国多个城市都在竞逐人工智能赛道。北京作为科技创新中心,依托亦庄的产业基础与政策优势,正加速构建“词元经济”高地。下一步,北京经开区还将出台专项扶持政策,设立词元产业发展基金,支持数据隐私计算、高质量合成数据等关键技术攻关,并探索词元跨境流通试点。
可以预见,随着词元工厂产能的爬坡、调度中枢的建成以及OPC社区的运营,亦庄有望成为全球AI数据要素流通的核心枢纽,为北京乃至全国人工智能产业高质量发展提供源源不断的“数字燃料”。
(本报记者 李想)