7月19日,在Agentic时代AI基础设施创新发展论坛上,中国工程院院士、清华大学计算机科学与技术系教授郑纬民发表主旨演讲,指出当前人工智能产业面临的核心矛盾并非芯片算力的简单堆叠,而是稳定、低成本、高等级产出Token的系统能力严重不足。这一观点引发了与会专家和企业代表的广泛共鸣,为算力基础设施投资与建设提供了新的思考方向。
算力扩张不等于Token产能提升
郑纬民院士在演讲中直言:“算力规模快速扩张并不等于产生高效的Token产能。”他解释说,Token作为大模型处理的基本语义单元,正在从技术指标蜕变为产业核心生产要素。然而,当前许多企业盲目追求GPU集群规模的扩大,却忽视了从算力到Token这一转化过程中的效率损耗。
“就像有了大型发电厂,不代表电力就能以低损耗、低成本输送到每个用户终端。”郑纬民以电力系统作比,强调算力基础设施需要构建完整的“Token供应链”。他指出,智能体时代对Token的需求呈现爆发式增长,但现有系统在稳定性、成本控制和输出质量上存在明显短板。
Token成产业核心竞争力
随着AI从辅助工具向自主智能体演进,Token的稀缺性愈发凸显。郑纬民分析,智能体需要持续、实时地与用户交互,每次交互都消耗大量Token,且对响应速度和一致性要求极高。例如,一个复杂的多步推理任务可能需要生成数千乃至数万个Token,任何不稳定的输出都可能导致任务失败。
“真正稀缺的不只是芯片,而是稳定、低成本、高等级地产出Token的系统能力。”郑纬民强调,这种能力涉及模型推理效率、内存管理、网络带宽、缓存策略等多个层面的协同优化。当前,行业对算力投资的关注点大多集中在硬件采购上,而对Token产出效率的系统性研究仍显不足。
推理系统走向分布式与异构化
面对Token产出效率的挑战,郑纬民指出,推理系统的设计思路正在发生根本性转变。传统模式下,推理任务多依赖单机优化,通过提升单芯片性能来压缩响应时间。但在智能体时代,模型规模持续增大、并发请求激增,单机优化已无法满足需求。
“推理系统正从单机优化,走向分布式、缓存化、异构化、服务化。”郑纬民描述了技术演进的四个方向:分布式调度使计算资源按需分配;缓存机制减少重复计算,降低Token生成成本;异构计算融合CPU、GPU、NPU等不同芯片特性,实现能效最优;服务化架构则像水电一样提供Token即服务(Token-as-a-Service)。
产业启示:关注“Token效率”投资
郑纬民的观点对当前AI基础设施建设具有重要指导意义。他提醒投资者和企业,单纯比拼算力规模的时代正在过去,未来竞争的焦点在于“Token效率”——即以最低成本和最高质量产出满足需求的Token。这要求企业重新审视算力集群的架构设计,在硬件之外投入更多精力优化推理框架、缓存策略和调度算法。
与会专家认为,郑纬民的发言切中了当前AI产业从“大模型训练”向“大规模推理”转型的关键痛点。随着智能体应用加速落地,Token作为核心生产要素的地位将进一步提升,而构建高效、稳定的Token产线将成为决定企业竞争力的关键变量。可以预见,围绕Token效率的优化创新,将催生一批新的技术公司和商业模式,推动AI基础设施进入精细化运营的新阶段。