随着大模型技术加速落地,AI推理市场正从“跑分竞赛”转向“实用主义”阶段。在这一背景下,摩尔线程联合创始人王东近日在一次行业闭门会议上提出鲜明观点:“推理市场不存在所谓的‘万能芯片’,真正决定推理效率和成本优势的,是多种计算单元、软件栈与场景化优化方案的组合。”这一论断迅速引发业内高度关注。
推理需求爆发,芯片“万金油”神话破灭
当前,大模型应用正从云端向边缘、端侧全面渗透。从智能客服、内容生成到工业质检、自动驾驶,不同场景的推理任务对算力、带宽、延迟、功耗的要求天差地别。王东指出:“一个模型在云端做批量推理,和在手机上做实时推理,需要的硬件架构完全不同。指望一款芯片通吃所有场景,既不现实也不经济。”
事实上,英伟达凭借CUDA生态长期主导训练市场,但在推理领域,AMD、英特尔、Groq以及众多AI芯片初创公司已开始从不同角度切入。王东认为,推理市场的碎片化本质决定了“单芯片万能”的逻辑难以成立。“就像家居装修,没有一件工具能完成所有工序。推理同样需要‘工具箱式’的解决方案。”
摩尔线程的“组合拳”:GPU+CPU+NPU异构协同
作为国产GPU领军企业,摩尔线程已在图形渲染和AI计算领域推出多代产品。王东透露,针对推理市场,摩尔线程的策略并非追求单一芯片性能的极致,而是构建“GPU+CPU+NPU”异构融合的计算平台,辅以自研的MUSA软件栈和推理引擎。
“我们观察到,许多推理任务中,模型计算仅占30%左右,其余是数据预处理、调度、后处理等非规整负载。”王东举例说,“GPU在矩阵乘法上有绝对优势,但在控制流、I/O密集型任务上效率不高。因此需要CPU来编排任务流,NPU加速特定算子,GPU处理核心计算——三者协同才能实现整体最优。”
此外,摩尔线程还推出了面向不同场景的推理解决方案:例如面向云端对话式AI的“夸娥”推理集群,面向边缘视频分析的“曲阜”推理卡,以及面向PC端本地大模型推理的“元计算”加速卡。王东强调,“我们卖的不是芯片,而是经过验证的解决方案组合。”
软件生态是“组合拳”的关键
王东坦言,硬件组合只是第一步,真正实现“1+1>2”的效果,依赖深厚的软件栈和生态适配。摩尔线程在MUSA指令集基础上,已经兼容PyTorch、TensorFlow、ONNX等主流框架,并针对Transformer、MoE等主流架构做了深度优化。“很多用户反馈,同样的任务在其他芯片上需要手动调优数周,而在我们平台上可以‘开箱即用’。”
他还透露,摩尔线程正在与多家大模型厂商合作,提供从模型量化、剪枝到推理部署的全链路工具链。“我们要让组合方案像乐高积木一样灵活,用户可以根据自身场景选择最合适的组件。”
行业格局生变:从“拼算力”到“拼场景”
分析人士认为,王东的言论折射出AI推理市场正在经历深刻变革。过去两年,各家企业竞相发布“XX Tops算力”的芯片,但实际落地中,高算力往往因内存带宽不足、数据搬运开销大等因素无法充分发挥。而推理场景的多样化,迫使厂商从“参数竞赛”转向“场景定制”。
一位GPU行业资深专家指出:“王东的观点触及了核心矛盾——推理不是单纯的数学计算,而是系统工程。未来胜出的不会是算力最强的公司,而是能提供最适配场景解决方案的公司。”
对于摩尔线程而言,这一策略也面临挑战:异构组合方案需要更复杂的软硬件协同设计,对于初创公司来说技术门槛极高。但王东表示,摩尔线程已积累超过200项相关专利,并拥有完整的IP核自研能力。“我们相信,在推理这个长跑赛道上,组合方案才是终局。”
展望:推理市场将迎来“百花齐放”
王东最后总结道:“未来2-3年,推理市场不会一家独大。无论是云侧的推理航母,还是端侧的轻量级引擎,都将各有所长。摩尔线程愿意做那个提供‘组合工具’的伙伴,与行业共同推动AI从‘能用’到‘好用’。”
随着国产替代和AI普及的双重浪潮叠加,推理市场的差异化竞争大幕已经拉开。而王东的“组合方案论”,或许正为这一市场指出了新的方向。