近日,多位知情人士向本刊透露,苹果公司自主研发的M2 Ultra芯片在运行先进人工智能工作负载时暴露出显著的性能瓶颈,迫使这家科技巨头不得不向英伟达大量采购GPU以支撑其AI基础设施。这一转变不仅意味着苹果在AI领域的硬件布局遭遇重大挫折,也进一步巩固了英伟达在AI算力市场的统治地位。
M2 Ultra的雄心与现实
M2 Ultra芯片是苹果在2023年WWDC上推出的顶级自研处理器,集成了惊人的1340亿个晶体管,配备24核CPU和最高76核GPU,一度被视为苹果向AI计算领域进军的核心武器。苹果官方曾宣称,M2 Ultra能够“处理最严苛的创意工作流”,包括机器学习训练和推理。然而,据内部测试和第三方基准评测显示,在运行大规模语言模型训练、多模态AI推理以及高精度科学计算等先进工作负载时,M2 Ultra的实际表现远逊于预期。
“问题出在架构设计上。”一位参与相关项目的苹果前工程师匿名透露,“M2 Ultra的GPU核心在通用图形渲染中表现优异,但对于AI所需的矩阵运算和并行浮点计算,其专用加速单元(如张量核心)的规模和效率远不及英伟达的H100甚至更早的A100。在训练一个包含数千亿参数的Transformer模型时,M2 Ultra的完成时间比英伟达H100慢了近4倍。”
此外,M2 Ultra的显存带宽虽然高达800GB/s,但依旧难以满足先进AI工作负载对高带宽显存(HBM)的需求。相比之下,英伟达H100的显存带宽超过3TB/s,且配备专用的Transformer引擎,能够实现8倍于前代的AI训练速度。
苹果被迫转向“宿敌”
面对自研芯片的短板,苹果不得不做出一个艰难的决定:大规模采购英伟达的H100 GPU用于其内部AI服务器集群。据供应链消息人士透露,苹果已从英伟达订购了价值数亿美元的H100芯片,主要用于训练其正在研发的下一代大语言模型(LLM)以及强化Siri、Apple Music等核心服务的AI能力。这一举动颇具讽刺意味——苹果曾在公开场合多次批评英伟达的GPU定价策略和生态封闭性,而如今却不得不向后者寻求关键算力支撑。
值得注意的是,苹果也在同时与AMD、英特尔等供应商接洽,但最终英伟达凭借CUDA生态的不可替代性赢得了订单。CUDA是英伟达开发的通用并行计算平台,目前全球绝大多数AI框架(如PyTorch、TensorFlow)均对其深度优化。苹果虽拥有Metal性能优化框架,但其AI开发工具链的成熟度和社区活跃度远不及CUDA,导致开发者难以将基于CUDA的模型高效迁移到苹果硬件上。一位AI初创公司CTO向本刊表示:“即使苹果的M系列芯片能跑,代码重写和调试的时间成本也足以劝退大多数团队。苹果若不能建立兼容CUDA的底层生态,自研芯片在AI领域就只能是一个‘优则秀之’的锦上添花。”
自主芯片战略遭遇“AI分水岭”
这一挫折对苹果的长期战略构成了直接挑战。自2020年推出M1芯片以来,苹果一直致力于通过自研芯片实现硬件差异化、降低对第三方供应商的依赖,并构建从设备到云的端到端垂直整合。然而,AI工作负载的特殊性——尤其是对专用加速硬件和强大生态系统的依赖——正在打破这一规划。
市场研究机构IDC的分析师指出:“AI不是另一个图形渲染或视频编解码任务,它需要整个底层计算栈的协同进化。苹果在CPU、GPU、神经引擎等通用组件上的设计能力毋庸置疑,但在AI领域,它落后英伟达至少一个代际。如果苹果不能在下一代芯片(如M3 Ultra或未来的AI专用芯片)中实现实质性突破,它可能在AI基础设施竞赛中长期处于劣势。”
未来:自研加速器还是开放兼容?
目前,苹果并未公开回应M2 Ultra在AI工作负载中的表现问题。但据产业链消息,苹果内部正在加速研发一款专用于AI加速的芯片,内部代号为“神经元”,旨在集成高性能张量核心和超大容量片上内存。同时,苹果也可能考虑部分开放其AI工具链,以更好地兼容英伟达CUDA生态,降低开发者迁移难度。
然而,技术突破和生态建设均非一日之功。在AI算力需求指数级增长的当下,苹果的“英伟达依赖症”短期内难以根治。这场看似矛盾的“合作”背后,折射出后摩尔定律时代芯片行业的一个残酷现实:即便是市值三万亿的科技巨头,也无法在所有前沿领域维持独立自洽的技术闭环。对于苹果而言,自研芯片的荣耀与AI算力的焦虑,注定将在未来数年内持续博弈。