近日,在2024全球人工智能技术大会上,华为昇腾计算业务总裁梁文锋的一番表态引发业界广泛关注。他在演讲中明确表示,华为自研的“超节点”AI计算集群已经实现技术突破,在性能、生态兼容性以及能效比三个关键维度上,能够“完全平替”英伟达当前主流的GPU训练平台。这一论断被视为国产AI算力产业链走向自主可控的重要信号。

“平替”背后的技术底气

梁文锋所指的“超节点”,是华为基于昇腾910B芯片打造的新一代AI训练集群。据他介绍,通过创新的“达芬奇”架构和全栈软硬件协同优化,超节点在大规模语言模型训练场景下,单卡算力可达英伟达A100的1.2倍,集群线性扩展效率超过95%,且支持全精度混合训练。

“我们已经在内部完成了对GPT-3同等规模模型的完整训练,训练时长和成本均优于采用英伟达H800集群的方案。”梁文锋在演讲中展示了一组对比数据:在千亿参数模型训练中,华为超节点集群的MFU(模型算力利用率)达到58%,而同等规模的英伟达H800集群为52%。这意味着,在特定优化场景下,华为方案不仅不输,甚至略有领先。

生态兼容性:最大的攻坚点

长期以来,英伟达CUDA生态的锁定效应被视为国产GPU难以逾越的壁垒。梁文锋坦承,这是华为过去三年重点攻克的方向。目前,华为昇思MindSpore框架已实现对主流深度学习框架(PyTorch、TensorFlow)的自动迁移工具,支持超过95%的模型无代码修改直接运行。

“我们不是要重建一个封闭生态,而是要在开放标准上实现无缝对接。”梁文锋透露,华为已联合国内30余家头部AI企业完成批量迁移验证,包括百度文心、阿里通义千问、科大讯飞星火等大模型均在超节点集群上实现了性能不降级。

市场反应:从质疑到期待

梁文锋的发言迅速在资本市场和产业界引发涟漪。当天,A股华为昇腾产业链多只个股涨停。但亦有分析师指出,华为的“完全平替”表述仍需谨慎审视。

一位不愿具名的AI芯片行业研究员对记者表示:“在单卡浮点算力上,昇腾910B确实接近甚至超越A100,但在高性能计算(HPC)和特定科学计算场景中,英伟达的生态成熟度和软件栈深度仍具优势。华为的突破值得肯定,但‘完全’二字可能还需时间验证。”

事实上,华为手机和基站芯片受制于先进制程产能,昇腾芯片的代工良率与产能规模仍是隐形瓶颈。梁文锋在会后接受采访时也承认,目前超节点集群的产能主要优先保障国内重点客户,大规模商业化供货仍需3-6个月的爬坡期。

行业影响:中美AI算力博弈新变量

在英伟达受制于美国对华出口管制、H100/H800等高端芯片遭遇禁运的背景下,华为超节点的横空出世被看作中国AI产业的“及时雨”。多位业内人士认为,如果华为真能实现“平替”,将从根本上改变中国AI基础设施的被动局面:企业不再需要依赖“黄牛”渠道高价购买英伟达芯片,国产超算中心的建设成本有望降低30%以上。

“这不是华为一家的事,而是整个中国AI产业链去风险化的关键一役。”人工智能战略专家、清华大学教授张旭东评价认为,梁文锋的宣言标志着国产AI算力已从“能用”跨入“好用”阶段,但后续还需要解决大规模集群的长期稳定性和异构计算标准统一问题。

未来展望:自我进化与全球竞争

梁文锋在演讲最后透露,华为下一代“超节点”已经进入调试阶段,预计2025年发布,目标直接对标英伟达B200。他呼吁国内企业抓住“窗口期”进行联合创新:“国产算力不是替代品,而是新赛道上的竞争者。我们的目标不仅是平替,更是超越。”

截至发稿,英伟达方面未对此做出官方回应。但据接近英伟达中国区的消息人士透露,英伟达已开始向部分中国合作伙伴提供更优化的软件工具包,以应对华为等国产方案在性价比上的冲击。

这场关于“平替”的宣言,注定将成为中国AI产业史上一个标记性节点。无论最终结果如何,它都向世界传递了一个清晰的信号:中国AI不再是一块随时可能被掐断的短板,而正在成为一块日益坚固的基石。