近日,智谱AI(Zhipu AI)正式发布了其最新一代大型语言模型GLM5.2,并公布了基于AMD Instinct MI355X加速器的高效推理基准测试结果。数据显示,在单个节点上,GLM5.2的推理吞吐量达到了惊人的2626个token/秒(tok/s/node),同时其运行成本较NVIDIA Blackwell架构方案降低了超过2倍。这一成果标志着国产大模型在跨平台推理优化方面取得了重要突破,也为AI基础设施的多元化选择提供了有力佐证。

AMD MI355X:新一代AI加速器的性能跃升

AMD Instinct MI355X是AMD针对大规模AI训练与推理推出的旗舰级加速器,基于CDNA 4架构,配备了高达288GB的HBM3e高带宽显存,并支持FP8、FP16等混合精度计算。此前,业界普遍认为AMD GPU在AI推理生态成熟度上仍与NVIDIA存在差距,但GLM5.2在MI355X上的实测表现彻底打破了这一固有认知。

在智谱AI公布的测试环境中,他们使用了单节点内搭载8块AMD MI355X加速器的服务器,针对GLM5.2模型(参数规模约为130亿级别)进行了优化的推理引擎部署。结果显示,该节点能够稳定维持2626 tok/s的吞吐量,且延迟控制在了毫秒级。这一数据不仅达到了业内顶尖水平,更直接挑战了NVIDIA H100/B200等Blackwell架构产品的性能标杆。

成本优势:超过2倍的降本效应

成本是此次发布的另一大核心亮点。智谱AI透露,在达到同等推理吞吐量的前提下,基于AMD MI355X的GLM5.2部署方案,其单节点TCO(总拥有成本)仅为NVIDIA Blackwell架构方案的一半以下。这主要得益于MI355X更具竞争力的硬件定价、更低的功耗(额定功耗约700W vs. Blackwell的700W-1000W+),以及智谱AI在底层软件栈上的深度优化。

具体而言,GLM5.2采用了自主研发的混合精度量化算法和内存访问模式优化,使得模型在AMD ROCm生态下能够充分发挥硬件潜力。智谱AI的工程师表示:“我们通过精细化的算子融合和显存复用,将MI355X的HBM带宽利用率提升至90%以上,从而在相同硬件成本下实现了更高的单位能耗产出。”

Blackwell对比:性能接近,价格腰斩

作为参照,NVIDIA Blackwell架构(如H100/B200)在同等规模节点上的推理吞吐量通常在3000-3500 tok/s左右,但硬件售价和部署成本远高于AMD方案。以公开市场报价估算,一套8卡Blackwell节点的采购成本约为AMD MI355X节点的2.5-3倍。考虑到GLM5.2的实际吞吐量差距仅在20%-30%之间,综合性价比优势极为突出。

这对于正在寻求降低AI推理成本的企业客户而言意义重大。无论是云服务商、大模型应用开发商还是企业内部AI部门,都面临算力成本逐年攀升的困境。AMD MI355X+GLM5.2的组合提供了一条“性能不减、成本剧降”的可选路径,有望加速大模型在更多场景中的实际落地。

生态与未来:跨平台推理的时代到来

此次发布也凸显了智谱AI在多平台适配上的技术实力。作为国内最早实现模型与AMD ROCm深度集成的公司之一,智谱AI不仅完成了对MI355X的全面支持,还同步优化了面向Intel Habana Gaudi、华为昇腾等非NVIDIA硬件的部署能力。这一策略有利于打破单一供应商的依赖,促进AI基础设施的自主可控和良性竞争。

业内分析认为,随着GLM5.2在AMD平台上的亮眼表现,越来越多的模型厂商将加速布局异构推理方案。AMD也在不断扩展其AI软件生态,ROCm 6.0及后续版本对PyTorch、Megatron-LM等主流框架的支持已趋于成熟。可以预见,2025年下半年开始,AMD MI355X有望在AI推理市场占据重要一席。

智谱AI表示,接下来还将针对更大规模参数(如千亿级)的GLM系列模型进行MI355X上的优化,并计划在近期发布完整的基准测试报告和部署指南。对于广大开发者而言,这意味着一个成本更低、选择更多样的AI推理时代已经拉开序幕。