随着大模型参数规模突破千亿乃至万亿级别,千卡至万卡规模的集群训练已成为行业常态,但算力利用率低、显存瓶颈突出、线性扩展效率不佳等“隐形成本”正严重制约着大模型工程化落地效率。7月20日,中国信息通信研究院(以下简称“中国信通院”)宣布正式启动“AISHPerf大模型训推工程实践性能基准研究工作”,旨在为行业构建一套可引用、可对标、可追溯的工程性能参考基准,推动可信智算体系规范化发展。
聚焦工程痛点:性能基准缺失制约大模型落地
当前,大模型从实验室走向产业应用,面临着“算力跑不满、显存放不下、扩展提不速”的普遍困境。业界统计显示,部分千卡集群的实际有效训练时间占比不足60%,算力利用率波动剧烈,且不同厂商、不同架构的硬件在相同模型任务上的表现差异悬殊。然而,行业至今缺乏一套公认的、面向工程实践的性能基准体系——各企业各自为政,指标口径不一,测试环境与场景脱节,导致硬件选型、集群规划、优化方向缺乏客观参考。
中国信通院此番依托人工智能软硬件协同创新与适配验证中心,基于AISHPerf人工智能软硬件基准体系,正式启动该项工作。AISHPerf体系自推出以来,已逐步覆盖推理、训练、基础算子等多个维度,此次聚焦“训练与推理工程实践”,意味着基准将更贴近真实生产环境中的规模化集群场景。
四大核心指标:从“跑分”到“工程效率”
据中国信通院介绍,本次研究工作以“建基准、聚数据、促优化”为核心方向,将系统梳理千卡至万卡规模集群在训练与推理环节的核心性能瓶颈,明确以下关键指标的定义口径与经验值区间:
训练环节重点包括模型算力利用率、显存利用率、线性扩展效率、有效训练时间占比。其中,有效训练时间占比直接反映了集群因故障、断点、通信均衡问题导致的空耗时间,是衡量工程化水平的关键指标。
推理环节则聚焦首词元时延、吞吐量、显存带宽利用率等指标。首词元时延直接影响用户交互体验,而显存带宽利用率则揭示了长序列推理场景下硬件潜能发挥的瓶颈。
中国信通院表示,将结合业界公开技术报告与实测数据,对上述指标进行系统性归集与校准,形成涵盖典型模型(如LLaMA系列、GPT系列等)在不同参数量级、不同批次大小下的性能基线。
标准先行:为可信智算提供“度量衡”
此次研究并非孤立的测试工作,而是中国信通院推动“可信智算”体系建设的组成部分。长期以来,算力市场存在“标称算力与现实性能不符”“厂商自测结果难以横向比较”等问题,用户在选择算力服务时缺乏公信力参照。AISHPerf基准研究通过统一测试场景、标准化指标定义、公开化数据追溯,旨在为行业提供“一把尺子”。
据了解,参与该工作的企业可申请成为基准共建单位,提供真实场景下的测试数据,并优先获得性能对标报告。中国信通院也计划后续发布《大模型训练与推理工程性能白皮书》,将经验值区间与优化建议面向全行业公开。
行业声音:从“卷参数”到“卷效率”
业内专家指出,大模型竞争正从“参数规模竞赛”转向“工程效率竞赛”。同样规模的集群,高效训练的迭代速度可相差数倍。AISHPerf基准的推出,将倒逼硬件厂商、云服务商、算法团队更加关注工程实效,而非单纯追求理论算力峰值。
某头部云厂商技术负责人表示:“我们期待这一基准能覆盖混合专家模型、长序列训练、分布式优化等新型场景,真正反映千卡集群的实战表现。”也有芯片企业呼吁,基准应保持与行业演进同步,避免短期固化。
据透露,中国信通院将在今年下半年组织首轮标准测试和结果验证,并计划于年底前公布首批核心指标的参考区间。随着基准体系的逐步完善,大模型开发者和算力采购方有望告别“盲人摸象”式的性能评估,迎来更加透明、高效的工程化时代。