当全球科技巨头仍在竞赛每秒千万亿次的浮点运算能力时,一场关于“计算什么是真正的效率”的认知革命正在悄然发生。一句来自计算体系结构领域的箴言——“Count the Bytes, Not the FLOPs”(计数字节,而非浮点运算次数),正从学术圈走向产业界,成为衡量AI系统真实性能的黄金法则。
FLOPs崇拜的终结
长久以来,FLOPs(每秒浮点运算次数)一直是衡量计算系统性能的“金标准”。从超级计算机的TOP500榜单到AI芯片厂商的产品宣传,谁拥有更高的FLOPs,谁就站在技术的制高点。这种思维定式深刻影响了整个产业链:芯片设计追逐更快的计算单元,AI模型关注更庞大的参数规模,硬件评测强调峰值运算能力。
然而,这种“FLOPs崇拜”正面临严峻挑战。当AI模型以近乎指数级的速度增长时,一个残酷的现实逐渐浮出水面:你根本无法把数据喂给计算单元。这就是著名的“内存墙”问题——计算速度的提升远远超过了内存带宽和容量的增长。
以当前备受关注的GPT类大模型为例,一个拥有数千亿参数的模型,其参数文件可能达到数百GB甚至更大。即使拥有世界最快的GPU,如果内存带宽不足、数据传输路径过长,大量的时间将被浪费在等待数据从内存传输到计算单元的路上。据统计,在某些的AI推理任务中,芯片实际利用率不足峰值性能的20%,其余80%的时间都是在“等待”中度过。
Bytes才是真正的瓶颈
“Count the Bytes, Not the FLOPs”的核心洞察在于:在数据密集型应用——特别是现代AI大模型中,真正限制系统性能的不是计算能力,而是数据的搬移效率。字节(Bytes)的流动速度,决定了FLOPs能否被有效利用。
这一观点的提出者之一、加州大学伯克利分校的Krste Asanovi教授曾直言:“我们不需要更快的乘法器,我们需要更短的数据路径。”这种思路正在影响从芯片架构到算法设计的各个层面。
在芯片层面,行业巨头开始将更多资源投入到缓存设计和内存架构上。NVIDIA最新的H100 GPU在内存带宽上进行了重大升级,带宽达到3.35 TB/s,同时配备80GB大容量HBM3显存。更重要的是,通过引入Transformer Engine等技术,在计算过程中自动调整数据精度,在保持模型精度的同时大幅减少数据传输量。
算法领域,稀疏化技术和量化技术成为热门方向。通过剪枝、知识蒸馏等手段,可以将模型参数大小缩小数倍乃至数十倍,同时保持大部分推理精度。这种“算法减重”本质上是在减少需要搬移的字节数量,从而缓解内存带宽压力。
架构革命:近存计算与存算一体
“Count the Bytes”的理念还在催生更彻底的架构变革。传统的冯·诺依曼架构中,计算单元和存储单元分离,数据在两者之间反复搬移,产生了大量的能量和时间消耗。据估算,数据搬移消耗的能量是计算本身消耗的数百倍甚至数千倍。
近存计算和存算一体架构在此背景下成为新的风口。将计算单元与存储单元在物理上尽可能贴近,甚至将计算能力集成到存储单元内部,可以大幅缩短数据移动的物理距离。三星、SK海力士等存储大厂已经推出了具备计算能力的HBM-PIM内存模组,能够在存储内部完成部分矩阵运算,减少与GPU主控之间的数据搬移。
这种架构变革对系统设计提出了全新要求。传统的量化标准——如TOPS/W(每瓦每秒万亿次运算)——正让位于更具实际意义的度量标准,如Effective Bandwidth Utilization(有效带宽利用率)和Data Movement Cost(数据搬移成本)。
行业启示:重构AI基础设施
“Count the Bytes”思维正在重构整个AI基础设施的投资逻辑。数据中心规划者不再只关注总算力,而是更加关注内存层次结构是否合理、互连带宽是否充足、缓存策略是否优化。云服务商提供AI算力时,也开始标注“内存带宽匹配”等级,帮助用户选择合适的实例规格。
对于企业用户而言,这一理念提供了审视AI投资的全新视角。在采购训练和推理硬件时,与其只看TOPS数值,不如更关注模型与硬件之间的“匹配度”——模型的参数规模、算子特性是否与硬件的内存架构、互联带宽相匹配。一套FLOPs不高但带宽充足、内存层次合理的系统,在实际的大模型推理场景中可能反而表现更优。
未来展望:从计算为中心到数据为中心
随着AI模型向更大规模演进,数据搬移的瓶颈只会越来越突出。或许不久之后,字节指标将成为比FLOPs更重要的评价维度。“Count the Bytes, Not the FLOPs”不只是一种技术调侃,更是一种计算哲学的转向——我们正在从“计算为中心”的时代,迈向“数据为中心”的新纪元。
在这个新时代,真正的算力革命或许不在于计算单元有多快,而在于数据是否能顺畅流动。正如一位业内专家所言:“未来AI芯片的竞争,将不再是谁能算得更快,而是谁能把数据搬得更巧。”