在人工智能大模型竞速与算力需求井喷的2024年,国产算力终于迎来历史性突破。近日,中科曙光正式宣布完成国产算力集群十万卡规模的规模化部署与验证测试,标志着我国在智能计算基础设施领域从“跟跑”迈向“并跑”,正式迈入十万卡集群时代。这一里程碑式的进展,不仅意味着国产算力在单体集群规模上追平国际领先水平,更展现出从芯片、网络、存储到系统软件全栈自主可控能力的系统性跃升。
十万卡:算力竞赛的“新门票”
所谓“十万卡”,即一个计算集群中集成了超过10万张高性能加速卡(GPU/NPU等)。这一量级被视为支撑万亿参数级大模型训练的基础门槛。此前,全球仅有极少数科技巨头如英伟达、谷歌等拥有十万卡以上集群的部署经验。而国内主流算力集群多停留在万卡规模,面临跨节点通信、能耗管理、故障恢复等多重挑战。
中科曙光此次“交卷”的十万卡集群,基于国产AI加速芯片构建,采用全自研的“星云”高性能计算互联架构,实现了每秒超百GB的节点间通信带宽,有效解决了大规模并行训练中的通信瓶颈。测试数据显示,在千亿参数大模型训练任务中,该集群的线性加速比达到95%以上,模型训练效率接近理论峰值。这意味着,国产算力已具备支撑下一代通用人工智能大模型的能力。
从“单点突破”到“系统协同”
十万卡集群的落地并非简单的硬件堆叠。曙光在系统层面实现了三大关键突破:一是高密度液冷散热技术,单机柜功率密度达到60kW,整体PUE(电能利用效率)低于1.15,解决了十万卡级的高功耗与散热难题;二是智能故障预测与自动恢复机制,集群日均故障率控制在0.01%以下,训练任务中断后可在秒级自动恢复,保障了大模型长周期训练的稳定性;三是异构算力统一调度平台,可兼容不同厂商的国产AI芯片,实现算力资源池化与动态调配。
“十万卡不是终点,而是国产算力生态走向成熟的新起点。”中科曙光总裁助理在技术发布会上表示,团队历时18个月攻克了大规模组网、光互联、分布式存储等30余项关键技术,相关成果已申请国际专利200余项。
行业共振:国产大模型迎来“加速器”
这一突破对国内AI产业影响深远。当前,文心一言、通义千问、智谱清言等国产大模型已进入千亿参数竞争阶段,但训练算力仍高度依赖进口加速卡。国产十万卡集群的可用性,意味着大模型企业可以在安全可控的环境下完成训练,大幅降低对海外供应链的依赖。据测算,该集群可支持同时训练三个万亿参数模型,或支持数十个千亿参数模型的并行研发。
业内人士分析,国产算力迈入十万卡时代,还将带动国产AI芯片生态的快速迭代。随着下游用户训推需求的爆发,国产芯片厂商将获得海量真实场景数据反馈,加速产品成熟。同时,国产算力中心将成为“东数西算”工程中智能计算枢纽的核心节点,推动中西部地区算力基础设施升级。
挑战犹存,自主之路仍需深耕
尽管十万卡集群已实现技术验证,但规模化部署仍需面对成本、运维、软件适配等现实难题。当前国产AI芯片的单卡算力与国际顶级产品仍存在代差,通过集群规模优势弥补性能短板的模式面临边际效益递减风险。业界呼吁,在扩大集群规模的同时,应加大底层芯片架构创新、编译器和框架优化等软硬协同投入。
曙光交出的这份“答卷”,是国产算力从“能用”到“好用”的关键一步。当十万卡集群从实验室走向商业运营,中国AI产业正站在新的算力起点上,向着更智能、更自主的未来加速前行。