记者 张睿

近日,国内权威机构在对某算力基础设施龙头进行深度调研时披露,该公司已成功在国家超算互联网郑州核心节点实现了10万张计算卡规模的集群稳定运行,标志着我国在超大规模算力集群的调度、运维与性能优化方面迈出了关键一步。这一突破不仅验证了国产算力基础设施的规模化能力,也为即将到来的AI大模型训练、科学计算等万亿级应用场景提供了坚实底座。

十年磨一剑,攻克“万卡”级算力调度难题

据了解,此次实现10万卡规模稳定运行的节点,位于国家超算互联网体系的核心枢纽——郑州数据中心集群。该节点依托公司自研的算力调度平台与高速互联网络,将10万张高性能GPU/NPU计算卡整合为统一算力池,实现了资源动态分配、故障自动迁移、能耗智能管控等功能。机构调研报告显示,该集群在持续72小时满负荷运行测试中,单任务中断率低于0.1%,通信延迟控制在微秒级,整体算力利用率达到92%以上,远超行业平均水平。

“10万卡规模意味着什么?相当于同时调动10万台服务器协同工作,任何一台卡出现故障,都可能引发连锁反应。”参与调研的机构分析师向记者表示,“该公司在异构计算、负载均衡、容错机制等方面的技术积累,是支撑这一规模稳定运行的核心竞争力。”

响应“东数西算”战略,赋能超算互联网生态

国家超算互联网自2023年启动建设以来,目标是将全国分散的超算中心、智算中心、数据中心连接成一张“算力网”,实现算力资源像水电一样按需调用。郑州作为中部算力枢纽,承担着连接东部应用需求与西部能源优势的枢纽作用。该公司在该节点率先实现10万卡规模落地,不仅验证了超算互联网的工程可行性,也为后续更大规模的节点扩展提供了标准化范本。

“我们不是简单地堆砌硬件,而是从网络架构、存储协议到中间件都进行了系统性重构。”该公司技术负责人在调研座谈会上介绍,“比如我们自研的‘天穹’分布式通信库,将非阻塞通信效率提升了40%;而其‘星河’智能运维系统,能在30秒内自动定位并隔离故障卡节点,从而保障集群整体可用性。”

机构观点:算力基建进入“十万卡时代”,龙头公司有望持续受益

多家券商机构在最新研报中指出,随着AI大模型参数突破万亿级,对算力的需求正从“千卡级”向“万卡级”乃至“十万卡级”跨越。该公司此次实现10万卡稳定运行,意味着其已具备承接下一代超大规模模型训练任务的能力。从产业链角度看,算力集群租赁、智算中心运营、算力调度平台等细分领域将迎来爆发式增长。

“在‘东数西算’和‘新质生产力’双重政策驱动下,算力基础设施的投资逻辑正从硬件采购转向运维服务。”前述分析师进一步指出,“该公司在运维自动化、能耗优化、弹性扩容等方面的积累,将使其在后续的算力资源交易市场中占得先机。”

展望未来:从“可用”到“好用”的算力生态

据透露,该公司下一阶段计划将该节点的算力规模扩展至30万卡,并面向科研机构、企业用户开放“算力即服务”模式。同时,公司正与多家大模型厂商合作,针对推理加速、数据并行训练等场景进行深度优化,力求让超大规模算力集群从“跑得起来”到“跑得高效”。

从国家超算互联网的宏大蓝图,到郑州节点的10万卡实战突破,这背后是中国算力产业链从跟跑到并跑、乃至领跑的缩影。正如调研报告结语所言:“当算力真正成为像电力一样的基础设施,千行百业的数字化革命才刚拉开帷幕。”