随着人工智能大模型从训练转向规模化推理应用,芯片算力正成为制约落地的关键瓶颈。韩国AI芯片初创公司Furiosa AI近日宣布,计划在明年将其第二代推理芯片(产品代号暂未公开)的产量翻倍,以满足全球云服务商和企业客户对高效能、低功耗推理硬件的爆发式需求。

产能扩张背后的市场信号

据公司内部人士透露,Furiosa AI当前已与多家北美及亚洲头部数据中心运营商签署了初步合作协议,第二代芯片的订单量远超预期。尽管公司未公开当前月产量基数,但此次翻倍计划意味着其产能将从试产阶段跃升至规模化交付。Furiosa AI首席执行官June Paik在近期采访中表示:“我们观察到终端客户不再满足于通用GPU的高功耗方案,而是迫切需要针对特定推理场景优化的专用芯片。明年产量翻倍只是第一步,我们正同步签约更大代工产能,为2026年的进一步扩张做准备。”

这一计划正值全球AI推理芯片市场快速膨胀之际。据行业研究机构预测,到2027年AI推理芯片市场规模将超过500亿美元,其中边缘和云端推理各占半壁江山。传统上由NVIDIA主导的GPU市场在推理效率、功耗比方面一直存在争议,为初创公司留下了差异化空间。

第二代芯片的技术突围

Furiosa AI的第一代芯片“Warboy”在2023年推出,基于三星14nm工艺,峰值性能约80 TFLOPS(FP16)。而第二代芯片据称采用了更先进的5nm制程,并首次引入了自研的“RNGD”架构(即第二代Tensor Core),在稀疏化计算、低精度混合推理方面实现了突破。官方此前公布的数据显示,其FP8推理性能达到800 TFLOPS以上,而典型功耗控制在75瓦以内,能效比(TOPS/W)较NVIDIA A100提升约4倍。

更重要的是,第二代芯片原生支持Llama、GPT、Stable Diffusion等主流模型的全栈量化部署,并兼容PyTorch和TensorFlow生态,极大降低了客户导入门槛。据内部测试,运行Llama 2 70B模型时,其首Token延迟仅为竞品的60%,且完全无需昂贵的高带宽内存(HBM),而是采用LPDDR5X,大幅降低了系统成本。

重塑AI芯片竞争格局

Furiosa AI此番扩产,直接挑战了当前由美国巨头主导的推理芯片版图。在云端推理战场,各大云厂商纷纷自研芯片:谷歌TPU、亚马逊Trainium/Inferentia、微软Azure Maia等均已形成内部闭环。但中小型云服务商和企业级私有化部署仍高度依赖NVIDIA。Furiosa AI瞄准的正是这一“弹性市场”——通过更高性价比和开放生态吸引非绑定的客户。

与此同时,中国AI芯片初创公司如寒武纪、燧原等也在加速追赶,但受制于先进制程获取难度,更多聚焦在14nm/28nm成熟工艺。Furiosa AI得益于韩国半导体产业链支撑,能够顺利获得三星5nm产能,这一优势使其在性能功耗比上领先至少一代。

不过,挑战依然严峻。NVIDIA正在以软件生态(CUDA、TensorRT)和庞大的开发社区筑起护城河,而Furiosa AI的软件栈成熟度仍需验证。此外,大客户对供应链稳定性的要求极高,翻倍产能能否按时交付、良率是否达标,将决定其明年能否真正站稳脚跟。

前景展望

可以预见,2025年将是AI推理芯片“百家争鸣”的关键节点。随着Furiosa AI等新兴力量的持续发力,市场有望从“单极化”走向“多极平衡”。对于企业客户而言,这意味着更多的选择、更低的成本和更快的部署速度。而Furiosa AI能否借此次扩产窗口,从“计划者”蜕变为“交付者”,将成为其能否跻身全球排头兵的关键一战。

在算力需求永无止境的当下,每一块芯片的提速,都在为智能世界的基础设施添砖加瓦。Furiosa AI的翻倍计划,或许正是一声破局的前奏。