全球首款自主推理AI芯片问世,算力架构迎来范式变革

2025年3月18日,北京——在今日举行的全球人工智能芯片峰会上,初创企业深度先见(DeepForesight)公司正式发布了其耗时四年研发的全新架构AI芯片“Forth”。这款被命名为“Forth”(意为“向前”)的芯片,被业界视为自GPU以来最激进的算力范式重构。据官方披露的数据,Forth在特定大模型推理任务上的能效比达到当前旗舰AI芯片的12倍至18倍,且首次在单芯片上实现了“推理即训练”的在线学习能力。

跳出冯·诺依曼的“内存墙”

传统AI芯片(如GPU、TPU)的算力增长正逼近物理极限,核心瓶颈在于冯·诺依曼架构中计算单元与存储单元之间的数据搬运延迟——即“内存墙”。Forth团队选择了一条截然不同的技术路径:基于存算一体(Compute-in-Memory)与数字光处理相结合的混合架构。

“我们不是在优化现有架构,而是从神经科学的稀疏连接中获取灵感。”DeepForesight联合创始人兼CEO林逸博士在发布会上表示,“Forth的核心创新在于‘动态稀疏激活矩阵’。芯片内集成了超过8000万个可重构存算单元,每个单元不仅能存储权重,还能在纳秒级时间内独立完成乘加运算,并通过片上自适应路由网络直接通信,无需经过外部内存。”

这意味着,当运行一个万亿参数级的大语言模型时,Forth可以动态地只激活与当前输入最相关的5%到10%的神经元路径,同时将中间计算结果就近存储并复用,从而将数据搬运功耗降低两个数量级。据现场演示,Forth在运行Llama-3.1-405B模型(全精度)时,单芯片功耗仅为75瓦,而使用NVIDIA H100完成同等任务需4张卡、总功耗超过2800瓦。

“推理-训练”的闭环革命

更令行业震动的是Forth引入的“持续微调单元”。传统AI芯片在推理阶段只能执行前向计算,所有参数更新都要回到昂贵的训练集群中完成。Forth则内置了一个非易失性忆阻器阵列,可以在推理过程中实时记录高频出错样例,并通过片上学习引擎对部分参数进行低秩更新——整个过程无需断开推理服务,也无需将数据上传到云端。

“这相当于让每一块推理芯片都变成了一个‘学习终端’。”清华大学计算机系教授李星评价道,“自动驾驶、工业质检、医疗影像等边缘场景,将第一次获得真正意义上的实时适应能力。一辆装配Forth芯片的汽车,在遇到从未见过的路况后,不需要等回厂升级,就能在下次遇到类似场景时自动纠正策略。”

不过,林逸也坦承,当前的持续微调仅限于模型尾部几个低秩适配层(LoRA),对底层基础的调整仍需依赖云端训练。但即便如此,这一突破已引发全球AI架构师的热议。Meta AI首席科学家Yann LeCun在社交媒体上转发该消息并评论:“如果规模扩展顺利,Forth可能改写摩尔定律在后摩尔时代的定义。”

供应链与生态的双重博弈

Forth芯片的量产并非坦途。据知情人士透露,其核心部件“忆阻器交叉阵列”目前只能采用台积电的特定先进封装工艺,良率尚不足45%。DeepForesight计划在2025年第四季度前将良率提升至70%以上,首批面向云服务商和大型制造企业的样品将于6月发货。公司同时宣布,已与阿里云、百度智能云达成联合测试协议,与特斯拉上海超级工厂就边缘AI质检方案展开深度合作。

在软件生态方面,Forth发布了一款名为“ForthKit”的编译器,支持PyTorch、TensorFlow、JAX等主流框架的自动转换。据现场测试,原生的Llama.cpp推理框架仅需修改三行代码即可迁移至Forth运行,这显著降低了用户的迁移门槛。但行业分析师指出,真正让生态扎根需要时间。“GPU统治AI二十年的核心是CUDA的锁定效应,”IDC半导体研究副总裁Mario Morales表示,“Forth必须证明它在训练、推理、集群互联等全场景下的易用性和稳定性,而不仅仅是峰值功耗。”

未来展望:从芯片到“算力植物”

在发布会的最后,林逸展示了一组极具科幻感的概念图:未来数据中心的天花板上垂挂着一排排生物状的光电模块,每块Forth芯片被封装在透明树脂中,通过光纤与相邻芯片构成网状——他称之为“算力森林”。

“Forth只是第一步。我们真正想做的是让算力增长摆脱对光刻机精度的一味依赖,转而通过三维堆叠、光子互联和自适应学习来实现‘算力自生长’。”他说,“就像丛林里的树,每棵树都不完美,但整片森林却拥有捕捉阳光、供养所有生命的卓越能力。”

截至发稿前,DeepForesight已公开的融资总额为18亿美元,投资者包括红杉资本中国、高瓴创投、以及亿万富翁兼科技投资人彼得·蒂尔(Peter Thiel)。随着Forth首批工程样片在5月下线,这场关于未来AI算力基座的竞争,正在加速。