2025年4月,人工智能与机器人交叉领域迎来重大突破。蚂蚁集团旗下蚂蚁灵波正式宣布开源LingBot-Video,这是全球首个基于Mixture-of-Experts(MoE)架构、面向具身智能(Embodied AI)的开源视频生成基础模型。这一举措不仅填补了具身智能领域高质量视频基模的开源空白,更为全球机器人研究人员提供了一套强大的数据生成与训练工具。

具身智能的“视觉语法”难题

具身智能的核心在于让机器人理解物理世界并与之交互。然而,传统机器人学习面临两大瓶颈:一是真实世界中采集机器人操作数据的成本极高,二是现有视频生成模型大多面向人类视觉内容,难以生成符合物理规律、具有动作连贯性的机器人视角视频。为解决这一矛盾,蚂蚁灵波团队创新性地提出了LingBot-Video模型。

据悉,该模型采用Mixture-of-Experts(MoE)架构,通过动态激活不同专家子网络,在保持计算效率的同时大幅提升模型容量。相比传统的稠密模型,MoE架构能更高效地处理多模态、多场景的具身视频数据,尤其擅长捕捉灵巧操作中的微小动作细节和复杂环境下的导航轨迹。

7万小时具身数据与动态画像引擎

LingBot-Video最引人注目的特点在于其独特的数据画像引擎。研究团队在海量互联网视频数据的基础上,系统性地引入了三类机器人专用数据:VLA(视觉-语言-动作)数据、VLN(视觉-语言-导航)数据以及Ego(第一视角)数据。这些数据覆盖了灵巧操作(如抓取、装配)、机器人移动(如避障、路径规划)和第一视角交互(如人机协作)等关键场景,总规模达到7万小时。

“这相当于一个机器人连续不断学习8年所积累的视觉经验。”蚂蚁灵波技术负责人表示,“通过数据画像引擎,我们能够对每一帧视频进行语义、动作、物理约束的多维度标注,从而让模型学会生成真正可执行的机器人操作序列。”

开源生态与行业影响

此次LingBot-Video的发布采取了完整开源策略,包括模型权重、训练代码、数据处理工具链以及部分基准数据集。这意味着全球开发者可以自由下载、修改和部署该模型,无需依赖任何闭源API。对于资源有限的学术团队和初创公司而言,这一开源举措极大地降低了进入具身智能研究领域的门槛。

业内分析人士指出,当前全球具身智能领域存在严重的“数据饥渴”,高质量视频数据的缺乏直接制约了机器人学习算法的进步。LingBot-Video的出现有望改变这一局面:通过生成逼真的、物理合理的机器人操作视频,研究人员可以低成本地合成大量训练数据,加速从仿真到现实(Sim-to-Real)的迁移过程。

技术亮点:从视频生成到动作理解

不同于常见的文生视频模型,LingBot-Video在生成过程中内嵌了动作感知能力。模型不仅需要预测下一帧像素,还需要隐式地学习物体间的物理关系、力反馈以及时序一致性。例如,当生成一个“拿起杯子”的视频时,模型会自动推演手指与杯壁的接触点、施力方向以及液体晃动等物理细节。这种从“视觉”到“物理”的跨越,正是具身智能区别于传统计算机视觉的关键所在。

此外,基于MoE架构的稀疏激活特性使得LingBot-Video在推理时具有极高的效率。在同等算力条件下,其生成速度可达传统稠密模型的3倍以上,且显存占用降低约40%。这为用户在边缘设备或机器人本体上部署实时视频生成能力提供了可能。

未来展望:连接仿真与现实

蚂蚁灵波表示,LingBot-Video只是其具身智能开源战略的第一步。未来团队计划将视频生成模型与强化学习、模仿学习框架深度融合,打造从“数据生成”到“策略训练”再到“迁移部署”的全链路开源工具。同时,他们正在探索将模型与真实机器人平台连接,实现“生成即执行”的闭环验证。

随着LingBot-Video的开源,全球机器人研究者将迎来一个崭新的数据基础设施。可以预见,在不久的将来,机器人不再需要从零开始在真实世界中“摸爬滚打”,而是可以通过海量合成视频快速掌握复杂技能。这或许正是通向通用具身智能时代的一把关键钥匙。