2025年7月10日,上海——蚂蚁灵波今日正式发布业界首个具身原生世界动作模型LingBot-VA 2.0。该模型不再沿用当前行业主流的“视频生成模型微调”技术路线,而是基于自回归架构从零开始预训练,围绕动态建模、因果预测和实时执行等机器人与真实环境交互的核心需求进行原生设计,标志着具身智能领域在底层技术路径上迈出了关键一步。

突破“视频微调”范式,从零构建物理交互能力

当前,多数具身智能模型采用“先训练视频生成模型,再将其微调为动作控制模型”的路径。这类方法本质上是将视觉理解与动作生成解耦,模型更擅长生成逼真的画面序列,却难以捕捉物理世界中的因果关系与实时反馈。蚂蚁灵波LingBot-VA 2.0彻底放弃了这一折中方案。

据蚂蚁灵波技术团队介绍,该模型采用纯自回归架构,直接以机器人本体传感器数据、动作指令和环境状态作为输入与输出,从零开始在海量物理交互数据中进行预训练。这种“原生设计”意味着模型的每一层参数都针对“执行真实动作”这一目标进行优化,而非从视频生成任务中迁移而来。

三大核心技术:动态、因果、实时

LingBot-VA 2.0的核心突破体现在三个维度:

动态建模:模型能够实时感知环境中物体的运动状态、受力变化和空间关系,而非简单识别静态图像。例如,当机器人尝试抓取一个在传送带上移动的包裹时,模型可同步计算包裹的速度、加速度和形变趋势,动态调整抓取轨迹和力度。

因果预测:区别于统计概率预测,LingBot-VA 2.0内置因果推断机制。当机器人推动一个物体时,模型会基于“推力-位移-反作用力”的因果链条预测后续状态,而非仅依赖历史运动模式。这一能力对复杂装配、精密操作等场景至关重要。

实时执行:模型架构针对低延迟推理进行了专门优化,在边缘端芯片上的动作执行决策时间可控制在毫秒级,满足机器人在高速运动或紧急避障场景下的响应需求。

从“看到”到“做到”的鸿沟正在弥合

“过去,机器人的视觉系统看到一杯水,但手部动作模型不知道水杯装满水与空杯时的抓取力应有何差异。”蚂蚁灵波首席科学家在发布会上表示,“LingBot-VA 2.0从设计之初就要求模型理解‘动作带来什么后果’,并将这种理解直接编码到参数中。”

这种原生设计还带来了另一个优势:数据效率。由于不需要依赖大量人工标注视频进行微调,模型在真实机器人上的迁移学习成本大幅降低。据透露,使用LingBot-VA 2.0,只需少量真实环境数据即可让机器人适应新的交互场景。

行业影响与应用前景

目前,该模型已在蚂蚁灵波自研的轮式机器人、机械臂平台和四足机器人上完成初步验证。在仓库分拣、家庭服务、设备巡检等场景的测试中,LingBot-VA 2.0在执行成功率、动作平滑度和环境适应速度上,均显著优于基于现有视频微调方法的模型。

业内人士分析,蚂蚁灵波此次发布的模型,不仅为具身智能提供了更符合物理规律的基础算法,也为机器人从业者提供了一种全新的技术选择。当行业仍在大规模采集视频数据、堆叠算力训练视频模型时,LingBot-VA 2.0的“原生动作生成”路线或将重新定义什么是真正的“智能体与世界的交互”。

蚂蚁灵波表示,下一步将开源LingBot-VA 2.0的预训练基座模型及部分训练代码,并计划年内推出面向中小型团队的商用SDK,以加速具身智能在千行百业的落地。随着这一基础模型的发布,机器人“看懂世界”与“改变世界”之间的技术鸿沟,正在被实质性填平。