近日,蚂蚁集团旗下具身智能技术公司——蚂蚁灵波科技宣布,其自主研发的新一代具身基座模型 LingBot-VLA 2.0 正式向全球开发者全面开源。此举标志着国内具身智能领域在基础模型层面向开放生态迈出关键一步,也为机器人行业的规模化落地提供了更强的技术底座。
从“感知”到“行动”的跃迁
具身智能(Embodied Intelligence)是让机器人具备在复杂物理环境中自主感知、理解并执行任务的能力。与传统机器人的固定编程不同,具身智能要求模型像人类一样,通过视觉、语言等多模态信息,实时生成精准的物理动作。
LingBot-VLA 2.0 的全称为“视觉-语言-动作”(Vision-Language-Action)基座模型,是蚂蚁灵波科技在具身智能领域的第二代核心产品。相较于1.0版本,2.0模型在三个方面实现了显著突破:
- 多模态融合深度增强:新模型能够同时处理高分辨率视觉图像、自然语言指令以及触觉、力反馈等多源异构数据,并在底层进行统一的语义对齐。这意味着机器人可以理解“把桌上的红色杯子拿到厨房”这样包含空间、颜色、物体和动作的复杂指令。
- 动作泛化能力大幅提升:通过海量仿真数据与真实世界数据的混合训练,LingBot-VLA 2.0对从未见过的新物体、新场景展现出更强的零样本执行能力。例如,在未预先学习的厨房环境中,机器人仍能完成“打开冰箱门并取出饮料”的任务,成功率较上一代提升超过40%。
- 端侧部署效率优化:模型通过知识蒸馏和量化压缩技术,在保持高精度的前提下将参数量减少了60%,可流畅运行于中低端嵌入式平台,大大降低了硬件门槛。
全面开源:技术普惠与生态共建
蚂蚁灵波科技此次选择将LingBot-VLA 2.0的完整模型权重、训练代码、数据集构建方案以及推理部署工具链全部开源,采用Apache 2.0许可协议。这一举措在具身智能业界引发广泛关注。
公司技术负责人表示:“具身智能还处于早期阶段,单打独斗无法推动行业快速进步。我们希望通过开源,让更多科研机构、中小企业和个人开发者能够站在一个高质量基座模型上,专注于垂直场景的应用创新,而不是重复造轮子。”
事实上,LingBot-VLA 2.0的开源并非孤例。此前蚂蚁灵波科技已在2024年开源了1.0版本,吸引了全球数千名开发者参与协作。此次2.0版本的发布,不仅包含了更大的训练数据规模(超过千万条跨场景轨迹数据),还提供了详细的复现指南和微调教程,显著降低了使用门槛。
行业影响与未来展望
从行业格局来看,LingBot-VLA 2.0的开源为国内具身智能生态注入了新的活力。目前,海外有谷歌的RT-2、斯坦福的VoxPoser等模型引领风向,但国内尚缺乏一个权威的开源基座。蚂蚁灵波科技此举有望吸引更多企业将注意力从“做模型”转向“用模型”,加速机器人在家庭服务、物流分拣、智能制造等场景的落地。
一位长期关注具身智能的产业分析师指出:“开源基座模型的价值在于,它能让不同行业的开发者快速验证商业闭环。比如一家做养老机器人的初创公司,不必从头训练大模型,只需在LingBot-VLA 2.0上添加护理场景的数据进行微调,就能大幅缩短研发周期。”
此外,蚂蚁灵波科技同步推出了“灵波开源合作伙伴计划”,承诺将定期发布模型更新,并联合高校、企业共建高质量训练数据集。可以预见,随着更多开发者的加入,LingBot-VLA 2.0有望成为国内具身智能领域的重要基础设施。
结语
从实验室到产业,具身智能的落地需要开放、协作的土壤。蚂蚁灵波科技选择将LingBot-VLA 2.0全面开源,不仅展现了其技术自信,更为整个行业铺设了一条更高效的创新之路。未来,随着开源生态的壮大,我们或许很快就能看到更多能自主理解指令、灵活完成任务的机器人走进千家万户。