“机器人目前没有大面积应用,核心原因是具身智能大模型还不够成熟。”近日,宇树科技联合创始人陈立在一次行业论坛上抛出这一观点,引发业内热议。作为全球四足机器人领域的头部企业,宇树科技的产品已落地巡检、安防、教育等有限场景,但距离真正“走进千家万户”仍有巨大鸿沟。陈立的判断,精准戳中了当前机器人产业从“能跑会跳”迈向“能理解会决策”的痛点。
从“自动化”到“智能化”的断层
回顾机器人发展史,工业机器人早在数十年前就实现了规模化应用——在汽车制造、电子装配等流水线上,机械臂以毫秒级的精度重复着固定动作。然而,当人们期待服务机器人、人形机器人进入家庭、医疗、养老等复杂环境时,技术却突然“卡了壳”。陈立指出,根本原因在于机器人缺乏对物理世界的通用理解能力:“目前的机器人更像一台高级数控机床,它能在预设轨道上精准运动,但一旦遇到未编程的场景,比如地板上突然出现一只猫,就会陷入‘失智’状态。”
这背后是“具身智能”的缺位。所谓具身智能,是指智能体通过身体与环境实时交互,利用感知、认知和行动循环来完成任务。而大模型(如GPT-4、Sora等)的爆发,让人们看到了赋予机器人“大脑”的可能——通过海量文本与视觉数据训练,模型能够理解指令、推理逻辑、规划动作。但陈立强调,这一技术路径尚处于萌芽期:“目前最先进的大模型仍以语言和图像为输入,缺乏对物理规律、触觉反馈、动态环境的本体感知。机器人拿着杯子知道要轻放,但大模型不知道‘玻璃易碎’背后的力学原理——这种‘脱节’正是瓶颈所在。”
数据与泛化的双重困境
为何具身智能大模型“不成熟”?陈立从两个维度给出了解释。首先是数据匮乏。语言模型可以爬取互联网上海量文本,而机器人的训练数据需要真实的物理交互记录——抓取物体的力度、行走在不同地面的重心调整、避障时的运动轨迹等。这类数据采集成本极高,且场景无限多样,导致模型难以覆盖长尾情况。“宇树科技积累了数万小时的运动数据,但相比自然语言训练动辄万亿token的规模,仍是杯水车薪。”
其次是泛化能力不足。当前机器人往往“学会一种技能就忘记另一种”,即所谓的灾难性遗忘问题。陈立举例:让一台人形机器人学习煮咖啡,它可能能记住按开关、取杯子等步骤,但若将咖啡机换成不同品牌,或者桌面摆放发生变化,模型就很可能失效。“人类婴儿看到一次杯子掉地会碎,就能举一反三推测其他易碎品的特性,但机器人目前做不到这种常识推理。”
行业共识:仍需3-5年突破期
陈立的观点并非孤论。特斯拉Optimus、波士顿动力Atlas等知名机器人项目的进展也印证了类似困境——它们能完成跑跳、后空翻等高难度运动,却难以完成“把桌上牛奶倒入冰箱”这样的日常动作,原因正是缺乏对“冰箱门需用力拉开”“牛奶盒要倾斜”等隐含物理规则的建模。行业普遍认为,具身智能大模型的突破需要算法架构、仿真环境和数据标注体系的协同变革。
在技术落地方面,陈立透露宇树科技正尝试“场景倒逼研发”:先在工业巡检、仓储物流等结构化环境中部署机器人,通过大量数据积累反哺模型迭代。“机器人不需要一开始就‘全知全能’,先把某个垂直场景的‘智能’做到99%的可靠度,再逐步扩展边界。”他同时呼吁产业链开放合作,推动建立统一的机器人数据集标准,避免各厂商重复造轮子。
未来可期:从“工具”到“伙伴”
尽管当前挑战重重,陈立对机器人产业的远景仍保持乐观。他认为,随着多模态大模型、神经辐射场(NeRF)等技术向物理世界延伸,以及硬件成本的持续下探,具身智能有望在未来3至5年内迎来“奇点时刻”。“到那时候,机器人不再是笨拙的执行者,而是能真正理解人类意图、适应动态环境的智能伙伴。”
对于普通消费者而言,这一判断意味着“家用机器人”的普及仍需耐心。但正如陈立所言,每一次技术突破都需要穿越低估现实后的务实投入。当具身智能大模型真正成熟的那一天,机器人从特定场景走向大规模应用的“最后一公里”,或许将真正被打通。