2025年7月15日,国内领先的通用机器人公司宇树科技正式发布其最新一代多模态大模型——UnifoLM-OminiA-0.3。这一版本的核心突破在于实现了“全模态交互理解”,即模型能够同时处理文本、图像、语音、视频、触觉及机器人运动姿态等多种信息输入,并在统一框架下进行协同推理与决策,标志着人机交互技术迈入“全域感知”新阶段。

从单一模态到全模态:交互范式的革命

过去几年,大语言模型(LLM)和多模态模型迅速发展,但大多数模型仍局限于“图文”或“语音+文本”的组合。UnifoLM-OminiA-0.3的发布打破了这一边界。宇树科技首席科学家在发布会上表示:“我们不再将不同感官数据视为独立通道,而是构建了一个统一的语义空间。无论是摄像头捕捉的画面、麦克风收录的语音,还是机器人关节的力矩反馈,都能被模型在同一时刻理解并关联。”

具体而言,该模型支持同时解析多达8种输入模态:文本、静态图像、动态视频流、语音(含语调和情绪)、环境声音、触觉信号(如压力分布)、机器人本体姿态数据以及激光雷达点云。例如,当机器人面对用户时,它可以一边识别用户的手势指令,一边分析其面部表情,同时感知周围物体的三维结构,并即时调整机械臂的抓取力度——这一切仅需数十毫秒。

技术突破:统一表征与实时协同

实现全模态交互的关键在于底层架构设计。UnifoLM-OminiA-0.3采用了宇树自研的“跨模态注意力融合网络”,不同模态的数据先通过轻量级编码器转换为统一长度的特征向量,再通过可学习的对齐矩阵投影到共享隐空间。这一设计避免了传统方法中不同模态数据需分别训练、后期拼接的冗余,使得模型能够捕捉模态间的细粒度关联——比如语音中的“小心”一词与视觉中突然出现的障碍物之间的因果关系。

此外,模型在实时性上也有显著提升。通过优化推理引擎和模型剪枝,UnifoLM-OminiA-0.3在宇树自家的通用机器人平台H1上,端到端响应延迟控制在150毫秒以内,接近人类自然交互的反应速度。这意味着机器人可以像人类一样,在行走、对话、操作物品的过程中连续感知环境,而非每次处理完一种模态后才能切换到下一种。

应用场景:从家庭服务到工业协作

全模态交互能力让机器人能够更自然地融入复杂的人类环境。在家庭场景中,机器人家政员可以通过观察主人拿起水杯的动作、识别其口渴的表情、以及听到“倒水”的指令,综合判断并主动完成倒水任务,即便周围环境嘈杂或指令不完整。在教育场景中,机器人老师能同时关注学生的眼神、书写动作和语音回答,从而精准评估学习状态。

工业领域同样受益显著。在柔性生产线中,装配机器人能够同时处理视觉质检数据、扭矩传感器反馈和工人语音指导,在出现异常时自主切换操作策略,大幅提升产线适应能力。宇树科技透露,已有数家智能制造企业启动了该模型的实景测试。

行业影响:通用机器人落地的关键一步

业内分析人士指出,UnifoLM-OminiA-0.3的发布不仅展示了宇树在大模型与机器人结合领域的技术积累,更验证了“一脑多体”思路的可行性——即同一模型可以适配不同形态的机器人(双足、四足、轮式),在共享认知能力的基础上进行差异化执行。这有望降低机器人行业的多模态AI开发门槛,加速机器人从“专用工具”向“通用伙伴”的转变。

不过,全模态交互也给隐私与安全带来新挑战。宇树科技表示,模型内置了动态权限控制模块,用户可随时关闭任意模态的数据采集,所有推理计算优先在本地边缘设备完成。同时,模型已通过国内相关算法备案,确保合规。

随着UnifoLM-OminiA-0.3的正式开启内测,宇树科技向外界展示了机器人“读懂世界”的全新可能。在人机共融的时代浪潮中,这场由全模态交互引发的变革才刚刚开始。