2025年7月15日,小米正式开源其自主研发的多模态自回归具身生成基础模型——Xiaomi-Robotics-U0。该模型拥有380亿参数,专注于为具身智能(Embodied AI)领域解决训练数据稀缺这一核心痛点。与以往仅关注感知或控制的模型不同,Xiaomi-Robotics-U0实现了“数据增强”与“场景生成”的双重突破:既能在保持几何一致性的前提下对已有数据进行精细化改造——如更换物体、光照、背景或添加干扰,无需重新采集;也能从零生成全新场景,覆盖危险、极端、长尾等真机难以触碰的环境。这一开源举措,被业界视为具身智能走向大规模落地的关键“基础设施”供给。
从“缺数据”到“造数据”:具身智能的底层突围
当前,具身智能研究面临的最大瓶颈并非算法本身,而是高质量、多样化、低成本训练数据的匮乏。传统做法依赖人工采集或仿真引擎渲染,前者成本高昂、场景单一,后者往往存在“仿真到现实”的差距(Sim-to-Real Gap)。小米Robotics-U0的定位正是“数据生成引擎”:它利用自回归架构与多模态理解能力,将真实世界的少量数据作为种子,通过生成式方式无限扩展训练样本集。
据介绍,该模型具备两大核心能力:首先,对已有数据进行“精准编辑”。例如,一个机械臂抓取杯子的演示视频,经过模型处理后,可将其中的杯子替换为瓶子,同时保持手部姿态、轨迹、背景光照的一致性,且无需重新录制。这种“换物体、换光照、换背景、加干扰”的操作,极大降低了数据采集的人力与时间成本。其次,模型可以从零生成全新场景,包括水下、高温、辐射等真机无法或难以复现的极端环境,以及“手被夹住”“传感器故障”等长尾故障案例,这些正是训练鲁棒机器人策略所急需的“困难样本”。
380亿参数的底气:自回归与多模态融合
Xiaomi-Robotics-U0采用自回归生成架构,结合文本、图像、深度图、力触觉等多模态输入,输出可操作的场景描述或渲染指令。380亿参数规模使其在理解复杂场景语义、保持几何与物理一致性方面具备显著优势。小米透露,该模型在内部测试中,对同一视点多帧生成的场景连贯性误差低于0.5%,物体替换后光照阴影的匹配度超过90%,已达到商用级数据增强工具的标准。
值得关注的是,小米此次不仅开源了模型权重,还同步发布了配套的工具链与评估基准,包括数据编辑API、场景生成配置文件以及针对生成质量的自动化评测脚本。这意味着研究人员与开发者可以直接接入该模型,快速构建属于自己的机器人训练数据集,无需从头训练大模型。
开源意义与行业影响
在智能机器人领域,小米并非第一个推出大模型的公司,但将380亿参数的具身生成模型完全开源,尚属业界首次。此前,OpenAI、Google DeepMind等机构虽发布了类似模型(如EgoGen、GenAug),但均未完全开放预训练权重或仅提供有限API。小米的开源策略被认为意在降低行业门槛,加速机器人从“特定场景”向“通用场景”的迁移。
一位机器人技术专家评论称:“具身智能的‘数据饥渴’长期以来被低估。小米Robotics-U0的开源,相当于为整个行业提供了一座‘数据自来水厂’——用户只需要几杯‘数据原水’,就能产出大量高质量的‘纯净水’。” 该模型尤其适合物流分拣、家庭服务、工业巡检等需要频繁适应新物体、新环境的场景。
风险与挑战
尽管前景广阔,但这类生成模型也面临潜在风险。生成的极端场景若被用于未经充分测试的机器人系统,可能引发安全事故。此外,生成的“伪训练数据”若存在系统偏差,反而可能恶化模型在真实世界的表现。小米在开源文档中明确提示了使用限制,并建议结合真实数据混合训练。
展望
随着Xiaomi-Robotics-U0的开源,具身智能的数据瓶颈有望迎来实质性突破。小米方面表示,后续将基于社区反馈推出微调版本,并探索与小米机器人(如CyberDog、CyberGear)的深度融合。可以预见,当“数据生成”变得像“写Prompt”一样简单,人形机器人与服务机器人的落地步伐将大大加快。2025年,或将成为具身智能的“数据爆发之年”。