2025年3月26日,国内通用机器人技术领军企业自变量机器人(XVariable Robotics)正式对外发布其最新研究成果——跨具身动作分词器X-Tokenizer。这一创新技术被视为机器人领域从“形态绑定感知”迈向“跨平台动作理解”的关键突破,有望显著提升机器人在复杂环境中对动作与任务的泛化能力。

什么是X-Tokenizer?

简单来说,X-Tokenizer是一种能够将不同形态机器人(如轮式、人形、四足、机械臂等)所产生的动作数据进行统一建模与分解的“动作分词器”。它类似于自然语言处理中的分词器(Tokenizer)——将连续的文本切分为有意义的词元,X-Tokenizer则把连续的机器人运动轨迹与操作动作,切分为跨形态通用的“动作词元”。

这一定位背后,是自变量机器人团队对当前机器人智能发展瓶颈的深刻洞察。目前,大多数机器人的运动控制与任务执行严重依赖于自身硬件形态和传感器配置。一台轮式机器人学到“开门”的动作,其人形或四足版本几乎无法复用。这种“形态孤岛”不仅导致数据利用率低下,也阻碍了机器人群体智能的进化。

核心突破:动作表示的通用化与标准化

X-Tokenizer的核心技术在于构建了一个独立于硬件形态的动作表示空间。它通过对多种机器人(包括不同自由度、不同驱动方式、不同末端执行器)的大量样本进行学习,将关节角度、末端位姿、力矩反馈等异构数据映射到统一的高维语义空间,并在此空间内完成动作的分词与重建。

根据自变量机器人技术团队介绍,X-Tokenizer具备三个显著特点:

  1. 跨具身泛化:经过训练后,从人形机器人脚部行走的步态数据中提取的动作词元,可以被四足机器人直接用于调整其奔跑模式;机械臂的精细抓取词元也可以迁移到灵巧手或其他夹爪装置上,无需重新训练。
  2. 高保真压缩与重建:在保证动作细节的前提下,X-Tokenizer能够将长序列动作压缩为少量关键词元序列,并在不同的目标机器人上以不同运动学约束进行重建,做到“意同形异”。
  3. 支持多模态融合:X-Tokenizer不局限于运动数据,还能同时编码视觉、触觉、力矩等感知信息,使得动作分词结果具备环境感知背景,从而提升任务执行的鲁棒性。

应用场景:从工业到家庭的全覆盖

X-Tokenizer的发布,将直接推动多个领域的机器人应用革命。在工业制造中,不同品牌、不同构型的协作机器人可以在不增加额外训练成本的情况下,共享操作动作库。例如,某工厂引入新的柔性装配线,只需将已有动作词元通过X-Tokenizer转换,即可让新机器人快速掌握装配技能。

在服务与家庭场景中,X-Tokenizer让“一机多用”真正成为可能。一台初级轮式服务机器人可以借助词元迁移,学会原本只有人形机器人才能完成的拾取、放置等动作,大大降低服务机器人落地门槛。同时,由于动作表示脱离了具体形态,未来机器人可以通过云端动作库自由切换技能,类似智能手机下载应用。

此外,对于具身智能研究社区而言,X-Tokenizer提供了一种标准化的动作数据集格式,有望促进不同实验室之间的数据共享与模型联合训练,加速通用机器人基础模型的发展。

展望:当机器人学会“跨物种”学习

自变量机器人创始人兼CEO在发布会上表示:“X-Tokenizer是我们在具身智能通用化道路上的重要里程碑。它让机器人从‘形态决定智能’走向‘智能超越形态’。下一步,我们将围绕X-Tokenizer构建开放的跨具身动作词元库,并与全球开发者共同探索机器人学习的GPT时刻。”

行业分析人士指出,这一技术使机器人具备了类似人类的“类比学习”能力。正如人类看到他人演示翻书动作后,即使身高、手形不同也能模仿完成,X-Tokenizer赋予机器人的正是这种形态无关的动作理解力。随着动作词元库的不断丰富,未来机器人的技能获取将越来越像语言学习——从字母到单词,从单词到句子,最终形成通用的动作语法。

自变量机器人的X-Tokenizer,无疑为正在到来的“通用机器人时代”铺下了一块关键的基石。