近日,由国内外多所顶尖高校及人工智能研究机构联合研发的新一代运动基础模型——Inertia-1 正式面向公众开源。该模型以“统一运动建模”为核心目标,尝试将人体动作、机器人运动、动物行为乃至物理世界中一切可量化运动的感知、理解与生成纳入同一框架,被视为运动智能领域向“基础模型”范式迈出的关键一步。
长期以来,运动相关的人工智能研究处于高度碎片化状态:动作识别、姿态估计、运动预测、轨迹生成、物理仿真等任务各自为战,训练数据格式迥异,模型架构互不兼容。这种“一人一摊”的局面严重制约了通用运动智能的发展。Inertia-1 的提出,正是为了打破这种壁垒——它希望像大语言模型统一自然语言处理任务一样,用一套统一的模型架构、一套预训练权重,去处理一切与运动相关的需求。
据项目团队介绍,Inertia-1 采用基于 Transformer 的多模态编码器-解码器架构,并创新性地引入了“运动感知”模块。该模块能够将时空运动信号(如关节旋转、位移、力向量、速度等)编码为连续的隐式表示,同时支持文本、视频、惯性测量单元(IMU)数据、骨骼动画序列等多种输入模态。模型在超过 1000 万条运动样本上进行了大规模预训练,数据覆盖人类日常活动、专业体育运动、四足机器人步态、机械臂操作轨迹等数十个领域,总时长超过 3 万小时。
在关键技术指标上,Inertia-1 展现出令人瞩目的通用能力。在跨任务迁移测试中,它能够在不经过微调或仅需少量提示的情况下,完成从视频中预测人体未来 5 秒的运动轨迹、基于文字描述生成完整舞蹈动作、以及根据环境约束规划机器人避障路径等任务。相比此前针对单一任务训练的专用模型,Inertia-1 在多数场景下的准确率提升 15% 至 30%,同时参数规模仅为传统集成系统的 1/5。
更为重要的是,Inertia-1 在物理合理性方面也取得了突破。传统生成式运动模型往往会出现“穿模”、“飘浮”、“关节反折”等不自然现象,而 Inertia-1 通过引入隐式物理约束层,在生成过程中实时计算运动链的动力学一致性,输出结果可直接用于仿真环境或实体机器人控制,无需额外的后处理修正。
“Inertia-1 是一份献给 AI 社区的开放探索。”项目核心负责人之一、某高校计算机视觉实验室教授在开源发布会上表示。“我们不仅公开了完整的模型权重、训练代码和多样化的预训练数据集,还提供了一个低门槛的交互式 Demo 平台,用户可以通过自然语言指令让模型实时生成或修正运动。我们相信,只有当学术界和工业界能够自由地复用、改进和扩展这项技术时,‘统一运动基础模型’才能真正落地。”
从应用前景来看,Inertia-1 的潜力辐射多个行业。在机器人领域,它可以作为“运动大脑”,让一台通用机器人无需针对每种操作场景单独编程,仅通过语言或演示即可学会新技能;在虚拟现实与游戏领域,它能够大幅降低动作捕捉成本,让角色动画更加自然丰富;在医疗康复领域,它可以辅助生成个性化的康复训练方案,并通过实时监测纠正患者动作;此外,运动分析、体育训练、人机交互等方向也将从中受益。
当然,Inertia-1 当前仍处于早期探索阶段。团队坦言,模型在处理极度复杂或高动态的运动(如自由体操、花样滑冰)时仍会出现细节失真,对超长序列(超过 30 秒)的生成稳定性也有待提升。同时,不同运动模态之间的统一表示方法存在精度损失,如何实现更细粒度的跨域对齐仍是未来研究重点。
值得注意的是,Inertia-1 的开源发布恰逢全球 AI 社区对“具身智能”关注度急剧升温之际。继语言、视觉基础模型之后,运动正成为下一个被大模型“攻占”的堡垒。可以预见,Inertia-1 将吸引大量研究者、工程师乃至创意工作者共同参与迭代,加速通用运动智能的到来。正如项目名称所寓意的那样——惯性(Inertia)是物体维持原有运动状态的性质,而 Inertia-1 正在成为推动整个运动 AI 领域向前奔涌的那股初始推力。