研究 / 官方
让机器人像调节旋钮一样切换动作风格
苹果机器学习研究团队于2026年7月发布论文,介绍了名为MoMo的两阶段模仿学习框架。该框架的核心创新在于将「运动模式」作为一种可跨任务复用的行为因子,让机器人不仅能准确完成操作任务,还能根据任务类型、操作对象和交互场景灵活调整动作的执行方式。MoMo由时空动作分词器和行为克隆Transformer两部分组成,后者以任务描述和连续运动模式条件作为输入。研究团队在六项真实机器人操作任务上进行了验证,结果显示通过调节运动模式条件,机器人可以产生稳定、动态及中间状态等不同行为风格,这些差异在关节速度、加速度和末端执行器接近角度上均有体现,且能被人类评估者有效区分。更值得关注的是,MoMo展现出组合泛化能力,能够将未见过的运动模式迁移到仅以单一模式演示过的任务上,同时基本保持任务成功率。
机器人在现实环境中执行操作任务时,面临的挑战不仅是「做什么」,更在于「怎么做」。同一个抓取动作,面对易碎物品时需要轻柔缓慢,面对工业零件时则可以快速有力。苹果机器学习研究团队提出的MoMo框架,正是为了解决这一执行层面的适应性问题,将运动风格从具体任务中解耦出来,作为独立的可控维度加以学习和复用。
MoMo的架构分为两个阶段。第一阶段是时空动作分词器,负责将机器人的连续动作序列编码为紧凑的离散表示,同时保留动作在时间和空间维度上的结构信息。第二阶段是行为克隆Transformer,它接收任务描述和一个连续的运动模式条件值作为输入,并据此生成相应风格的动作序列。这种设计使得运动模式可以像旋钮一样被连续调节,而非在几个固定选项间切换。
研究团队在六项真实机器人操作任务上对MoMo进行了系统评估。实验结果表明,通过改变运动模式条件,机器人能够产生可被人类评估者明确区分的稳定型、动态型及中间过渡型三类行为。这些行为差异在多个可量化指标上均有体现,包括关节运动速度、加速度曲线以及末端执行器的接近角度,证明运动模式的变化并非表面现象,而是深入影响了机器人的整体运动策略。
MoMo最具说服力的发现来自跨模式迁移实验。对于仅以单一运动模式进行过演示的任务,MoMo能够在推理阶段将用户请求的未见模式成功迁移过去,同时任务成功率基本不受影响。这一结果表明,框架学到的运动模式是真正意义上可组合、可迁移的行为因子,而非对特定任务-模式组合的简单记忆。
MoMo的研究思路与苹果此前探索的人形机器人策略学习方向形成呼应。此前,苹果团队已在利用以自我为中心的人类演示数据训练跨形态机器人策略方面开展研究,旨在降低数据采集成本并提升泛化能力。MoMo则在此基础上进一步细化了对机器人行为的可控粒度,为构建更灵活、更具表达力的机器人操作系统提供了新的技术路径。
从更宏观的视角来看,MoMo所提出的「运动模式作为可复用行为因子」这一概念,为机器人学习领域带来了新的研究范式。未来,这一框架有望与自然语言指令相结合,让用户通过语言描述直接指定机器人的动作风格,进一步降低人机协作的门槛,并推动机器人在家庭服务、工业装配等对动作精细度要求各异的场景中实现更广泛的落地应用。
要点
- MoMo将运动模式解耦为独立的连续可控条件,使机器人动作风格可像旋钮一样灵活调节,而非在固定选项间切换
- 框架在六项真实机器人任务上验证了运动模式的可区分性,差异体现在关节速度、加速度和末端执行器接近角度等可量化指标上
- MoMo展现出组合泛化能力,能将未见过的运动模式迁移到仅以单一模式演示的任务上,同时基本保持任务成功率
- 时空动作分词器的设计使动作序列在保留时空结构的同时实现紧凑编码,是框架实现跨任务模式复用的关键技术基础
原始标题:MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。