AI资讯 / 研究

研究 / 官方

Claude 的机器人能力有多强?Anthropic 给出基准答案

Anthropic Research

Anthropic 边界红队发布研究,评估 Claude 等语言模型在机器人任务中的真实表现。研究团队让模型控制多种机器人,包括经典控制玩具、四足与人形机器人、机器臂,以及真实的 Unitree Go2 四足机器人,并比较四种抽象层级不同的控制接口:直接输出力矩、编写 Python 控制器、训练强化学习策略、监督预训练策略。结果显示,模型在机器人上的得分不仅取决于模型本身,也取决于机器人本体与控制接口的组合。在人形机器人等高难度本体上,当前的模型只有在高抽象层接口、借助预训练策略时才能取得成绩。在底层关节控制与简单控制任务上,新一代模型相对前代有进步但并不稳定。在导航与操作任务中,借助预训练策略与感知工具,模型可以完成简单环境导航,但稳定的空间记忆与自定位仍是短板;抓取等操作全流程成功率仍在 0 到 5.5% 之间。研究指出,模型正在快速进步,但能否可靠地驱动机器人,很大程度上取决于它被接入机器人的方式。

Anthropic 边界红队近日公布一项系统性研究,考察 Claude 等语言模型在机器人任务中的实际能力。研究覆盖了从经典控制问题到真实四足机器人的多种场景,模型需要在不同抽象层级上控制机器人,包括直接给出关节力矩、编写 Python 控制器、通过强化学习训练策略,以及以自然语言监督一个预训练策略。

研究的核心结论是:模型在机器人上的得分不仅取决于模型本身,也取决于机器人本体与控制接口的组合。同一个模型,在直接控制关节时可能表现糟糕,但只要接入一个预训练策略或简单的方向工具,就能在导航与抓取任务上取得可观的成绩。这意味着评价语言模型的物理能力时,不能只看模型,还要看它被如何接入机器人。

在底层控制层面,研究团队观察到新一代模型相较前代有所进步,但并不稳定:有些模型明显更强,有些则与上一代持平。在最困难的本体——尤其是人形机器人上,今天的模型只能在高层接口、借助预训练策略完成低层物理计算时,才能获得有意义的进展。

在导航任务上,模型已经能完成有限但有意义的全身控制:新一代模型在四足机器人的站立、平衡与行走上有进步,在人形机器人平衡上也有较弱但可度量的提升;借助预训练策略与感知工具,它们甚至可以在简单环境中导航。然而,涉及稳定空间记忆、自定位或长时序开放规划的任务,模型依然失败。

在操作任务上,模型开始产出有用的局部物理行为,例如伸手接触物体并完成抓取。但全流程成功率仍然很低,仅在 0 到 5.5% 之间。当接入视觉-语言-动作预训练策略后,操作能力相对直接控制有显著提升,新一代模型在识别失败动作、避免无差别听从策略方面也更成熟,逐步缩小监督带来的性能损失。

研究指出,一个未经过任何机器人训练、面向通用对话的模型,在条件顺利时已经能够自己编写并下载工具,缓慢驱动四足机器人走出迷宫,或者把盘子从台面放到炉灶上。随着模型代际更迭,这种能力的可靠性差距正在缩小,预示着语言模型与物理世界结合的前景与挑战都将持续放大。

要点

  • 模型在机器人任务上的表现强烈依赖控制接口:高抽象层的策略监督比直接输出力矩更可靠
  • 新一代模型在底层控制上有所进步,但跨代提升并不稳定,部分模型并未明显强于前代
  • 在人形机器人等高难度本体上,当前模型仍需预训练策略才能完成有意义的控制
  • 操作任务全流程成功率仍仅在 0 到 5.5%,但局部抓取与接触能力在持续改善
  • 通用对话模型无需专门训练即可在条件顺利时完成简单导航与抓取任务,能力差距正在缩小
查看原始来源

原始标题:How Claude Performs on Robotics Tasks

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。