AI资讯 / 研究

研究 / 官方

追踪定位任务基准发布

Anthropic Research

Anthropic 与合作伙伴 Andon Labs 发布了名为「Project Pilot」的最新研究,测试前沿 AI 模型能否自主操控无人机执行室内人员定位与跟踪任务。研究团队将整体任务拆解为五个子任务:三维空间重建、无人机自定位、路径规划与飞行导航、目标人物检测以及持续跟踪。为支撑可重复评估,团队将上述物理任务转化为软件仿真环境,并建立了由人机协作团队共同制定算法的性能基线。最终形成的 Drone-Bench 基准由 Andon Labs 独立运行,Anthropic 未直接参与评测。研究指出,无人机本身是典型的双重用途技术,与 AI 能力的结合既带来搜救、灾害响应等正当应用场景,也引发监控滥用等安全隐患。Anthropic 表示,此类能力评估是其前沿红队工作的核心,旨在为政策制定者和社会各界提供及时的态势感知。

Anthropic 的前沿红队在过去一年持续探索 AI 模型与物理世界的交互边界。继「Project Vend」让 AI 运营小型商店、「Project Fetch」让机器狗取回物品之后,最新的「Project Pilot」将目光投向空中:测试 AI 能否自主驾驶四旋翼无人机,在室内办公环境中完成对指定人员的定位与跟踪。这一任务的选择并非偶然,其应用场景与政策争议均远比此前实验更为直接和敏感。

研究团队将核心任务拆解为五个相互依存的子任务。首先是「重建」,将办公室视频转化为三维模型并生成二维障碍地图;其次是「定位」,根据已知姿态的视频帧将无人机当前视角匹配到地图上;第三是「导航」,在障碍地图上规划路径并实时飞行;第四是「检测」,利用目标人物的参考照片构建检测器,在视频流中识别并框定目标;最后是「跟踪」,根据检测框持续调整无人机姿态,保持目标居中且距离稳定。

为提升评估效率,团队将上述物理任务全部迁移至软件仿真环境,使模型可以在无需每次搭建实体场景的情况下反复接受测试。这是相较于「Project Fetch」的重要改进——后者完全依赖物理实验。基线性能由人机协作团队共同制定:Andon Labs 工程师借助编程智能体为每个子任务开发算法,并在实体演示中验证了端到端任务的完整成功。若某模型能在所有子任务上达到或超越该基线,则可认定其具备自主操控无人机完成此类监控任务的能力。

Drone-Bench 基准由 Andon Labs 在与 Anthropic 协商后独立开发,评测过程也由 Andon Labs 独立运行,Anthropic 未获得基准的直接访问权限。这一设计有助于保持评估的客观性。值得注意的是,该基线既非未经辅助的人类能力下限,也非人机深度协作的能力上限,而是代表当前 AI 领域专家(而非全职机器人工程师)使用现代工具所能达到的实际水平。

无人机是典型的双重用途技术,已被广泛应用于农业增产和军事打击等截然不同的场景。AI 与无人机能力的结合同样具有两面性:搜救行动、灾害响应和合法公共安全执法是其正当用途,而对个人的未经授权监控、权力机构的越权使用则构成潜在滥用风险。Anthropic 强调,正因如此,对这一交叉领域建立更充分的实证认知至关重要。

Anthropic 指出,随着模型能力的持续提升,AI 使用现成机器人的便捷程度正逐步接近编程智能体使用软件工具的水平。Project Pilot 的发现再次印证了一个规律:技术进步在带来民主化机遇的同时,也在同等程度上扩大了风险敞口。研究团队呼吁技术开发者、公民社会与各国政府尽快就有效规范和治理框架达成共识,以应对 AI 自主操控物理设备这一新兴能力带来的深远影响。

要点

  • Anthropic 与 Andon Labs 联合推出 Drone-Bench 基准,系统评估 AI 模型自主操控无人机执行室内人员定位与跟踪任务的能力。
  • 整体任务被拆解为重建、定位、导航、检测、跟踪五个子任务,并全部迁移至软件仿真环境以支持高效可重复评估。
  • 无人机与 AI 的结合具有显著双重用途属性,合法应用与滥用风险并存,亟需政策层面的前瞻性治理。
  • 评测基线由人机协作团队共同制定,代表当前 AI 专家使用现代工具的实际能力水平,而非理论上限或下限。
  • Anthropic 前沿红队的核心职能之一是为社会提供 AI 物理世界能力的态势感知,为政策制定提供实证依据。
查看原始来源

原始标题:Can AI models fly drones?

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。