产业 / 媒体
GPT-6 Astra在机器人基准测试中展现空间推理重大突破
OpenAI的GPT-6 Astra在一项名为StationeryBench的新型机器人基准测试中表现出色,引发业界广泛关注。该测试涵盖五类桌面物体操作任务,包括拔掉马克笔笔帽、倒出回形针以及在两条机械臂之间传递尺子等。测试中,GPT-6 Astra与Ai2的MolmoAct2模型均控制相同的双臂YAM机器人,各进行100次试验。最终,Astra成功完成7项任务,中位进度得分达到46分;而MolmoAct2完成任务数为零,中位进度得分仅为12分。康奈尔大学与谷歌DeepMind的AI研究员Yoav Artzi将这一结果称为「空间推理的阶跃式进步」。此外,在尚未公开的REMAP基准测试中,GPT-6 Astra的准确率已接近人类水平,但研究人员指出在某些场景下仍与人类存在差距。
StationeryBench是一项专为评估机器人模型空间理解能力而设计的新型基准测试,由研究人员公开发布,所有结果、视频及代码均可在GitHub上获取。测试设置了五类典型桌面操作任务,要求模型控制双臂YAM机器人完成精细的物体操控动作,旨在考察模型对三维空间关系的感知与执行能力。
在200次总试验中,GPT-6 Astra以7项任务完成、中位进度得分46分的成绩遥遥领先。相比之下,Ai2旗下的MolmoAct2模型在100次试验中未能完成任何一项任务,中位进度得分仅为12分。两者之间的差距之悬殊,令研究界对GPT-6 Astra的空间推理能力刮目相看。
康奈尔大学与谷歌DeepMind研究员Yoav Artzi对这一结果给予高度评价,将其定性为「空间推理领域的阶跃式进步」。他推测OpenAI在训练GPT-6 Astra时使用了大量三维数据,例如Blender场景文件,这与该模型在三维任务上的显著提升高度吻合。
在尚未正式发布的REMAP基准测试中,GPT-6 Astra的表现同样令人瞩目,准确率已接近人类水平。不过Artzi也坦言,「即便是Astra,在其他场景下也尚未达到人类的表现水准」,这意味着当前进展虽然显著,但距离全面媲美人类的空间认知能力仍有距离。
值得关注的是,OpenAI此前已公开表示有长期计划自主研发消费级机器人产品。GPT-6 Astra在空间推理方面的突破性表现,或将为其机器人战略提供重要的技术支撑,也预示着通用具身智能领域的竞争将进一步加剧。
要点
- GPT-6 Astra在StationeryBench测试中完成7项机器人任务,竞争对手MolmoAct2完成数为零,差距显著。
- 研究人员认为Astra的提升源于大量三维数据训练,其在3D任务上的进步与这一推测高度吻合。
- 在未公开的REMAP基准测试中,Astra准确率接近人类水平,但在部分场景下仍存在差距。
- OpenAI的机器人战略布局与GPT-6 Astra的空间推理突破相互呼应,具身智能领域竞争加速。
原始标题:GPT-6 Astra appears to show a "step change" in spatial reasoning based on early benchmarks
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。