产业 / 媒体
历时24小时、调用工具逾3300次
AI爱好者CozyBlaze近日发起了一项颇具挑战性的实验,让OpenAI新旗舰模型GPT-6 Astra在无人干预的情况下自主通关了Valve旗下经典3D解谜游戏《传送门》。整个通关过程共进行了3336次工具调用,按API价格计算成本达571.18美元,约合人民币3838元,实际由CozyBlaze每月200美元的Codex Pro订阅服务覆盖。技术层面,模型通过Model Context Protocol(MCP)与经过修改的SourcePauseTool控制游戏,思考期间游戏暂停,AI接收截图及位置信息后再规划并执行操作。完整直播记录长达约24小时,剪辑精华版约2小时。CozyBlaze对此持务实态度,认为此次通关不应被视为标准化基准测试,但承认这一成果令OpenAI早在2016年提出的「单一智能体解决多类游戏任务」愿景初现雏形。GPT-6 Astra本月初正式成为OpenAI旗舰模型,在多个专业领域达到当前最先进水平。
AI爱好者CozyBlaze近日公开了一项实验结果:他让OpenAI最新旗舰模型GPT-6 Astra在完全自主的状态下通关了Valve经典3D解谜游戏《传送门》。整个过程历时约24小时,共进行了3336次工具调用。按照OpenAI的API定价计算,此次实验的推理成本达到571.18美元,折合人民币约3838元,但CozyBlaze表示这些费用实际上由他每月200美元的Codex Pro订阅服务所覆盖,并未产生额外支出。
在技术实现层面,CozyBlaze采用了Model Context Protocol(MCP)与经过修改的SourcePauseTool(SPT)相结合的方案。每当GPT-6 Astra进入思考状态时,游戏便自动暂停;模型完成规划并发出一组输入指令后,SPT解除暂停并将这些操作付诸执行。在AI思考期间,系统会持续向模型提供实时游戏截图以及玩家角色的当前位置等关键信息,确保模型能够准确感知游戏状态。
这套「思考-暂停-执行」的循环机制也解释了实验时长与视频时长之间的显著差异。完整的直播记录累计长达约24小时,而经过剪辑的精华视频仅约2小时。大量时间消耗在模型的推理与规划环节,而非实际的游戏操作本身。这种机制虽然在效率上与人类玩家相去甚远,但对于验证AI的自主决策与空间推理能力而言,已具有相当的说服力。
CozyBlaze对这次实验结果保持了相当务实的态度。他坦承,目前AI在自主游戏领域仍存在诸多待解问题,此次通关也不应被当作衡量AI能力的标准化基准测试。然而他同时指出,看到一个通用型智能体能够自主探索游戏世界并最终完成整个流程,令人感到OpenAI早在2016年提出的长期愿景——打造一个能够解决各类游戏任务的单一AI智能体——正在逐步走向现实。
GPT-6 Astra于本月初正式成为OpenAI的新旗舰模型。OpenAI将其定位为代表「新一代智能」的系统,并宣称该模型在计算机操作、网页浏览、软件工程、网络安全、科学研究及专业工作等多个领域均已达到当前最先进水平。此次自主通关《传送门》的实验,是GPT-6 Astra发布后引发广泛关注的能力展示之一,也与其在ARC-AGI-3基准测试中取得99.95%高分的表现共同勾勒出这一新模型的能力边界。
要点
- GPT-6 Astra在无人干预下自主通关《传送门》,全程历时约24小时,共进行3336次工具调用,按API定价折算成本约571美元。
- 技术方案采用MCP协议与修改版SourcePauseTool,模型在思考期间游戏暂停,接收截图和位置信息后再执行操作,形成完整的感知-规划-执行闭环。
- 实验发起者CozyBlaze明确表示,此次通关不应被视为AI能力的标准化基准测试,但认为其意义在于印证了OpenAI 2016年提出的通用游戏智能体愿景。
- GPT-6 Astra本月初成为OpenAI旗舰模型,在计算机操作、软件工程、网络安全等多个专业领域达到当前最先进水平。
原始标题:OpenAI GPT-6 Astra 模型自主通关 3D 解谜游戏《传送门》:耗时 24 小时,成本 571 美元
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。