Agent / 分析
OpenAI 发布 GPT-5.6 三档新模型,Codex 与 ChatGPT 整合迈向超级应用
OpenAI 一次性推出 GPT-5.6 Sol、Terra、Luna 三档模型与全新 ultra 推理档位,并以日、月、地球对应规格命名。Sol 在 Terminal-Bench 2.1、DeepSWE、Agents' Last Exam、ARC-AGI-2 等基准上刷新 SOTA,官方称综合成绩优于 Claude Fable 5 与 Opus 4.8,耗时与成本均显著下降。同步上线的 ChatGPT Work 把 Codex 桌面端、ChatGPT、Sites 公测、程序化工具调用、多智能体 Beta 整合进同一入口,被视为 OpenAI 超级应用战略的倒数第二步。API 端 Sol、Terra、Luna 输入价格分别为 5、2.5、1 美元每百万 token,加入缓存写入价格与九折缓存读取折扣。
OpenAI 正式发布 GPT-5.6 系列三档模型 Sol、Terra 与 Luna,分别对应日、地、月体量级别,作为此前文学化命名的替代。三档模型在 ChatGPT、Codex 与 API 同步上线,Plus、Pro、Business 与 Enterprise 用户可在中等及以上推理档使用 Sol,Pro 与 Enterprise 额外获得 5.6 Pro 高质量选项。API 价格分层为 Sol 5 美元/30 美元、Terra 2.5 美元/15 美元、Luna 1 美元/6 美元每百万输入输出 token,首次加入缓存写入计费并保留九折缓存读取折扣。
OpenAI 此次新增 ultra 推理档位,官方称之为最高能力设置,会默认协调四个智能体并行处理多个工作流,在 token 消耗上升的前提下换取更强结果与更短任务完成时间。max 档位则给予模型比 xhigh 更多时间进行推理、探索替代方案、检查与修正。官方表示在多类基准测试中,5.6 系列以更低成本取得更高表现,Terra 略高于 Fable 5,Luna 超过 Opus 4.8,且完成时间约为后两者的三分之一,输出 token 与估算成本约一半与四分之一。
在基准表现上,OpenAI 宣布 Sol 在 Agents' Last Exam 上拿到 53.6 的新高分,比 Claude Fable 5 自适应档领先 13.1 分;中等推理下以约四分之一估算成本领先 Fable 11.4 分,Terra 与 Luna 更以约十六分之一成本反超 Fable。Sol 同时刷新 Terminal-Bench 2.1、DeepSWE、CyberBench、Excel Modeling Benchmark、Legal Research Bench、ProofBench、SWE-bench 等多项 SOTA,并在 ARC-AGI-2 上取得 92.5%、在 ARC-AGI-3 上取得 7.8%,是首个经核验在 ARC-AGI-3 单机博弈上击败基线的前沿模型。
第三方测评总体把 Sol 放在前沿梯队。Artificial Analysis 给出 Intelligence Index 59 分,比 Fable 5 低 1 分但任务成本约为三分之一;Coding Agent Index 拿到 80 分领跑,单任务成本低于 Fable 5 与 Opus 4.8。Vals 把 GPT-5.6 排在 Vals Index 与多模态榜第二,承认 Fable 在部分基准仍领先但两者已属同一梯队;该机构同时提醒 AA-Omniscience 上 Sol 相比 5.5 仅小幅进步,且幻觉率高于 5.5 max。
产品层面,OpenAI 把 Codex 桌面端与 ChatGPT 合并为 ChatGPT Work,同步推出 Sites 公测、程序化工具调用,以及 Responses API 中的多智能体 Beta。官方称这是超级应用战略的倒数第二步,仅剩代理化浏览器的走向尚未明确。Sam Altman 在发布文中称这是公司迄今最强的模型,Greg Brockman 强调要为每一档目标性能给出最佳价格与最高能力上限。
在安全与能力外延上,OpenAI 表示 GPT-5.6 是迄今在网络与生物相关任务上最强的模型,部分 API 调用可能因双重用途被拦截或暂停以做额外审查。Computer Use 性能亦获提升,运行更快、token 更省,并支持批处理、并行多步任务与画中画监督。同日 Meta Superintelligence Labs 发布 Muse Spark 1.1 并首次接入 Meta Model API,因撞上 OpenAI 前沿发布而未能成为当日头条。
要点
- GPT-5.6 分 Sol、Terra、Luna 三档,API 输入价每百万 token 分别为 5、2.5、1 美元,新增 ultra 档默认四智能体并行推理。
- Sol 在 Terminal-Bench 2.1、SWE-bench、Agents' Last Exam、ARC-AGI-2 等多项基准刷新 SOTA,官方称在多项测试中以更低成本击败 Claude Fable 5 与 Opus 4.8。
- Codex 桌面端并入 ChatGPT Work,搭配 Sites 公测与 Responses API 多智能体 Beta,被业内视为 OpenAI 超级应用战略的倒数第二步。
- 第三方测评把 Sol 列为前沿梯队:Artificial Analysis Intelligence Index 59、Coding Agent Index 80,但 Vals 与 AA-Omniscience 指出与 Fable 仍有差距且幻觉率高于 5.5 max。
- OpenAI 同步强调 GPT-5.6 在网络与生物等双重用途任务上为迄今最强,相关 API 调用可能被拦截或暂停以做安全审查。
原始标题:[AINews] OpenAI launches GPT 5.6 Sol/Terra/Luna, Codex becomes ChatGPT superapp
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。