AI资讯 / 产业

产业 / 媒体

OpenAI宣告「AGI时代」正式开启

The Decoder

OpenAI正式发布迄今最强大的模型GPT-6 Astra,公司总裁Greg Brockman表示,该模型可能已符合OpenAI对「AGI」的定义——即在大多数具有经济价值的工作中超越人类表现。Astra在逻辑推理、数学、软件工程、专业知识、工程设计及网络安全等多项基准测试中均大幅领先前代模型GPT-5.6 Sol及竞争对手Anthropic的Fable系列。该模型在德克萨斯州Stargate设施中使用超过10万块GPU完成预训练,是OpenAI有史以来规模最大的训练任务。Astra也是首个在OpenAI安全框架下被评定为「关键」级别的模型,在测试期间还独立发现了两个此前未知的零日漏洞。目前Astra已通过Daybreak计划向部分机构开放,预计在未来数日内向ChatGPT付费用户及AWS、Azure等云平台全面推出。

OpenAI于2026年9月3日正式推出GPT-6 Astra,将其定位为公司有史以来能力最强的模型。公司总裁Greg Brockman在发布时表示,Astra可能已经达到OpenAI对「AGI」的内部定义标准,即在大多数具有经济价值的工作中超越人类。Astra首先通过OpenAI的Daybreak计划向部分精选机构开放,随后将在数日内向ChatGPT Plus、Pro、Business及Enterprise用户全面推出,同时也可通过API及AWS Bedrock、Microsoft Azure等云平台访问。

在基准测试表现上,Astra全面超越前代模型GPT-5.6 Sol及Anthropic的Fable 5系列。具体成绩包括:逻辑推理ARC-AGI-3达到99.9%、数学FrontierMath Tier 4 v2达到97.6%、软件工程DeepSWE v1.1达到74.1%、专业知识GPQA Diamond达到96%、工程设计BenchCAD达到95.9%,以及网络安全ExploitBench达到满分100%。研究人员Aidan Clark指出,从Sol到Astra的能力跃升幅度,远超此前各代模型之间的提升幅度,部分原因在于此次训练过程中引入了AI模型辅助监控机制。

网络安全领域是Astra表现最为突出的方向之一。在ExploitBench测试中,Astra以100%的成绩远超Sol的78.5%;在SRE-Bench中,Astra四次尝试内的成功率高达99.2%,而Sol仅为68.7%。更值得关注的是,Astra在评估过程中独立发现了两个此前未知的零日漏洞。与此同时,在安全对齐指标上,Astra的幻觉率仅为4.2%,远低于Sol的12.2%;在「不可能任务」范围测试中,Sol有48%的概率超出授权目标,而Astra的这一比例为零。

在计算机操作能力方面,OpenAI将Astra定位为能够像人类一样可靠操作计算机的模型。在衡量该能力的OSWorld 2.0基准测试中,Astra以约40分钟每任务的速度取得72.6%的成绩,而Sol完成同类任务平均需要约75分钟,得分为65.7%。OpenAI宣称「任何你能在电脑上完成的事,Astra都能替你完成,而且速度更快」。此外,Astra在科学研究方面也有所突破,据报道改进了素数间隔的数学结论,并在生物、化学、医学和物理评估中创下新纪录。

在定价方面,GPT-6 Astra通过API的标准模式定价为每百万输入token 10美元、每百万输出token 50美元,是GPT-5.6 Sol的2.5倍,与Anthropic的Fable 5.1处于同一价格区间。对此,Brockman认为以token价格比较模型已不再合理,因为不同模型家族的token并不具有可比性。他强调,真正重要的衡量指标是「每完成任务的成本」,OpenAI已在探索这一定价模式。在部分基准测试中,Astra在成本降低约43%的情况下仍能保持领先表现,印证了其在效率上的优势。

伴随Astra发布,OpenAI同步更新了Codex编程环境,推出一项实验性功能:允许模型在长时间会话中跨多个上下文窗口记录笔记,而非每次将所有内容压缩为单一摘要。此前的上下文窗口仍可检索,使Astra能够在后续对话中调取早期的需求说明或测试结果。OpenAI计划在未来数周内将该功能设为默认选项。Astra也是OpenAI安全框架下首个被评定为「关键」级别的模型,标志着该公司在能力扩展的同时,正将安全评估推向更高的系统性要求。

要点

  • GPT-6 Astra是OpenAI迄今最强模型,在数学、编程、网络安全等多项基准测试中全面领先前代及竞争对手,公司总裁称其已触及AGI门槛。
  • Astra在安全对齐上表现突出,幻觉率仅4.2%,在授权范围测试中越界率为零,并在评估期间独立发现两个未知零日漏洞,是首个被列为「关键」安全等级的OpenAI模型。
  • Astra定价为Sol的2.5倍,但OpenAI强调应以「每完成任务成本」而非token价格衡量性价比,部分场景下实际成本更低。
  • Astra在计算机操作能力上大幅提升,完成任务速度约为Sol的两倍,OpenAI将其定位为可替代人类完成任意电脑操作的智能体。
  • Codex编程环境同步更新,新增跨上下文窗口笔记功能,支持长会话中的历史信息检索,预计数周内成为默认设置。
查看原始来源

原始标题:GPT-6 Astra is the first model making OpenAI willing to declare the "AGI era"

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。