AI资讯 / 产业

产业 / 媒体

OpenAI GPT-5.6 Sol 仅凭一段模糊指令便自主完成 Luna 模型后训练

The Decoder

OpenAI 公布新一代旗舰模型 GPT-5.6 Sol,能够在极少人工介入的情况下自主完成对较小模型 Luna 的后训练。研究人员仅通过 Codex 平台给出一段描述模糊的提示,Sol 便自行选定训练配置、挑选 GPU、运行脚本并验证流程。OpenAI 为衡量这类能力构建了基于真实 AI 研究任务的递归自我改进基准,Sol 的综合得分比 GPT-5.5 高出 16.2 分。公司同时披露,Sol 已用于调试、训练优化与实验执行等环节,内部活跃研究员的日均 token 输出较 GPT-5.5 时代的峰值翻倍以上。

OpenAI 表示,新一代旗舰模型 GPT-5.6 Sol 具备独立完成较小模型后训练的能力。研究人员借助 Codex 平台向 Sol 发送一段描述相当模糊的提示,要求其寻找合适的训练配置、挑选 GPU、启动训练脚本并验证流程是否正常。Sol 据此自主完成了 Luna 模型的后训练工作,整个过程几乎不需要人工介入。

OpenAI 研究员 Kathy Shi 在一次公开演示中表示,过去这类工作通常需要一组资深研究员协作完成,而现在已经非常接近所谓自动化研究员的水平。不过 OpenAI 员工 Jason Liu 也在后续澄清,Sol 并非从零设计训练方案,大部分配置源自其自身后训练流程,核心任务是将既有设置适配到更小的 Luna 模型并执行训练。Liu 估计,这项工作原本大约需要两名研究员多花两周时间,因此仍是显著的效率提升。

为直接衡量模型的递归自我改进能力,OpenAI 构建了一套基于真实 AI 研究任务的内部评估体系,涵盖调试研究系统、优化内核与训练方案、运行机器学习实验以及改进其他模型等场景。在汇总后的递归自我改进指数上,Sol 的得分比上一代 GPT-5.5 高出 16.2 分,位居该基准模型层级榜首,其后依次是 Terra、Luna、GPT-5.5 和 GPT-5.4。

递归自我改进一直是 AI 安全研究领域的核心议题,因为它指向一种反馈循环:系统每完成一轮自我增强,便更有能力继续提升自己。OpenAI 竞争对手 Anthropic 此前曾强调,完整的递归自我改进尚未实现,但可能比多数机构预期的更早到来,并指出 Claude 已能承担主要范式转变之间的渐进性工作,方向性决策中由人类作出的比例已降至个位数百分比。

OpenAI 还公布了内部使用 GPT-5.6 Sol 的数据:研究人员将 Sol 部署在调试、训练系统优化、实验执行与结果阅读等整个开发周期中。即便在内部测试阶段,活跃研究员的人均日均 token 输出也较 GPT-5.5 创造的此前峰值翻倍以上,代码合并请求与实验数量同样显著上升。过去六个月中,分配给内部编码推理的算力份额增长约 100 倍,基于 Agent 的 token 用量增长约 22 倍。OpenAI 承认这些指标并不直接等同于研究进展,但仍反映出 AI 辅助工作正在快速规模化。

要点

  • OpenAI 称 GPT-5.6 Sol 仅凭一段模糊指令,便自主完成了 Luna 模型的后训练流程。
  • 在 OpenAI 内部递归自我改进基准上,Sol 比上一代 GPT-5.5 高出 16.2 分。
  • OpenAI 员工澄清 Sol 并非完全从零设计,而是将既有配置适配到 Luna 并执行训练,但估计仍能节省约两周人力。
  • 使用 Sol 后,OpenAI 内部活跃研究员的日均 token 输出较 GPT-5.5 时代的峰值翻倍以上。
  • 过去六个月,OpenAI 内部编码推理算力增长约 100 倍,基于 Agent 的 token 用量增长约 22 倍。
查看原始来源

原始标题:OpenAI's GPT-5.6 Sol autonomously post-trained the smaller Luna model with a "fairly underspecified prompt"

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。