Agent / 分析
GPT-5.6递归自我优化推动大幅降价,四个月内旗舰智能成本下降13倍
OpenAI于2026年7月30日宣布对GPT-5.6系列大幅降价:Luna下调80%至每百万输入token 0.20美元、输出1.20美元,Terra下调20%至2美元/12美元,Sol则新增最高2.5倍速的Fast模式。此次降价背后是GPT-5.6 Sol对自身推理服务的系统性优化——包括自主重写生产内核、改进投机解码草稿模型、优化KV缓存管理,以及在Rust编排层减少重复计算。最令业界震动的是一项横向对比:今年3月发布的GPT-5.4旗舰版在AA基准上得分51分,与当前Luna最高档持平,而GPT-5.4的定价为2.50美元/15美元,Luna现价仅为0.20美元/1.20美元。这意味着同等智能水平的token价格在约四个月内下降了约13倍,折算年化降幅约达2000倍,AI算力成本持续加速下行的趋势再度得到印证。
OpenAI此次降价并非单纯的商业策略调整,而是由GPT-5.6 Sol的自我优化能力直接驱动。该模型被用于分析生产流量、调整负载均衡,并以OpenAI自研的Triton和Gluon语言自主重写生产内核,仅这一环节就将端到端服务成本降低了20%。与此同时,Sol还自主设计并运行了数百项实验,优化投机解码的草稿模型架构,使token生成效率提升超过15%,整个过程包括对硬件故障和训练不稳定的自主干预。
在推理加速之外,OpenAI还对面向Codex和ChatGPT Work等产品的智能体编排层进行了系统性改造。工具、技能与插件采用延迟发现机制,仅在需要时才加载;工具输出默认限制在1万token以内,防止上下文窗口无谓膨胀。提示缓存方面,编排层将所有模型可见历史视为只追加结构,保留提示前缀以复用已计算数据,从而维持较高的缓存命中率,显著降低重复计算开销。
降价效果在实际应用层面已迅速落地。OpenAI表示,ChatGPT应用内的自动审查功能和Codex CLI将从GPT-5.4切换至Luna,预计成本降低约10倍。从成本效益曲线来看,多位分析人士指出,OpenAI当前的价格已超越DeepSeek、GLM、MiniMax等开源模型,以及Gemini Flash-Lite等主打性价比的专用模型,在非微调智能的成本竞争中处于领先位置。
最具冲击力的数据来自社区观察者nicdunz的横向对比:GPT-5.4旗舰版在AA基准上以最高配置获得51分,与当前Luna最高档的得分完全持平。然而GPT-5.4的定价为每百万token输入2.50美元、输出15美元,而Luna现价仅为0.20美元和1.20美元。这意味着在约四个月的时间里,同等基准智能水平的token价格下降了约13倍,折算年化降幅约达2000倍,远超此前的观测速率。
值得注意的是,ARC-AGI-3评测围绕智能体系统整体设计引发了新一轮讨论。François Chollet明确区分了专用基准测试工具与通用API功能的边界,而Opus 5在官方半私有设置下得分30.2%、GPT-5.6 Sol在标准工具链下仅得7.8%,但后者在启用推理保留与上下文压缩后公开集得分升至38.3%。这一差异表明,长周期评测越来越多地衡量的是包含推理保留、截断策略、工具编排在内的完整智能体系统,而非单纯的基础模型权重能力。
在开源生态方面,Thinking Machines发布了Inkling-Small,这是一个总参数量276B、激活参数仅12B的原生多模态MoE开源模型,定位于以四分之一的规模实现与原版Inkling相当的性能,并支持在推理过程中联合处理音频、图像与文本。vLLM宣布提供Day-0支持,Modal也展示了在单张B300上的部署方案。开源阵营的持续发力,为追求数据主权和完整控制权的用户提供了另一条路径,但在纯成本效益维度,OpenAI当前的优势仍然显著。
要点
- GPT-5.6 Sol通过自主重写推理内核、优化投机解码和KV缓存,将自身服务成本降低约20%,是此次大幅降价的核心技术驱动力。
- 同等基准智能水平的token价格在约四个月内下降约13倍,折算年化降幅约达2000倍,AI算力成本加速下行趋势持续强化。
- GPT-5.6 Luna定价已低于DeepSeek、GLM等主流开源模型及Gemini Flash-Lite等专用低价模型,在非微调智能成本竞争中暂居领先。
- ARC-AGI-3评测结果显示,长周期智能体评测的核心已从基础模型权重转向完整系统设计,包括推理保留、上下文压缩与工具编排策略。
- 开源阵营Inkling-Small以12B激活参数实现旗舰级性能,为重视数据主权的用户提供了可行替代方案,但成本竞争力仍落后于OpenAI当前定价。
原始标题:[AINews] GPT 5.6 price cut by 20%-80%: Cost of GPT 5.4 Intelligence dropped 13x in 4 months due to GPT 5.6 recursive self-optimization
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。