产业 / 媒体
OpenAI 用 GPT-5.6 Sol 优化自身推理链路,端到端服务成本最多降低 20%
OpenAI 于 7 月 29 日发布博文,披露了一项以 AI 优化 AI 的工程实践:团队借助 GPT-5.6 Sol 模型对 GPT-5.6 系列自身的推理链路进行系统性优化,最终使生产环境端到端服务成本最多降低 20%。GPT-5.6 系列于 7 月 9 日正式推出,定位为 OpenAI 当前最强模型。在此次优化中,GPT-5.6 Sol 通过 Codex 分析生产流量,识别负载失衡来源,并自主改写 GPU 内核代码。团队还让该模型学习 Triton 和 Gluon 两种编程语言,以便直接优化推理引擎底层内核。与此同时,OpenAI 引入开源工具 FpSan 对模型生成的内核代码进行浮点数正确性验证,并对推测性解码机制加以改进,使 token 生成效率提升超过 15%。
OpenAI 于 2026 年 7 月 29 日发布技术博文,宣布利用 GPT-5.6 Sol 模型对 GPT-5.6 系列的 AI 推理链路实施全面优化。这一做法的核心逻辑是以模型优化模型:让当前最强的 AI 系统承担起分析和改进自身运行效率的工程任务,从而在不依赖大规模人工介入的前提下持续压缩计算成本、提升 GPU 利用效率。
在请求调度层面,OpenAI 的系统会综合地域分布、可用容量和加速器类型来分配用户请求;集群内部则进一步参考负载状况、上下文长度和缓存可用性等因素进行精细化任务分发。GPT-5.6 Sol 通过 Codex 持续分析生产流量,识别负载失衡的根源,并在此基础上测试不同路由策略、动态调整启发式规则,使整体调度更加高效。
在模型前向传播环节,GPT-5.6 Sol 负责识别哪些计算步骤可以预先完成、哪些可以规避、哪些可以并行执行,并通过 Codex 自主改写生产环境中的 GPU 内核代码。为了让模型具备直接操作底层推理引擎的能力,团队专门训练 GPT-5.6 Sol 掌握 Triton 和 Gluon 两种编程语言,使其能够针对性地优化内核实现,最终将端到端服务成本压缩最多 20%。
代码正确性是此次优化的重要保障环节。OpenAI 引入开源工具 FpSan(浮点数清理器)对 GPT-5.6 Sol 自动生成的内核代码进行验证,确保浮点运算结果的精度与可靠性符合生产标准。这一验证机制有效降低了 AI 自动生成代码在数值计算层面引入错误的风险,为大规模部署提供了安全保障。
在推测性解码(speculative decoding)方面,OpenAI 同样借助 GPT-5.6 Sol 完成了针对性改进。推测性解码是一种推理加速技术,其原理是由较小的草稿模型预测下一个 token,再由主模型对预测结果进行验证或修正。经过此轮优化,token 生成效率提升超过 15%,进一步降低了大规模推理服务的延迟与成本压力。
此次实践标志着 OpenAI 在 AI 系统自我优化方向上迈出了具有示范意义的一步。通过让模型深度参与自身推理链路的工程改进,OpenAI 不仅实现了可量化的成本收益,也为行业探索了一条以 AI 驱动基础设施演进的新路径。随着模型能力持续增强,这类自动化优化循环有望在未来发挥更大作用。
要点
- OpenAI 利用 GPT-5.6 Sol 对自身推理链路进行系统优化,生产环境端到端服务成本最多降低 20%
- GPT-5.6 Sol 学习 Triton 和 Gluon 编程语言后,可自主改写和优化 GPU 内核代码
- OpenAI 引入开源工具 FpSan 验证 AI 生成内核的浮点数正确性,保障生产环境安全
- 推测性解码机制经优化后,token 生成效率提升超过 15%
- 此次实践展示了以 AI 优化 AI 基础设施的可行路径,具有重要行业参考价值
原始标题:OpenAI 部署 GPT-5.6 优化模型自身推理性能,端到端服务成本最多降低 20%
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。