AI资讯 / 产业

产业 / 媒体

价格减半,但性能提升有限

The Decoder

OpenAI发布GPT-6 Sol与Luna两款新模型,相较前代GPT-5.6 Sol和Luna,token价格直接腰斩。Sol的输入价格从每百万token 4美元降至2美元,输出从20美元降至10美元;Luna的输入从0.20美元降至0.10美元,输出从1.20美元降至0.50美元。OpenAI将降价归因于缓存与推理效率的提升,并声称将节省的成本直接让利给用户。在定位上,Sol面向代码审查、功能开发等复杂重复性任务,Luna则针对文档摘要、信息提取等高频低难度场景。OpenAI在多项基准测试中将新模型与Anthropic的Claude系列对比,强调其成本优势。然而,独立评测机构Artificial Analysis的分析显示,两款模型的智能评分与上代基本持平,部分知识类基准测试甚至出现退步,实际性能提升相当有限。

OpenAI于2026年9月正式推出GPT-6 Sol与Luna,这两款模型的核心卖点是大幅降低的使用成本。Sol现定价为每百万输入token 2美元、输出10美元,Luna则分别为0.10美元和0.50美元,均较前代削减约50%。OpenAI表示,这一降价源于推理效率与提示缓存技术的持续优化,节省的成本将直接传递给开发者和用户。值得注意的是,此前定位最低端的Terra模型已同步下线。

在产品定位上,OpenAI为两款模型划定了明确的使用场景。Sol主要面向构建新功能、代码审查、调试和数据分析等需要持续处理的复杂任务;Luna则更适合大批量、定义清晰的轻量任务,例如文档摘要、信息提取和简短问答。此外,GPT-6还引入了提示缓存优化,缓存命中的输入token可享受九折优惠,并新增缓存使用仪表盘与诊断工具,方便开发者精细化管理缓存策略。

OpenAI在发布时重点以价格对比Anthropic的Claude系列。在测试计算机操作能力的OSWorld 2.0基准上,GPT-6的表现据称与Claude Opus 5相近,但成本低约80%。在覆盖47种工具的业务流程自动化基准AutomationBench上,Sol在最高推理强度下据报超越了Opus 5。代码基准FrontierCode 1.1显示,Sol以每任务2.14美元的成本取得49.3%的得分,而Claude Fable 5.1得分50.3%但每任务花费高达12.83美元。

然而,独立评测机构Artificial Analysis的分析给出了更为冷静的判断。数据显示,GPT-6 Sol与Luna的每任务成本确实减半,但智能评分基本停留在GPT-5.6的水平,部分评测有所进步,另一些则出现退步。在Artificial Analysis智能指数上,Sol从47分微升至48分,Luna维持在37分不变。更值得关注的是,在测试44个专业领域计算机知识工作的GDPval-AA v2.1基准上,Sol下滑约100个Elo分,Luna下滑约75分,主要原因被归结为输出呈现质量下降和结果不完整。

此次发布还暴露出OpenAI内部模型选择逻辑的混乱。在DeepSWE v1.1软件工程基准上,Luna以最高推理强度运行时得分与Sol在次高强度下的表现相当,但成本低78%;Sol即便调至最高强度,也仅比Luna高出2.2个百分点。这让开发者在实际选型时面临困惑。与此同时,OpenAI在基准测试的选取上也被外界质疑存在挑选倾向,GDPval等常规指标未被纳入,且显然未能预判到Anthropic同期发布的Opus 5.5——后者据称性能更强且价格最高可低40%。

综合来看,GPT-6 Sol与Luna的最大意义在于将上一代模型的能力以更低的价格普及化,而非推动智能边界的突破。OpenAI在这一轮竞争中押注的是成本效率,而非性能领先。随着各家大模型厂商的基准测试愈发复杂且难以横向比较,真正的考验将落在日常工作场景中的实际表现上。

要点

  • GPT-6 Sol与Luna相较前代价格减半,Sol输入每百万token降至2美元,Luna降至0.10美元,降价源于缓存与推理效率提升
  • 独立评测显示两款模型智能水平与上代GPT-5.6基本持平,部分知识类基准测试甚至出现退步,实际性能提升有限
  • OpenAI主要以价格优势对标Anthropic Claude系列,但未能预判Anthropic同期发布性能更强、价格更低的Opus 5.5
  • Luna在最高推理强度下可匹敌Sol次高强度的表现,但成本低78%,OpenAI自身模型间的选择逻辑令开发者困惑
  • 基准测试选取被质疑存在倾向性,GDPval等常规指标缺席,AI模型评测体系的可信度问题再度引发关注
查看原始来源

原始标题:OpenAI's GPT-6 Sol and Luna cut prices in half but barely move the needle on performance

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。