产业 / 媒体
GPT-6 Astra发布当天基准数据多次变动,AI行业评测公信力再受质疑
2026年9月3日,OpenAI发布旗舰模型GPT-6 Astra,但整个发布过程颇为混乱:博客文章上线后迅速撤下,近两小时后才重新对外开放,期间多项基准测试数据发生显著变化。据互联网存档快照显示,Astra的幻觉率曾从4.2%骤降至2%,随后又恢复至4.2%;竞争对手Anthropic旗下Fable 5.1在数学评测中的成绩也一度从87.8%下调至78%,目前回升至83%。此外,ARC-AGI-3评测成绩从预发布草稿中的98.6%变为正式博客中的99.99%。OpenAI将这些变动解释为确保数据准确性的正常修正,但斯坦福大学研究人员和业内专家对评测方法的透明度提出质疑,认为反复调整测试条件以获取更高分数的做法可能损害行业公信力。这一事件再次将AI基准测试的可靠性问题推至聚光灯下。
9月3日,OpenAI原计划在美国东部时间下午2点发布GPT-6 Astra的博客公告,但文章上线后不久即遭撤下。下午3点32分,OpenAI官方X账号发布博客链接时,页面仍无法正常访问。CEO萨姆·奥尔特曼随后发帖称遇到了部署问题,直至约一小时后页面才恢复正常。OpenAI对撤稿原因先后给出内容管理系统故障和互联网中断两种解释,并强调此事与基准测试数据无关。
当博客重新上线后,多项评测数据已悄然发生变化。其中最受关注的是Astra的幻觉率:最初版本为4.2%,在下午5点20分的快照中骤降至2%,几乎减半;前代模型GPT-5.6 Sol的幻觉率也同步从12.2%降至9.4%。然而截至报道发出时,两项数据又双双恢复至最初数值。此外,GPT-5.6 Sol在内部网络安全评测ExploitBench中的成绩从5.5%大幅跳升至11.5%,OpenAI表示正在评估是否将其回调,原因是11.5%对应的推理能力等级目前并未向商业用户开放。
数学能力评测方面的数据同样经历了反复。Anthropic旗下Fable 5.1在FrontierMath Tier 4评测中的成绩,从首版快照中的87.8%一度下调至78%,目前回升至83%;GPT-5.6 Sol的成绩也从83%降至80.5%后恢复至83%。而在正式发布前向媒体提供的预发布草稿中,Astra在ARC-AGI-3评测中的成绩为98.6%,正式博客中则变为99.99%。OpenAI对此解释称,发布前验证评测结果是标准流程,草稿与最终版本之间存在调整属于正常现象。
围绕这些变动,外界对所谓「Benchmaxxing」现象的担忧随之升温。这一术语指通过反复调整测试条件、多次运行评测来尽可能拉高基准分数的做法。斯坦福智能系统实验室研究人员Anka Reuel和Mike Hardy指出,GPT-6 Astra的系统卡对幻觉率评测方法几乎未提供任何技术细节,甚至未列出测试项目数量。两人认为,Astra编码能力评分从57.7%微升至57.9%这0.2个百分点的变化,也可能源于反复重新运行测试。OpenAI承认,其公布的评测分数是在最佳条件下取得的最高成绩,可能与普通用户实际使用ChatGPT时的体验存在差距。
基准测试数据争议并非OpenAI独有的问题。2025年,Meta曾被曝Llama 4的公开成绩来自内部版本而非面向公众的正式版本,前首席AI科学家Yann LeCun后来承认公司确实对测试结果进行了修饰。Snorkel AI的AI工程师Vincent Sunn Chen表示,在模型发布前最后几小时内调整数据并不罕见,因为模型检查点、配置参数、工具框架等因素都会影响最终成绩,通常会持续调整至发布前夕。他呼吁行业形成新规范:修改基准数据时应明确说明测试条件的具体变化,以便研究人员准确解读结果。
基准测试成绩对AI公司而言意义重大,既是衡量技术进步的标尺,也是吸引客户和人才的重要砝码。然而数据的频繁变动,以及外界对企业是否诚实展示测试结果的质疑,正在让客户和投资者愈发难以判断哪款模型真正适合特定任务。对于OpenAI而言,这一事件可能动摇其在市场上主打的核心叙事——拥有业界最强AI模型。考虑到该公司可能计划于2027年进行IPO,评测透明度问题的敏感性无疑更加凸显。
要点
- GPT-6 Astra发布当天,OpenAI多次修改博客中的基准测试数据,幻觉率等关键指标出现大幅波动后又恢复原值,整个发布过程混乱异常。
- 竞争对手Anthropic旗下模型的部分评测成绩在OpenAI博客中也经历了下调再回升的变化,引发外界对数据客观性的质疑。
- 斯坦福研究人员指出,OpenAI系统卡对评测方法的披露严重不足,反复重新运行测试以获取更高分数的做法存在透明度隐患。
- AI行业基准测试数据争议由来已久,Meta的Llama 4事件已有先例,业内专家呼吁建立修改数据时须说明测试条件变化的行业规范。
- 评测数据的可信度直接影响AI公司的市场形象与商业竞争力,对于筹备IPO的OpenAI而言,透明度问题的潜在影响尤为值得关注。
原始标题:OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。