产业 / 媒体
跳过5.1直接上线,自主迭代能力令开发者震惊
多名开发者通过抓包和请求状态检测发现,Anthropic 已在 Claude Code 中悄然推送 Opus 5.2 的灰度版本,前端名称未变,但底层模型 slug 已指向新版本,意味着公司直接跳过了 5.1。实测反馈显示,Opus 5.2 响应速度明显加快,输出更加简洁精准,且彻底改变了此前大模型普遍存在的「偷懒」问题——面对复杂长任务时,模型会自动进入持续迭代的严酷循环(gauntlet loop),无需用户催促即可将任务推进至完成。与此同时,一份此前曝光的 Anthropic 内部风险报告显示,公司手中还握有更强的底牌:代号 Model 2 的内部模型在 CoBench v2 榜单上得分 62.8%,已大规模接管公司代码编写;而更上层的 RSI 模型据称可替代研究团队 85% 的工作,Anthropic 的 AI 自我进化飞轮正在加速转动。
昨晚,大量 Claude 用户在使用 Claude Code 调用 Opus 5 时,发现其表现与网页版存在明显差异。开发者通过抓包和查看 /status 请求状态后确认,虽然前端界面显示的名称未变,但底层模型 slug 已指向 Opus 5.2。这意味着 Anthropic 大概率直接跳过了 5.1 版本,将 5.2 以路由方式悄悄推送给部分用户进行灰度测试,是 AI 大厂惯用的隐秘上线策略。
根据开发者实测反馈,Opus 5.2 的升级可以用三个维度概括:速度、精度与持续性。在响应速度上,新版本相比 Opus 5 有肉眼可见的质的飞跃;在输出质量上,废话大幅减少,代码生成和长文本处理的完成度明显提升。最受关注的改变是模型彻底告别了此前大模型普遍存在的懒惰倾向——遇到复杂任务不再只给框架或要求用户手动继续,而是主动进入持续迭代模式直至任务完成。
为了验证自己是否被路由到 Opus 5.2,社区中流传出一个简单的检测方法:在关闭联网搜索的情况下,向 Claude Code 询问关于社区人物「重置哥 Tibo」的信息。由于旧版 Opus 5 的训练数据中不包含该人物的详细信息,若模型能够准确识别并解释其背景,则说明当前使用的是权重已更新的 Opus 5.2。开发者 @jan_volad 分享的测试截图显示,同一提示词在两个版本下的回答截然不同,证实底层权重确实存在差异。
Opus 5.2 并非 Anthropic 的全部底牌。据此前曝光的内部风险报告,公司内部正在广泛使用一个代号为「Model 2」的未发布模型。在专门测试真实 AI 研发任务的 CoBench v2 榜单上,Model 2 得分 62.8%,比当前公认最强的 Mythos 5 高出 12.5 分。更值得关注的是,Anthropic 目前大部分公司代码已由 Model 2 以 Agent 方式自动生成,AI 正在大规模参与下一代 AI 的开发工作,但官方表示暂不对外发布该模型。
报告中提及的第三层能力更为震撼:Anthropic 的 RSI(递归自我改进)模型据称可替代研究团队高达 85% 的工作,且在性能测试中比 Model 2 还高出 22 分。RSI 的核心逻辑是 AI 理解自身架构后自主修改代码以提升能力,形成指数级的智能增长循环。从 Opus 5.2 的自主迭代行为,到 Model 2 接管代码编写,再到 RSI 替代人类研究员,Anthropic 的技术路径正越来越清晰地指向让 AI 创造更强 AI 的方向,而非单纯服务于人类用户。
要点
- Anthropic 已在 Claude Code 中以路由方式悄然推送 Opus 5.2 灰度版本,直接跳过 5.1,响应速度与任务持续完成能力显著提升
- Opus 5.2 引入自主迭代机制(gauntlet loop),面对复杂长任务可无需催促地持续推进直至完成,彻底改变大模型懒惰问题
- Anthropic 内部未发布的 Model 2 在 CoBench v2 上得分 62.8%,已大规模接管公司代码编写工作
- RSI 模型据内部报告可替代研究团队 85% 的工作,性能测试得分比 Model 2 还高出 22 分,AI 自我进化飞轮正在加速
- 社区发现可用询问「重置哥 Tibo」的方式检测自己是否被路由到 Opus 5.2,两版本回答差异明显证实权重已更新
原始标题:Anthropic Claude Opus 5.2 灰度测试曝光:响应更快,告别“偷懒”
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。