模型 / 官方
性能全面提升,诚实度显著增强
Anthropic 于 2026 年 5 月 28 日推出 Claude Opus 4.8,这是 Opus 系列的最新升级版本。该模型在多项基准测试中超越前代 Opus 4.7,尤其在编码、智能体技能、推理和实际知识工作方面表现突出。新版本还引入了动态工作流功能,允许 Claude 在单个会话中运行数百个并行子智能体,处理大规模代码迁移等复杂任务。同时,用户现在可以控制 Claude 在任务中的努力程度。Opus 4.8 的诚实度提升约四倍,更倾向于主动标记不确定性,减少无根据的声明。早期测试者反馈其判断更可靠,工具调用更高效,整体协作体验显著改善。
Anthropic 正式发布 Claude Opus 4.8,这是其旗舰模型 Opus 系列的最新版本。新模型在 Opus 4.7 的基础上实现了全面性能提升,覆盖编码、智能体能力、推理和实际知识工作等多个领域。Opus 4.8 即日起可用,价格与之前保持一致。同时,Anthropic 还推出了多项新功能,包括 claude.ai 上的努力控制选项,以及 Claude Code 中的动态工作流功能,后者允许模型处理超大规模问题。Opus 4.8 的快速模式速度提升至 2.5 倍,且成本比前代模型降低三倍。
在能力评估方面,Opus 4.8 在多个基准测试中表现优异。在超级智能体基准测试中,它是唯一一个端到端完成所有案例的模型,超越了前代 Opus 和 GPT-5.5。在 CursorBench 上,Opus 4.8 在所有努力级别上都超过了前代模型。工具调用效率显著提升,使用更少的步骤完成相同智能水平的任务。在法律智能体基准测试中,Opus 4.8 创下最高分记录,成为首个在全部通过标准上突破 10% 的模型。在计算机使用和浏览器智能体测试中,Opus 4.8 在 Online-Mind2Web 上获得 84% 的分数,较 Opus 4.7 和 GPT-5.5 有显著提升。
早期测试者普遍反馈 Opus 4.8 在协作体验上有了质的飞跃。在 Claude Code 中,它能提出正确的问题,发现自身错误,并在计划不完善时提出质疑。在翻译、深度研究、幻灯片制作和分析等智能体产品中,它提供了强大的可靠性。测试者还指出,Opus 4.8 在长时间会话中能更好地保持上下文和风格方向,输出质量更高、信息更密集。在 CoCounsel Legal 等专业工作流中,Opus 4.8 在一致性和推理质量上带来了有意义的改进,这对于高风险的职业工作流至关重要。
Opus 4.8 最显著的改进之一是其诚实度。Anthropic 训练所有模型保持诚实,但 AI 模型有时会急于下结论。早期测试者报告称,Opus 4.8 更倾向于标记工作中的不确定性,减少无根据的声明。评估显示,Opus 4.8 在代码中遗漏缺陷的可能性比前代低约四倍。对齐评估表明,Opus 4.8 在支持用户自主性和维护用户最佳利益等亲社会特质上达到新高,同时不端行为率显著低于 Opus 4.7,与最佳对齐模型 Claude Mythos Preview 相当。
除了模型升级,Anthropic 还推出了动态工作流功能,允许 Claude 在 Claude Code 中承担更大任务。Claude 可以规划工作,然后在单个会话中运行数百个并行子智能体,并在向用户报告前验证输出。例如,Claude Code with Opus 4.8 现在可以执行跨数十万行代码的代码库迁移。此外,claude.ai 和 Cowork 中新增的努力控制功能,让用户可以选择 Claude 在响应中投入多少努力。在更高努力设置下,Claude 会进行更深入的思考,以提供更优质的答案。
要点
- Claude Opus 4.8 在编码、推理和智能体任务上全面超越前代,并在多个基准测试中创下新高。
- 新版本诚实度提升约四倍,更主动标记不确定性,减少无根据声明,对齐评估显示不端行为率显著降低。
- 动态工作流功能允许 Claude 在单个会话中运行数百个并行子智能体,处理大规模代码迁移等复杂任务。
- 用户现在可以控制 Claude 在任务中的努力程度,更高设置下模型会进行更深入思考。
- Opus 4.8 快速模式速度提升至 2.5 倍,成本比前代降低三倍,价格保持不变。