AI资讯 / 模型

模型 / 官方

智能、高效,在编码与智能体任务中树立新标杆

Anthropic News

Anthropic 于 2025 年 11 月 24 日正式发布 Claude Opus 4.5,这是其迄今为止最智能、最高效的模型。该模型在真实世界软件工程测试中达到业界领先水平,尤其在编码、智能体任务和计算机使用方面表现卓越。Opus 4.5 在深度研究、幻灯片与电子表格处理等日常任务上也有显著进步。定价为每百万输入/输出 token 5/25 美元,使前沿能力更易获取。早期测试者反馈,该模型能自主处理复杂多系统错误,并在长周期自主任务中展现出色规划与执行能力。

Anthropic 今日宣布推出 Claude Opus 4.5,这是其最新旗舰模型,在智能性、效率以及编码、智能体任务和计算机使用方面均达到世界最佳水平。该模型在真实世界软件工程测试中取得业界领先成绩,同时在深度研究、幻灯片和电子表格处理等日常任务上也有显著提升。Opus 4.5 代表了 AI 系统能力的一次飞跃,并预示着工作方式将发生更大变革。

Opus 4.5 现已通过 Anthropic 应用、API 以及三大主流云平台提供。开发者可通过 Claude API 使用 claude-opus-4-5-20251101 模型。定价为每百万输入/输出 token 5/25 美元,使 Opus 级别的能力对更多用户、团队和企业开放。与此同时,Anthropic 还发布了 Claude 开发者平台、Claude Code 及消费级应用的更新,包括支持更长运行时间的智能体工具,以及在 Excel、Chrome 和桌面端使用 Claude 的新方式。

早期测试者反馈显示,Claude Opus 4.5 在处理模糊性和权衡推理时无需过多引导。面对复杂的多系统错误,它能自主找出修复方案。几周前对 Sonnet 4.5 而言几乎不可能的任务,如今 Opus 4.5 已能胜任。测试者普遍认为,Opus 4.5 能够“理解”复杂需求。许多早期访问客户也分享了类似体验,称其为“真正的 SOTA”,且价格已降至可成为大多数任务首选模型的程度。

在编码和智能体工作流方面,Opus 4.5 表现出色。与 GitHub Copilot 配合时,它能在内部编码基准测试中超越 Sonnet 4.5,同时将 token 用量减半,特别适合代码迁移和重构任务。在 Lovable 的聊天模式中,Opus 4.5 的前沿推理能力显著提升了项目规划质量,进而优化代码生成。在 Terminal Bench 上,它比 Sonnet 4.5 提升了 15%,在 Warp 的规划模式中优势尤为明显。

Opus 4.5 在长周期自主任务中表现卓越,能够进行持续推理和多步骤执行。在内部评估中,它处理复杂工作流时死胡同更少。对于企业级复杂任务,Opus 4.5 在结合信息检索、工具使用和深度分析的多步骤推理任务上取得了业界领先成果。在 30 分钟的自主编码会话中,它保持了稳定的高性能表现。此外,Opus 4.5 还代表了自我改进型 AI 智能体的突破,在办公任务自动化中,其智能体能在 4 次迭代内达到峰值性能,而其他模型在 10 次迭代后仍无法匹敌。

在 Cursor 中,Opus 4.5 相比前代 Claude 模型有显著改进,定价更优,在困难编码任务上智能性更强。它能够跨两个代码库协调三个智能体完成复杂重构,制定稳健计划并处理细节。在 Notion Agent 中,Opus 4.5 首次实现了 Opus 级别的可用性,擅长解读用户意图,首次尝试即可生成可分享内容。在 Excel 自动化和金融建模方面,内部评估准确率提升 20%,效率提升 15%。在 3D 可视化、代码审查和 SQL 工作流等场景中,Opus 4.5 均展现出更高的精度和效率,工具调用错误和构建/ lint 错误减少 50% 至 75%。

在评估中,Claude Opus 4.5 在 2 小时限时内完成了一项以难度著称的内部考试,得分超过所有人类候选者。这一成绩凸显了其在复杂任务上的卓越能力。Anthropic 表示,Opus 4.5 的“努力参数”设计使其能够动态调整推理深度,避免过度思考,在低努力模式下仍能保持所需质量,同时大幅提升效率。这种控制能力正是复杂工作流所迫切需要的。

要点

  • Claude Opus 4.5 在编码、智能体任务和计算机使用方面达到世界最佳水平,并在日常办公任务中表现显著提升。
  • 定价降至每百万 token 5/25 美元,使前沿 AI 能力对更广泛用户和企业更加可及。
  • 在长周期自主任务中,Opus 4.5 展现出卓越的规划与执行能力,token 用量减少高达 65%。
  • 自我改进型智能体在办公自动化中实现 4 次迭代达到峰值性能,远超其他模型。
  • 在内部难度考试中,Opus 4.5 在 2 小时内得分超过所有人类候选者。
查看原始来源

原始标题:Introducing Claude Opus 4.5

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。