模型 / 官方
Anthropic 发布 Claude Sonnet 4.5:最强编程模型与全新 Agent SDK
Anthropic 于 2025 年 9 月 29 日正式发布 Claude Sonnet 4.5,称其为全球最强的编程模型。该模型在 SWE-bench Verified 评估中达到最先进水平,可连续 30 小时以上处理复杂多步骤任务。在计算机使用基准 OSWorld 上,Sonnet 4.5 以 61.4% 的准确率领先,较四个月前 Sonnet 4 的 42.2% 大幅提升。模型在推理、数学以及金融、法律、医学和 STEM 等专业领域均表现出显著进步。同时,Anthropic 推出了检查点、VS Code 扩展、上下文编辑和记忆工具,以及全新的 Claude Agent SDK,让开发者能够构建更强大的智能体应用。
Anthropic 今日宣布推出 Claude Sonnet 4.5,这是其迄今为止最强大的模型,在编程、计算机使用和推理方面实现了重大飞跃。该模型在 SWE-bench Verified 评估中达到最先进水平,能够连续 30 小时以上专注于复杂、多步骤的编程任务。在 OSWorld 基准测试中,Sonnet 4.5 以 61.4% 的准确率领先,较四个月前 Sonnet 4 的 42.2% 提升了近 20 个百分点。
除了核心能力的提升,Anthropic 还推出了一系列产品升级。在 Claude Code 中,新增了用户最常要求的检查点功能,可保存进度并允许即时回滚到之前状态。同时,团队更新了终端界面,并发布了原生 VS Code 扩展。Claude API 新增了上下文编辑功能和记忆工具,使智能体能够运行更长时间并处理更复杂的任务。
在 Claude 应用中,代码执行和文件创建(电子表格、幻灯片和文档)功能已直接集成到对话中。此外,上个月加入等待列表的 Max 用户现已可使用 Claude for Chrome 扩展。Anthropic 还发布了 Claude Agent SDK,将自身用于构建 Claude Code 的基础设施开放给开发者,让他们能够构建自己的前沿智能体应用。
Claude Sonnet 4.5 也是 Anthropic 迄今为止最对齐的前沿模型。通过广泛的安全训练,模型在减少谄媚、欺骗、权力寻求和鼓励妄想行为等方面取得了显著改进。针对智能体和计算机使用能力,团队在防御提示注入攻击方面也取得了重要进展,这是用户面临的最严重风险之一。
早期客户反馈显示,Claude Sonnet 4.5 在编程、金融分析、法律研究和安全等领域均表现出色。Cursor 用户报告了最先进的编程性能,GitHub Copilot 在多步推理和代码理解方面显著提升。Canva 和 Figma 等设计平台也观察到模型在创意控制和交互流畅性方面的进步。Devin 的规划性能提升了 18%,端到端评估分数提高了 12%。
Claude Sonnet 4.5 现已全面可用,开发者可通过 Claude API 使用 claude-sonnet-4-5,定价与 Sonnet 4 保持一致,为每百万输入/输出 token 3/15 美元。Anthropic 表示,这是其最强大的模型,也是构建复杂智能体和计算机使用任务的最佳选择。
要点
- Claude Sonnet 4.5 在 SWE-bench Verified 和 OSWorld 基准测试中均达到最先进水平,编程和计算机使用能力大幅提升。
- 模型可连续 30 小时以上处理复杂任务,在金融、法律、医学和 STEM 等专业领域表现显著优于前代。
- Anthropic 推出检查点、VS Code 扩展、上下文编辑和记忆工具,以及 Claude Agent SDK,赋能开发者构建更强大的智能体应用。
- Claude Sonnet 4.5 是 Anthropic 最对齐的前沿模型,在减少谄媚、欺骗和权力寻求等行为方面取得重大进展。
- 早期客户反馈显示,模型在编程、安全、金融分析和设计等领域均带来显著效率提升和成本降低。