工程 / 官方
Opus 5.5 每项任务实际花多少钱?Anthropic 详解定价逻辑
Anthropic 工程师 Addy Osmani 在官方博客发布了一篇深度拆解文章,系统说明 Claude Opus 5.5 在实际任务中的成本构成。文章指出,用户真正关心的不是每百万 token 的单价,而是完成一项具体任务的总花费。影响总成本的四个核心因素分别是:任务轮次、缓存命中率、输出 token 类型(含思考过程)以及所选模型。与 Opus 5 相比,Opus 5.5 的输入和输出 token 价格下调 20%,缓存读取价格大幅下调 60%,从输入价格的十分之一降至二十分之一。对于以缓存读取为主的长会话任务,输入成本最多可节省 60%;而对于几乎无缓存、输出占主导的短问答任务,节省幅度约为 20%。文章还强调,模型减少无效轮次、批量调用工具、保持会话连续性以维持高缓存命中率,是控制成本的最有效手段。
在 Claude Code 的实际使用中,任务成本并不等于 token 单价乘以 token 数量那么简单。每一轮对话都会把此前所有内容重新发送给模型,这意味着轮次越多,重复处理的 token 就越多。以一个从 2 万 token 上下文增长到 12 万 token 的任务为例,40 轮完成时平均每轮发送约 7 万 token,累计输入约 280 万 token;而同一任务若能在 25 轮内完成,输入量降至约 175 万 token,成本差距相当显著。
缓存命中率是影响输入成本最大的单一变量。同样是 280 万输入 token,若无缓存则需花费约 11.20 美元;缓存命中率达到 90% 时降至约 1.62 美元;达到 96% 时进一步降至约 0.99 美元。保持会话连续性是维持高命中率的最简单方式,避免频繁中断或重置上下文可以让缓存自然保持在较高水平。
输出 token 的成本往往被低估。在 Opus 5.5 的定价体系中,一个输出 token 的价格是一个缓存读取 token 的 100 倍。典型任务产生约 6 万个输出 token,费用约为 1.20 美元,相当于从缓存中读取 600 万 token 的成本。值得注意的是,模型的思考过程也按输出 token 计费,即便 Claude Code 界面只向用户展示摘要,完整的思考链路仍会产生费用。
Opus 5.5 相较于 Opus 5 带来了两方面变化:价格下调和任务执行效率提升。输入与输出 token 价格均下调 20%,缓存读取价格下调 60%。对于 Pro、Max 或 Team 计划用户,更低的 Opus 5.5 价格会直接体现在使用额度上,含缓存上下文在内的额度可比 Opus 5 多用约 25%。缓存读取价格的大幅削减对长会话的 Claude Code 用户影响最为明显,因为长会话的输入成本主要由缓存读取构成。
控制成本的实用策略集中在减少无效轮次上。给模型提供可自我验证的机制——例如可运行的测试、构建脚本或端点调用——能让模型更早发现错误,避免在错误路径上消耗多余轮次。批量调用工具、一次性收集所需信息,也能减少重复发送上下文的次数。此外,Opus 5.5 在长任务结束时会生成一份总结报告,说明已完成的修改、发现的问题以及需要用户跟进的事项,有助于减少因信息不透明而导致的重复运行。
文章最后提醒,所有数字均为说明性示例,实际成本因代码库规模、任务复杂度和使用习惯而存在较大差异。Anthropic 建议用户通过 Claude Code 的 /usage 命令查看自己会话的实际 token 分布,再结合官方定价页面的最新价格进行核算,而非直接套用文章中的估算数字。
要点
- 任务总成本由轮次数量、缓存命中率、输出 token 量和模型选择共同决定,单看 token 单价会产生误导
- Opus 5.5 缓存读取价格下调 60%,对以长会话为主的 Claude Code 用户节省效果最为显著,输入成本最多可降低 60%
- 输出 token(含思考过程)价格是缓存读取的 100 倍,控制模型思考量和减少无效轮次是降低账单的核心手段
- 保持会话连续性、提供可自我验证的工具调用机制,是在不牺牲任务完成质量前提下降低成本的最佳实践
- 用户应通过 /usage 命令查看自身会话的实际 token 分布,再结合官方定价自行核算,避免依赖通用估算
原始标题:What a task costs on Opus 5.5 | Claude by Anthropic
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。