AI资讯 / 产业

产业 / 媒体

Claude Code速度最快但成本近三倍于最便宜的竞争对手

The Decoder

AI工具公司Composio近日发布了一项基准测试,将DeepSeek V4 Flash模型分别运行在Claude Code、Codex、OpenCode和Oh My Pi四个智能体框架上,针对Gmail、GitHub、Slack、Notion等真实工具执行30项任务。测试结果显示,各框架的任务成功率差异不大,但成本与速度的差距却相当显著。Claude Code以平均122秒每任务的成绩夺得速度第一,但每次成功任务的费用高达0.195美元;而OpenCode每任务仅需0.073美元,成本最低,但成功率略低,为14/30。Oh My Pi成功率最高(17/30),却是速度最慢的框架,平均耗时272秒。整体来看,框架选择带来的成本差距接近3倍,速度差距超过2倍,这对大规模部署AI智能体的企业而言是不可忽视的变量。

AI工具公司Composio近期公布了一项针对智能体框架的横向对比测试。测试选用DeepSeek V4 Flash作为统一底层模型,分别在Claude Code、Codex、OpenCode和Oh My Pi四个框架上运行,执行涵盖Gmail、GitHub、Slack、Notion等真实工作场景的30项任务。这项测试的核心发现是:模型相同的情况下,框架的选择对实际使用成本和响应速度产生了远超预期的影响。

从速度维度来看,Claude Code表现最为突出,平均每任务耗时仅122秒。然而,这一速度优势伴随着高昂的代价——每次成功任务的费用达到0.195美元,是四个框架中最贵的。值得注意的是,Claude Code在测试中使用的工具调用次数最少、生成的输出token数量也最低,这意味着其高成本并非来自更多的计算消耗,而更可能源于框架本身的定价策略或调用方式。

在成本端表现最优的是OpenCode,每次成功任务仅需0.073美元,约为Claude Code的三分之一。不过,OpenCode的成功率略低,30项任务中仅完成14项。Oh My Pi则在成功率上领先,以17/30的成绩位居第一,但其平均任务耗时长达272秒,是速度最慢的框架,比Claude Code慢出约一倍以上。

测试还发现,有7项任务的通过或失败结果完全取决于所使用的框架,而与模型能力无关。这一现象表明,框架层面的实现差异——包括提示词构建方式、工具调用逻辑、错误处理机制等——会对实际任务结果产生实质性影响,而非仅仅是性能包装层。对于需要在生产环境中大规模部署AI智能体的团队,框架选型已成为一个不可忽视的工程决策。

综合来看,此次测试揭示了一个重要现实:在AI智能体生态中,底层模型之外的软件封装层正在成为影响实际使用体验的关键变量。成本相差近3倍、速度相差逾2倍的结果,意味着企业在选择智能体框架时,需要根据自身业务对速度、成本和成功率的优先级排序做出权衡,而非简单地以模型能力作为唯一评判标准。

要点

  • Claude Code在四个框架中速度最快(122秒/任务),但成本最高,达0.195美元/任务
  • OpenCode成本最低(0.073美元/任务),约为Claude Code的三分之一,但成功率略低
  • Oh My Pi成功率最高(17/30),但速度最慢,平均耗时272秒
  • 有7项任务的结果完全由框架决定,与底层模型无关,框架选型对实际效果有实质影响
  • 相同模型下,框架差异带来近3倍成本差距和超2倍速度差距,大规模部署时不可忽视
查看原始来源

原始标题:Claude Code is the fastest agent framework but costs nearly three times more than the cheapest rival

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。