产业 / 分析
模型之外,AI 编程的真正胜负手在于「执行框架」
Endor Labs 的 Agent Security League 基准测试揭示了一个反直觉的现象:决定 AI 编程表现的关键,不是模型,而是驱动模型运行的执行框架(harness)。GPT-5.5 在 OpenAI 自家的 Codex 框架中功能正确率仅为 61.5%,切换到 Cursor 框架后跃升至 87.2%,提升幅度高达 25.7 个百分点。Claude Opus 4.7 同样在竞争对手的 Cursor 框架中(91.1%)超过了 Anthropic 自家的 Claude Code(87.2%)。这一结果表明,两家顶级前沿模型在对手的框架中均表现更优。框架的影响不止于性能,还延伸至成本控制。输入 token 占 OpenRouter 流量的 86%—98%,而框架通过缓存策略直接决定输入规模。研究显示,智能缓存可将成本降低 40%—80%,并将首 token 响应时间缩短 13%—31%。框架已从「模型包装器」的标签中脱身,成为 AI 技术栈中真正的竞争支点。
Endor Labs 在同一周内将相同模型分别接入不同执行框架进行测试,结果令人意外。OpenAI 的 GPT-5.5 在其原生 Codex 框架中功能正确率为 61.5%,而在 Cursor 框架中达到 87.2%,仅因运行时环境不同便产生了 25.7 个百分点的差距。Anthropic 的 Claude Opus 4.7 在自家 Claude Code 框架中得分 87.2%,在 Cursor 框架中则达到 91.1%。两款顶级前沿模型均在竞争对手的框架中表现更佳,这一结论直接挑战了「模型决定一切」的行业惯性认知。
执行框架对 AI 系统的影响涵盖性能、成本与准确性三个维度。从流量结构来看,输入 token 占 OpenRouter 总流量的 86%—98%。尽管输出 token 的单价是输入的 5 倍,但由于输入量远超输出,输入成本仍主导整体账单。这意味着谁控制了输入,谁就控制了成本。而模型本身对输入内容没有决策权,框架才是真正的掌控者——它决定向模型发送哪些上下文、发送多少。
缓存策略是框架控制成本的核心手段。跨 500 个长周期 Agent 会话的研究显示,智能缓存可实现 41%—80% 的成本削减,并将首 token 响应时间缩短 13%—31%,且节省效果随提示词长度从 500 token 扩展至 50,000 token 呈线性增长。效果最优的策略是:仅缓存稳定的前缀部分,将动态内容置于缓存断点之后。框架还负责信息检索——决定读取哪段代码、引用哪份风格指南、分析投资简报的哪个章节,检索越精准,成本越低。
Cursor 框架之所以能让两款模型均超越原生框架,在于其技术实现与第一方框架高度对齐:动态工具获取、基于优先级的前缀组装、双层缓存机制。这些技术并非 Anthropic 或 OpenAI 的专属能力,第三方框架同样可以复现甚至超越。Claude Code 的优势在于与缓存 API 和模型的深度协同设计,在真实会话中缓存命中率约达 96%,并可跨同版本用户共享系统提示缓存,子 Agent 以 99% 字节一致性构建,节省约 90% 的相关成本。但这种协同优势并非不可逾越。
这一系列数据重新定义了 AI 技术栈的竞争格局。框架已不再是简单的「模型包装器」,而是真正影响模型表现上限的关键层。对于企业和开发者而言,选择或构建执行框架的决策,其重要性已不亚于选择底层模型本身。随着更多第三方框架在基准测试中超越原生框架,模型厂商与框架开发者之间的边界将持续模糊,围绕框架层的竞争也将成为 AI 编程工具市场的新主战场。
要点
- 同一模型在不同执行框架下功能正确率相差最高 25.7 个百分点,框架对性能的影响已超过模型本身
- 输入 token 占 LLM 流量的 86%—98%,框架通过缓存策略可将成本降低 40%—80%,是成本控制的核心杠杆
- Cursor 等第三方框架已能复现甚至超越第一方原生框架的缓存与上下文管理能力,打破了协同设计的护城河
- 框架层正从「工具辅助」升级为 AI 技术栈的核心竞争维度,选择框架的战略重要性与选择模型并驾齐驱