AI资讯 / 工程

工程 / 工程

GitHub Copilot 智能体框架跨模型性能与效率评测

GitHub AI & ML

GitHub 近日发布了对 Copilot 智能体框架(agentic harness)的系统性评测报告,涵盖 SWE-bench Verified、SWE-bench Pro、SkillsBench、TerminalBench 及内部 Win-Hill 等多项基准测试。评测对象包括 Claude Sonnet 4.6、Claude Opus 4.7、GPT-5.4 和 GPT-5.5 四款主流模型,并与各模型厂商原生框架(Claude Code、Codex CLI)进行横向对比。结果显示,在固定模型与任务的前提下,GitHub Copilot 框架的任务完成率与厂商原生框架基本持平,同时在大多数配置下实现了更低的 Token 消耗。该框架目前支持 GPT、Claude、Gemini 及 MAI 等系列共 20 余款前沿模型,并提供自动模型选择功能,可根据任务意图与模型状态动态优化 Token 效率。报告还通过 TerminalBench 2.0 的方差分析,直观呈现了各智能体配置在成本与完成率之间的权衡关系。

GitHub Copilot 的智能体框架是 Copilot SDK 的核心共享组件,同时为 Copilot CLI、Copilot 应用、代码审查等多个产品线提供支撑。框架负责协调工具调用、上下文管理与工作流编排,其性能直接影响所有下游体验。GitHub 工程团队强调,框架层面的每一项优化都能惠及全部产品表面,因此将框架的速度、Token 效率与行为可预测性列为核心设计目标。

在评测方法上,GitHub 同时采用公开行业基准与内部自研基准,后者来源于 GitHub 和 Microsoft 内部的大型代码库。为确保对比公平,团队在相同模型、相同任务、归一化上下文窗口、推理强度、工具选择及 MCP 服务器配置下,将 GitHub Copilot CLI 与 Claude Code、Codex CLI 等厂商原生框架进行对照实验,并辅以真实世界指标和在线实验加以验证。

Token 效率方面,评测结果显示 GitHub Copilot 框架在保持任务完成率与厂商框架持平的同时,在大多数配置下消耗的 Token 更少。任务完成率的差异均在模型随机性导致的方差范围之内,研究团队将此定性为「有效等价」。这意味着开发者无需在模型能力与框架效率之间做出取舍。

TerminalBench 2.0 的方差分析提供了更细粒度的视角。散点图以任务完成率为纵轴、每任务美元成本为横轴,每个数据点代表一种智能体与模型的组合配置,椭圆区域标注了至少五次运行的一倍标准差范围。分析显示,GPT 系列模型在成本最低的区间实现了较强的完成率,而 Claude Opus 则以更高成本换取最高完成率。GitHub Copilot 框架的紫色标记在完成率和成本两个维度上均未落后于同模型竞争对手。

多模型支持是 GitHub Copilot 框架区别于单一厂商框架的关键优势。框架支持 20 余款前沿模型,并允许用户自带密钥接入开源或本地模型。自动模型选择功能可根据任务意图与模型健康状态动态分配最优模型。此外,跨模型家族的「橡皮鸭」(Rubber Duck)机制允许一个模型对另一个模型的输出进行审查与批评,从而突破单一模型的能力上限。

GitHub 表示,基准测试仅是评估信号之一,团队还持续追踪真实使用指标与在线实验数据,以确保框架优化能够真正转化为开发者的实际收益。在上下文处理、模型路由及委托机制等方向,GitHub 已有多项优化正在推进,目标是让每一个 Token 都发挥最大价值。

要点

  • GitHub Copilot 智能体框架在任务完成率上与 Claude Code、Codex CLI 等厂商原生框架基本持平,同时在大多数配置下消耗更少 Token。
  • TerminalBench 2.0 方差分析表明,GPT 系列模型成本效益最优,Claude Opus 完成率最高,Copilot 框架可让用户按需在两者之间灵活切换。
  • 框架支持 20 余款前沿模型及自带密钥接入,自动模型选择功能可动态平衡任务意图与 Token 效率。
  • 跨模型家族的「橡皮鸭」审查机制是单一厂商框架无法提供的能力,可进一步提升输出质量。
  • 评测采用公开基准与内部大型代码库基准相结合的方式,并辅以真实世界指标,确保结论具备实际参考价值。
查看原始来源

原始标题:Evaluating performance and efficiency of the GitHub Copilot agentic harness across models and tasks

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。