工程 / 工程
多模型编排实现前沿级代码质量
GitHub 正式推出 Project HydraFusion 研究预览版,这是一套基于运行时编排的多模型协作框架,旨在为开发者提供前沿级别的代码智能,同时控制推理成本与延迟。HydraFusion 会针对每个请求自动选择三种执行模式之一:单模型直接求解、级联模式(高效模型先行、质量门控决定是否升级)、以及批评-修订模式(独立模型审查后由原模型修订)。在三项智能体编码基准测试中,HydraFusion 的最优配置在 TerminalBench 2.1 上以低于 Claude Opus 5 约 67% 的估算成本实现了高出 4.9 个百分点的任务完成质量。目前该功能已通过 GitHub Copilot CLI 的 /experimental 入口向所有 Copilot 计划用户开放,按各模型标准费率计费。
GitHub 于 2026 年 9 月推出 Project HydraFusion 研究预览版,将其定位为继年初「自动模型选择」功能之后的下一步演进。与自动模型选择在请求前静态匹配模型不同,HydraFusion 在运行时动态构建完整执行计划,从多个提供商的模型池中按需调度,完成起草、批评、修订或升级等不同阶段的工作。对开发者而言,整个过程透明无感——只需像选择普通模型一样选中 HydraFusion,其余交由系统处理。
HydraFusion 目前支持三种执行模式。「单模型」模式在任务可被一个模型直接解决时保持最低延迟与成本;「级联」模式让高效模型先行尝试,若结果未通过质量门控则自动升级至更强模型;「批评」模式则引入来自不同模型家族的独立只读评审者,对草稿进行审查,再由原模型根据反馈修订一次。三种模式各自针对不同的质量与成本权衡场景,系统根据任务的推理、代码生成、调试和工具使用等能力信号自动选择最合适的模式。
在工程实现层面,HydraFusion 围绕五项原则构建:完整计费(汇总所有执行环节的 token 消耗)、有界执行(每个环节设有超时与取消机制)、隔离审查(批评步骤在无工具的隔离上下文中运行,不修改代码仓库)、故障安全应用(工作流取消或验证失败时不写入任何补丁)、以及路由验证(执行前核查工作流定义、模型绑定与可用性)。这套机制确保多模型编排在仓库级别的工作中具备可靠性与可审计性。
基准测试结果显示,HydraFusion 在三项智能体编码评测中均展现出显著的成本优势。在 TerminalBench 2.1 上,其验证任务质量比 Claude Opus 5 高出 4.9 个百分点,估算成本降低 67%;在 CheckpointBench(基于真实 GitHub Copilot 会话的内部基准)上,质量几乎持平(差距仅 0.1 个百分点),成本降低 65%;在 DeepSWE 上,成本降低 36%,质量略低 1.5 个百分点。所有对比均在相同中等推理级别下进行,成本核算涵盖起草、批评、修订、升级、重试等全部环节。
HydraFusion 目前以研究预览形式向所有 GitHub Copilot 计划用户开放,入口为 GitHub Copilot CLI 中的 /experimental 命令。用户依次执行 /update 更新至最新版本、/experimental on 开启实验功能,再通过 /model 选择「HydraFusion (Research Preview)」即可使用。计费方式按 HydraFusion 实际调用的各模型标准费率计算。GitHub 表示,随着新模型加入 Copilot 模型池,HydraFusion 将持续评估并纳入,使其编排能力随模型前沿同步演进,并将根据研究预览期间收集的反馈优化进度可见性等用户体验细节。
要点
- HydraFusion 在运行时动态编排多个模型,自动在单模型、级联、批评-修订三种执行模式间选择,开发者无需手动切换。
- 基准测试显示,最优配置在 TerminalBench 2.1 上以低 67% 的估算成本超越 Claude Opus 5 约 4.9 个百分点,成本与质量可兼得。
- 批评模式引入来自不同模型家族的独立评审者,与 GitHub Copilot 的 Rubber Duck 审查模式一脉相承,为复杂任务提供额外质量保障。
- 所有执行环节均有超时控制与故障安全机制,确保工作流失败时不会向代码仓库写入不完整变更。
- 目前以研究预览形式向全部 Copilot 计划用户开放,按实际调用模型的标准费率计费,GitHub 将持续根据社区反馈迭代优化。
原始标题:Project HydraFusion: Frontier quality via multi-model orchestration
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。