研究 / 官方
让小模型也能胜任复杂智能体任务
微软研究院发布开源框架 Orchard,旨在降低智能体 AI 研究的基础设施门槛。框架核心是 Orchard Env——一个基于 Kubernetes 的轻量级环境服务,可在不修改底层架构的前提下,同时支持软件工程、网页浏览和个人助理等多类智能体的训练与评估。Orchard 的关键设计在于允许研究者直接在 Codex、OpenClaw、ZeroClaw 等真实部署框架(harness)中端到端训练模型,消除了以往在简化环境中训练、在真实环境中部署所带来的性能落差。团队同步发布了三个领域专属训练方案:Orchard-SWE(软件工程)、Orchard-GUI(图形界面操作)和 Orchard-Claw(工具调用),以及相应的训练数据和评估方法。其中 Orchard-SWE 仅凭约 30 亿活跃参数便在 SWE-bench Verified 基准上取得 69.7% 的成绩,配合价值模型重排序后进一步提升至 73.0%,展示了小模型在复杂真实任务上的巨大潜力。
当前 AI 研究正快速从静态问答转向能够规划、推理并在多步骤环境中自主行动的智能体系统。这类系统可以修复复杂代码库中的漏洞、代替用户浏览网页,或管理涉及日历和邮件的工作流。然而,构建顶尖智能体系统往往依赖专有沙箱、封闭训练流水线和私有数据集,大多数研究者和从业者难以获取或复现,形成了明显的研究瓶颈。
为填补这一空白,微软研究院推出 Orchard 开源框架。其核心组件 Orchard Env 是一个基于 Kubernetes 的轻量级环境服务,能够并行创建、管理和销毁数千个隔离容器,覆盖数据蒸馏、强化学习推演和评估等训练全流程。与现有框架不同,Orchard Env 无需修改即可支持编程、网页浏览、工具调用等不同任务类型,以及多种智能体系统,使研究团队在引入新基准或训练算法时无需从头重建底层基础设施。
Orchard 的另一项关键创新是支持在真实部署框架中进行端到端训练。当前最强大的智能体并非以裸模型运行,而是通过 Claude Code、Codex、OpenClaw 等复杂框架管理多轮推理、工具调用和外部系统连接。Orchard 通过轻量级代理记录框架自身的模型调用作为训练数据,每次推演在独立容器中运行,从而让模型直接在最终部署的框架中完成训练,彻底消除训练与部署环境不一致的问题。
在软件工程领域,Orchard-SWE 基于 Mini-SWE-Agent 框架构建,从 MiniMax-M2.5 和 Qwen3.5-397B 两个先进开放权重模型中蒸馏了 10.7 万条智能体交互数据,覆盖大量真实 GitHub Issue。训练过程采用信用分配监督微调方法,即便智能体未能完全解决问题,系统也会从部分成功的尝试中提取有价值的训练信号,有效扩充了可用训练数据的规模。
最终,Orchard-SWE 仅使用约 30 亿活跃参数,便在 SWE-bench Verified 基准上达到 69.7% 的成绩,引入价值模型重排序后进一步提升至 73.0%,接近参数量超出十倍的前沿闭源系统。Orchard-GUI 和 Orchard-Claw 则分别针对图形界面操作和工具调用场景,同样验证了小型开放权重模型在复杂真实任务中的强劲表现。
微软研究院在发布 Orchard 框架的同时,一并开放了训练数据和评估方法,希望帮助更广泛的研究社区构建和研究开放智能体系统。Orchard 的整体设计理念是将运行时环境作为独立可复用的服务,而非嵌入特定训练框架的专属基础设施,这一思路有望推动智能体 AI 研究走向更加开放、可复现的新阶段。
要点
- Orchard Env 基于 Kubernetes 构建,可并行管理数千个隔离容器,无需修改即可跨任务类型和智能体系统复用,大幅降低研究基础设施成本。
- Orchard 支持在 Codex、OpenClaw、ZeroClaw 等真实部署框架中直接进行端到端训练,消除训练与部署环境不一致带来的性能落差。
- Orchard-SWE 仅凭约 30 亿活跃参数在 SWE-bench Verified 上达到 69.7%(重排序后 73.0%),证明小型开放权重模型可逼近参数量超出十倍的前沿系统。
- 信用分配监督微调方法从部分成功的失败尝试中提取训练信号,有效扩充了可用训练数据,是提升小模型性能的关键技术手段。
- 框架同步开放训练数据和评估方法,旨在推动智能体 AI 研究走向更开放、可复现的生态。
原始标题:Orchard: An open framework for scalable agentic AI
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。