研究 / 官方
为计算机操作智能体打造深度演化训练环境
微软研究院推出Echoverse项目,专为计算机操作类AI智能体设计深度演化训练环境。该项目的核心洞察在于:智能体只有在行动真正产生后果的环境中才能有效学习,而现实中大量需要自动化的工作流程——如电子邮件、客服系统、银行和云控制台——都隐藏在登录墙之后,无法直接用于训练。Echoverse的解决方案是构建合成世界:数据库归研究者所有,状态变化真实发生,但可以安全重置并从数据层面进行评分。项目共建立12个训练世界,包括10个深度领域世界和2个能力专项世界,重点针对日期选择器、嵌套过滤器等模型反复失败的UI元素进行强化训练。经过全部12个世界的训练,一个9B参数模型的得分从36.5%提升至67.1%,与GPT-5.4的差距缩小至14个百分点。项目已开源4个训练世界及相关代码、数据和评分工具。
计算机操作类AI智能体面临的核心挑战,在于如何在多步骤工作流中真正理解行动的后果。一次点击是否改变了系统状态、一条消息是否真正发送出去——这些信息仅凭截图无法判断,必须在一个状态真实变化的环境中才能学习。然而,现实中大量高价值的自动化场景,如企业邮件、医疗记录、云平台控制台等,都位于封闭系统之后,既无法直接用于训练,也无法在每次尝试后重置状态。
Echoverse的解决思路是将这些封闭系统重建为合成训练世界。所谓「世界」,由三个要素构成:应用程序及其状态与可执行动作构成的环境、在其中设定目标的任务集,以及对照真实数据评判结果的验证器。与现有方法不同,Echoverse不追求单纯扩大训练世界的数量,而是强调每个世界的内部质量——状态是否跨屏幕和用户保持一致、工作流依赖关系是否完整、薄弱技能是否以足够多样的形式出现以实现泛化。
项目共构建了12个训练世界:10个针对具体业务领域的深度世界,以及2个专门针对模型薄弱能力的专项世界,后者聚焦于日期选择器和嵌套过滤器这两类模型反复出错的UI控件。实验证明,训练环境的保真度至关重要——在同一网站的浅层版本和深度版本上分别训练后,模型在浅层版本上出现了性能退步,而在深度版本上则持续提升,直接验证了高保真环境的必要性。
Echoverse的另一个关键创新是「协同演化」机制。传统微调只改进模型本身,而Echoverse将构建环境与训练模型视为同一个持续循环:在世界中运行模型、定位失败点、修复世界的任务和验证器使其更精确或更具挑战性、再用更清晰的信号训练,如此反复。这意味着同一次评分运行既衡量了模型,也改进了评判模型的世界,避免了静态基准饱和的问题。
在强化学习阶段,研究团队以基于真实数据的验证器作为奖励信号,结果显示RL不仅提升了模型在未见任务上的表现,还让智能体学会以更少步骤完成目标,体现出真正的策略优化而非单纯的模仿学习。最终,经过全部12个世界训练的9B参数模型,得分从基线的36.5%提升至67.1%,与GPT-5.4相差仅14个百分点,展示了高保真合成环境在提升智能体能力方面的巨大潜力。
目前,微软研究院已在GitHub和Hugging Face上开源了4个训练世界,包含完整的代码、数据集和基于真实数据的评分工具,以支持学术界对高保真计算机操作训练环境的进一步研究。研究团队认为,真正的杠杆点不在于堆砌更多训练世界,而在于建立一个让模型、环境和验证器共同进化的持续改进循环。
要点
- 高保真合成训练环境是关键:在浅层环境中训练会导致模型性能退步,深度环境才能带来真实提升,环境质量比数量更重要。
- 针对薄弱能力的专项训练可实现跨域泛化:专门针对日期选择器、嵌套过滤器等难点UI控件的训练,能让模型在从未见过的业务场景中也能正确操作这些控件。
- 模型、环境与验证器的协同演化优于单独优化模型:同一次评分运行既改进模型又修复世界,形成复利式提升,避免静态基准饱和。
- 强化学习结合真实数据验证器,可让智能体以更少步骤完成任务,体现出策略层面的真正优化。
- 项目已开源4个训练世界及配套工具,为计算机操作智能体研究提供了可复用的高保真基础设施。
原始标题:Echoverse: Deep, evolving environments for computer-use agents
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。