研究 / 官方
苹果提出API调用智能体的无环境合成数据生成方法
训练API调用大语言模型智能体通常需要大量高质量轨迹数据,但传统方法依赖完整执行环境和预填充数据库,成为规模化瓶颈。苹果研究团队提出无环境合成数据生成方法,仅需API规范,利用LLM作为即时数字世界模型,生成模拟智能体与有状态环境交互的轨迹。该方法通过LLM生成多样化任务、教师智能体迭代求解、LLM模拟器生成连贯API响应,最后由LLM裁判过滤轨迹。在AppWorld和OfficeBench基准测试中,微调模型取得显著性能提升,证明无需可执行环境即可生成有效监督信号。
训练API调用大语言模型智能体需要海量高质量轨迹数据,但传统方法要求完整实现可执行API环境和预填充后端数据库,这成为规模化扩展的主要瓶颈。苹果机器学习研究团队提出一种无环境合成数据生成方法,仅需API规范即可生成训练数据,无需任何可执行环境。该方法将大语言模型作为即时数字世界模型,模拟智能体与有状态环境之间的交互过程。
具体流程分为三步:首先,LLM根据提供的API规范生成多样化可解任务;然后,教师智能体迭代求解每个任务,同时LLM模拟器根据任务上下文和模拟历史生成连贯的合成API响应;最后,LLM裁判过滤轨迹以确保数据集质量。这种方法完全摆脱了对物理环境的依赖,使得数据生成可以大规模并行进行。
研究团队在AppWorld和OfficeBench两个挑战性基准上评估了该方法,这两个基准包含信息检索和状态改变两类任务。实验结果显示,在合成数据上微调的模型取得了显著性能提升,证明了无需可执行环境即可生成有效监督信号。这一成果为训练跨多样化API生态系统的智能体提供了实用且可扩展的解决方案。
该方法的优势在于其灵活性和可扩展性。由于不依赖特定环境,它可以快速适配新的API集合,无需为每个API生态系统构建和维护复杂的模拟环境。此外,LLM模拟器能够生成多样化的API响应,包括正常响应和异常情况,从而增强训练数据的覆盖范围和鲁棒性。
苹果研究团队表示,这一方法为API调用智能体的训练开辟了新途径。未来工作将探索如何进一步提升合成数据的质量,以及如何将该方法应用于更复杂的多步骤任务和实时交互场景。该研究已在苹果机器学习研究页面发布,相关论文和代码可供学术界和工业界参考。
要点
- 苹果提出无环境合成数据生成方法,仅需API规范即可训练API调用智能体,无需完整执行环境。
- 方法利用LLM作为数字世界模型,通过任务生成、教师求解和LLM模拟三步生成高质量轨迹数据。
- 在AppWorld和OfficeBench基准上,微调模型取得显著性能提升,验证了方法的有效性。
- 该方法具有高度可扩展性,可快速适配新API生态系统,无需为每个环境构建模拟器。
- LLM模拟器能生成多样化API响应,包括异常情况,增强训练数据的鲁棒性和覆盖范围。
原始标题:Environment-free Synthetic Data Generation for API-Calling Agents
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。