AI资讯 / 论文

论文 / 论文

面向真实场景的前瞻性智能体能力评测基准

arXiv LLM/Agent

随着大语言模型与多模态大模型的快速发展,能够主动操作日常工具的智能体逐渐走入真实应用场景。然而,现有评测基准多依赖沙盒环境与单轮交互,且按场景分类的任务体系容易混淆多种能力,难以定位失败根源。为此,研究团队推出 UniClawBench,这是首个以能力驱动的前瞻性智能体评测基准,围绕技能使用、探索、长上下文推理、多模态理解与跨平台协同五项基础能力,设计了 400 个中英双语真实任务。该基准在实时 Docker 容器中以细粒度步骤检查点进行评估,并通过执行者、隐藏监督者与用户三类智能体构建闭环多轮交互,模拟真实人类反馈。团队还对比多种主流模型与智能体框架,揭示基础能力与框架设计的联合影响,为未来研究提供开源工具。

现有的智能体评测基准普遍依赖沙盒环境与单轮交互范式,难以反映智能体在真实动态场景中的表现。同时,按业务场景划分任务类别的方式容易把技能使用、推理、规划等不同能力混杂在一起,导致当智能体失败时,研究者难以判断瓶颈究竟来自哪一项基础能力,制约了诊断与改进的效率。

为解决上述问题,研究团队提出 UniClawBench,一个以能力维度驱动的评测基准。它将智能体的核心能力拆解为五项:技能使用、探索、长上下文推理、多模态理解以及跨平台协同,并在每一项能力下构建真实可执行的任务,从根本上避免场景分类带来的能力混淆问题。

基于上述能力框架,团队设计了 400 个中英双语真实世界任务,涵盖日常工具操作与多平台协作等场景。不同于以往依赖静态预录答案的评测方式,UniClawBench 在实时 Docker 容器中运行任务,通过细粒度的逐步完成检查点对智能体表现进行打分,从而更准确地衡量其在动态环境中的执行能力。

在评测机制上,该基准引入了由执行者智能体、隐藏监督者智能体和用户智能体构成的闭环评估策略。用户智能体模拟真实人类的反馈,执行者完成实际任务,隐藏监督者负责在不泄露评分标准的前提下进行监督与验证,从而在多轮交互中实现贴近真实使用情境的评估流程。

研究团队还在多种主流智能体框架上对前沿大模型进行了系统比较,重点区分基础模型能力与框架层设计选择对最终表现的贡献。实验结果表明,真实场景下的智能体性能由模型能力与框架设计共同决定,单一维度的优化难以全面提升表现。该基准代码与数据已开源,为后续研究提供了可复现的实验平台。

要点

  • UniClawBench 是首个以能力驱动的前瞻性智能体评测基准,将核心能力拆解为五项基础维度。
  • 基准包含 400 个中英双语真实任务,在实时 Docker 容器中通过细粒度步骤检查点进行评估。
  • 采用执行者、隐藏监督者与用户三类智能体构建闭环多轮交互,模拟真实人类反馈且不泄露评分标准。
  • 通过多模型与多框架的系统对比,揭示基础能力与框架设计共同决定智能体在真实环境中的表现。
  • 基准代码与数据已在 GitHub 开源,便于后续研究复现与扩展。
查看原始来源

原始标题:UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。