AI资讯 / 研究

研究 / 官方

多智能体系统的协作模式与潜在风险

Anthropic Research

Anthropic 前沿红队发布研究报告,聚焦新兴多智能体系统中出现的行为模式与潜在问题。随着 AI 模型能力持续提升,智能体正在共享代码库、市场及其他社会系统中承担越来越多的任务,智能体之间的真实交互量有望在人类充分理解其运作条件之前,就超过人与人、人与智能体之间的交互总量。研究团队通过两项实验探索多智能体协作的效果:一是让 45 个智能体协同检测开源软件漏洞,结果显示协调型智能体群体发现的漏洞数量远超独立并行方式,且两种方法发现的漏洞高度互补;二是让多个智能体群体协作开发文字网页游戏,结果表明当智能体之间存在强依赖关系时,协调难度显著上升,最终产出质量普遍不佳。研究指出,个体层面看似无害的行为特征,在系统层面可能叠加为不可预期的全局性失败。

Anthropic 前沿红队于 2026 年 8 月发布研究报告,系统梳理了当前多智能体系统中出现的行为规律与潜在风险。报告指出,现有机构和社会系统是围绕人类速度的监督机制设计的,而随着 AI 智能体在速度和成本上逐渐超越人类,部分机构将演变为人机混合体,另一些则可能完全由智能体主导运营。这一趋势的演进速度可能超出人类社会的适应能力。

在软件漏洞检测实验中,研究团队将 45 个智能体部署于各自独立的虚拟机中,并为其提供共享论坛以便协调,要求它们共同检测 15 个开源软件项目中的安全漏洞。结果显示,协调型智能体群体在 2700 万 token 的运行中发现了 266 个漏洞,而独立并行方式在 650 万 token 的运行中仅发现 21 个。值得注意的是,两种方法发现的漏洞中仅有 12 个重叠,说明二者具有高度互补性。

协调型智能体群体展现出自发专业化的能力:各智能体自行构建工具,并逐渐专注于特定类型的漏洞发现。研究团队认为,这种专业化分工与协调机制在未来将显著优于无序的暴力搜索方式。然而,当智能体之间存在强依赖关系时,协调的复杂性会急剧上升,这在大型软件工程项目中尤为突出。

为测试强依赖场景下的协调能力,研究团队让多个智能体群体协作开发可在网页端运行的文字开放世界奇幻游戏。实验中,团队尝试了三种不同的提示策略:基础协作提示、规定角色分工的提示,以及设立首席执行官层级的提示。然而三种方式的结果差异不大,最终产出的游戏质量普遍较差,无法正常运行。这表明在任务依赖关系复杂的场景下,当前智能体的协调能力仍存在明显瓶颈。

报告强调,智能体与人类在多个维度上存在本质差异:它们可以持续工作更长时间、即时处理海量信息、拥有超越任何个人的知识广度,但同时也容易出现虚构信息和奖励黑客等问题。更令人担忧的是,个体层面看似无害的行为倾向,在多智能体系统中可能相互叠加,演变为难以预料的全局性失败。Anthropic 表示,此次研究旨在引发业界对上述风险的广泛讨论,并推动相应缓解措施的探索。

要点

  • 协调型智能体群体在软件漏洞检测中发现的漏洞数量约为独立并行方式的 12 倍,且两种方法发现的漏洞高度互补,仅有极少数重叠。
  • 智能体群体能够自发形成专业化分工,但当任务之间存在强依赖关系时,协调难度显著上升,当前模型在复杂协作场景下的表现仍不稳定。
  • 不同提示策略(基础协作、角色分工、CEO 层级)对智能体群体的最终产出质量影响有限,说明提示工程并非解决多智能体协调问题的根本手段。
  • 个体智能体层面的良性行为特征,在多智能体系统中可能叠加为不可预期的系统性风险,需要在规模化部署前建立更完善的评估与监督机制。
  • 智能体间交互量有望在人类充分理解其运作条件之前就超过人际交互总量,现有机构和监督体系亟需针对这一趋势进行适应性调整。
查看原始来源

原始标题:Patterns and problems in multiagent systems

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。