AI资讯 / 研究

研究 / 官方

Anthropic 发布开源工具 Bloom,自动化评估前沿 AI 模型的行为对齐

Anthropic Research

Anthropic 于2025年12月发布开源工具 Bloom,专为自动化评估前沿 AI 模型的行为对齐而设计。传统行为评估耗时漫长,且面临训练集污染和能力迭代导致评估失效的双重风险。Bloom 通过四个自动化阶段——理解、构思、推演和判断——将研究者对某一行为的描述转化为包含多样化场景的完整评估套件,并输出行为触发率、平均行为强度等量化指标。Anthropic 已利用 Bloom 对16个前沿模型完成了四项对齐相关行为的基准测试,涵盖妄想性奉承、指令驱动的长期破坏、自我保护倾向和自我偏好偏差,整个流程仅耗时数天。验证实验显示,Bloom 的评分与人工标注结果高度相关,Claude Opus 4.1 作为评判模型时斯皮尔曼相关系数达0.86,并能在10项怪异行为测试中成功区分9项基线模型与刻意设计的失对齐模型。

高质量的行为评估是理解前沿 AI 模型对齐状态的核心手段,但这一工作长期面临两大瓶颈:开发周期漫长,以及评估内容随模型迭代而失效。当评估场景被纳入新模型的训练数据,或模型能力大幅提升后,原有评估便不再能有效检验研究者真正关心的行为特征。Anthropic 此前已发布 Petri 工具用于探索模型行为全貌,而 Bloom 则作为互补工具,专注于对单一行为进行深度量化评估。

Bloom 的工作流程分为四个自动化阶段。首先,理解阶段的智能体分析研究者提供的行为描述和示例对话,生成关于测量目标与测量原因的详细背景信息。其次,构思阶段的智能体基于上述背景,自动生成多样化的评估场景,每个场景包含情境设定、模拟用户、系统提示和交互环境。第三阶段为并行推演,智能体同时模拟用户和工具的响应,以触发目标模型的目标行为。最后,判断阶段由评判模型对每份对话记录进行评分,并由元评判模型生成套件级别的综合分析报告。

与固定评估集不同,Bloom 每次运行都会生成不同的场景,同时通过评估种子文件保持可复现性。种子文件记录行为描述、示例对话及其他参数,研究者在引用 Bloom 指标时须同步提供对应种子。研究者还可灵活配置各阶段所用模型、交互轮次长度、是否向目标模型开放工具调用、场景多样性程度,以及真实感和触发难度等次级评分维度,从而在不依赖固定提示格式的前提下实现灵活且可复现的评估。

为验证 Bloom 的可靠性,Anthropic 从两个维度展开测试。在区分能力方面,研究团队将生产版 Claude 模型与经系统提示刻意设计为展示特定怪异行为的「模型生物体」进行对比,Bloom 在10项行为中成功区分了9项;唯一未能区分的自我推销行为,经后续人工审查发现基线模型本身也存在类似表现。在评分校准方面,研究者对40份对话记录进行人工标注,并与11种不同评判模型的输出进行比对,Claude Opus 4.1 表现最佳,斯皮尔曼相关系数达0.86,且在评分极端值区间与人工判断的一致性尤为突出。

Anthropic 利用 Bloom 对16个前沿模型完成了四项基准测试,分别评估妄想性奉承、指令驱动的长期破坏、自我保护倾向和自我偏好偏差。每套评估包含100个独立推演场景,并重复三次以计算标准差。整个流程从概念设计到结果生成仅耗时数天,远低于传统评估方式所需的时间成本。Bloom 已在 GitHub 开源,并集成 Weights & Biases 实验追踪和 Inspect 兼容的对话记录导出功能,供研究社区广泛使用。

要点

  • Bloom 通过四阶段自动化流水线,将行为评估的开发周期从数月压缩至数天,显著提升对齐研究效率。
  • 验证实验表明,Bloom 能在10项行为测试中成功区分9项基线模型与刻意失对齐模型,评分与人工标注的斯皮尔曼相关系数最高达0.86。
  • Bloom 每次运行生成不同场景,通过种子文件保持可复现性,避免固定评估集被纳入训练数据后失效的问题。
  • Anthropic 已发布16个前沿模型在四项对齐相关行为上的基准测试结果,为行业提供横向比较参考。
  • Bloom 完全开源,支持灵活配置,可与主流实验追踪平台集成,降低研究者的工程门槛。
查看原始来源

原始标题:Automated behavioral evals

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。