AI资讯 / 模型

模型 / 官方

Anthropic 大幅优化 Fable 5 生物安全分类器,误报率降低 85%

Anthropic News

Anthropic 宣布对 Claude Fable 5 的生物安全分类器进行重大更新,将生物相关查询的「回退」触发率降低约 85%。所谓回退,是指系统检测到潜在风险后将用户请求转交给能力较弱的 Opus 5 模型处理。此次更新后,用户在解读化验结果、了解症状或进行生物学教育学习时,将极少再遭遇请求被拦截的情况,医疗专业人员也能获得更多临床支持。Anthropic 表示,Fable 5 在部分高难度生物任务上已超越领域专家,这既带来了巨大的医疗潜力,也引发了对双重用途滥用的担忧。目前,病毒学、毒理学和分子设计等领域的查询仍会触发回退机制,Anthropic 计划通过可信访问通道逐步向专业生物研究人员开放前沿能力。

Anthropic 于 2026 年 8 月正式宣布,针对旗舰模型 Fable 5 的生物安全分类器完成重要迭代。本次更新的核心目标是大幅减少误报——即系统将无害的生物相关查询错误识别为高风险内容并触发回退的情况。根据 Anthropic 内部测试数据,更新后生物相关回退率整体下降约 85%,覆盖公司旗下所有产品形态。

Fable 5 在生物领域的能力已达到相当高的水准,在部分复杂生物任务上甚至能超越人类专家。这一能力的双面性正是 Anthropic 构建严格安全机制的根本原因:同样的知识既可以帮助研究人员开发新型医疗手段,也可能被恶意行为者用于生物武器研发。美国情报界 2026 年度威胁评估报告明确指出,合成生物学与基因编辑等生物技术进步可能催生新型生物威胁,多个国家级行为者疑似维持着活跃的进攻性生物武器项目。

为应对上述风险,Anthropic 在 Fable 5 发布之初采取了极为保守的策略,将几乎所有生物相关查询纳入拦截范围。这一决策虽然保障了安全底线,却也给大量合法用户带来了困扰——医学生、医疗从业者乃至普通用户在询问日常健康问题时,都可能遭遇请求被转交给能力较弱模型的情况。Anthropic 坦承这是一种有意为之的权衡:生物领域滥用的潜在后果可能是灾难性的,因此宁可接受较高的误报率。

此次优化的技术核心在于对分类器「规则集」的全面重写。Anthropic 团队详细梳理了各类无害使用场景,并广泛征求内外部专家意见,在此基础上生成新的训练数据并完成分类器重训练。验证结果显示,更新后的分类器仍能有效识别有害及双重用途的研究内容,同时对更广泛的良性查询保持开放。病毒学、毒理学、分子设计等高风险领域的查询依然会触发回退至 Opus 5 的机制。

Anthropic 表示,生物与医疗领域是 AI 对世界产生积极影响最大的机遇所在,公司正在大力投入,探索以负责任的方式向生物学家开放前沿能力。目前,Fable 5 尚不适用于专业生物研究和药物开发场景,但公司承诺将通过可信访问通道逐步弥合这一差距,让更多专业研究人员能够安全地使用模型的完整能力。

这一案例折射出前沿 AI 安全治理的普遍难题:如何在能力开放与风险管控之间找到动态平衡点。Anthropic 选择先以宽泛分类器上线、再持续迭代收窄误报范围的路径,而非等待安全机制完全成熟后才发布模型。这种「边跑边调」的策略在业界引发了关于 AI 安全与可用性取舍的广泛讨论,也为其他前沿模型的安全部署提供了可参考的实践样本。

要点

  • Fable 5 生物相关查询的回退触发率降低约 85%,日常健康咨询、症状查询、教育类生物问题将大幅减少被拦截的情况。
  • 病毒学、毒理学、分子设计等双重用途领域的查询仍会触发回退至 Opus 5,Fable 5 暂不支持专业生物研究与药物开发场景。
  • Anthropic 通过重写分类器规则集、引入多元专家反馈、重新生成训练数据三步完成本次迭代,在降低误报的同时维持对高风险内容的拦截能力。
  • Anthropic 计划通过可信访问通道逐步向专业生物研究人员开放 Fable 5 的前沿生物能力,以弥合当前的功能缺口。
  • 此次更新体现了前沿 AI 安全部署的典型策略:以保守姿态首发,再通过持续迭代扩大合法用途覆盖范围,而非等待安全机制完全成熟后才上线。
查看原始来源

原始标题:Improving Fable 5 Safeguards

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。