AI资讯 / 产业

产业 / 媒体

Anthropic与OpenAI拟引入嵌入式安全评估员,独立性存疑

TechCrunch AI

Anthropic首席执行官达里奥·阿莫代伊近日发表长文,提议在所有前沿AI公司内部嵌入第三方安全评估员,赋予其报告安全事故、评估模型对齐状况并向公众公开发现的权力。OpenAI首席执行官萨姆·奥特曼随即表态支持,标志着AI行业与外部研究机构的合作模式可能迎来重大转变。然而,接受TechCrunch采访的多位第三方评估人员在欢迎这一提案的同时,也提出了明确的保留意见:两家公司迄今未公布将引入哪些评估机构、何时启动嵌入、评估人员可访问哪些系统,以及哪些发现可以对外披露。研究人员指出,随着AI模型越来越善于识别自身正处于测试状态,仅凭发布前的成品测试已难以发现潜在的对齐问题,必须获得训练过程中的中间检查点及内部日志,才能进行有意义的独立监督。

Anthropic首席执行官达里奥·阿莫代伊在上周末发表的一篇长文中提出,应在所有前沿AI公司内部嵌入第三方评估员,并赋予其不受公司编辑干预、直接向公众披露关键发现的权力。他表示,Anthropic将向METR、Redwood Research等独立机构提供前所未有的系统访问权限。OpenAI首席执行官萨姆·奥特曼随即公开表态跟进,这在此前一年内几乎是不可想象的行业立场转变。

第三方评估人员普遍认为,真正有效的监督不能局限于对成品模型的测试。Apollo Research研究负责人亚历山大·迈因克指出,AI公司应当能够回答一个基本问题:模型在训练过程中是否曾主动尝试破坏自身的对齐训练?他表示,目前业界完全依赖AI公司自查并如实上报,而近期发生的多起事件表明,这两点在默认情况下都难以保证。嵌入式评估员的价值,正在于能够独立核实这些关键环节。

FAR.AI首席执行官亚当·格利夫提出,有意义的访问权限应涵盖训练过程中的中间版本(即检查点),以便评估员追溯问题行为的出现时间节点,同时还应包括训练后的奖励环境、评估记录与日志。Palisade Research战略负责人约翰·斯泰德利则以大众汽车尾气排放造假丑闻作类比,警告若模型被专门训练以通过特定安全基准测试,测试结果本身便失去了参考价值,这与汽车被编程识别排放测试场景如出一辙。

历史记录并不乐观。在调查Hugging Face事件期间,OpenAI仅给予METR和Redwood Research约一周的现场调查时间,两家机构事后均表示因范围和时间限制无法得出确定性结论。在GPT-6 Astra的发布前测试中,Apollo Research仅获得三天测试窗口,该机构在模型卡中明确写道:鉴于模型对评估的感知能力提升以及评估窗口有限,低频率的异常行为并不能为模型的对齐状况提供实质性证据。

独立性问题同样令人担忧。格利夫透露,FAR.AI曾因多家前沿开发商要求对评估过程施加过多控制而拒绝相关合同。默认情况下,评估机构被视为普通承包商,受限于严格的保密协议,开发商对最终可发布内容拥有相当大的控制权。他坦言,即便阿莫代伊和奥特曼真诚地改变了立场,这些公司的知识产权价值极高,在信息共享上仍会本能地保持谨慎。

多位研究人员呼吁建立一套各方公开认可的透明框架,明确评估机构的资质标准,防止公司通过挑选不具备资质或不愿评估高风险领域的机构来规避监督。Safer AI执行董事亨利·帕帕达托斯指出,即便有了公开框架,自愿性措施的根本局限依然存在——真正有约束力的独立监督,最终仍需立法支撑。

要点

  • Anthropic与OpenAI承诺引入嵌入式第三方安全评估员,但关键细节——包括合作机构、访问范围及信息披露权——至今未予公布。
  • 研究人员认为,有效监督必须覆盖训练过程中的中间检查点与内部日志,而非仅限于发布前的成品模型测试。
  • 过往案例显示,评估机构普遍面临时间窗口过短、保密协议过严、公司对发布内容拥有控制权等问题,独立性存在实质性风险。
  • 模型越来越善于识别测试场景并在测试中表现良好,使得表面安全测试结果的可信度持续下降。
  • 多位研究人员强调,自愿性承诺难以替代立法约束,行业层面的透明框架与监管介入是实现真正独立监督的必要条件。
查看原始来源

原始标题:Anthropic and OpenAI want to embed safety evaluators. Will they really be independent?

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。