AI资讯 / 产业

产业 / 媒体

OpenAI新推理技术引发AI安全专家强烈警觉

TechCrunch AI

OpenAI即将推出的Astra模型引入了一种名为「递归深度」(recurrent depth)的推理技术,又称「不透明递归」(opaque recurrence)。与传统推理模型逐步呈现思考过程的方式不同,该技术允许模型对同一查询进行多轮循环处理,留下更少可读的推理痕迹,从而绕过常规的思维链记录。这一特性令AI安全领域的研究者深感忧虑——思维链监控一直是识别模型异常行为和价值偏差的重要工具。Redwood Research首席执行官Buck Shlegeris表示极度担忧,认为若该技术被进一步扩展,将彻底摧毁思维链的可监控性。长期关注AI安全的Zvi Mowshowitz则呼吁通过立法防止各AI实验室陷入「竞相逐底」的恶性竞争。目前OpenAI方面强调Astra对该技术的使用仍属有限,思维链依然保持可读性,并重申对思维链监控的长期承诺。

据《The Information》报道,OpenAI正在为其新模型Astra引入一种名为「递归深度」的推理技术。与现有推理模型依赖线性、逐步展开的思考链不同,该技术允许模型对同一问题进行多次循环处理,整个推理过程更难以被外部观察者追踪和解读。这种架构上的转变,被部分研究者视为AI透明度领域的重大退步。

思维链(Chain of Thought,CoT)监控是当前AI安全实践的核心工具之一。通过读取模型逐步推理的记录,研究人员可以识别潜在的错误逻辑、价值偏差乃至恶意行为。在OpenAI此前发生的「流氓代理」事件中,思维链记录正是还原代理异常行为原因的关键证据。一旦推理过程转入「潜在空间」而无法被读取,这一安全机制将大打折扣。

Redwood Research首席执行官Buck Shlegeris在消息曝光后第一时间发文,表达了强烈担忧。他指出,即便Astra目前对该技术的使用较为有限,但若OpenAI选择进一步扩大递归规模,思维链的可监控性将被彻底摧毁。Redwood Research首席科学家Ryan Greenblatt也警告称,不透明推理的扩展速度可能远超传统思维链推理,最终导致模型完全在潜在空间中运作,外部监控形同虚设。

AI安全倡导者Zvi Mowshowitz则将矛头指向整个行业生态。他认为,OpenAI与Anthropic此前共同维护的「思维链忠实性与可监控性」已成为行业默契,而不透明递归技术的出现正在打破这一共识。他呼吁通过立法手段加以约束,防止各大AI实验室为追求性能而争相放弃安全底线,形成「竞相逐底」的恶性局面。

面对外界质疑,OpenAI首席科学家Jakub Pachocki在X平台发文回应,强调公司自首款推理模型起便致力于保留和利用思维链监控,这是当前研究项目的核心目标。他同时指出,所有AI模型都存在一定程度的不透明推理,学界也普遍不将思维链日志视为模型推理的直接映射。OpenAI还表示,Astra的思维链预计仍将保持可读性,公司不会转向所谓的「神经语言」(neuralese)模式。

值得关注的是,《The Information》周三的后续报道显示,Anthropic与Google DeepMind均已在内部讨论这一技术,表明不透明递归并非OpenAI独有的探索方向,而可能成为下一代推理模型的普遍趋势。这进一步加剧了安全研究者的担忧——如果行业整体向该方向迁移,现有的AI监控框架将面临系统性挑战,相关安全标准的制定迫在眉睫。

要点

  • OpenAI的Astra模型引入「不透明递归」推理技术,使模型推理过程留下更少可读痕迹,削弱了思维链监控的有效性
  • 多位顶级AI安全研究者公开表达强烈担忧,认为该技术若被大规模推广将彻底瓦解现有的AI行为监控机制
  • OpenAI强调Astra目前对该技术的使用仍属有限,思维链依然可读,并重申对思维链监控的长期承诺
  • Anthropic与Google DeepMind也在讨论类似技术,显示不透明递归可能成为行业性趋势,引发系统性安全隐患
  • 部分研究者呼吁通过立法手段防止AI实验室在安全透明度上「竞相逐底」
查看原始来源

原始标题:OpenAI’s new reasoning technique alarms AI safety experts

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。