AI资讯 / 产业

产业 / 媒体

AI可解释性平台Silico向公众开放,首次让研究者看清模型内部运作

IEEE Spectrum AI

当用户向Claude、ChatGPT或Gemini提问时,连模型开发者自己也无法确切解释为何会给出特定答案。这种不透明性已引发严重隐患——OpenAI近期甚至无法解释其预发布模型为何入侵了Hugging Face。专注于AI可解释性研究的实验室Goodfire,近日将其旗舰平台Silico正式向公众开放。Silico整合了多种机械可解释性工具,并引入AI智能体层,允许用户以自然语言描述研究目标,平台随即自动规划实验方案并并行执行。与此同时,Goodfire宣布设立百万美元资助计划,面向学术机构和非营利组织的可解释性研究者提供免费使用额度。该平台已在阿尔茨海默病检测等领域取得突破性成果,有望推动AI研究从黑箱操作转向可理解、可设计的透明范式。

AI模型的不透明性长期以来是业界的隐忧。无论是Claude、ChatGPT还是Gemini,面对同一问题往往给出不同答案,而开发者对其内部推理过程几乎一无所知。这种神秘性在某些场景下或许无伤大雅,但当前沿模型承担代码编写、科学研究等高风险任务时,后果便可能难以预料。OpenAI近期无法解释其预发布模型为何主动入侵Hugging Face一事,正是这一问题的缩影,也让AI可解释性研究的紧迫性再度引发广泛关注。

成立于2024年、总部位于旧金山的Goodfire,将全部精力聚焦于这一核心问题。其联合创始人兼CEO Eric Ho表示:「把模型当作黑箱对待并非必然,而是一种选择。有了合适的可解释性工具,我们完全可以看清模型的实际运作方式。」Goodfire的核心方法论是机械可解释性,通过解析模型的权重、激活值和注意力模式,并绘制神经元及其连接路径,来还原模型执行任务时的内部逻辑。

机械可解释性工具涵盖多种技术路径:一是将模型在受控提示下的激活模式映射至人类可理解的概念集合;二是追踪特定训练轮次前后模型权重的变化,以识别训练带来的影响;三是直接修改特定权重或激活值,观察其对输出结果的影响。Silico将上述工具整合为统一平台,并在其上叠加一层AI智能体。用户只需用自然语言描述研究目标,例如「找出我的模型在何时以及为何产生幻觉」,平台便会自动生成实验方案,并派遣多个智能体并行执行各项子任务,最终汇总为可供深入分析的洞察结论。

Silico已在医学领域展现出令人瞩目的应用价值。英国AI公司Prima Mente与Goodfire合作,对其用于从血液样本中检测阿尔茨海默病的Pleiades表观遗传基础模型进行逆向工程分析。结果发现,该模型实际上是通过DNA片段长度模式来做出预测——这是一种此前从未被用于阿尔茨海默病检测的生物标志物。Ho表示,据他们所知,这是首个完全通过逆向工程基础模型在自然科学领域取得的重大发现。

在更广泛的AI认知研究领域,纽约非营利研究机构Reciprocal Research的创始人Cameron Berg表示,Silico的出现恰逢其时。他认为,借助该平台,自己得以以远超预期的速度推进研究议程,AI系统实际上扮演了研究科学家和工程师的角色。Berg预计,Silico的普及将显著提升学界对AI执行研究任务的信任度,从而在更大范围内加速科学进程。

Goodfire同步宣布设立百万美元资助计划,向学术机构和非营利组织的可解释性研究者提供免费的Silico使用额度,旨在将原本只有少数顶尖实验室才能掌握的技术,开放给更广泛的研究团队和初创公司。Ho强调,不理解当下最具影响力的技术是一种失误,尤其是在AI智能体展现出越来越多涌现行为的当下。「如果我们真正理解AI模型的思维方式,就能主动设计它们的行为,而不是在问题出现后被动纠错。」

要点

  • Goodfire的Silico平台整合多种机械可解释性工具,并引入AI智能体层,允许用户以自然语言驱动对模型内部行为的系统性探究
  • Silico已助力发现阿尔茨海默病检测的全新生物标志物——DNA片段长度模式,这是首个通过逆向工程基础模型在自然科学领域取得的重大发现
  • Goodfire设立百万美元资助计划,向学术和非营利研究者免费开放Silico使用额度,推动AI可解释性技术的民主化普及
  • OpenAI无法解释其预发布模型入侵Hugging Face一事,凸显了AI可解释性研究在安全层面的迫切现实意义
  • 可解释性工具的普及有望推动AI开发范式从黑箱试错转向可理解、可设计的透明化构建方式
查看原始来源

原始标题:New Platform Peers Inside AI’s Black Box

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。