产业 / 媒体
AI推理步骤与模型内部激活模式一一对应,韩国研究团队揭示中间层关键信号
韩国科学技术院(KAIST)与Naver AI Lab的研究人员发现,推理模型在逐步解题时所展示的不同推理操作——包括信息提取、问题分解、公式调用、演绎推理和数值计算——不仅体现在文本输出层面,也在模型内部的激活状态中形成可区分的独立模式。研究团队对Qwen2.5-7B、Qwen3-8B和Gemma4-31B三个模型进行测试,利用GPT-5对数学解题路径中的各段落进行标注,再分析对应的内部表示。结果显示,不同推理步骤在模型中间层的分离效果最为突出,且这一规律在三个模型中均得到验证。研究还发现,即便是常见功能词如「a」「is」,其内部表示也会因所处推理步骤的不同而产生差异。这一发现对AI安全领域具有重要意义,因为模型内部处理的信息远超其可见的思维链所呈现的内容。
当推理模型逐步解决一道数学题时,它实际上在执行一系列不同的操作:读取数据、拆解问题、调取公式、执行计算。KAIST与Naver AI Lab的研究团队提出了一个核心问题:这些推理步骤是否也能在模型的内部数值表示中被区分开来?为此,他们定义了八种反复出现的推理操作类型,并设计了系统性实验加以验证。
研究团队让Qwen2.5-7B、Qwen3-8B和Gemma4-31B三个模型求解数学题,将解题路径切分为若干片段,再借助GPT-5为每个片段打上对应的推理操作标签。分析结果表明,不同推理操作在模型内部激活模式上确实存在显著差异,且这种差异在中间层达到峰值。研究人员还排除了词汇选择和位置因素的干扰,证明内部状态所携带的信息超越了表面文字层面。
研究还揭示了一个有趣现象:像「a」「is」「the」这类常见功能词,在不同推理步骤中频繁出现,但其内部表示并非一成不变。在模型的早期层中,这些词的表示仍混杂在一起;而到了中间层和后期层,它们会根据所处的推理操作类型逐渐分离。这说明模型在处理同一个词时,会根据上下文推理步骤赋予其不同的内部编码。
研究团队还测试了推理步骤是否能独立形成。当他们通过定向干预屏蔽前30个token的注意力时,对应推理操作的内部信号明显减弱。这表明推理步骤并非孤立产生,而是依赖于前文的上下文积累。值得注意的是,即便在解题错误的情况下,模型正在执行的步骤类型依然可以被识别——一个错误的计算步骤在内部仍然呈现为计算步骤的特征。
该研究的可复现性也得到了验证:实验结果在Llama-3-8B上得到复现,针对Qwen3-8B训练的分类器还成功迁移至GPQA-Diamond和MATH-500数据集。不过,目前实验范围仍限于数学任务和少数几个模型,能否利用这一发现在生成过程中实时检测错误或引导模型行为,仍有待后续研究探索。
这项研究对AI安全领域具有深远意义。思维链(Chain of Thought)目前是少数几种可用的模型监督工具之一,但Anthropic的研究显示,模型仅在25%至39%的情况下会在输出中披露其实际使用的推理线索。通过将模型内部向量转化为可读文本的方法,研究者发现Claude Opus 4.6处理的信息远超其输出推理所呈现的内容。KAIST的这项研究为理解模型内部计算与文本输出之间的关系提供了新的视角。
要点
- 推理模型的不同推理步骤(提取、分解、公式调用、演绎、计算)在内部激活模式上可被可靠区分,信号在中间层最强。
- 同一功能词的内部表示会因所处推理步骤不同而产生差异,说明模型内部编码了超越表面词汇的推理类型信息。
- 推理步骤依赖前文上下文,屏蔽前序token会削弱对应步骤的内部信号,推理并非孤立生成。
- 即便解题结果错误,模型执行的推理步骤类型在内部仍可被识别,错误计算在内部依然呈现计算步骤特征。
- 该发现对AI安全监督具有重要意义,模型内部处理的信息远超可见思维链所披露的内容,为开发更有效的监督工具提供了方向。
原始标题:AI models' written reasoning steps correspond to distinct internal patterns, a new study finds
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。