论文 / 论文
GRAPHEVAL如何揭穿自洽性的错觉
大语言模型常出现看起来合理却并不忠实的推理,而主流的自洽性解码仅比较最终答案是否一致,无法识别中间步骤的逻辑缺陷。为此,研究者提出GRAPHEVAL框架,将不确定性量化重定义为整体推理忠实度问题,并推出新的指标Graph Reasoning Coherence Score,用语义与结构共识捕捉模式坍缩和自信幻觉。实验显示,该指标是唯一在不同能力模型上都与推理忠实度呈稳定负相关的度量。同时引入的Graph Self-Consistency采用medoid选择,用推理忠实度换取名义准确率,揭示了小模型自洽性分数被不忠实的幸运猜测推高,而强模型则能保持或提升准确率。对抗实验进一步证明所选推理路径是关键承重点,迫使模型偏离会显著降低忠实度。
大语言模型的推理输出常常看似流畅,但其中间步骤可能存在隐性错误或不忠实的逻辑跳跃。传统自洽性方法通过多次采样并对最终答案做多数投票来评估可靠性,却无法识别那些最终答对但推理链本身有缺陷的"幸运猜测"情形,这在高风险应用中带来隐患。
为了弥补这一短板,研究者提出GRAPHEVAL框架,将不确定性量化重新定义为对整体推理忠实度的综合评估。其核心假设是,忠实的推理在多条采样之间应当呈现语义与结构上的内在一致,而不仅是末端答案的偶然重合。
框架中的关键新指标Graph Reasoning Coherence Score(GRCS)通过图结构刻画推理空间中的语义结构共识,能够捕捉模式坍缩与自信幻觉等异常模式。在横跨不同能力档位的模型实验里,GRCS是唯一与推理忠实度呈现稳定负相关的度量,体现出对推理质量的判别能力。
研究者还设计了Graph Self-Consistency(GSC)解码策略,采用medoid方式在多条候选路径中挑选最具代表性的推理链。结果显示,该方法在小模型上会牺牲部分名义准确率以换取忠实度,暴露出自洽性分数被不忠实猜测虚高的问题;而在更强的模型上,忠实度与准确率均可保持甚至提升。
进一步的对抗medoid消融实验表明,GSC所选路径在推理过程中扮演着"承重点"的角色。当外力迫使模型偏离该路径时,整体推理忠实度显著下降,在特定场景下还会引发准确率下滑,印证了图结构评估对关键推理节点的敏感性。
要点
- 自洽性多数投票只能比对最终答案,难以识别推理链内部的逻辑错误,存在被"幸运猜测"虚高的风险。
- GRAPHEVAL将不确定性量化重新定义为整体推理忠实度问题,引入基于图的评估视角。
- 新指标GRCS是少数能在不同能力模型上都与推理忠实度稳定负相关的度量,可用于捕捉模式坍缩与自信幻觉。
- Graph Self-Consistency采用medoid选择,在小模型上揭示自洽性虚高现象,在强模型上保持或提升准确率。
- 对抗实验表明所选推理路径是关键承重点,偏离后会导致忠实度与准确率同步下滑。
原始标题:Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。