AI资讯 / 论文

论文 / 论文

将验证能力拓展为大模型全新扩展维度

arXiv LLM/Agent

预训练、后训练与测试时算力已成为提升大语言模型能力的主要范式。该研究将验证能力——即判断解答正确性的能力——确立为新的算力扩展维度,并提出通用验证框架 LLM-as-a-Verifier。与传统评分方式不同,该框架对评分标记的 logits 分布求期望以生成连续分数,从而支持评分粒度、重复评估与准则分解三个方向的扩展。在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench、MedAgentBench 等基准上分别取得 86.5%、78.2%、87.4% 和 73.3% 的最优成绩。其细粒度信号还可估计任务进度,为 Claude Code 提供监控扩展,并为 SAC 与 GRPO 等强化学习算法提供密集反馈,提升机器人与数学推理任务的样本效率。

预训练、后训练与测试时算力被视为大语言模型能力提升的三大支柱。本研究在此之外提出第四个维度——验证,即将判断解答正确性的能力作为新的可扩展资源,并据此构建了通用验证框架 LLM-as-a-Verifier。

与传统语言模型裁判直接输出离散分数不同,该框架对评分标记的 logits 分布求期望,生成连续分数。这种概率化设计使验证能力可以沿三个方向独立或叠加扩展:评分粒度、重复评估次数以及评估准则的分解粒度。

粒度的提升带来正负样本之间更清晰的分离,使对比结果更加稳定可校准;重复评估通过降低方差提升准确率,准则分解则通过拆分任务复杂度带来额外增益。配合框架内置的成本敏感排序算法,系统可在候选方案中高效选出最优解。

在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 与 MedAgentBench 四个智能体基准上,该方法分别取得 86.5%、78.2%、87.4% 和 73.3% 的最优成绩,展示了通用验证能力在代码执行、软件工程、机器人奖励建模以及医疗智能体等多个领域的迁移潜力。

除直接用于排序外,连续分数还可作为任务进度的代理指标。研究团队基于此为 Claude Code 开发了监控扩展,使开发者能够实时观测并改进自己的智能体系统。

在强化学习场景中,该框架可提供比稀疏奖励更密集的反馈信号,在机器人控制与数学推理任务上分别提升 SAC 与 GRPO 算法的样本效率,进一步将验证能力嵌入到训练闭环之中。

要点

  • 验证能力被确立为大模型在预训练、后训练与测试时算力之外的第四个扩展维度。
  • 基于评分 logits 期望值的连续分数设计,使验证可在粒度、重复次数与准则分解三个维度灵活扩展。
  • 在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench、MedAgentBench 四个基准上均刷新最优成绩。
  • 连续分数可作为任务进度代理指标,并为 Claude Code 提供可监控自身表现的扩展。
  • 密集的验证反馈可提升 SAC 与 GRPO 在机器人与数学推理任务上的强化学习样本效率。
查看原始来源

原始标题:LLM-as-a-Verifier: A General-Purpose Verification Framework

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。