AI资讯 / 研究

研究 / 论文

大模型高效推理扩展的新范式

BAIR

大型语言模型的推理能力近年来主要依靠推理时扩展来提升,但顺序推理存在固有缺陷:随着探索深度增加,上下文窗口不断膨胀,模型性能因「上下文腐化」而下降,用户等待时间甚至可达数十分钟乃至数小时。并行推理作为自然解法应运而生,允许模型同时探索多条独立路径。然而,现有并行方法大多在模型外部强制规定并行结构,无法根据问题复杂度灵活调整。自适应并行推理(APR)范式的提出,使模型能够在推理时自主决定是否并行、并行粒度以及线程间的协调方式。伯克利AI研究院的这篇综述系统梳理了从固定并行到自适应控制的技术演进,重点介绍了ThreadWeaver、Multiverse、Parallel-R1等代表性方法,并探讨了推理系统设计、训练策略与奖励机制等核心问题,同时指出该领域仍存在若干重要的开放性挑战。

顺序推理的规模化困境是APR诞生的直接动因。当前主流推理模型通过输出中间步骤、回溯与探索来提升准确率,但这种方式导致推理链条随问题复杂度线性增长。上下文窗口的持续累积使模型难以从大量中间路径中准确定位关键信息,产生所谓的「上下文腐化」现象。对于需要数百万token进行规划的复杂任务,用户等待时间极长,推理成本也随之急剧攀升,这使得单纯依靠延长输出序列来提升能力的路径愈发难以为继。

现有并行推理方法可分为三个层次。最简单的是自洽性采样与Best-of-N,即独立采样多条完整推理链后投票或用验证器选优,实现简单但存在大量冗余计算。更进一步的是基于启发式的结构化搜索,如思维树、思维图和蒙特卡洛树搜索,通过已知搜索算法分解子任务并剪枝,但需要预先了解分解策略。近期出现的ParaThinker、GroupThink和Hogwild!推理等方法则在并行线程的独立性与协作性之间做出不同权衡,但共同缺陷在于并行结构仍由外部强制施加,模型本身并不具备自适应能力。

APR范式的核心创新在于将并行化决策纳入模型自身的生成控制流。模型通过输出特殊控制token来决定何时顺序推理、何时派生并行线程,以及如何汇总各线程结果。这一设计带来三项关键优势:相比思维树,APR无需领域特定的分解启发式,模型通过强化学习自主发现有效的并行模式;相比Best-of-N,APR在分支前即规划各线程任务,避免冗余计算;相比非自适应方法,APR可以在简单问题上选择不并行,将算力集中于真正需要探索的复杂问题。

在推理系统层面,APR的执行遵循「分叉-汇合」设计:模型将问题分解为子任务后并发处理,再将结果聚合为最终答案。然而,独立线程的KV缓存合并存在技术难题——各线程从相同位置ID开始生成,直接拼接会产生非标准的位置编码和非因果注意力模式。对此,学界形成两种路线:Multiverse等方法修改推理引擎,通过页表操作将非连续内存块拼接为单一KV缓存序列,节省重新预填充的计算开销,但系统脆弱性较高;ThreadWeaver则保持推理引擎不变,在客户端将所有线程文本输出拼接后进行第二次预填充,工程实现更简洁,也更易与现有基础设施兼容。

训练APR模型需要解决示范数据与奖励设计两大问题。示范阶段教会模型并行控制流的语法,但仅靠监督微调不足以激励有效并行。研究者发现,单纯奖励线程数量容易被模型「刷分」,而仅奖励并行结构的使用又会导致模型在不必要时也强行并行。ThreadWeaver提出以关键路径长度占总token数的比例作为并行效率奖励,并将其与正确性奖励挂钩——只有在答案正确时才给予并行效率奖励,从而避免模型为追求并行而牺牲准确率。

尽管APR展现出显著潜力,该领域仍面临多个开放性问题。并行化在推理时究竟是持续提升准确率,还是主要作为训练阶段的探索支架?Parallel-R1的实验表明,移除并行化奖励后模型会迅速退回顺序推理,这究竟是训练稳定性问题、奖励设计缺陷,还是自回归预训练本身与并行结构存在根本性张力?此外,如何让并行化决策感知硬件算力预算、如何支持深度超过一层的递归并行结构,也是亟待探索的方向。这些问题的解答将决定APR能否真正成为高效推理扩展的主流范式。

要点

  • 顺序推理的上下文累积会导致性能下降和延迟激增,并行推理是突破这一瓶颈的自然路径,但现有方法大多在模型外部强制规定并行结构。
  • 自适应并行推理(APR)让模型自主决定是否并行、并行粒度及线程协调方式,通过特殊控制token将并行化纳入生成控制流,避免了对简单问题的算力浪费。
  • 推理系统层面存在两种KV缓存处理路线:修改引擎以复用缓存(Multiverse)与保持引擎不变在客户端拼接文本后二次预填充(ThreadWeaver),各有工程上的权衡。
  • 有效的并行奖励需与正确性挂钩,以关键路径长度占比衡量并行效率,防止模型为刷分而滥用并行结构。
  • APR是否在推理时持续提升准确率、模型是否会退回顺序推理、如何支持递归并行等问题仍是重要的开放性挑战。
查看原始来源

原始标题:Adaptive Parallel Reasoning: The Next Paradigm in Efficient Inference Scaling

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。