研究 / 官方
用优势感知推测解码将大模型推理延迟降低最高 2 倍
大型语言模型在数学推理等任务中依赖长链式思维(Chain of Thought),但这带来了高昂的推理计算开销。推测解码(Speculative Decoding)是缓解这一问题的主流技术之一,其核心思路是用轻量草稿模型快速生成候选 token,再由能力更强的目标模型并行验证。然而,传统 token 级推测解码在语义等价步骤中容易因 token 不匹配而产生不必要的拒绝,导致效率损失。现有步骤级方法虽有改进,但对被拒绝步骤的重新生成往往收效甚微,浪费了目标模型的算力。苹果机器学习研究团队与 UC Berkeley 合作提出 ARBITRAGE 框架,通过训练轻量路由器动态判断目标模型是否能产出质量显著更优的推理步骤,从而实现近似最优的效率与精度权衡。在多个数学推理基准测试中,ARBITRAGE 在精度持平的条件下将推理延迟降低最高约 2 倍。
推测解码的基本逻辑是以小博大:让参数量更少、速度更快的草稿模型先行生成候选内容,再交由大模型批量验证,从而减少大模型的串行调用次数。这一思路在通用文本生成场景中已被广泛验证,但在数学推理等需要严密逻辑链条的任务中,token 级别的匹配验证机制暴露出明显短板——即便两个步骤在语义上完全等价,细微的措辞差异也可能触发拒绝,导致目标模型不得不重新生成,反而增加了整体延迟。
为解决这一问题,学界近年来将验证粒度从 token 提升至推理步骤(step)层面,即整体接受或拒绝一个完整的推理步骤,而非逐 token 比对。这种步骤级语义验证在一定程度上提升了接受率,但现有方法在拒绝某一步骤后,往往直接调用目标模型重新生成,而重新生成的结果与草稿模型的输出质量差距有限,造成目标模型算力的浪费。如何在拒绝后更智能地分配计算资源,成为进一步提升效率的关键瓶颈。
ARBITRAGE 框架的核心创新在于引入了一个轻量级路由器(router),用于预测在当前推理步骤中目标模型相对于草稿模型的「优势」大小。当路由器判断目标模型能够产出质量显著更优的步骤时,才调用目标模型;否则直接采用草稿模型的输出。这一动态路由机制取代了传统的固定接受阈值,使系统能够根据具体推理上下文灵活分配算力,而非一刀切地处理所有步骤。
研究团队还引入了「ARBITRAGE ORACLE」这一理论参照系——即一个总能选择质量更高步骤的理想路由器。实验表明,ARBITRAGE 的实际表现能够逼近这一理论上界,在效率与精度的权衡曲线上接近最优。在多个数学推理基准测试中,ARBITRAGE 持续超越此前的步骤级推测解码基线方法,在精度持平的条件下将推理延迟压缩最高约 2 倍,验证了动态路由策略相对于静态阈值方法的显著优势。
这项研究由苹果机器学习研究团队与 UC Berkeley、ICSI 及 LBNL 联合完成,多名作者为并列第一贡献者。从更宏观的视角来看,ARBITRAGE 所代表的「按需调用大模型」思路,与当前业界在推理成本控制方面的核心诉求高度契合。随着推理模型在实际部署中的规模持续扩大,如何在不牺牲输出质量的前提下降低单次推理的计算开销,将成为模型落地的关键竞争维度之一。
要点
- ARBITRAGE 是一种步骤级推测解码框架,通过轻量路由器动态判断是否调用目标模型,避免对每个步骤都进行高成本的大模型推理
- 相比传统固定阈值的步骤级方法,ARBITRAGE 在多个数学推理基准上实现了最高约 2 倍的推理延迟降低,且精度基本持平
- 研究引入「ARBITRAGE ORACLE」作为理论最优参照,实验结果表明该框架的实际表现能够逼近这一上界,具备近似最优的效率精度权衡
- 该工作由苹果机器学习研究团队联合 UC Berkeley 等机构完成,已作为论文发表,代表了推测解码技术在推理任务场景下的重要进展
原始标题:Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。