AI资讯 / 研究

研究 / 论文

让大语言模型通过信念状态实现高效长程交互

BAIR

随着AI助手被要求完成越来越复杂的任务,大语言模型的上下文窗口面临无法无限扩展的根本瓶颈。现有的递归摘要(上下文压缩)方案虽能压缩历史信息,但会带来显著的性能损失,在协作代码生成等高质量数据稀缺的领域尤为突出。伯克利人工智能研究团队提出了ABBEL框架,其核心思路是将摘要生成任务独立出来,以自然语言信念状态的形式对摘要内容进行监督。受递归贝叶斯估计启发,模型被周期性地提示根据新观测更新信念状态,并通过信念评分机制对信念内容的质量进行强化学习监督。在协作编程基准CollabBench上,ABBEL将与全上下文模型的性能差距缩小约50%,训练步数减少50%,同时峰值上下文长度显著低于全上下文方案。

当AI模型需要协助完成软件开发等复杂任务时,往往需要经历数百乃至数千步的交互。将完整的交互历史保留在上下文中既不现实,也不经济。目前业界普遍采用的解决方案是上下文压缩,即让模型对历史信息进行递归摘要。Cursor最新的composer 2.5模型以及在线编程竞赛中首个持续击败所有人类选手的系统Grandcode,都在训练或推理阶段引入了上下文压缩机制。

然而,压缩方案存在难以忽视的缺陷。尽管在基准测试中性能差距看似不大,但Cursor等平台仍建议用户在任务进行中避免使用压缩功能。研究团队通过类Wordle游戏Combination Lock的实验直观展示了这一问题:经过强化学习微调后,使用摘要上下文的模型虽然持续改进,但始终无法追平使用完整上下文的模型。让模型在完成任务的同时进行自我摘要,本身就增加了学习问题的复杂度。

ABBEL的核心创新在于将信念状态作为信息瓶颈。模型在每次获得新观测后更新自然语言信念状态,后续的行动选择仅基于当前的后验信念,而非完整历史。这一设计借鉴了递归贝叶斯估计的思想,将摘要生成从行动决策中解耦,使两个子任务都能得到更专注的优化。信念状态以自然语言表达,保持了良好的可解释性。

为进一步提升信念质量,ABBEL引入了信念评分机制。该机制将当前语言模型同时视为信息的编码器和解码器,通过衡量信念状态能否被用于重建最新观测来打分,并将此作为辅助强化学习任务的奖励信号。对于编程场景,好的信念应当既简洁,又能尽可能还原最新的代码变更;对于难以定义启发式规则的领域,则采用通用的自编码器风格评分函数。

在协作编程基准CollabBench上,ABBEL-rec-BG(使用重建信念评分)将与全上下文模型的测试通过率差距从6个百分点缩小至约3个百分点,成功率差距从8个百分点缩小至约3个百分点,同时训练步数从100步减少至50步,峰值上下文长度也远低于全上下文方案。在Combination Lock任务中,引入领域知识信念评分后,ABBEL的学习效率甚至超过了全上下文模型。

研究团队还在多目标问答任务中验证了峰值信念长度惩罚的有效性,结果显示在几乎不损失性能的前提下可显著降低内存占用,优于对推理长度施加惩罚的常见做法。展望未来,显式信念状态作为信息瓶颈还可用于引导探索、促进多智能体通信,以及提升用户对模型记忆内容的可控性,为长程交互系统的记忆机制研究开辟了新方向。

要点

  • ABBEL将摘要生成从行动决策中解耦,以自然语言信念状态替代完整交互历史,在保持可解释性的同时降低内存占用
  • 信念评分机制通过辅助强化学习任务监督信念内容质量,在CollabBench上将与全上下文模型的性能差距缩小约50%,训练步数减少一半
  • 在Combination Lock任务中,结合领域知识的信念评分使ABBEL的学习效率达到甚至超越全上下文模型
  • 峰值信念长度惩罚可在多目标问答任务中显著压缩内存使用,且性能几乎不受影响,优于直接惩罚推理长度的方案
  • 显式信念状态作为信息瓶颈为多智能体通信、用户可控记忆等长程交互应用场景提供了新的技术路径
查看原始来源

原始标题:Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。