AI资讯 / 论文

论文 / 论文

用率失真视角统一LLM与智能体中的记忆压缩

arXiv Inference/Systems

随着大语言模型和智能体规模扩大,用于记忆的计算与存储开销持续攀升,包括键值缓存、长提示、循环状态与跨会话历史。为此,四个相对独立的研究方向各自发展出压缩手段:KV缓存的淘汰与量化、提示的剪枝与蒸馏、架构状态的边界控制,以及智能体记忆的整合。该综述主张,这些方法其实是同一问题的不同表现,即在资源预算下决定保留哪些上下文信息、以何种保真度保留,从而维持下游任务效用。作者用一个统一的压缩目标函数和层级无关的下界来形式化这一视角,并构建了一个七轴分类法,跨技术栈一致地归类现有方法,尝试在KV管理与智能体长期记忆之间迁移机制。研究还发现两层共同规律:决定保留内容的信号是注意力幅度或近期性,并且在查询到来前就丢弃信息、无法撤销;针对智能体反复执行的压缩操作,缺少统一基准。

大语言模型和基于其构建的智能体在记忆环节投入的算力与显存越来越多,涵盖注意力键值缓存、超长提示、循环状态以及跨轮次和跨会话的历史记录。由于这些记忆均非免费,四个相对独立的研究方向各自演化出压缩策略:对KV缓存做淘汰或量化,对提示进行剪枝或蒸馏,对架构状态设定边界,以及对智能体记忆进行整合。

本文的核心主张是将上述四类做法纳入同一个理论视角,即率失真决策:在资源预算约束下,选择保留哪些上下文衍生信息、保留到什么精度,以最大化下游任务效用。作者给出一个统一的压缩目标函数和一个不依赖具体层级的下界,使得不同技术栈的方法可以在同一框架下被比较和分析。

基于这一框架,作者构建了七轴分类法,将KV缓存管理、提示压缩、循环状态压缩与智能体记忆整合等方法一致归类,并展示了从前端推理服务的KV策略到智能体长期记忆之间尚未被联系过的机制迁移路径,强调跨层借鉴的潜力。

综述还指出两条贯穿各层的共性规律。其一,决定保留内容的判据通常是注意力幅度或时间近因性,其失败模式也高度一致:在查询尚未到来时便丢弃信息、且无法回退,导致后续查询所需的关键内容丢失。其二,现有压缩评估多聚焦于单轮长上下文,而智能体反复执行的压缩操作几乎没有被度量过,目前也没有一个基准能同时固定一个预算轴并贯穿所有层。

基于上述观察,论文提出了一套基准设计建议、一组小型参考实验以及面向压缩感知的设计原则,并梳理了仍待解决的开放问题,为后续研究提供可落地的方向。

整体来看,该工作为分散在不同子领域的方法提供了一座共通语言,使得研究者能够更系统地理解记忆压缩的本质,并在KV管理与智能体长期记忆之间发现新的迁移机会。

要点

  • KV缓存淘汰、提示剪枝、架构状态约束与智能体记忆整合,本质上都是资源预算下的率失真问题。
  • 统一的压缩目标与层级无关的下界,使跨技术栈方法可被一致分析与比较。
  • 决定保留的判据多为注意力幅度或近期性,且普遍存在查询前丢弃、无法撤销的失效模式。
  • 智能体反复执行的压缩操作缺乏统一度量,目前缺少能贯穿所有层的基准。
  • 论文提出基准建议、参考实验与压缩感知设计原则,并梳理了开放问题。
查看原始来源

原始标题:What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。