研究 / 官方
苹果研究院提出共享选择性持久记忆架构,大幅提升智能体LLM系统任务完成率
苹果机器学习研究院在EMNLP 2026上发表论文,提出一种名为「共享选择性持久记忆」的新型记忆架构,专为通过多轮工具调用生成代码的智能体LLM系统设计。该架构的核心思路是:每次会话结束后,系统并非保存完整对话历史,而是有选择地提取并保留四类可复用上下文——任务规格、数据模式、工具配置和输出约束,同时丢弃仅对当次会话有效的推理痕迹。研究团队还引入了「零Token数据刷新」机制,使已生成的程序可在不重新调用LLM的情况下完成数据更新。在三个企业级部署场景中,该架构将任务完成率提升至96%,远高于无记忆状态下的79%,以及保留完整历史时的71%。值得注意的是,完整历史持久化反而因引入过时推理痕迹而拖累了任务完成率,印证了选择性记忆策略的必要性。
智能体LLM系统在企业场景中面临一个根本性困境:每次新会话都从零开始,此前积累的配置选择、领域约束、数据模式和工具调用模式全部丢失。用户不得不在每次交互中重复提供相同的背景信息,既耗费时间,又增加了Token消耗。苹果研究团队将这一问题定义为「上下文冷启动」问题,并将其视为制约多轮智能体系统实用性的核心瓶颈。
为解决上述问题,研究团队提出了共享选择性持久记忆架构。该架构在会话结束后自动识别并提取四类具有跨会话复用价值的上下文:任务规格(用户目标与需求描述)、数据模式(数据库结构与字段定义)、工具配置(API端点与连接器参数)以及输出约束(格式要求与业务规则)。与此同时,仅对当次会话有效的中间推理步骤则被主动丢弃,避免其污染后续生成质量。
该架构的另一个关键特性是「共享性」。研究团队将选择性记忆封装为可转移的工作空间,并引入基于角色的访问控制机制,使不同用户可以在权限范围内共享和复用已积累的上下文,无需每位用户从头重新描述任务背景。这一设计在企业协作场景中尤为实用,可显著降低团队内部的重复性规格说明成本。
研究团队在一个已部署的协作工作空间平台上实现了该架构。该平台支持LLM智能体生成、编辑和维护多种制品,包括交互式仪表盘、结构化报告和数据驱动文档,数据来源涵盖CSV上传、SQL数据库、REST API和MCP服务器等多种连接器类型。平台还集成了Git版本控制与草稿隔离机制,用户可以自由探索修改方案并随时回滚,无需重新调用模型。
在性能表现方面,共享选择性持久记忆架构在三个企业部署场景中实现了96%的任务完成率,显著优于无记忆基线的79%。更值得关注的是,完整历史持久化方案的完成率仅为71%,低于无记忆基线,表明过时的推理痕迹会对智能体产生误导性偏差。零Token数据刷新机制则将周期性数据更新任务的耗时缩短至原来的1/14,而基于摘要的生成方式相比直接注入原始数据,每次调用的Token消耗降低了97倍。
研究团队在四个公开数据集上进行了复现实验,零Token刷新机制在12次试验中全部成功,验证了该方法的泛化能力。这项研究为企业级智能体系统的记忆管理提供了一套经过实证检验的设计范式,核心结论是:记忆的价值不在于保存得多,而在于保存得准——选择性比完整性更重要。
要点
- 共享选择性持久记忆架构通过只保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,将任务完成率提升至96%,同时避免了完整历史持久化带来的性能下降问题
- 完整对话历史持久化并非中性操作,过时的推理痕迹会主动干扰智能体判断,导致任务完成率(71%)甚至低于无记忆基线(79%),选择性丢弃是必要设计
- 零Token数据刷新机制将已生成程序与运行时数据解耦,使周期性数据更新无需重新调用LLM,任务耗时降低14倍,在企业数据报表场景中具有显著实用价值
- 基于角色访问控制的工作空间共享机制,使团队成员可复用已积累的上下文记忆,降低协作场景中的重复规格说明成本
- 该研究在四个公开数据集上的复现实验证实了方法的泛化能力,为智能体系统记忆架构设计提供了可参考的工程范式
原始标题:Shared Selective Persistent Memory for Agentic LLM Systems
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。