AI资讯 / 工程

工程 / 工程

用查询感知压缩技术降低 Amazon Bedrock 上的 RAG 成本

AWS Machine Learning

检索增强生成(RAG)在规模化部署时,每次调用发送给基础模型的输入 Token 往往是成本的重要组成部分。Amazon Bedrock 的开放可组合架构支持在检索与最终答案生成之间插入自定义后处理步骤。AWS 机器学习团队提出一种「查询感知上下文压缩」模式:检索完成后,先用价格更低的小模型(如 Claude Haiku)对检索到的文本块进行过滤,仅保留与用户查询直接相关的片段,再将压缩后的上下文传给主模型(如 Claude Sonnet)生成答案。该模式通过一个 AWS Lambda 函数实现,兼容 Amazon Bedrock Knowledge Bases 等现有检索器,并可与提示词缓存、智能提示路由及重排序 API 叠加使用,从而实现复合成本节省。此外,去除无关上下文还能减少模型幻觉的发生概率。

RAG 系统在检索阶段通常倾向于高召回率,会返回 5 至 20 个候选文本块,以确保主模型拥有充足的参考材料。然而随着业务规模扩大,每次查询需要处理的输入 Token 数量可能达到数千个,尤其是技术文档和法律类 RAG 场景。这使得输入 Token 费用成为不可忽视的运营成本,如何在不损失回答质量的前提下减少主模型接收的 Token 数量,成为工程优化的核心命题。

查询感知压缩模式在标准 RAG 流程中仅新增一个步骤:在检索器返回文本块之后、主模型生成答案之前,由一个小型低成本模型读取所有检索块和用户查询,输出与问题直接相关的逐字片段。整个压缩调用与答案生成调用均在同一个 AWS Lambda 函数内完成,架构改动最小,且与 Amazon Bedrock Knowledge Bases 等托管检索器完全兼容。

该模式的经济逻辑取决于两个关键因素:小模型与主模型之间的价格比,以及小模型实际达到的压缩比。设检索到的输入 Token 数为 R、压缩比为 c,则主模型仅需处理 R/c 个上下文 Token。压缩调用虽然引入了小模型的输入和输出成本,但由于小模型单价远低于主模型,当检索上下文较大、价格比较高且大量内容可被裁剪时,整体费用将显著下降。

在实现层面,Lambda 函数通过 Amazon Bedrock Converse API 依次调用两个模型。压缩提示词指示小模型仅输出与查询相关的原文片段,不做改写或总结,从而保留信息的准确性。主模型随后基于压缩后的上下文生成最终答案。这种设计还带来一个附加收益:去除无关上下文可以缩小幻觉产生的空间,提升答案的可靠性。

该模式还可与 Amazon Bedrock 的多项现有能力叠加,进一步放大成本收益。提示词缓存可减少重复上下文的计费;Amazon Bedrock 智能提示路由能根据查询复杂度自动选择合适模型;重排序 API 则可在压缩前进一步提升检索块的相关性排序。三者组合使用,可在不改变用户体验的前提下实现复合式成本优化,适合已在 Amazon Bedrock 上构建 RAG 应用的团队逐步引入。

要点

  • 在 RAG 检索与主模型答案生成之间插入小模型压缩步骤,可显著减少主模型处理的输入 Token 数量,从而降低规模化部署成本。
  • 压缩收益取决于小模型与主模型的价格比以及实际压缩比,检索上下文越大、价格差越高,节省效果越明显。
  • 整个方案通过单个 AWS Lambda 函数实现,兼容 Amazon Bedrock Knowledge Bases,架构改动最小,可快速集成到现有 RAG 流程。
  • 去除无关上下文不仅降低成本,还能减少主模型产生幻觉的概率,提升答案质量。
  • 该模式可与提示词缓存、智能提示路由和重排序 API 叠加使用,实现复合成本优化。
查看原始来源

原始标题:Reduce RAG costs on Amazon Bedrock with query-aware compression

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。