工程 / 工程
面向企业AI的任务感知知识压缩技术
检索增强生成(RAG)在处理跨越数百份文档的复杂分析任务时存在明显局限:相似度搜索只能返回片段,无法捕捉文档间的深层关联。AWS机器学习团队提出的任务感知知识压缩(TAKC)技术,通过大语言模型将整个知识库预先压缩为面向特定任务的精简表示,并按四个压缩层级缓存,在查询时根据问题复杂度自动路由至合适层级。该方案在AWS上以两条解耦的无服务器流水线实现,分别处理文档摄入与用户查询,支持开源部署。压缩比从8倍到64倍不等,在大幅降低Token消耗的同时,保留了任务相关的关键信息,尤其适合金融尽职调查、合规审查等需要跨文档综合推理的企业级场景。
传统RAG在面对复杂企业分析场景时往往力不从心。以私募股权公司评估一笔5亿美元的并购交易为例,尽职调查团队需要同时分析12家子公司五年的财务报表、200余份供应商合同、8个设施的环保合规报告以及50余起法律案件。当分析师询问综合财务风险与供应商条款及未决诉讼之间的关联时,RAG的相似度搜索根本无法给出有效答案——相关信息分散在数百份文档中,彼此之间并不存在词汇层面的相似性。
TAKC的核心思路是将文档压缩从查询时转移到摄入时。系统在离线阶段,针对每种任务类型对每份文档进行一次压缩,生成任务专属的精简表示。同一份年报,面向财务分析的压缩版本会保留营收、利润率和现金流数据,而面向合规审查的压缩版本则侧重监管引用和违规历史。这种差异化压缩避免了通用摘要信息密度被稀释的问题,使每个任务场景都能获得高度聚焦的知识表示。
为应对不同查询对信息粒度的差异化需求,TAKC设计了四个压缩层级。轻度压缩(8倍)保留约87.5%的上下文削减量,适合需要多步推理和跨文档综合的复杂分析;中度压缩(16倍)适用于中等复杂度的分析查询;高度压缩(32倍)服务于事实性查找;超高压缩(64倍)则用于分类和关键词检索。查询复杂度分析器根据问题长度、类型及分析性语言的出现频率,自动将请求路由至对应层级,整个过程对用户完全透明。
在AWS架构层面,TAKC由两条解耦的无服务器流水线构成。摄入流水线中,文档上传至Amazon S3后触发Lambda函数,将文档切分为256个Token的片段(重叠50个Token以防止边界信息丢失),随后并行调用Amazon Bedrock在四个压缩层级上完成压缩,结果存入Amazon ElastiCache Serverless,以复合键(takc:{task}:{rate})进行索引。查询流水线则通过Amazon API Gateway暴露REST接口,Amazon Cognito负责JWT鉴权,整体架构无需自定义认证代码,显著降低了实现复杂度。
对于大规模生产部署,官方建议在切块与压缩步骤之间引入Amazon SQS队列,以优雅处理并发限流问题,同时为压缩函数配置预留并发。任务类型的压缩提示词应存储在AWS Systems Manager Parameter Store或专用S3前缀中,确保提示词变更可审计,并在更新后触发重新压缩。为验证压缩质量,可将各层级的LLM响应与基于完整原始文档生成的响应进行对比,参考实现中已包含相应的测试脚本,支持针对特定任务类型和文档集合进行定制化评估。
TAKC并非要取代RAG,而是在RAG力所不及的跨文档综合推理场景中提供补充。该方案的开源实现可直接部署在用户自己的AWS账户中,适合金融、法律、合规等对文档关联分析要求较高的企业用户。随着企业AI应用从简单问答向复杂分析演进,这类将知识压缩与分层路由相结合的架构模式,有望成为下一代企业知识系统的重要组成部分。
要点
- TAKC在文档摄入阶段完成压缩,查询时直接检索任务专属的精简表示,从根本上解决了RAG无法捕捉跨文档关联的问题。
- 四级压缩层级(8x/16x/32x/64x)配合查询复杂度自动路由,在控制Token成本的同时,为复杂分析查询保留足够的上下文信息。
- 同一份文档可针对不同任务类型生成完全不同的压缩版本,财务分析版与合规审查版在内容侧重上截然不同,信息密度更高。
- 整体架构基于AWS无服务器服务(Lambda、API Gateway、ElastiCache、Bedrock、Cognito)构建,天然适配突发性摄入与可变查询负载的企业场景。
- 开源实现支持一键部署至用户自有AWS账户,并提供压缩质量验证脚本,降低了企业落地的技术门槛。
原始标题:Beyond RAG: Task-aware knowledge compression for enterprise AI on AWS
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。