模型 / 官方
无需解析文档的视觉增强检索生成框架
OpenBMB 团队发布的 VisRAG 2.0(即 EVisRAG)是一个以视觉语言模型为核心的检索增强生成框架,其最大特点是完全跳过文档解析步骤,直接将文档页面作为图像进行嵌入和检索,从而避免传统文本提取过程中不可避免的信息损失。在此基础上,EVisRAG 引入了证据引导机制:系统先对检索到的每张图像进行语言层面的观察,提取各图像的局部证据,再综合这些线索完成最终推理与回答。训练方面,EVisRAG 采用自研的奖励范围限定群体相对策略优化算法(RS-GRPO),通过细粒度的词元级奖励信号,同步优化模型的视觉感知与推理能力。该项目已在 ACM MM 2026 上被接收,相关模型、数据集与代码均已在 HuggingFace 和 GitHub 上公开发布,并支持在 UltraRAG v2 平台中一键复现。
传统 RAG 系统在处理 PDF 等富格式文档时,通常需要先将文档解析为纯文本,再进行向量化检索。这一过程往往导致表格、图表、排版等关键信息大量流失。VisRAG 的核心思路是彻底绕开这一环节,直接将文档页面以图像形式输入视觉语言模型,由模型完成嵌入与检索,从而在源头上保留文档的完整信息密度。
VisRAG 2.0 的升级版本 EVisRAG 在检索之后引入了一套证据引导推理流程。系统首先对每张检索到的图像进行独立的语言观察,提炼出各自的关键证据片段,随后将这些分散的证据汇聚起来进行跨图推理,最终生成答案。这种先感知、再推理的两阶段设计,使模型在面对多图问答场景时表现更为稳健。
在训练策略上,EVisRAG 采用两阶段方案。第一阶段基于 LLaMA-Factory 进行监督微调,第二阶段引入自研的 RS-GRPO 算法。RS-GRPO 的创新之处在于将细粒度奖励信号绑定到特定范围的词元上,使视觉感知模块与语言推理模块能够在同一优化目标下协同提升,避免了传统强化学习方法中奖励信号过于稀疏的问题。
检索模块 VisRAG-Ret 基于 MiniCPM-V 2.0 构建,融合了 SigLIP 视觉编码器与 MiniCPM-2B 语言模型。其训练数据集包含约 36.2 万条查询-文档对,其中 34% 来自公开学术数据集,66% 为利用 GPT-4o 对网络爬取 PDF 页面生成伪查询的合成数据。生成模块则无需额外微调,可直接接入 MiniCPM-V 2.0、MiniCPM-V 2.6 或 GPT-4o 等任意视觉语言模型。
目前,EVisRAG 已发布基于 Qwen2.5-VL-7B-Instruct 和 Qwen2.5-VL-3B-Instruct 训练的视觉语言奖励模型,所有评测基准数据集也已上传至 HuggingFace。该项目被 ACM MM 2026 接收,并已集成至 UltraRAG v2 平台,研究者可通过标准化流程快速复现 EVisRAG 与 VisRAG 的完整实验结果,降低了多模态 RAG 研究的复现门槛。
要点
- VisRAG 直接以图像形式嵌入文档,彻底规避传统文本解析带来的信息损失,尤其适合处理含有复杂排版、表格和图表的 PDF 文档
- EVisRAG 引入证据引导的两阶段推理机制,先对各检索图像提取局部证据,再跨图综合推理,显著提升多图问答场景下的准确性
- 自研的 RS-GRPO 训练算法通过词元级细粒度奖励,实现视觉感知与语言推理的联合优化,是该框架性能提升的关键技术支撑
- 项目已完全开源,模型、训练数据与评测基准均可在 HuggingFace 获取,并支持在 UltraRAG v2 中一键复现,具备较强的实用落地价值
原始标题:OpenBMB/VisRAG — Parsing-free RAG supported by VLMs
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。