AI资讯 / 产业

产业 / 媒体

同级最强开放权重搜索智能体

The Decoder

中国实验室 AllSpark 发布了 Iris-mini 和 Iris-pro 两款开源搜索智能体,分别拥有 350 亿和 3970 亿参数,均基于 Qwen 系列模型构建,支持 256,000 token 的上下文窗口。两款模型在 BrowseComp、BrowseComp-ZH、DeepSearchQA 和 Humanity's Last Exam 四项基准测试中,于各自参数量级的开放权重模型中取得领先成绩。训练流程从网页链接结构反向构建多步推理任务,并通过两阶段数据过滤与「SFT-RL 交替爬升」方法持续优化模型。研究团队还发现,上下文管理策略对评测得分的影响有时超过模型本身的差异,尤其对较小模型影响显著。此外,专为搜索任务生成的训练数据意外提升了模型在通用工具使用和办公场景中的表现,表明搜索能力可能是一种更基础的智能体技能。模型权重已在 Hugging Face 开放下载,代码托管于 GitHub。

AllSpark 团队近日发布 Iris-mini 与 Iris-pro 两款开源搜索智能体及完整训练方案。Iris-mini 拥有 350 亿参数,Iris-pro 拥有 3970 亿参数,分别基于 Qwen3.6-35B-A3B 和 Qwen3.5-397B-A17B 构建,均支持 256,000 token 的上下文窗口。根据论文,两款模型在各自参数量级的开放权重搜索智能体中均取得最强基准成绩,为开源社区提供了具有竞争力的搜索推理方案。

训练数据的构建方式颇具新意:团队从网页的链接结构出发,以种子页面及其外链为基础构建术语关系图,再从中生成需要多步推理才能回答的复合问题。为防止模型通过简单文本匹配作弊,除最终答案外的所有关键词均被替换为同义表述。只有参考模型在无工具时无法解答、有工具时可以解答的问题才会进入数据集,确保任务既有难度又可验证。

在训练流程上,团队采用「SFT-RL 交替爬升」策略:先由更强的教师模型生成包含推理、搜索查询和结果的解题路径,再经过两轮过滤——第一轮检查路径的正确性与重复问题,第二轮由从数据中自动归纳标准的裁判模型逐步审核。随后,模型通过针对真实网络搜索的强化学习进一步优化,每轮中最难的已解任务和最高效的解题路径将反馈至下一轮训练。

团队特别指出,上下文管理策略对基准得分的影响往往被低估。在长时间搜索任务中,上下文可能在所有子问题解决前就已耗尽,而简单丢弃对话历史的做法会人为延长搜索过程,却无法真实反映模型能力。为此,团队在保持工具、上下文限制和裁判模型一致的前提下,对每项基准分别测试开启和关闭上下文管理的结果。数据显示,上下文管理对 Iris-mini 的 BrowseComp 得分提升最高达 21.2 分,原因在于小模型完成同等任务所需步骤更多,更容易触及上下文上限。

在四项基准测试中,Iris-mini 在开启上下文管理后分别取得 82.2、84.8、86.9 和 52.3 分,Iris-pro 则达到 88.6、85.1、92.9 和 56.4 分。Iris-mini 在同级模型中三项领先,仅在 DeepSearchQA 上落后于 XYZ-Aquila-mini;Iris-pro 在大参数量级中领先或持平,且有时接近需要更多算力的闭源系统。值得注意的是,论文附录还记录了一个基准标注错误的案例:BrowseComp-ZH 中一道关于《权力的游戏》的题目,模型回答「Bolton」实为正确,但标准答案却标注为「Lannister」,这促使团队着手构建更高质量的评测基准。

研究中一个意外发现引发广泛关注:专为搜索任务生成的训练数据和专项模型,显著提升了模型在通用工具使用和办公场景等从未训练过的任务上的表现。团队据此认为,搜索能力可能是一种基础性智能体技能,而非单一专项能力,因为在任何需要处理不完整信息的场景中,这种学习到的行为都能发挥作用。目前,Iris-mini 和 Iris-pro 的模型权重已在 Hugging Face 开放,代码发布于 GitHub,训练数据构建与训练流程将在后续陆续开源。

要点

  • Iris-mini(350亿参数)和 Iris-pro(3970亿参数)在各自量级的开放权重搜索智能体中取得最强基准成绩,均基于 Qwen 系列模型构建。
  • 训练数据从网页链接结构反向生成多步推理任务,并通过两阶段过滤和「SFT-RL 交替爬升」策略持续提升模型质量。
  • 上下文管理策略对评测得分的影响有时超过模型本身差异,对小模型尤为显著,最高可提升 21.2 个百分点。
  • 专为搜索设计的训练数据意外提升了模型在通用工具使用和办公场景中的表现,表明搜索可能是一种基础性智能体能力。
  • 模型权重已在 Hugging Face 开放,代码托管于 GitHub,训练数据与流程将后续开源。
查看原始来源

原始标题:Iris-mini and Iris-pro are the strongest open-weight search agents in their class

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。