AI资讯 / 模型

模型 / 官方

深度研究框架性能超越 ChatGPT、Claude 与 Gemini

Meituan LongCat GitHub

美团 LongCat 团队近日在 GitHub 上开源了 LongCat-DeepResearch,这是一套面向开放式研究任务的深度研究执行框架。该框架将研究需求以可执行的 ResearchSpec 格式进行结构化管理,支持各章节独立并行研究与写作,并通过全局编辑与局部修订机制对最终报告进行精准优化,避免反复重写。框架本身仅依赖 Python 标准库,兼容 Python 3.10 及以上版本,用户只需实现 llm、web_search 和 web_fetch 三个接口即可接入自有服务。配合基于 LongCat-2.0 专项增强的深度研究模型,完整系统在 DeepResearchBench、DeepResearchBench II 和 ResearchRubrics 三项基准测试中均超越 ChatGPT、Claude 和 Gemini 的 Deep Research 产品。目前该仓库仅开放研究框架本身,数据构建流程、训练数据及训练代码暂不包含在内。

LongCat-DeepResearch 的核心设计理念是将复杂的开放式研究任务拆解为三个阶段:探索与规划、章节研究、组装与编辑。在规划阶段,多个规划器对问题及早期资料进行分析,由裁判合并各方提案,批评者识别遗漏,修订者最终生成可执行的 ResearchSpec。这种多角色协作机制确保研究方向在启动前已经过充分论证,减少后续返工。

章节研究阶段是该框架的关键创新之一。各章节由独立的研究者在隔离上下文中分别展开调研与写作,同时保留对完整规范的访问权限。这种并行架构既避免了不同章节之间的上下文干扰,又保证了整体研究目标的一致性,使得大规模报告的生成效率显著提升。

在组装与编辑阶段,已完成的各章节直接拼合,随后由全局编辑器识别归属与一致性问题,再由局部编辑器针对各章节范围进行定向修订。这一机制的核心优势在于避免了传统方案中因整体重写导致的质量损耗,转而采用精准的局部干预策略,使最终报告在连贯性与准确性上均得到保障。

框架的后端接口设计遵循清晰的契约规范。llm 方法负责向用户自有模型发送 OpenAI Chat Completions 格式请求并返回响应;web_search 接收查询并返回标准化搜索结果;web_fetch 接收一组 URL 并按序返回可读页面内容。框架本身不捆绑任何托管后端,用户在本地创建 local_backend.py 文件即可完成配置,凭证与服务商特定代码均保留在本地,不会被 Git 追踪。

在基准测试表现方面,LongCat-DeepResearch 配合 LongCat-2.0 增强模型,在 DeepResearchBench、DeepResearchBench II 和 ResearchRubrics 三项评测中均超越 ChatGPT、Claude 和 Gemini 的同类深度研究产品。值得注意的是,当前开源仓库仅包含研究框架本身,数据构建流程所使用的证据验证管线、生成数据集、隐藏评分标准、训练轨迹及训练代码均未纳入开放范围,商业化部署仍需用户自行配置模型与搜索服务。

要点

  • LongCat-DeepResearch 采用规划、并行章节研究、定向编辑三阶段架构,系统性解决了深度研究任务中的上下文干扰与反复重写问题
  • 框架仅依赖 Python 标准库,通过三个标准接口即可接入任意自有模型与搜索服务,部署门槛较低
  • 配合 LongCat-2.0 增强模型,完整系统在三项主流深度研究基准上全面超越 ChatGPT、Claude 和 Gemini
  • 当前开源范围仅限研究框架,训练数据、数据构建流程及训练代码暂不对外开放
查看原始来源

原始标题:meituan-longcat/LongCat-DeepResearch

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。