AI资讯 / 模型

模型 / 官方

万亿参数原生多模态智能体模型

Moonshot AI GitHub

Moonshot AI 正式开源 Kimi K2.5,这是一款在 Kimi-K2-Base 基础上经约 15 万亿视觉与文本混合 token 持续预训练而成的原生多模态智能体模型。模型采用混合专家架构(MoE),总参数量达 1 万亿,每次推理激活 32B 参数,支持 256K 上下文长度。Kimi K2.5 将视觉理解、语言推理与智能体工具调用深度融合,同时支持即时模式与思考模式、对话范式与智能体范式的灵活切换。在多项权威基准测试中,Kimi K2.5 在视觉问答、数学推理、代码生成及智能体搜索等维度均展现出与 GPT-5.2、Claude 4.5 Opus、Gemini 3 Pro 相当乃至更优的性能表现,尤其在 BrowseComp 智能体搜索任务中引入「Agent Swarm」多智能体协同机制后,得分达到 78.4,超越所有对比模型。

Kimi K2.5 是 Moonshot AI 推出的首款开源原生多模态智能体大模型,基于 Kimi-K2-Base 通过约 15 万亿视觉与文本混合 token 的持续预训练构建而成。模型在架构层面采用混合专家(MoE)设计,总参数量达 1 万亿,每次前向推理仅激活 32B 参数,在保持强大能力的同时有效控制了推理成本。视觉编码器采用自研 MoonViT,参数量约 4 亿,支持跨模态深度融合。

在核心能力设计上,Kimi K2.5 强调三大特性的协同:原生多模态预训练使模型在视觉知识、跨模态推理及基于视觉输入的工具调用方面具备扎实基础;视觉驱动编码能力允许模型直接从 UI 设计图、视频工作流等视觉规格生成代码,并自主编排工具完成视觉数据处理任务;Agent Swarm 机制则将单智能体扩展升级为自导向的群体协同执行方案,能够将复杂任务分解为并行子任务,由动态实例化的领域专属智能体协同完成。

在推理与知识类基准上,Kimi K2.5 思考模式在 AIME 2025 上取得 96.1 分,HMMT 2025 达到 95.4 分,GPQA-Diamond 达到 87.6 分,整体与 GPT-5.2 及 Gemini 3 Pro 处于同一梯队。在引入工具增强后,HLE-Full 得分从 30.1 提升至 50.2,超越 GPT-5.2 的 45.5 和 Claude 4.5 Opus 的 43.2,显示出工具调用与推理能力的有效协同。

视觉理解方面,Kimi K2.5 在 MathVista(mini)上以 90.1 分领先 GPT-5.2 的 82.8 分,InfoVQA 达到 92.6 分,OCRBench 达到 92.3 分,均显著优于对比模型。视频理解方面,VideoMMMU 得分 86.6,LVBench 达到 75.9,在长视频理解任务 LongVideoBench 上以 79.8 分超越 GPT-5.2 的 76.5 分及 Gemini 3 Pro 的 77.7 分,展现出较强的时序视觉推理能力。

智能体搜索是 Kimi K2.5 的重要差异化方向。在 BrowseComp 基准上,标准模式得分 60.6,引入上下文管理后提升至 74.9,启用 Agent Swarm 后进一步达到 78.4,大幅超越 GPT-5.2 的 65.8 分。DeepSearchQA 得分 77.1,同样优于 GPT-5.2 的 71.3 分。代码能力方面,SWE-Bench Verified 得分 76.8,SWE-Bench Multilingual 达到 73.0,LiveCodeBench(v6)得分 85.0,整体处于开源模型前列。

要点

  • Kimi K2.5 采用 1T 总参数 MoE 架构,激活参数仅 32B,支持 256K 上下文,兼顾能力与推理效率。
  • Agent Swarm 多智能体协同机制在 BrowseComp 上将得分推至 78.4,超越 GPT-5.2、Claude 4.5 Opus 等闭源旗舰模型。
  • 工具增强显著放大模型推理上限,HLE-Full 加工具后得分从 30.1 跃升至 50.2,提升幅度达 20 个百分点。
  • 视觉与代码能力深度融合,模型可直接从 UI 设计图或视频工作流生成可执行代码,拓展了多模态智能体的实际应用场景。
  • 模型完全开源,技术报告同步发布,为学术界与开发者提供了可复现的高性能多模态智能体基础模型。
查看原始来源

原始标题:MoonshotAI/Kimi-K2.5 — Open Visual Agentic Intelligence

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。