产业 / 媒体
2.8 万亿参数,首个达到该规模的开源大模型
月之暗面于 2026 年 7 月 27 日正式开源 Kimi K3 模型,发布了模型权重与技术报告,并同步开源支撑训练的三项关键基础设施技术:MoonEP、FlashKDA 和 AgentEnv。Kimi K3 拥有 2.8 万亿参数,是目前首个达到该规模的开源模型,基于自研 KDA 混合线性注意力机制(Kimi Delta Attention)与注意力残差技术构建,原生支持视觉理解,上下文窗口达 100 万 token。在架构层面,模型引入 Stable LatentMoE 框架,可在 896 个专家中高效激活 16 个,整体扩展效率较上一代 K2 提升约 2.5 倍。Kimi K3 在长程编码、大型代码库处理及视觉推理等任务上表现突出,综合评测成绩稳定超越除 Claude Fable 5 和 GPT-5.6 Sol 以外的所有模型,展现出开源阵营的前沿竞争力。
月之暗面于 7 月 27 日晚间正式开源 Kimi K3,这是一个拥有 2.8 万亿参数的大型语言模型,也是目前全球首个达到该参数规模的开源模型。官方同步发布了模型权重与完整技术报告,并将支撑训练的三项基础设施技术一并开源,模型权重已上传至 Hugging Face,代码托管于 GitHub。
在架构设计上,Kimi K3 采用自研的 KDA 混合线性注意力机制(Kimi Delta Attention)与注意力残差技术,原生支持视觉理解能力,上下文窗口长达 100 万 token。这一设计使模型在处理超长文档、大型代码库及多模态输入时具备显著优势,无需额外适配即可应对复杂的长上下文任务。
在专家混合(MoE)架构方面,Kimi K3 结合 Stable LatentMoE 框架进一步扩大了稀疏度,模型可在 896 个专家中高效激活 16 个。配合训练方法与数据配方的系统性优化,这些结构性改进使 Kimi K3 相比上一代 K2 的整体扩展效率提升约 2.5 倍,能够更高效地将算力转化为实际能力。
在应用能力层面,Kimi K3 具备出色的长程编码能力,可在极少人工监督的情况下持续完成长时间工程任务,理解并处理大型代码库,同时协调调用终端工具。此外,模型还擅长融合软件工程与视觉推理的复合任务,能够借助截图和视觉反馈优化游戏开发、前端设计及 CAD 等场景中的工作流程。
在综合评测表现上,官方表示 Kimi K3 整体仍落后于最强闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但在完整评测集中展现出前沿水平的能力,并稳定超越其他所有模型。值得关注的是,在过去 12 个月中有 9 个月,Kimi 模型始终保持着开源模型的参数规模上限,显示出月之暗面在开源赛道上的持续投入。
本次开源还包含三项训练基础设施技术:MoonEP 负责高性能通信,FlashKDA 提供高性能算子支持,AgentEnv 则构建分布式强化学习环境。其中 FlashKDA 此前已开源,MoonEP 与 AgentEnv 随本次发布正式对外开放,覆盖了从通信到算子再到训练环境的完整关键链路,为社区复现与二次开发提供了重要支撑。
要点
- Kimi K3 是全球首个达到 2.8 万亿参数规模的开源模型,模型权重与技术报告已完整公开。
- 模型采用 KDA 混合线性注意力机制,支持 100 万 token 上下文窗口与原生视觉理解,扩展效率较上代提升约 2.5 倍。
- MoonEP 和 AgentEnv 随本次发布正式开源,与此前已开源的 FlashKDA 共同构成完整的训练基础设施技术栈。
- 综合评测中 Kimi K3 稳定超越除 Claude Fable 5 和 GPT-5.6 Sol 以外的所有模型,在开源阵营中处于领先位置。