产业 / 媒体
逼近 GPT-5.6 Sol 与 Fable 5,定价告别极低价时代
中国 AI 公司月之暗面(Kimi)发布新一代开源多模态模型 K3,采用混合专家架构,总参数达 2.8 万亿,原生支持图像与视频处理,上下文窗口达到 100 万 token。Kimi 官方基准显示,K3 接近 Claude Fable 5 与 GPT 5.6 Sol,并大幅领先 Opus 4.8 与 GLM 5.2。独立机构 Artificial Analysis 给出 57 分的综合智能指数,与上述结论基本一致,但指出 K3 的幻觉率从前代的 39% 上升到 51%。K3 专为长时间软件开发、知识工作和复杂推理设计,演示项目包括程序化生成的开放世界 3D 游戏。定价方面,每百万输入 token 3 美元、输出 token 15 美元,相较 K2.6 显著提高,标志着中国前沿模型告别超低价竞争。
Kimi 发布旗舰开源多模态模型 K3,采用混合专家架构,配备 896 位专家、2.8 万亿总参数,上下文窗口达到 100 万 token,原生支持图像与视频处理。Kimi 称其为 3 万亿参数级别中首个开源模型,完整权重计划在 7 月 27 日前发布,面向长时间编程、知识工作和复杂推理场景。
Kimi 官方基准测试显示,K3 性能接近 Claude Fable 5 与 GPT 5.6 Sol,但大幅领先包括 Opus 4.8 与 GLM 5.2 在内的其他系统。在 35 项测试中,K3 约 7 次拿到第一,其余多数位居第二或第三。不过部分测试使用了不同的智能体框架,结果并不在完全相同的条件下取得。
独立评测机构 Artificial Analysis 在 Intelligence Index 上给 K3 打出 57 分,与 Opus 4.8 和 GPT-5.5 持平,仍落后于 Fable 5 与 GPT-5.6 Sol。智能体任务方面,K3 在 GDPval v2 上取得 1668 的 Elo 评分,相较 K2.6 的 1190 大幅提升,在 AutomationBench-AA 上以 53% 的得分位列第一。
评测同时指出,K3 的准确率从 33% 提升至 46%,综合得分由 +6 升至 +18,但幻觉率从 39% 攀升到 51%,意味着模型在答对更多问题的同时也产生了更多虚构回答。Kimi 将 K3 的主要用途定位为最小人工干预下的长时间软件开发,强调其能分析大型代码库并跨多步骤保持任务专注。
K3 引入名为 Kimi Delta Attention 的新注意力架构,官方称可让百万 token 上下文的解码速度提升最高 6.3 倍,并借助注意力残差机制使训练效率提升约 25%。模型还能结合屏幕截图检查代码改动后的视觉输出,这套闭环系统被命名为 Vision in the Loop,被定位为游戏开发、UI 设计与 CAD 的基础能力。
定价方面,K3 输入 token 每百万 3 美元(缓存命中 0.30 美元),输出 token 每百万 15 美元,相较 K2.6 的 0.95/4.00 美元大幅上涨,与 Anthropic Sonnet 5 同价,但明显低于 Fable 5。Artificial Analysis 测算每任务成本约 0.94 美元,接近 GPT-5.6 Sol 的 1.04 美元,约为 Opus 4.8 的一半。这一定价显示中国前沿模型供应商已不再以极低价格为竞争核心。
要点
- K3 是参数规模约 3 万亿级别的首个开源权重模型,完整权重将在 7 月 27 日前发布。
- Kimi 官方基准与 Artificial Analysis 独立评测均显示 K3 接近 Fable 5 与 GPT-5.6 Sol,并大幅领先 Opus 4.8、GLM 5.2 等对手。
- K3 在准确率提升的同时,幻觉率从 39% 上升至 51%,可靠性问题需开发者关注。
- K3 输入与输出价格分别为每百万 token 3 美元与 15 美元,相较 K2.6 翻倍以上,标志着中国前沿模型告别超低价时代。
- K3 引入 Kimi Delta Attention 架构,百万 token 解码速度最高可提升 6.3 倍,面向长时间智能体编程场景。
原始标题:Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 while signaling the end of super cheap Chinese AI
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。