AI资讯 / 产业

产业 / 媒体

月之暗面Kimi K3模型在AI智能体知识工作基准测试中超越GPT-5.6 Sol,仅次于Claude Fable 5

IT之家

月之暗面旗下Kimi K3模型在AI智能体知识工作基准测试AA-Briefcase中取得1543分,超越GPT-5.6 Sol的1501分,仅次于Claude Fable 5的1574分。该测试模拟真实企业办公环境,涉及数据科学、产品管理、企业战略等场景,要求处理海量碎片化信息并生成商务交付物。Kimi K3拥有2.8万亿参数和100万Tokens上下文窗口,在编程等领域表现突出。微软正在内部测试该模型,评估其接入Copilot助手的可行性。

独立AI评测机构Artificial Analysis于7月22日更新了AI智能体知识工作基准测试AA-Briefcase,结果显示月之暗面(Moonshot AI)的Kimi K3模型斩获1543分,超过GPT-5.6 Sol的最高1501分,仅次于Claude Fable 5模型的1574分。这一成绩标志着国产大模型在复杂知识工作领域迈入全球第一梯队。

AA-Briefcase是Artificial Analysis于2026年6月推出的全新基准测试,专为评估AI在处理长周期、高复杂度真实业务中的表现而设计。它模拟企业中真实且混乱的办公环境,测试数据科学、产品管理、企业战略等场景,要求处理25000多条Slack消息、3500多封电子邮件、会议纪要和财务报表等海量碎片化上下文,并生成Excel财务模型、董事会汇报PPT等实际商务交付物。

Kimi K3模型由月之暗面于2026年7月16日正式上线,是其迄今为止最强的旗舰模型,拥有2.8万亿参数和100万Tokens的上下文窗口,尤其擅长编程、游戏/3D与知识类任务。在编程能力方面,Kimi K3在Frontend Code Arena基准测试中曾以1679分超越Claude Fable 5登顶,在品牌营销、数据分析等七个前端领域中的六个位居第一。

与上一代Kimi K2.6模型在AA-Briefcase上的816分相比,K3实现了近翻倍的性能提升。在榜单上,Kimi K3还超过了Claude Sonnet 5的最高1388分和Claude Opus 4.8的最高1347分,展现出显著的代际进步。Kimi K3模型采用按量计费,每100万Tokens的输入费用在缓存命中时为2元,未命中时为20元,输出费用为100元。

近期有报道称,微软正在内部测试Kimi K3模型,并评估将其部分接入Copilot AI助手的可行性,以降低推理成本。这一动向表明,国产大模型在性能和成本效益上已获得国际科技巨头的关注,有望在全球AI生态中扮演更重要的角色。

要点

  • Kimi K3在AA-Briefcase基准测试中获1543分,超越GPT-5.6 Sol,仅次于Claude Fable 5。
  • AA-Briefcase模拟真实企业办公环境,测试数据科学、产品管理等复杂知识工作场景。
  • Kimi K3拥有2.8万亿参数和100万Tokens上下文窗口,在编程等领域表现突出。
  • 与上一代K2.6相比,K3在AA-Briefcase上的分数从816分提升至1543分,性能近乎翻倍。
  • 微软正在内部测试Kimi K3,评估其接入Copilot助手的可行性以降低推理成本。
查看原始来源

原始标题:超 GPT-5.6 Sol:月之暗面 Kimi K3 模型 AI 智能体知识工作跑分仅次于 Claude Fable 5

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。