产业 / 媒体
Kimi K3网络攻击能力远落后于美国顶级模型,蒸馏训练或是关键原因
英国AI安全研究所(UK AISI)与美国AI标准与创新中心(CAISI)联合对月之暗面旗下最新模型Kimi K3进行了网络安全能力评测。结果显示,Kimi K3在卡内基梅隆大学开发的ExploitBench基准测试中得分32.2%,而美国领先模型平均达76.2%,差距悬殊。在模拟企业网络攻击测试中,Kimi K3平均完成32步攻击路径中的17步,美国顶级模型则达28.5步。值得注意的是,Kimi K3的安全护栏未能有效阻止漏洞开发或攻击性网络操作请求。研究人员指出,Kimi K3在通用基准测试中表现强劲,但网络攻击能力明显偏弱,这一现象与外界关于月之暗面蒸馏Anthropic模型的指控相吻合——若训练数据主要来自Claude的输出,而Claude会屏蔽高级网络攻击查询,则蒸馏所得模型自然难以获得相应的深层漏洞利用能力。
英国AI安全研究所与美国AI标准与创新中心近期联合发布了对月之暗面Kimi K3模型的网络安全能力评测报告。评测采用卡内基梅隆大学开发的ExploitBench基准,该基准包含41个2023年后在Chrome V8引擎中发现的真实漏洞,用于衡量模型在软件漏洞利用流程中的推进能力。Kimi K3得分32.2%,美国领先模型平均76.2%,中国另一模型GLM-5.2则为24.4%。Kimi K3在开放权重模型中创下新高,但与美国顶级系统相比仍有显著差距。
在最高难度的任意代码执行(ACE)级别测试中,Kimi K3在全部41项任务中均未达到该级别。ACE是最严重的漏洞利用等级,意味着攻击者可完全控制目标系统。相比之下,美国领先模型在41项任务中有20项实现了ACE。值得注意的是,评测机构对美国闭源模型禁用了系统级安全护栏,以测量其最大能力上限,而这些护栏在公开版本中默认启用。
第二项测试名为「最后防线」(TLO),模拟一次跨越四个子网、约20台主机、共32步的企业网络攻击,人类专家完成该任务约需20小时。Kimi K3平均完成至第17步,美国领先模型平均达28.5步,GLM-5.2仅完成11步。Kimi K3在十次尝试中有一次完整走完攻击路径,说明其具备相应能力,但稳定性不足。评测机构指出,当被引导并获得初始网络访问权限时,Kimi K3能够自主攻击防御薄弱的小型企业系统。
CAISI的时间序列分析追踪了2025年初以来中美模型在网络能力上的Elo评分变化。数据显示,双方能力均在提升,但中国模型始终落后于美国模型。英国研究所此前评估,开放模型之间的性能差距约为四至七个月,而2025年初这一差距为六至十个月。研究机构警告,这一差距不应令人产生自满情绪,开放模型不断增长的网络攻击能力正在制造「持续且不可逆的滥用风险」。
Kimi K3的评测结果还为外界对中国模型开发商的蒸馏指控提供了佐证。美国科学顾问迈克尔·克拉齐奥斯近期指控月之暗面通过将Anthropic旗下Fable模型的最优输出作为训练数据,来提升Kimi K3的性能。研究人员认为,Kimi K3通用基准强、网络攻击能力弱的表现,恰好符合蒸馏Claude输出的逻辑——Anthropic的安全分类器会专门屏蔽高级网络攻击查询,因此这类数据在蒸馏数据集中严重缺失,导致模型无法习得深层漏洞利用能力,却能在通用任务上与西方顶级模型比肩。
此次评测的更广泛意义在于,它揭示了AI模型网络攻击能力评估的复杂性。对美国模型禁用安全护栏后所暴露的能力,在公开接口中几乎无法触及,因此也难以通过蒸馏方式获取。这意味着,即便中国模型在通用能力上持续追赶,在网络安全这一高度敏感领域,美国模型的实际能力优势仍可能长期维持。如何在能力评估透明度与安全风险之间取得平衡,将是各国AI监管机构面临的持续挑战。
要点
- Kimi K3在ExploitBench漏洞利用基准测试中得分32.2%,美国领先模型平均达76.2%,差距超过44个百分点
- Kimi K3的安全护栏未能有效阻止漏洞开发或攻击性网络操作请求,存在明显安全隐患
- 通用基准强而网络攻击能力弱的表现,与月之暗面蒸馏Anthropic Claude模型的指控高度吻合,因为Claude会屏蔽高级网络攻击查询
- 中国AI模型网络能力持续提升,但与美国顶级系统的差距仍维持在数月量级,研究机构警告不应因此自满
- 美国模型禁用安全护栏后所展现的深层漏洞利用能力,在公开接口中几乎不可访问,这为防止能力扩散提供了一定屏障
原始标题:Kimi K3 trails frontier US models by a wide margin on cyber exploits, and distillation may explain why
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。