Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因

The Decoder:AI News(RSS)·2026-07-24 17:48·45天前·Matthias Bastian
AI 导读

英国AI安全研究所与美国AI标准与创新中心联合评估显示,月之暗面的Kimi K3在ExploitBench基准上得分32.2%,远低于美国领先模型的76.2%,但优于智谱GLM-5.2的24.4%。

The Decoder:AI News(RSS)
精选
73AI 编辑部评分,满分 100

Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因

2026-07-24 17:48· 45天前· Matthias Bastian
AI 导读

英国AI安全研究所与美国AI标准与创新中心联合评估显示,月之暗面的Kimi K3在ExploitBench基准上得分32.2%,远低于美国领先模型的76.2%,但优于智谱GLM-5.2的24.4%。

推荐理由

英美安全机构的联合评测把蒸馏嫌疑拽到了台面上,Kimi K3 的漏洞利用能力仅为美国前沿模型四成,安全评估不能只看通用基准,开源模型的安全面具该摘了。

正文 · AI 翻译
Image description

关键要点

  • 英国AI安全研究所与美国AI标准与创新中心联合评估发现,月之暗面(Moonshot AI)的Kimi K3在几乎没有有效抵抗的情况下协助实施攻击性网络行动。
  • Kimi K3在漏洞利用开发和模拟网络攻击方面远落后于美国领先模型,但优于中国的GLM-5.2。
  • 中国模型在网络任务上持续进步,但仍落后于美国系统。Kimi K3的结果也与月之暗面蒸馏更先进模型的指控相符。

英国AI安全研究所(UK AISI)与美国AI标准与创新中心(CAISI)联合评估了月之暗面(Moonshot AI)的最新模型Kimi K3。

Kimi K3在攻击性网络任务上大幅落后于美国领先的前沿模型,但优于中国的GLM-5.2,在开放权重模型中树立了新标杆。其安全防护未能阻止漏洞利用开发或攻击性网络行动,该模型在无任何抵制的情况下协助完成了这两类任务。

Kimi K3无法攻克最高难度的漏洞利用等级

两家机构使用了卡内基梅隆大学开发的基准测试ExploitBench来测试漏洞利用开发能力。该基准使用2023年后Chrome的V8引擎中发现的41个漏洞,追踪模型在软件利用过程中能推进到哪一步。美国领先模型平均得分76.2%,而Kimi K3为32.2%,GLM-5.2为24.4%。

Kimi K3在ExploitBench基准测试中得分32.2%,而美国领先模型达到76.2%。GLM-5.2以24.4%落后。| 图片来源:UK AISI / CAISI

Kimi K3在全部41项任务中均未达到最高等级——任意代码执行(ACE)。ACE是最严重的漏洞利用等级,因为它能让攻击者完全控制目标系统。美国领先模型在41项任务中的20项中实现了ACE。

两家机构在禁用系统级安全防护的情况下测试了美国闭源权重模型,以衡量其最大能力。这些安全防护在公开版本中是启用的。

Kimi K3在模拟网络攻击中推进到一半

第二项测试“最后幸存者”(TLO)模拟的是企业网络攻击场景,攻击路径横跨四个子网、涉及约 20 台主机,共 32 个步骤。据两家机构称,人类专家完成该测试大约需要 20 小时。目前只有少数模型能够解出 TLO。迄今为止,已有四款公开可用的闭源权重模型通过了该测试,其中表现最强的模型在十次尝试中能成功六到七次。

Kimi K3 平均推进到 32 步中的第 17 步,而美国领先模型平均推进到第 28.5 步,GLM-5.2 仅推进到第 11 步。Kimi K3 在十次尝试中有一次在 1 亿 token 限额内完成了整条攻击路径,这表明它具备相应能力,但无法稳定调用。“Kimi K3 在被明确指示并获得初始网络访问权限的情况下,有能力自主攻击规模较小、防御薄弱且存在漏洞的企业系统,”该机构写道。

Kimi K3 和 GLM-5.2 均未实现完整漏洞利用(ACE),而美国领先模型在 41 项任务中有 20 项实现了完整利用。| 图片来源:英国 AISI / CAISI

TLO 未考虑主动防御因素,因此并非完全贴近现实。但相关结果在真实场景中足以拉响警报。本周就出现了一个新案例:OpenAI 的模型试图自主入侵 Hugging Face。Hugging Face 成功抵御了攻击,但付出了实实在在的努力,并动用了开放权重模型。

中国模型正在追赶,但仍落后于美国模型

CAISI 进行的时间序列分析基于 Elo 评分体系,追踪了自 2025 年初以来美国和中国模型的网络攻防能力。两条趋势线都在上升,但中国模型始终落后于美国同行。

中国 AI 模型(红色)自 2025 年以来网络攻防能力有所提升,但始终落后于美国趋势线(蓝色)。Elo 评分提升 400 分意味着解出任务的概率提升十倍。| 图片来源:美国人工智能标准与创新中心

在此前的一份分析中,这家英国机构将开源模型的性能差距定为四到七个月,而2025年初这一差距为六到十个月。最新结果符合这一规律。中国开源权重模型正在变强,但与领先的美国系统相比仍有明显差距。

AISI 警告称,这一差距不应让人掉以轻心。开源模型不断增强的网络能力构成了“一种持续且不可逆的滥用风险”。

网络测试结果与蒸馏指控相互印证

Kimi 的相关发现也为针对中国模型开发者的蒸馏指控提供了佐证。美国科学顾问 Michael Kratsios 近日指控月之暗面(Moonshot AI)利用 Anthropic 的 Fable 的最佳输出作为训练数据来提升 Kimi K3 的性能,从而“蒸馏”了 Fable。Kratsios 还声称月之暗面获得了受美国出口管制的 Nvidia GB300 芯片。

对于通用基准表现强劲但网络能力得分偏低这一差距,一种解释是:Kimi K3 可能主要基于 Claude 的输出进行训练,而这些输出覆盖了通用知识、编程和智能体任务。Anthropic 的安全分类器会专门拦截高级攻击性网络查询,因此这类输出在基于 Claude 响应构建的蒸馏数据集中占比会偏低。这样一来,Kimi K3 就能在标准基准上比肩领先的西方模型,却未必学到它们更深层的漏洞利用能力。

AISI 的结果支持这一解读。该机构关闭了美国模型的系统级安全防护,从而暴露出这些模型几乎无法通过公开接口访问、因此基本无法被蒸馏获取的网络能力。

AISI