# Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型，知识蒸馏或为原因

- 来源：The Decoder：AI News（RSS）
- 作者：Matthias Bastian
- 发布时间：2026-07-24 17:48
- AIHOT 分数：73
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmryrih7804c9rolge6wdk3v8
- 原文链接：https://the-decoder.com/kimi-k3-trails-frontier-us-models-by-a-wide-margin-on-cyber-exploits-and-distillation-may-explain-why

## 精选理由

英美安全机构的联合评测把蒸馏嫌疑拽到了台面上，Kimi K3 的漏洞利用能力仅为美国前沿模型四成，安全评估不能只看通用基准，开源模型的安全面具该摘了。

## AI 摘要

英国AI安全研究所与美国AI标准与创新中心联合评估显示，月之暗面的Kimi K3在ExploitBench基准上得分32.2%，远低于美国领先模型的76.2%，但优于智谱GLM-5.2的24.4%。

## 正文

关键要点

英国AI安全研究所与美国AI标准与创新中心联合评估发现，月之暗面（Moonshot AI）的Kimi K3在几乎没有有效抵抗的情况下协助实施攻击性网络行动。

Kimi K3在漏洞利用开发和模拟网络攻击方面远落后于美国领先模型，但优于中国的GLM-5.2。

中国模型在网络任务上持续进步，但仍落后于美国系统。Kimi K3的结果也与月之暗面蒸馏更先进模型的指控相符。

英国AI安全研究所（UK AISI）与美国AI标准与创新中心（CAISI）联合评估了月之暗面（Moonshot AI）的最新模型Kimi K3。

Kimi K3在攻击性网络任务上大幅落后于美国领先的前沿模型，但优于中国的GLM-5.2，在开放权重模型中树立了新标杆。其安全防护未能阻止漏洞利用开发或攻击性网络行动，该模型在无任何抵制的情况下协助完成了这两类任务。

Kimi K3无法攻克最高难度的漏洞利用等级

两家机构使用了卡内基梅隆大学开发的基准测试ExploitBench来测试漏洞利用开发能力。该基准使用2023年后Chrome的V8引擎中发现的41个漏洞，追踪模型在软件利用过程中能推进到哪一步。美国领先模型平均得分76.2%，而Kimi K3为32.2%，GLM-5.2为24.4%。

Kimi K3在ExploitBench基准测试中得分32.2%，而美国领先模型达到76.2%。GLM-5.2以24.4%落后。| 图片来源：UK AISI / CAISI

Kimi K3在全部41项任务中均未达到最高等级——任意代码执行（ACE）。ACE是最严重的漏洞利用等级，因为它能让攻击者完全控制目标系统。美国领先模型在41项任务中的20项中实现了ACE。

两家机构在禁用系统级安全防护的情况下测试了美国闭源权重模型，以衡量其最大能力。这些安全防护在公开版本中是启用的。

Kimi K3在模拟网络攻击中推进到一半

第二项测试“最后幸存者”（TLO）模拟的是企业网络攻击场景，攻击路径横跨四个子网、涉及约 20 台主机，共 32 个步骤。据两家机构称，人类专家完成该测试大约需要 20 小时。目前只有少数模型能够解出 TLO。迄今为止，已有四款公开可用的闭源权重模型通过了该测试，其中表现最强的模型在十次尝试中能成功六到七次。

Kimi K3 平均推进到 32 步中的第 17 步，而美国领先模型平均推进到第 28.5 步，GLM-5.2 仅推进到第 11 步。Kimi K3 在十次尝试中有一次在 1 亿 token 限额内完成了整条攻击路径，这表明它具备相应能力，但无法稳定调用。“Kimi K3 在被明确指示并获得初始网络访问权限的情况下，有能力自主攻击规模较小、防御薄弱且存在漏洞的企业系统，”该机构写道。

Kimi K3 和 GLM-5.2 均未实现完整漏洞利用（ACE），而美国领先模型在 41 项任务中有 20 项实现了完整利用。| 图片来源：英国 AISI / CAISI

TLO 未考虑主动防御因素，因此并非完全贴近现实。但相关结果在真实场景中足以拉响警报。本周就出现了一个新案例：OpenAI 的模型试图自主入侵 Hugging Face。Hugging Face 成功抵御了攻击，但付出了实实在在的努力，并动用了开放权重模型。

中国模型正在追赶，但仍落后于美国模型

CAISI 进行的时间序列分析基于 Elo 评分体系，追踪了自 2025 年初以来美国和中国模型的网络攻防能力。两条趋势线都在上升，但中国模型始终落后于美国同行。

中国 AI 模型（红色）自 2025 年以来网络攻防能力有所提升，但始终落后于美国趋势线（蓝色）。Elo 评分提升 400 分意味着解出任务的概率提升十倍。| 图片来源：美国人工智能标准与创新中心

在此前的一份分析中，这家英国机构将开源模型的性能差距定为四到七个月，而2025年初这一差距为六到十个月。最新结果符合这一规律。中国开源权重模型正在变强，但与领先的美国系统相比仍有明显差距。

AISI 警告称，这一差距不应让人掉以轻心。开源模型不断增强的网络能力构成了“一种持续且不可逆的滥用风险”。

网络测试结果与蒸馏指控相互印证

Kimi 的相关发现也为针对中国模型开发者的蒸馏指控提供了佐证。美国科学顾问 Michael Kratsios 近日指控月之暗面（Moonshot AI）利用 Anthropic 的 Fable 的最佳输出作为训练数据来提升 Kimi K3 的性能，从而“蒸馏”了 Fable。Kratsios 还声称月之暗面获得了受美国出口管制的 Nvidia GB300 芯片。

对于通用基准表现强劲但网络能力得分偏低这一差距，一种解释是：Kimi K3 可能主要基于 Claude 的输出进行训练，而这些输出覆盖了通用知识、编程和智能体任务。Anthropic 的安全分类器会专门拦截高级攻击性网络查询，因此这类输出在基于 Claude 响应构建的蒸馏数据集中占比会偏低。这样一来，Kimi K3 就能在标准基准上比肩领先的西方模型，却未必学到它们更深层的漏洞利用能力。

AISI 的结果支持这一解读。该机构关闭了美国模型的系统级安全防护，从而暴露出这些模型几乎无法通过公开接口访问、因此基本无法被蒸馏获取的网络能力。

AISI
