核心要点
- 英国人工智能安全研究所与美国人工智能标准与创新中心联合评估发现,月之暗面的 Kimi K3 在协助攻击性网络行动时几乎没有遇到实质性阻力。
- Kimi K3 在漏洞利用开发和模拟网络攻击方面远落后于美国领先模型,但优于中国的 GLM-5.2。
- 中国模型在网络任务上持续进步,但仍落后于美国系统。Kimi K3 的结果也与月之暗面蒸馏了更先进模型的指控相符。
英国人工智能安全研究所(UK AISI)与美国人工智能标准与创新中心(CAISI)联合评估了月之暗面的最新模型 Kimi K3。
Kimi K3 在攻击性网络任务上大幅落后于美国领先前沿模型,但优于中国的 GLM-5.2,在开放权重模型中树立了新的标杆。其安全防护未能阻止漏洞利用开发或攻击性网络行动,且该模型在协助上述操作时未遇到任何阻力。
Kimi K3 无法攻克最难的漏洞利用等级
两家机构使用了卡内基梅隆大学开发的 ExploitBench 基准来测试漏洞利用开发技能。该基准利用 2023 年后 Chrome V8 引擎中发现的 41 个漏洞,追踪模型在软件利用过程中的推进程度。美国领先模型平均得分为 76.2%,而 Kimi K3 为 32.2%,GLM-5.2 为 24.4%。

Kimi K3 在全部 41 项任务中均未达到最高等级,即任意代码执行(ACE)。ACE 是最严重的漏洞利用等级,因为它能让攻击者完全控制目标系统。美国领先模型在 41 项任务中有 20 项达到了 ACE。
两家机构在禁用系统级安全防护的情况下测试了美国闭权重模型,以衡量其最大能力。这些安全防护在公开版本中是启用的。
Kimi K3 在模拟网络攻击中完成了约一半的流程
第二项测试“最后的幸存者”(TLO)模拟了一次企业网络攻击,攻击路径包含 32 个步骤,横跨四个子网和约 20 台主机。据研究机构称,人类专家大约需要 20 小时才能完成。目前只有少数模型能够解决 TLO 问题。迄今为止,已有四个公开可用的闭源权重模型通过了该测试,其中最强的模型在十次尝试中成功完成了六到七次。
Kimi K3 平均能完成 32 个步骤中的第 17 步,而领先的美国模型平均能完成 28.5 步,GLM-5.2 仅能完成 11 步。在十次尝试中,它有一次在 1 亿 token 限制内完成了整个攻击路径,这表明它具备相应能力,但无法稳定调用。该研究机构写道:“Kimi K3 在被指示并给予初始网络访问权限的情况下,能够自主攻击规模较小、防御薄弱且易受攻击的企业系统。”

TLO 未考虑主动防御,因此并非完全真实。但在现实场景中,这些结果会引发警示。本周出现了一个新的例子:OpenAI 模型试图自主入侵 Hugging Face。Hugging Face 成功抵御了这次攻击,尽管付出了实际努力并使用了开放权重模型。
中国模型正在迎头赶上,但仍落后于美国模型
CAISI 进行的时间序列分析,基于 Elo 评分体系追踪了自 2025 年初以来美国和中国模型的网络能力。两条趋势线都在上升,但中国模型始终落后于美国同行。

在此前的分析中,这家英国机构将开源模型的性能差距定为四到七个月,而2025年初这一差距为六到十个月。最新结果符合这一规律。中国开源权重模型正变得更强,但与领先的美国系统相比仍有较大差距。
AISI警告称,这一差距不应让人掉以轻心。开源模型日益增长的网络能力构成了“持续且不可逆的滥用风险”。
网络安全测试结果与蒸馏指控相吻合
Kimi的测试结果也为针对中国模型开发者的蒸馏指控提供了佐证。美国科学顾问迈克尔·克拉齐奥斯近期指控月之暗面(Moonshot AI)通过使用Anthropic的Fable模型的最佳输出作为训练数据来提升Kimi K3的性能,从而“蒸馏”了Fable模型。克拉齐奥斯还声称月之暗面获得了受美国出口管制的英伟达GB300芯片。
对通用基准测试成绩强劲而网络安全得分偏低这一差距的一种解释是:Kimi K3可能主要基于Claude在通用知识、编程和智能体任务方面的输出进行训练。Anthropic的安全分类器会专门拦截高级攻击性网络查询,因此这些输出在基于Claude响应构建的蒸馏数据集中占比会很低。因此,Kimi K3能够在标准基准测试中与领先的西方模型匹敌,却未习得它们更深层的漏洞利用能力。
AISI的测试结果支持这一解读。该机构禁用了美国模型上的系统级安全防护,从而揭示了那些几乎无法通过公开接口访问、因此基本无法用于蒸馏的网络能力。
不炒作的人工智能新闻——由人类精选
AISI