STORY · 事件已收束

Kimi K3 在 ExploitBench 基准测试中得分 32.2%

2 个信源 · 2 篇报道持续 1最新动态 2天前
最新进展

英国AISI与美国CAISI联合评估:月之暗面Kimi K3网络能力显著低于前沿模型

TIMELINE

报道时间线

2 条公开报道 · 官方一手 0 条 · 最新在前
  1. 英国AISI与美国CAISI联合评估:月之暗面Kimi K3网络能力显著低于前沿模型
    Hacker News 热门(buzzing.cc 中文翻译)

    英国AISI与美国CAISI联合评估了月之暗面7月16日发布的Kimi K3,发现其网络能力显著低于前沿模型。在ExploitBench上Kimi K3得分为32%,高于GLM-5.2的24%,但未能在41个样本中实现任意代码执行,而前沿模型平均完成20/41。在32步模拟企业网络攻击中,Kimi K3平均到达第17步,前沿美国模型平均到达28.5步。

  2. Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因
    The Decoder:AI News(RSS)精选

    英国AI安全研究所与美国AI标准与创新中心联合评估显示,月之暗面的Kimi K3在ExploitBench基准上得分32.2%,远低于美国领先模型的76.2%,但优于智谱GLM-5.2的24.4%。

STORYLINE

同一故事线

这些事件属于同一条持续叙事