Kimi K3 在 ExploitBench 基准测试中得分 32.2%
英国AISI与美国CAISI联合评估:月之暗面Kimi K3网络能力显著低于前沿模型
TIMELINE
2 条公开报道 · 官方一手 0 条 · 最新在前报道时间线
- 英国AISI与美国CAISI联合评估:月之暗面Kimi K3网络能力显著低于前沿模型
英国AISI与美国CAISI联合评估了月之暗面7月16日发布的Kimi K3,发现其网络能力显著低于前沿模型。在ExploitBench上Kimi K3得分为32%,高于GLM-5.2的24%,但未能在41个样本中实现任意代码执行,而前沿模型平均完成20/41。在32步模拟企业网络攻击中,Kimi K3平均到达第17步,前沿美国模型平均到达28.5步。
- Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因
英国AI安全研究所与美国AI标准与创新中心联合评估显示,月之暗面的Kimi K3在ExploitBench基准上得分32.2%,远低于美国领先模型的76.2%,但优于智谱GLM-5.2的24.4%。
STORYLINE
这些事件属于同一条持续叙事