AI-NEWS · 2026年 7月 25日

Kimi K3 攻防能力实测

测试背景与数据拆解

英国人工智能安全研究所(UK AISI)和美国人工智能标准与创新中心(CAISI)最近联合发布了一份针对月之暗面(Moonshot)最新模型 Kimi K3 的网络安全评估报告。这次测试将 Kimi K3 的实战表现与“模型蒸馏”争议直接挂钩,试图通过极端对抗环境验证其真实能力边界。

在漏洞利用开发(Exploit Development)这一核心指标上,Kimi K3 的表现呈现明显的两极分化:它在通用逻辑推理和代码生成任务中处于第一梯队,但在模拟真实网络攻击时,数据显著落后于美国顶级闭源模型,却明显优于智普 AI(Zhipu)的 GLM-5.2,确立了其在开源模型组中的新标杆地位。

关键性能数据与差距分析

安全机构在测试美国闭源模型时,刻意关闭了系统级安全防护以挖掘其极限能力,而公众接触的版本默认开启此防护。这种测试条件的差异是理解数据的关键。

  • 漏洞利用成功率:美国顶级模型平均得分为 76.2%,Kimi K3 为 32.2%,GLM-5.2 为 24.4%
  • 最高风险等级达成率:在 41 项基于卡内基梅隆大学 ExploitBench 基准的任务中,Kimi K3 0 项达到“任意代码执行”(ACE,最高危险等级);而美国顶级模型在同一组任务中达成了 20 项
  • 攻击链长度:在模拟跨越 4 个子网、约 20 台主机的企业网络攻击(TLO 测试,32 个步骤)中,人类专家平均耗时约 20 小时。Kimi K3 平均卡在 第 17 步,而美国顶级模型平均达到 第 28.5 步

虽然 Kimi K3 在 10 次尝试中有一次成功在 10 亿 token 内独立完成了整个攻击链,证明其具备征服小型、低防御企业系统的潜力,但这属于极端个例。对比来看,GLM-5.2 仅到达 第 11 步,相比 K3 在复杂网络路径规划上的差距拉大。

长期趋势与能力构成

CAISI 自 2025 年初起追踪中美模型网络能力,采用 Elo 评分体系进行长期观测。结果显示,虽然中美模型的能力曲线均呈上升趋势,但红蓝差距始终存在。Elo 增加 400 分意味着完成任务的概率增加 10 倍,目前的评分差距换算成时间跨度,约为 6 到 10 个月。

这一数据印证了英国机构此前的预估:开源模型与美系系统的差距在 4-7 个月区间,且正在缓慢收窄,但追赶美国闭源模型的“护城河”依然深厚。

“蒸馏”争议的逻辑自证

关于月之暗面利用 Anthropic 的 Fable 模型进行“蒸馏”以提升 Kimi K3 性能的指控,与本次测试结果存在高度的逻辑互证,但也揭示了能力来源的结构性差异。

  1. 通用能力与网络安全能力的背离:Kimi K3 在通用基准测试中成绩优异,但在网络安全测试中大幅落后。这符合模型主要学习通用知识、编程和智能体(Agent)任务的特征,而非深度网络对抗。
  2. 训练数据的筛选机制:Anthropic(Claude 系列)的安全分类器专门过滤掉了高级网络查询类样本。因此,即使 K3 通过蒸馏学习了 Claude 的输出,其训练数据集中关于深层网络攻击技巧的样本比例极低,这直接限制了模型在特定领域的深度挖掘。
  3. 测试条件的变量影响:AISI 的评估通过关闭美国模型的系统级防护,挖掘出了那些无法通过公开接口获取、也难以在常规蒸馏数据中习得的网络能力。

结论与潜在风险

本次测试不仅给出了一个分数,更揭示了模型能力构成的“潜规则”。Kimi K3 的强项在于通用逻辑推理和代码生成(受通用蒸馏数据影响),而其网络攻击能力的短板(0 ACE,平均步骤少)恰恰证明了其并未掌握核心的网络攻防深度技巧

美国模型(如 GPT 系列等)可能保留了更深层的、经过特定安全策略训练(或针对攻击性任务微调)的数据,从而在“黑盒”测试中展现出恐怖的攻击力;而中国模型(如 Kimi K3)受限于开源/合规数据的清洗标准,自动过滤了高风险的恶意攻击样本,导致在纯粹的网络对抗中“手软”。

风险提示方面,AISI 警告称,开源模型网络攻击能力的持续增长代表了“持续且不可逆转的误用风险”,这一风险不容忽视,尤其是在缺乏主动防御机制的初期阶段。公司账单之外,还要看每个人把额度花到哪里,同样的算力投入,若缺乏针对性的安全对齐,可能只换来几段无法投入实战的废话。

火龙果频道