一场由英美两大AI安全机构联合发起的“压力测试”,意外揭开了国产大模型在安全维度上的真实底牌。英国人工智能安全研究所(UK AISI)与美国AI标准与创新中心(CAISI)近期对月之暗面最新模型Kimi K3进行了全面安全评估,结论颇为耐人寻味:在漏洞利用与模拟网络攻击等关键安全指标上,Kimi K3显著落后于美国头部模型,但在开源权重模型组中仍优于智谱GLM-5.2,创下国产模型在该项测试中的新纪录。更值得警惕的是,Kimi K3的安全防护机制几乎未能对漏洞利用行为构成有效阻碍——模型在执行此类操作时,几乎未遇到任何阻力。
首份测试考卷来自卡内基梅隆大学开发的ExploitBench基准。该基准从Chrome V8引擎中提取了2023年后的41个真实漏洞,依据软件利用的推进程度进行评分。结果令人震惊:美国头部模型平均得分76.2%,而Kimi K3仅获32.2%,GLM-5.2则以24.4%垫底。更关键的是,Kimi K3在41个任务中从未达到最高级别的“任意代码执行”(ACE)——这是最危险的等级,意味着攻击者可完全控制目标系统;而美国模型在41个任务中有20次实现了ACE。值得注意的是,英美机构在测试美国闭源权重模型时,特意关闭了系统级安全防护,以衡量其最大能力上限,而这些防护在公开版本中默认开启。

第二份考卷名为“最后幸存者”(TLO),模拟了一个横跨四个子网、约20台主机、包含32个步骤的企业网络攻击路径。研究人员表示,人类专家完成该任务约需20小时。目前,仅少数模型能真正通过这项测试;迄今为止,四个公开可用的闭源权重模型已通过测试,其中最强的一个在十次尝试中成功六至七次。Kimi K3平均在步骤17处卡住,而美国头部模型可达步骤28.5,GLM-5.2仅推进至步骤11;不过,在十次尝试中的一次,Kimi K3在10亿token内成功完成了整个攻击链——这表明它具备能力,只是尚不稳定或未经过针对性调优。该机构得出结论:给定初始网络访问权限和一条额外指令,Kimi K3可以独立攻破防护较弱、更易入侵的小型企业系统。需要说明的是,TLO并未包含主动防御机制,因此与现实环境存在差异。但就在本周,有消息披露OpenAI的一个模型曾试图独立入侵Hugging Face,虽使用了开源权重模型,但最终被成功阻断。
从时间线来看,国产模型确实在追赶,但差距依然存在。CAISI自2025年初起便采用Elo评级系统追踪中美模型的网络能力。两条趋势线均呈上升态势,但代表中国模型的红线与代表美国模型的蓝线之间始终存在差距。Elo提升400点意味着任务完成概率提升十倍——这个差距不容小觑。此前,英国机构估计开源模型与美国系统之间的性能差距为四至七个月,而2025年初这一差距为六至十个月。最新结果恰好落在这个区间内。AISI的警告直截了当:开源模型不断增长的网络能力构成了“持续且不可逆转的滥用风险”,这一点不容忽视。
最耐人寻味的部分,恰恰落在测试结果与蒸馏指控的交汇点上。近期,美国科学顾问Michael Krazios公开指责月之暗面,声称其使用了Anthropic的Fable模型的最佳输出作为训练数据,对Kimi K3进行“蒸馏”优化,并获得了美国管控的NVIDIA GB300芯片。通用基准测试成绩优异而网络安全得分偏低这一现象,恰好与这一解释吻合:Kimi K3很可能主要学习了Claude在通用知识、编程和智能体任务上的输出。Anthropic的安全分类器会专门过滤高级网络查询,因此这些样本在蒸馏数据集中占比极低——于是模型在标准排名上能与西方对手竞争,却未能学习到更深层的利用技术。AISI的评估间接支持了这一解读:通过关闭美国模型的系统级防护,那些几乎无法通过公开接口获取、因此几乎不可能被纳入蒸馏数据的网络能力得以暴露。一场考试,测出的不仅是分数,更是分数背后那些不便于言说的来路。