一、一份来自英美的"体检报告"
上周,英国人工智能安全研究所(UK AISI)和美国人工智能标准与创新中心(CAISI)联手给Kimi K3做了一次"攻击性网络任务体检"。结果一出,场面有点尴尬——漏洞利用得分32.2%,美国领先模型76.2%,差了不止一倍。
测试用的是卡内基梅隆大学开发的ExploitBench基准,从Chrome V8引擎里挖出41个真实漏洞,沿着利用过程一路打分。41项任务里,K3一项都没摸到最危险的"任意代码执行"(ACE)等级,而美国模型拿下了20项。
说白了,就是同样一道安全攻防题,别人考了76分,K3只考了32分。
二、模拟攻击也差了一大截
第二份试卷叫"最后的幸存者"(TLO),模拟一次横跨4个子网、约20台主机的企业网络攻击,32个步骤,人类专家要啃20个小时。
K3平均走到第17步就卡住了,美国模型能推到第28.5步。不过有个细节值得注意——K3在十次尝试里有一回跑通了整条攻击链,说明能力是有的,只是不稳定,调不动。
英美机构下了判断:只要给到初始访问权限,K3就能自主啃下规模较小、防御薄弱的企业系统。听着有点吓人,但别忘了,这个测试没算主动防御,离真实场景还有距离。
三、中美差距不是在缩小吗?
CAISI用Elo评分体系追踪了自2025年初以来中美模型的网络能力。两条线都在涨,但中间那条缝一直没合上。Elo差400分意味着解决任务的概率差十倍——这不是小数目。
英国机构此前估算开源模型与美国系统的性能差在4到7个月,2025年初是6到10个月,最新结果正好落在这条规律里。
追赶确实在追,但"追"和"追上"是两回事。
四、蒸馏疑云:考卷量出的不只是分数
最耐人寻味的部分来了。美国科学顾问迈克尔·克拉齐奥斯曾公开指控月之暗面,称其把Anthropic的Fable模型最优输出当训练数据,给K3"蒸馏"提质,还说对方拿到了受美国出口管制的英伟达GB300芯片。
而通用基准成绩漂亮、网络安全得分却塌了一截——这恰好能用蒸馏来解释:K3大概率主要吃的是Claude在通用知识、编程和智能体任务上的输出;但Anthropic的安全分类器会专门掐掉高级攻击性网络查询,于是这类样本在蒸馏数据集里占比极低。
模型因此能在标准榜上和西方对手叫板,却没学到更深的漏洞利用本事。一张考卷,量出的不只是分数,还有水面下没说破的来历。
写在最后
说实话,K3在开放权重模型里已经立起了一根标杆,比智谱GLM-5.2的24.4%高出一截。但"标杆"和"前沿"之间,隔着的不只是技术,还有数据来源的透明度。
蒸馏这事,如果真坐实了,那通用基准的高分就得打个折。毕竟,考试抄来的高分,换个考场未必还能复现。
评论区