Kimi K3 看似接近前沿,但其网络安全测试暴露出更大的差距
Kimi K3 在一项进攻性网络安全测试中获得 32.2%,不足领先美国模型 76.2% 平均得分的一半。这一结果使 Moonshot AI 关于其新旗舰模型接近闭源模型前沿的更广泛说法变得更加复杂。
这一差距出现在英国人工智能安全研究所与美国人工智能标准与创新中心联合开展的一项评估中。测试考察了 Kimi 是否能够构建可用的漏洞利用程序,以及是否能在模拟企业网络中进行渗透。
Kimi K3 的表现仍优于智谱 AI 的 GLM-5.2,后者在同一漏洞利用基准上得分为 24.4%。不过,Kimi 未能在 41 个受测漏洞中的任何一个上实现任意代码执行。领先美国模型平均可在 20 项任务中达到这一最终阶段。
这一反差之所以重要,是因为 Kimi K3 此前在编程、视觉开发、长上下文处理和智能体任务上展现出令人印象深刻的成绩。Moonshot 将其定位为一款拥有 2.8 万亿参数、接近 Anthropic 和 OpenAI 产品水平的开放权重模型。
网络安全评估呈现出更不均衡的图景。Kimi 在多项直观可见的产品任务中似乎颇具竞争力,但在一项严苛、多阶段的能力测试中仍明显落后。
有关 Moonshot 在开发过程中使用知识蒸馏的指控,也让这种不均衡带上了政治色彩。蒸馏是指利用另一更强模型的输出训练模型。美国官员尚未公开任何技术证据,证明蒸馏导致了 Kimi K3 的这一特定性能特征。
因此,基准差距并不能证明存在抄袭。但它确实揭示了:仅凭精致的输出和广泛的综合分数来判断是否处于前沿,存在局限。
Kimi 网络安全测试究竟发现了什么
核心结果不只是 Kimi 落败,而是它在漏洞利用开发中最关键的阶段之前便停滞不前。
这项政府评估使用了 ExploitBench,这是由卡内基梅隆大学研究人员创建的公开基准。它衡量 AI 智能体在利用软件漏洞所需各阶段中能推进多远。
单纯让程序崩溃并不算完整利用。智能体必须构建越来越有实用价值的能力,包括任意内存访问、控制流操纵,以及最终实现任意代码执行。
该基准使用了 2023 年后在 V8 中披露的 41 个漏洞。V8 是 Chrome 所使用的 JavaScript 和 WebAssembly 引擎。这些漏洞已被修复,但仍为受控评估提供了困难而现实的目标。
ExploitBench 论文描述了这条能力阶梯上的 16 个可衡量步骤。确定性检查会验证智能体是否真正达到每一步,从而降低看似合理但无法运行的回答的价值。
Kimi K3 的 ExploitBench 总分为 32.2%。GLM-5.2 得分为 24.4%,而领先美国系统的平均分为 76.2%。
这一得分差异并不局限于较小的中间里程碑。Kimi 在 41 项任务中没有一项实现任意代码执行。领先系统平均成功完成了 20 项任务。
任意代码执行使攻击者能够在目标上运行自选指令。与发现漏洞或生成导致崩溃的输入相比,这代表着严重得多的后果。
评估人员还在 The Last Ones 中测试了 Kimi;这是一个包含四个子网和约 20 台主机的模拟企业网络。该环境包含一条 32 步攻击路径,人类专家大约需要 20 小时才能完成。
在 1 亿 token 的限制下,Kimi 平均达到第 17 步。领先美国模型达到第 28.5 步,而 GLM-5.2 达到第 11 步。
Kimi 在十次尝试中有一次完成了整个流程。能力更强的闭源模型在此前测试中有六至七次完成这一流程。
这一次成功运行排除了一个令人宽慰的解释。Kimi 并非完全无法在实验室条件下完成端到端入侵。它的主要弱点在于多次尝试中的可靠性和深度。
联合网络安全评估指出,模拟环境没有活跃的防御者或防御监控,也不会对现实网络中会触发警报的高噪声操作施加惩罚。
测试从获得初始网络访问权限之后开始,并包含一条刻意设置的攻击路径。它没有复现受防护企业内部常见的不确定性、欺骗、访问控制和中断。
即使具备这些有利条件,Kimi 通常仍在中途附近停下。这使其进攻能力高于一款主要开放权重同类模型,但低于受测的最强闭源系统。
这项评估也具有选择性。Kimi 的托管配置阻碍了研究机构运行完整的网络安全测试套件,因此其综合能力估计仅依赖 ExploitBench。
因此,它的置信区间比在多个基准上接受测试的模型更宽。结果具有意义,但并非对所有网络安全技能的完整排名。
改变的是证据质量。Kimi K3 此前已展示出强劲的公开演示和通用基准成绩。政府测试衡量的是:这些能力能否经受一条漫长、严苛的技术依赖链考验。
它们往往未能做到。
为什么 Kimi K3 的基准差距重要
Kimi K3 同时给开放模型倡导者和美国前沿实验室带来压力,因为它的优势与弱点指向相反的方向。
Moonshot 于 2026 年 7 月 16 日推出 Kimi K3。该公司称,这一模型包含 2.8 万亿总参数,并采用稀疏混合专家架构。
混合专家模型会将每个输入路由至一小部分专业化组件。Moonshot 表示,Kimi 会激活 896 名专家中的 16 名,从而减少每个 token 所需的计算量。
该模型还支持原生视觉输入,且上下文窗口最高可达 100 万 token。Moonshot 将这些功能定位于编程、设计、研究和持续性的智能体工作。
在其 Kimi K3 概览中,Moonshot 承认该模型整体上仍落后于最强的专有竞争对手。不过,该公司报告的结果显示,Kimi 在多项评估类别中接近前沿。
这些结果塑造了一个颇具吸引力的叙事:一家中国公司打造出一款规模极大的模型,似乎接近领先美国系统,并计划发布其权重。
ExploitBench 带来了更严格的限定。即使编程和漏洞利用任务都涉及阅读代码、使用工具和修复失败尝试,具有竞争力的编程表现也不能保证具有竞争力的漏洞利用构建能力。
普通编程基准通常奖励在熟悉的代码库中完成明确的软件任务。漏洞利用开发则要求另一种能力组合,包括底层推理、实验、内存操纵,以及对目标进程的精确控制。
每一个成功步骤都会成为下一步的依赖。若模型在早期出现细微错误,可能会耗费数百万 token 探索一条没有产出的路径。
32.2% 的分数表明,Kimi 能够在这条链路中取得有意义的进展。任意代码执行为零则表明,其进展很少转化为完全控制。
对 Moonshot 而言,这削弱了任何关于综合智能分数足以证明广泛前沿等同性的简单主张。企业买家不能假定,在一种智能体类别中的卓越表现会迁移到另一种类别。
对美国实验室而言,这一结果仅带来有限的安心。Kimi 超过了 GLM-5.2,并曾一次完成整个网络流程。开放权重系统正在获得此前主要集中于闭源模型的能力。
开放权重也改变了能力的扩散方式。模型一旦发布,便可被修改、微调、整合到定制脚手架中,或在没有原始提供商安全防护的情况下运行。
因此,即使 Kimi 仍落后于闭源前沿,其计划中的权重发布依然重要。攻击者并非需要针对每个目标都使用最强系统;他们需要的是一个可获取、可适配且能力足够的系统。
防御者也面临同样的机会。安全团队可以检查开放模型,在受控网络内部部署它,并将其调整用于漏洞研究,而无需将敏感代码发送到外部。
该基准并未裁定这种双重用途之间的平衡。它表明这一能力已相当可观,但其最先进的形态仍不均衡。
开发者也应注意智能体框架的作用。模型并非仅靠生成文本来利用软件;它需要借助工具、命令执行、反馈循环,以及保存状态的策略来工作。
不同的框架可能在不改变 Kimi 底层权重的情况下提升其表现。反过来,薄弱的框架也可能让强模型看起来能力不如实际水平。
研究机构使用标准化环境以支持比较,但标准化并不意味着对产品中立。公开编程排名常常将不同模型与不同脚手架结合起来,从而导致不可靠的同类比较结论。
这正是 Kimi 网络安全测试的重要性超越单一排行榜的原因。它衡量的是一条能力链,在其中,表层流畅性难以掩盖缺失的技术深度。
这一结果让 Kimi 的发布不再只是一个简单的竞赛叙事,而转变为关于能力形态的问题。从一个角度看,该模型可能接近前沿;从另一个角度看,则相距甚远。
蒸馏可以复制输出,但未必转移每一种能力
知识蒸馏可以合理解释不均衡的表现,但现有证据尚未建立这一因果关联。
蒸馏利用更强模型的输出训练另一模型。学生模型可以吸收推理、格式、工具使用或任务完成中的模式,而无需获得教师模型的权重。
这项技术在合法模型开发中很常见。它可以压缩系统、转移专业化行为,或在人类样本稀缺时生成合成训练数据。
争议涉及授权与规模,而非这一技术本身的存在。白宫科学技术政策办公室主任 Michael Kratsios 指控 Moonshot 蒸馏了 Anthropic 的 Fable 模型。
据报道的指控,Moonshot 构建了一个内部平台,可在不同访问方式之间切换以规避检测。政府尚未公开发布支持该说法的日志、训练记录或取证方法。
Anthropic 此前曾指控 Moonshot 和其他中国实验室针对 Claude 开展大规模蒸馏行动。Moonshot 尚未给出详细的公开回应,以说明 Kimi K3 的训练数据是如何构建的。
这留下了两个独立问题:其一是未经授权的蒸馏是否发生;其二是蒸馏是否解释了 Kimi 的网络安全基准差距。
第一个是证据和政策争议。第二个则是一项技术假设。
使用教师模型回答训练的学生模型,能够学习采样输出中所呈现的行为。然而,这种迁移取决于提示覆盖范围、输出质量、训练目标,以及学生模型自身的架构。
可见的编程任务提供了大量示例和清晰反馈。模型可以通过大量生成轨迹,学习构建界面、编辑代码仓库和讲解软件的惯例。
高级漏洞利用构造则更难捕捉。成功案例稀少,具有操作敏感性,并且依赖于与特定环境的交互。
教师模型的最终回答可能省略失败的实验、内部的不确定性和中间发现。这些隐藏步骤中,可能包含可靠自主工作所需的大部分知识。
ExploitBench 的要求也不只是复现回答风格。其随机化检查要求智能体针对实时目标构建可运行的原语。死记硬背的语言无法通过这些检查。
这形成了一个连贯的假设:蒸馏或许能更快地改善那些可见、被频繁采样的行为,而对需要深入环境交互的罕见能力,提升则更慢。
因此,Kimi 在常见编程任务上可能看起来接近其被指称的教师模型,但在漏洞开发方面仍明显落后。基准测试的表现与这一说法相符。
一致性并不等于证据。还有数种其他解释同样符合这些证据。
Moonshot 可能在进攻性网络安全方面投入了较少的后训练工作。其智能体框架在维持长链漏洞利用流程方面可能不够有效。安全训练也可能选择性地改变了某些行为,尽管评估几乎没有发现相关拒答的证据。
模型的稀疏架构也可能导致其在不同任务上呈现不同优势。其长上下文设计或许有助于研究和软件导航,却未必能以同样速度提升底层漏洞利用推理能力。
训练数据构成也是另一种可能。一个接触过大量 Web 开发和代码仓库数据的模型,可能在公开编程任务中表现出色,却接触到较少高质量的漏洞利用轨迹。
最后,这一比较涉及未具名的美国模型。读者无法考察它们的架构、训练日期、网络安全专项后训练或确切产品版本。
一篇 Associated Press 报道称,Kimi 在多项能力上正接近 Claude 和 ChatGPT。这一宽泛观察可以与其在某个专业领域存在严重短板并存。
负责任的结论应当保持克制。蒸馏或许有助于解释为何一个模型对前沿行为的模仿并不均衡,但这项评估并未检测蒸馏。
它衡量的是 Kimi 在两个受控网络安全环境中能够完成什么。它并未揭示哪些训练示例促成了这种能力。
将该分数视为取证证据,会夸大基准测试的意义。忽视这种不均衡的能力画像,则会浪费其最有价值的信号。
安全性结果并不令人安心
Kimi 较低的能力并未伴随有效的防护措施,以阻止其提供进攻性网络安全协助。
评估人员报告称,Kimi 的防护机制并未阻止它尝试漏洞开发或进攻性网络操作。模型会参与任务,而非持续拒绝执行。
这一细节排除了差距的一种可能解释。Kimi 得分 32.2% 并不只是因为它拒绝了大多数请求。
对领先美国模型的测试关闭了系统级防护措施。这一选择使研究机构能够估算其最大技术能力,而非其公开产品提供协助的意愿。
因此,这一比较将 Kimi 可触及的行为,与美国系统在限制较少情况下的潜在能力并列。它并不表明普通用户能够从公开的美国聊天产品获得同等协助。
这种区别具有双向影响。封闭式提供商可以更新服务器端防护措施、监控使用情况、撤销账号并限制工具访问。开放权重用户则可在下载模型后移除许多行为控制。
Kimi 现有的防护措施已允许其完成被评估的工作。一旦权重可用,下游版本可能进一步削弱这些防护。
风险仍不应被夸大。Kimi 未能在全部 41 项 ExploitBench 任务中实现任意代码执行。在模拟企业攻击中,它十次尝试仅完成一次。
有能力的人类操作员仍需验证输出、修复失败步骤、选择目标并管理操作安全。该模型并非能够可靠攻破加固组织的自动入侵系统。
然而,可靠性并非唯一相关指标。不可靠的助手仍可能减少侦察、漏洞利用适配、脚本编写和反复实验所需的人力。
The Last Ones 的结果提供了一个具体场景。在获得对一个小型、刻意设置漏洞的网络的初始访问后,Kimi 平均完成了 32 个攻击步骤中的 17 个。
当模型停滞时,人类可以接手,再将更新后的状态交回模型继续工作。这种混合工作流可能比期待完全自主更贴近现实。
模型的 token 配额也很重要。每次尝试最多可消耗 1 亿个 token,这允许进行长时间的试错。这并不是典型的随意聊天会话。
评估 Kimi 的组织应区分三个问题:
模型能否识别或解释一个漏洞?
它能否在受控条件下创建可运行的漏洞利用?
它能否在生产级安全工作流中安全运行?
政府评估主要回答第二个问题。它对于安全部署、可审计性、数据处理或抗滥用能力提供的证据有限。
企业团队不应将较低分数视作一种安全控制。能力限制可能会在微调、更好的工具集成或新模型发布后发生变化。
他们也应避免假设提供商的防护措施在每一种下游部署中都完好无损。模型权重、智能体软件、提示词和执行权限共同构成一个系统。
最直接的防御教训关乎权限。AI 编程智能体不应仅因其基础模型在网络安全基准上的表现不佳,就获得广泛的生产环境访问权限。
沙箱化、凭证隔离、网络限制、人工审批和详细日志仍然必不可少。这些控制既能遏制恶意使用,也能减少意外损害。
这一问题超越了 Kimi。ExploitBench 项目报告称,在受测系统中触发崩溃已变得常见,而完整漏洞利用能力仍主要集中在私有前沿模型附近。
这一边界将会移动。更好的智能体、更大的上下文窗口和专项后训练,都可能将不稳定的能力转化为可重复的工作流。
因此,Kimi 的结果提供的是一次暂时性测量,而非永久性的安全余量。其当前差距很大,但其参与意愿使剩余能力仍具有操作相关性。
这些数字无法证明什么
这项评估挑战了 Kimi 的前沿叙事,但不足以支持对该模型质量、来源或现实世界危险性的完整判断。
ExploitBench 覆盖的是一个引擎中的一种漏洞类别。V8 被广泛部署且难以利用,但它并不代表所有操作系统、应用框架或网络服务。
该基准提供补丁提交,并要求智能体开发漏洞利用。它衡量的是在漏洞已知后进行的利用,而不是独立发现未知缺陷。
Kimi 在 Web 应用、内存安全语言、配置错误、云权限或社会工程方面可能表现不同。这项评估没有回答这些问题。
汇总比较也隐藏了模型身份。研究机构将最强比较组描述为近期美国前沿闭源权重模型,但未点名每一项产品。
这保护了敏感评估信息,却限制了外部审查。买家无法复现确切比较,也无法判断某个具名商业模型是否与报告中的平均值相符。
76.2% 这一数字是平均值,并非普适的前沿门槛。个别系统可能高于或低于它。
Kimi 的 32.2% 分数还包括在 16 个漏洞利用阶段中的部分进展。不应将其解读为解决了约三分之一的漏洞。
同样,任意代码执行成功次数为零,并不意味着网络安全能力为零。该模型仍复现了崩溃、开发了中间原语,并在网络靶场中推进了进度。
置信区间值得关注。Kimi 的整体网络安全估计来自选择性评估,而其他模型则在更多任务和领域中拥有结果。
未来的完整评估可能改变其估计位置。更好的框架或不同的推理配置也可能改变结果。
模拟网络带来了另一项限制。它没有活跃的防御者、没有端点检测,也不对高噪声命令施加惩罚。
完成该靶场证明了在有利条件下的一种自主能力。它并不能证明 Kimi 能够悄无声息地攻破一家现代企业。
反向推论同样不安全。频繁未能完成靶场,并不能证明组织面对定制版本或人类引导工作流时风险很小。
蒸馏争论同样需要这种严谨性。基准测试可以揭示一种异常画像,但无法重建训练流程。
技术证据需要访问记录、生成的数据集、模型比较、训练文档,或为归因而设计的统计方法。已发布的网络安全评估中似乎没有这些内容。
政治背景增加了另一层不确定性。Kimi 的出现正值美国围绕中国 AI、出口管制、开放权重和知识产权展开激烈辩论之际。
政府机构有正当理由测试外国模型。但其结果仍应通过方法与局限来评估,而不应被纳入地缘政治叙事后不加审视地接受。
Moonshot 自身的基准声明也应获得同等对待。公司自行选择的测试可以突出真实优势,同时让重要弱点未被衡量。
最有力的解读应结合两组证据。Kimi K3 在若干编程和智能体任务中似乎能力很强,但在高级漏洞利用构造上明显较弱。
这并不矛盾。通用模型的发展并不均衡,而基准平均值可能掩盖领域间的显著差异。
对开发者而言,实际应对方式是任务特定的评估。较高的通用分数不应替代针对生产中使用的确切代码仓库、工具、权限和失败条件进行测试。
安全团队需要对抗性试验,记录的不仅是成功,还包括持续性、权限升级行为、拒答模式,以及犯错后的可恢复性。
企业买家应要求提供模型卡、安全评估、部署控制,以及清晰说明每项防护由哪个组件负责的文档。
Kimi 的网络安全分数最有价值之处,在于警示人们不要基于单一数字进行采购决策。它说明,无论是发布演示还是单项安全基准,都无法承载完整决策。
开放权重发布后值得关注什么
三个信号将决定 Kimi 的网络安全差距是否仍属结构性差距、能否通过工程手段缩小,或是否会因定制化而变得更危险。
第一个信号是 Moonshot 发布权重后的独立复现。研究人员应在文档化的硬件、推理设置、提示词和智能体脚手架条件下重新运行 ExploitBench。
如果独立结果仍接近 32.2%,评估的核心发现就会更有力。尽管 Kimi 具备其他优势,它在漏洞开发方面仍会显得明显落后于闭源前沿模型。
如果在更好的测试框架下性能大幅提升,解读就会改变。最初的结果将更多反映系统集成能力,而不仅仅是模型能力。
第二个信号来自 Moonshot 的技术报告和安全文档。该公司承诺将披露更多关于 Kimi K3 架构、训练和评估的细节。
有价值的信息披露应说明网络安全后训练、防护机制设计、数据治理,以及 Moonshot 所发布基准分数的测试条件。它还应澄清可下载模型是否与托管服务一致。
这些细节无法单独定论蒸馏指控。但它们仍可缩小关于模型如何构建、其能力来源何处的不确定性。
详细的安全评估将强化 Moonshot 的论点,即其理解开放权重带来的风险。有限的信息披露则会让企业只能依赖外部测试。
第三个信号是发布后的专项微调。安全研究人员和模型托管方很可能会针对编程、漏洞分析和自主工具使用来调整 Kimi。
通用聊天质量的小幅提升不会改变本文的结论。但如果任意代码执行或网络范围任务的可靠性大幅提高,情况就不同了。
这一结果将表明,Kimi 当前的弱点源于后训练或脚手架,而非深层能力限制。它也会压缩防御方的准备时间。
对企业而言,最稳妥的假设是:今天的分数不会一成不变。模型会随着新检查点、更长的推理、改进的工具和社区修改而变化。
开发者应跟踪可复现的能力评估,而非依赖发布首周的排名。安全负责人则应测试完整部署的智能体,包括其权限和工具链。
Kimi K3 并未抹去美国在先进网络安全能力方面的领先地位。但它也没有提供持久的安全缓冲。
其 32.2% 的 ExploitBench 结果揭示了更强通用基准背后隐藏的巨大差距。其成功完成网络范围任务的尝试表明,较低分数仍然具有现实风险。
下一个问题不是 Kimi 在某一项基准测试中胜出还是落败,而是开放权重开发者能否比防御方适应得更快地,将零散且不一致的网络安全技能转化为可靠能力。



