top of page

Kimi K3 完成一次模拟网络攻击

Kimi K3 在 10 次尝试中有一次完成了包含 32 个步骤的模拟网络攻击,让一则引人注目的 Google News 标题引出了更棘手的安全问题。

这款开放权重模型并未在评估中占据主导地位。其平均推进至第 17 步,而最强的美国模型平均达到 28.5 步。它在 41 项需要任意代码执行——即接管目标系统能力——的任务中也全部未能完成。

不过,这次成功运行仍然意义重大。在政府评估人员证明 Kimi K3 能够自主穿越一个刻意设置漏洞的企业网络后,Moonshot AI 发布了该模型的权重。这一结果让开放获取与可部署的安全控制,成为同一项技术进步的两面。

领先的闭源模型已经能更可靠地完成这些任务。开放权重的分发改变了风险格局,因为外部运营者可以下载、修改、微调并部署底层模型,而开发者无法控制每一次交互。

因此,这条新闻既不是“Kimi K3 击败美国模型”,也不是“Kimi K3 未能通过网络安全测试”。真正重要的进展在于,一款可下载的模型跨越了某项实际运行门槛,尽管它仍远远落后于闭源模型前沿。

Kimi K3 网络安全评估实际发现了什么

Kimi K3 曾一次完成整个靶场,但其平均表现仍明显低于领先的闭源模型。

英国 AI Security Institute 和美国 Center for AI Standards and Innovation 于 2026 年 7 月 23 日发布了他们的联合网络安全评估。他们将这项工作称为初步评估,采用了一小组公开和私有基准。

评估涵盖两项相关能力。漏洞利用开发衡量模型能否将软件漏洞转化为可运行的攻击;网络靶场则衡量它能否在模拟企业网络中持续进行规划和行动。

这套名为“The Last Ones”的网络靶场包含连续的 32 个步骤,覆盖四个子网和约 20 台主机。评估人员估计,人类专家大约需要 20 小时才能完成。

Kimi K3 获得初始网络访问权限及攻击环境的指令。随后,它必须发现主机、识别弱点、在网络中横向移动,并沿着刻意构建的攻击路径继续推进。

在 10 次尝试中,该模型平均推进至第 17 步。评估人员用于比较的领先美国网络安全模型平均达到 28.5 步。

Kimi K3 在其中一次尝试中完成了全部 32 个步骤。这次成功运行发生在 1 亿 token 的限制内,为该智能体提供了充足空间进行长时间推理、工具使用和重复操作。

领先的闭源模型稳定得多。此前测试过的模型在 10 次尝试中有六到七次完成靶场。因此,Kimi K3 的一次成功证明了能力,而非可靠性。

这一区别至关重要。一次完成表明,该模型能在有利条件下组合出所需行为;九次未完成则表明,它尚不能可靠地复现这种行为。

Kimi K3 的表现也优于 GLM-5.2,评估人员将后者认定为截至 2026 年 6 月可获得的最强开放权重网络安全模型。Kimi 平均达到第 17 步,而 GLM-5.2 平均为第 11 步。

在 ExploitBench 上,Kimi K3 得分为 32%,GLM-5.2 为 24%。ExploitBench 要求模型根据提供的漏洞开发端到端利用程序。

在最关键的层面,结果则较弱。Kimi K3 在 41 个样本中均未实现任意代码执行。能力最强的对比模型平均在 41 个样本中成功完成 20 个。

任意代码执行将使攻击者能够在已被攻陷的目标上运行自选命令。在这一阶段失败表明,Kimi K3 往往能找到部分攻击组件,但难以完成完整的漏洞利用链。

因此,公开结果同时支持两个结论:Kimi K3 大幅落后于闭源模型前沿,但在已评估的开放权重模型中创下了新的高点。

这种组合造就了 Google News 报道背后的张力。该完成记录在基准内是真实的,但不能脱离模型较低的平均表现以及靶场的人为条件来理解。

为什么开放权重改变了安全计算

核心风险并不在于 Kimi K3 领跑网络安全前沿,而在于其能力可以在 Moonshot 无法控制部署的情况下被传播。

开放权重发布提供了用于生成模型输出的已学习数值参数。这种访问权限使独立运营者能够托管模型、检查其部分行为,并针对专门任务进行调整。

开放权重并不等同于完整开源。训练数据、开发代码和完整训练流程可能仍不可获取。不过,权重访问权仍比普通托管聊天机器人或应用程序编程接口转移了更多控制权。

Moonshot 将 Kimi K3 描述为一款拥有 2.8 万亿参数的混合专家模型。混合专家架构会让每个输入经过被选定的模型组件,而不是同时激活所有参数。

根据该模型的技术论文,Kimi K3 每个 token 激活 1040 亿个参数,以及其 896 个路由专家中的 16 个。它还支持原生视觉和 100 万 token 上下文窗口。

Moonshot 表示,其架构的扩展效率约为 Kimi K2 的 2.5 倍。该公司将这一改进归因于新的注意力机制、稀疏专家设计和修订后的训练方法。

这些规格有助于解释模型持续处理长任务的能力。网络入侵模拟不只是回答孤立的问题。智能体必须保持目标、解读工具反馈、更新策略,并执行大量相互依赖的操作。

同样的智能体特性也支持合法工作。开发者可以将其用于代码维护、漏洞分析、事件调查和防御性测试。研究人员则可以复现发现,而无需将敏感材料发送给托管服务商。

开放部署还能改善隐私和运营控制。组织可以将提示词、源代码和日志保留在自己选择的基础设施中。它可以检查周边软件,并决定何时允许模型访问工具。

然而,一旦权重离开开发者,提供商层面的防护措施就更难执行。托管服务商可以监控请求、暂停滥用账户、更新分类器、限制工具并修改系统提示词。

独立运营者可以移除这些层级。嵌入模型的拒答行为也可能通过微调或其他修改被削弱。

英国研究所更广泛的开放权重分析指出,一旦权重公开,部署控制就无法被普遍应用。该分析还警告称,当运营者持有模型时,拒答训练可能具有可逆性。

这使 Kimi K3 与网络安全表现更强的闭源模型有所不同。即使控制措施并不完美,闭源服务商仍可以在模型与用户之间设置控制层。

Kimi 评估发现,其安全措施并未阻止漏洞利用开发或进攻性操作的尝试。不过,这一比较需要谨慎看待,因为评估人员关闭了美国闭源模型的系统级防护,以衡量其最大能力。

这些闭源系统的公开版本通常包含额外控制。因此,该测试更直接地比较了底层能力,但并不代表普通公众用户的实际体验。

开放权重风险处于能力、访问和控制的交汇处。Kimi K3 的能力弱于领先闭源模型,但坚定的运营者拥有更大的部署修改自由。

这正是为什么这次完成的模拟攻击值得获得超越一条吸睛 Google News 结果的关注。它标志着一个类别的进展,在这一类别中,安全不能完全依赖原始提供商保留控制权。

Google News 捕捉了成功,而非基准的局限性

这次模拟攻击旨在衡量长程能力,而不是复现一家具备防御能力的企业所面临的不确定性。

“The Last Ones”包含一系列刻意设置漏洞的系统。测试从获得初始网络访问权限之后开始,因此模型无需解决进入真实企业环境所涉及的每一个问题。

该靶场没有活跃的防御人员,也缺乏能够隔离机器、阻止可疑流量、轮换凭据或在告警后中断攻击者行动的防御工具。

它同样不会对高噪声行为施加惩罚。在真实网络中,重复扫描、失败登录、异常命令执行和横向移动,都可能在攻击者达成最终目标之前很早触发告警。

这些条件并不会使结果失效。受控基准会移除外部变量,使评估人员能够针对同一任务比较模型。它们是诊断工具,而非对现实世界必然表现的预测。

十分之一的完成率带来了另一项限制。恶意运营者无法假定 Kimi K3 会按需完成类似攻击。失败尝试会消耗时间、token、基础设施和机会,同时暴露行动。

1 亿 token 的额度同样重要。它让智能体有空间进行广泛试验和恢复。经过长时间反复试错后取得成功的模型,与行动快速且稳定的模型所构成的威胁不同。

不过,不可靠的自动化对攻击者仍可能具有实际价值。软件可以被重复运行、并行化,或部署到许多目标上。当额外尝试的成本下降时,较低的单次成功率也会变得更具意义。

漏洞利用结果显示了当前能力上限所在。Kimi K3 能够执行进攻性工作流的部分环节,但在 41 个任意代码执行样本中一个也未完成。

Moonshot 自己的论文指出了高级漏洞利用工作中反复出现的弱点。该模型可能陷入无成效的调试,在存在缓解措施时选择糟糕策略,或无法验证最终结果。

这些是重大短板。它们会影响部分技术知识究竟能否转化为实际入侵,而不是一组未完成的命令和观察。

该评估也不能证明 Kimi K3 在网络靶场中发现了此前未知的漏洞。它测试的是模型在一个由专家构建、包含预设弱点的环境中的表现。

结果同样并未显示该模型独立选择了真实目标。评估人员提供了目标、初始访问权限、受控环境和工具。智能体是在这一设置内运行的。

新闻标题往往会将这些条件压缩成二元结果。“完成模拟网络攻击”这一说法准确,但如果不提及十分之一的成功率和模型较弱的平均表现,便并不完整。

相反的概括同样会造成误导。若因 Kimi 落后于美国系统而将评估称为失败,就会忽略其领先于 GLM-5.2,以及其成功完成自主运行这一事实。

最恰当的解读,是将这项基准测试视为一个早期预警信号。它表明开放模型正在获得更长的操作链能力,同时也显示出其稳定性与前沿模型之间仍有多大差距。

因此,Google News 读者应当区分三项主张。Kimi K3 曾一次完成该范围测试。它并未匹敌领先的闭源模型。该结果也并未证明其能够对具备防御能力的现实企业发动可靠攻击。

真正的竞争是能力与遏制之间的较量

随着开放模型逼近闭源前沿,问题将从谁的得分最高,转向哪些安全防护措施仍能得到有效执行。

Moonshot 于 7 月 16 日发布 Kimi K3,随后公布了其完整权重。该公司将这一系统定位于编程、推理、知识工作和长周期智能体任务。

它的网络安全表现是这些通用能力的副产物。接受过浏览代码仓库、调试程序、使用终端和完成延展性计划训练的模型,可以将类似技能应用于安全工作。

这种重叠使网络安全能力具有双重用途。防御者需要理解漏洞、复现攻击、检查恶意代码,并验证补丁是否有效。攻击者同样能从许多相同的技术技能中获益。

屏蔽所有与安全相关的请求会削弱其合法价值。允许所有请求则会带来明显的滥用风险。因此,提供商依赖于情境敏感的政策、监控、账户控制和工具访问限制。

开放权重削弱了提供商执行这种平衡的能力。运营者可以在没有身份核验或集中式日志的情况下部署模型,也可以在模型周围配置自定义工具和自动化流程。

这并不意味着每一种开放权重部署都很危险。大多数用户并不具备开展实质性入侵行动所需的基础设施、访问权限、专业知识或意图。

运行一个 2.8 万亿参数模型同样需要大量计算资源。权重可用并不意味着 Kimi K3 成了任何人都能在笔记本电脑上高效运行的消费级应用。

基础设施提供商仍可实施控制措施。云服务商、模型托管公司、代码平台和网络运营商都可能检测滥用行为或限制某些部署。组织也可以通过沙箱和最小权限访问来约束智能体。

但这些控制措施是碎片化的。当模型开发者运营唯一接口时,它们无法提供那种集中式执行点。

闭源模型一方也有自身弱点。提供商的防护措施可能失效,而意志坚定的用户可能找到绕过方式。提供商还可能改变访问规则、收集敏感日志,或终止客户所依赖的服务。

开放模型提供了可检查性、可移植性和本地控制。它们可以减少对单一供应商的依赖,并支持闭源接口无法容纳的研究。

这使安全问题成为一种权衡,而不是对开放性的全民公投。相关挑战在于识别那些能够在独立部署后依然有效、同时又不消除合法访问的控制措施。

可能的控制措施包括更安全的训练数据、更难移除的行为约束、受控发布节奏、独立评估,以及对高风险工具组合的限制。

没有任何一项能提供完整答案。行为防护可以被修改。评估可能遗漏隐藏能力。发布限制可能集中控制权,却无法阻止后续扩散。

Kimi K3 发布详情说明了这种压力为何会持续。Moonshot 为长周期执行打造了该模型,并将其发布到面向消费者、编程、企业和 API 的产品中。

其一百万 token 上下文和智能体训练具有商业价值。同样的特性也帮助模型在漫长的攻击路径中保持持续参与。

Anthropic 和 OpenAI 等闭源提供商面临来自两个方向的压力。它们既必须提高安全性,又要与客户可以自行调整并在其他地方托管的可下载系统竞争。

其他开放模型开发者则面临不同要求。他们必须说明在发布前进行了哪些评估,以及分发后哪些控制措施仍具实际意义。

Kimi K3 并未决定这场竞争的胜负。它将开放权重的边界推进得足够远,以至于网络安全评估应成为标准发布要求,而非偶尔进行的外部测试。

安全团队应从 Kimi K3 中得到什么启示

组织应将 AI 智能体视为拥有受限权限的操作身份,而不是仅仅生成文本的聊天界面。

这项基准测试开始时,模型已能够访问目标环境。这一细节映照出最重要的企业风险:当智能体能够将推理与凭证、终端、代码仓库和网络工具相连接时,它就可能变得危险。

组织首先应盘点 AI 智能体可以执行操作的所有位置。相关图谱包括 shell 访问、云控制台、源代码管理系统、工单平台、远程管理工具,以及存储在提示词或文件中的机密信息。

权限应与狭窄的任务范围相匹配。编程助手很少需要不受限制的生产环境凭证。安全测试智能体也很少需要持续访问每一个子网。

短期凭证可降低被窃取或滥用访问权限的价值。审批关卡可以中断高影响操作,例如更改身份策略、修改防火墙规则,或在生产系统上执行代码。

网络分段同样限制智能体横向移动的能力。The Last Ones 要求跨越四个子网取得进展,因此系统间移动是被衡量能力的一部分。

防御者应同时记录模型交互及其产生的工具活动。仅有提示词记录无法显示智能体是否扫描网络、打开远程会话或修改服务。

工具活动还能提供更强的检测信号。安全系统可以标记异常命令序列、重复身份验证失败、异常进程创建,或超出智能体分配范围的访问。

评估开放权重的组织还需要围绕服务环境实施额外控制。它们应验证模型来源、保护权重文件、限制微调流程,并监控系统提示词和工具定义的变更。

内部模型并不会自动保证隐私。提示词可能出现在日志、可观测性系统、缓存或第三方插件中。只有完整数据路径受到治理时,本地部署才有帮助。

安全团队还应针对智能体的重复行为测试其控制措施。模型可能前九次失败、在第十次成功。只记录单次尝试的传统评估可能低估这种持续性。

因此,任何醒目结果都应同时附带通过率和完成率。团队需要知道模型成功的频率、消耗多少算力,以及哪些控制措施能检测到其尝试。

根据其项目说明,美国 CAISI 负有评估可能影响国家安全的 AI 能力的职责。与英国研究所的联合测试,为一致性测量提供了有用基础。

然而,企业不应等待政府基准测试覆盖其确切环境。内部测试可以模拟公司现有的工具、权限、身份系统和监控措施。

防御性用途也应得到同等关注。同一智能体可以在人工监督下帮助复现漏洞、测试网络分段、审查可疑脚本和调查告警。

团队应明确界定这种监督。若一个人无法检查智能体的中间操作,那么在最终审批环节提供的保护也十分有限。

实际教训并不是禁止 Kimi K3 或开放模型,而是假定有能力的智能体将通过众多分发渠道获得,然后围绕这些智能体能够触及的范围设计控制措施。

将决定下一步走向的三个信号

下一阶段取决于可复现性、发布后的修改,以及真实防御是否能阻止测试范围中观察到的行为。

第一个信号,是完整权重发布后的独立复现。研究人员需要通过不同的服务栈、智能体框架、提示词和 token 预算测试同一模型。

基准测试结果可能部分取决于周边框架,因为它为模型提供工具并管理其交互循环。复现将表明,完成结果反映的是稳定的模型能力,还是一种狭窄配置。

更高的完成率将加强这样一种担忧:开放权重网络安全智能体正在缩小操作能力差距。持续较低的结果则会削弱从那一次成功运行中得出的主张。

研究人员应报告完整的结果分布。平均步骤数、成功完成次数、算力使用、失败策略和检测事件,比单一排行榜分数能揭示更多信息。

第二个信号,是外部开发者修改 Kimi K3 后会发生什么。开放权重允许进行专门微调、改变拒绝行为、集成新工具,以及采用不同的推理设置。

面向安全的调优可以改善防御性分析。进攻性调优则可能提高漏洞利用完成率,或移除在原始训练过程中保留下来的防护措施。

这一信号将难以衡量,因为定制部署可能保持私密。已发表研究、模型衍生版本和事件报告将提供部分证据。

若适度微调就能带来显著改进,将加强这样一种观点:基础模型评估低估了下游风险。若改进甚微,则表明更深层的能力限制仍难以克服。

第三个信号,是针对主动防御的表现。未来的测试范围应包含监控、端点保护、凭证轮换、欺骗系统,以及会对可疑活动作出响应的防御者。

Kimi K3 的成功运行并未遇到这些障碍。一个能完成静态路径的模型,可能会在环境随着每次可检测操作而变化时失败。

在响应式防御下成功,将代表一个更严重的门槛。失败则会证实,当现实世界不会等待智能体的下一步时,当前智能体依然脆弱。

这些观察比又一个病毒式传播的 Google News 标题更重要。核心问题在于,开放模型罕见的实验室成功是否会变得可重复、可适配且难以遏制。

对开发者而言,当前行动是:在选择智能体之前,要求获得完整的评估背景。对企业采购方而言,则是将模型采购与身份、日志和网络控制相连接。

对安全团队而言,挑战很具体:测试当 AI 智能体获得与人类操作员相同的访问权限时会发生什么。然后移除任务并不需要的每一项权限。

Kimi K3 并未超越闭源前沿,也没有攻克一家具备防御能力的公司。但它确实表明,一个可下载模型可以在受控条件下完成一次漫长的模拟入侵。

组织会将这一结果视为一则耸动的 Google News 故事,还是将其作为在下一代模型到来前测试智能体权限的理由?

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page