Cisco 的小型 AI 模型揭示了更大的安全权衡
- Sophie Larsen

- 6天前
- 讀畢需時 14 分鐘
Cisco Foundation AI 于 7 月发布了两款开放权重安全模型,尽管证据显示,即便是领先系统仍会遗漏大多数存在漏洞的代码位置。这一消息在 Google News 中被呈现为又一轮模型、基准测试和安全研究的月度发布。但真正重要的并不是 Cisco 的发布节奏。
Cisco 正在验证:小型专用模型能否以比通用前沿系统更经济的方式完成重复性的安全工作。Antares-350M 和 Antares-1B 会在软件仓库中搜索与已知漏洞类别相关的文件。它们可以在本地运行,让敏感源代码始终留在组织自身的环境中。
这一设计挑战了这样一种假设:每项困难的 AI 任务都需要使用可获得的最大模型。同期,Microsoft 和 Google 也推出了各自的专用网络安全系统。一场新兴竞争正将专注、可本地部署的模型与具备更广泛推理能力的大型服务置于对立面。
Cisco 的基准测试结果支持专用化路线,但也揭示了其局限性。Cisco 主要基准中表现最好的系统,File F1 分数仍低于 0.23。近五分之二的基准任务让所有接受评估的模型都无功而返。
因此,这是一种权衡,而非一场胜利巡礼。较小的模型提供了更低的运行需求、更严格的数据控制,以及可重复的仓库分析能力。其不完整的结果仍需要经验丰富的分析人员、既有安全工具和谨慎验证来补足。
Cisco 在 7 月实际发布了什么
Cisco 发布的是一套专注的代码搜索系统,而非自主漏洞猎手。
2026 年 7 月 21 日,Cisco 将 Antares-350M 和 Antares-1B 作为开放权重小型语言模型推出。它们用于漏洞定位,即寻找可能包含所描述弱点的文件。
这一区别很重要,因为定位只是漏洞管理的一个阶段。Antares 不会独立确认可利用性、判断严重程度、生成完整补丁,或批准代码投入生产环境。
相反,每个模型都会接收一个代码仓库和一份 Common Weakness Enumeration 描述。CWE 是一套标准化分类,用于描述反复出现的软件弱点,例如不当的输入验证。
模型通过终端命令浏览只读代码仓库。它会搜索相关模式、读取候选文件、评估证据,并在某条搜索路径看似无效时调整方向。
Cisco 在其 Antares 发布公告中描述了这种行为。系统会返回一份按可能性排序的文件列表,以及探索期间所使用命令的记录。
这一记录对安全运营至关重要。分析人员可以检查模型如何得出结论,而不是只收到一个缺乏支撑的漏洞判定。
Antares-350M 面向计算资源受限的环境,支持 32,000 token 的上下文窗口。Antares-1B 支持 128,000 token,设计为可在单个图形处理器上运行。
本地执行是另一项定义性特征。企业可以检查专有代码,而无需将代码仓库传输给托管模型提供商。这一选择回应了隐私、数据驻留和合同方面的顾虑;这些问题往往会阻碍基于云的安全分析。
Cisco 还推出了 VLoc Bench 来衡量这些模型。该基准包含 500 项任务,覆盖 290 个代码仓库、六个软件包生态系统,以及 147 个不同的 CWE 类别。
每项任务都包含一个带有已知漏洞的代码仓库快照。真实标签来自相应安全补丁所修改的文件。
该基准将定位与验证分开。在定位阶段,模型必须找到与该弱点相关的文件。在验证阶段,它会检查已打补丁的代码仓库,并应避免错误报告已修复的问题。
这种结构比完整的渗透测试更为狭窄,但也比从预先准备好的提示词中检索代码片段要求更高。
模型必须在信息有限的条件下导航陌生代码仓库。这使该基准与安全公告分诊相关,因为防御方往往在定位具体实现之前,就已知晓弱点类别。
Cisco 将 Antares 定位为静态分析、软件组成分析、密钥扫描、动态测试和人工审查的补充。它并未将这些模型描述为上述控制措施的替代品。
因此,眼下的改变务实但有限。安全团队获得了两款可下载模型,可将大型代码仓库缩小为一组较小的候选文件。
这种初步筛选能够在重复性调查中节省注意力。但它无法证明所选文件确实存在漏洞,也无法证明被遗漏的文件是安全的。
为什么 Google News 漏掉了真正的利害关系
Google News 的标题将 7 月描绘成持续不断的发布流,而真正的变化关乎谁负担得起持续代码审查。
应用安全团队不会只检查一次代码仓库。代码会变化,依赖项会更新,安全公告会到来,原本可接受的行为也可能在新攻击技术下变得危险。
托管的前沿模型可以协助这些审查。然而,反复进行仓库规模的分析会消耗大量推理资源,并且可能要求将敏感代码发送到企业基础设施之外。
小型本地模型改变了这种运营方程。它们可以反复执行狭窄任务,而不必让每一次扫描都依赖高价的外部服务。
这一权衡同时给多个群体带来压力。前沿模型提供商必须证明,更广泛的推理能力能够产生足以证明更高运行需求合理性的额外价值。
安全供应商必须决定,专用模型是否应纳入现有扫描器、分诊控制台和持续集成流水线。内部安全团队则必须判断,模型生成的文件排序是否真的能减少分析人员的工作量。
Cisco 的方法也对那些将 AI 安全视为采购聊天机器人的组织施加了压力。漏洞定位是一个工作流问题,涉及代码仓库访问、证据采集、权限和人工升级处理。
一个有用的部署方案会将 Antares 连接到受控的代码仓库快照,记录搜索轨迹、返回候选文件,并将这些候选项转交给分析人员。
分析人员会将输出与依赖项数据、静态发现、测试和原始安全公告进行比对。只有在那之后,组织才会决定是否需要修复。
这种分工很重要,因为漏洞工作具有不对称后果。误报会消耗分析人员时间,而漏报则会让危险代码未被发现。
7 月的发布表明,没有任何单一模型必须独占完整流程。一个模型可以定位可疑代码,另一个则可评估可利用性或起草修复方案。
Google DeepMind 在通过其 CodeMender 项目推出专用网络模型时,也表达了类似观点。Microsoft 同样宣布了一款内部训练的网络安全模型及相关安全代理。
一项行业比较称,三家公司都在追求面向特定任务的系统。它们共同的动机包括访问限制,以及大规模运行前沿模型的成本。
这种趋同使 Cisco 的工作超越了一次产品发布的重要性。专用安全模型正成为确定性扫描器与通用 AI 助手之间一个独立层级。
当维护者能够定义可靠规则时,静态工具仍然有效。当任务需要广泛推理、生成修复方案或跨多个系统交互时,前沿模型仍然有用。
小型安全模型则处于两者之间。它可以学习调查式搜索模式,同时保持足够紧凑,以便受控且高频地部署。
竞争的关键问题不是 Antares 能否胜过每一个更大的模型,而是一组专用系统能否在常规防御工作流中提供足够的准确性。
如果这种模式奏效,买方将通过任务经济性和运营适配度来评估 AI。通用基准测试的声望,其重要性将低于分诊时间可衡量的缩减。
小型安全模型挑战前沿模型经济学
Antares 表明,对于定义严格的安全任务,训练出的搜索行为可能比参数数量更重要。
通用代码模型会在许多无关能力之外学习漏洞相关工作。它们必须支持写作、解释、规划、代码生成以及广泛的软件推理。
Antares 则缩小了目标范围。它学习搜索、检查证据、修正路径,以及识别与给定弱点描述相关的文件。
这一更狭窄的训练目标让 Cisco 能将模型容量投入到代码仓库导航中。这种方法更像一名通过工具开展工作的受训调查人员,而非记忆安全术语的聊天机器人。
模型从有限证据开始。它可以搜索文件名和代码模式,检查相关文件,并利用新线索指导后续命令。
一个有用的代理还必须能够放弃薄弱假设。缺少这种行为,代码仓库探索可能会变成一连串昂贵且重复的搜索。
Cisco 的基准测试会在命令数量限制下检验这一过程。因此,代码仓库结构成为任务的一部分,而不再是隐藏在提示词中的背景信息。
结果支持 Cisco 的专用化论点。根据已发布的基准数据,Antares-1B 在 VLoc Bench 上取得了 0.209 的 File F1 分数。
尚未发布的 Antares-3B 达到 0.223。领先的 GPT-5.5 配置得分为 0.229,在 Cisco 的评估中仅留下很小的数值差距。
参数数量本身并未决定排名。Cisco 称,其为特定目的训练的 3B 模型,与包含超过 1,000 亿参数的通用系统表现相当或更优。
更大的重点并不是 3B 模型已经在总体上等同于前沿系统。事实并非如此。这一比较只涵盖一个受限任务、一套测试框架和一种评分方法。
Cisco 随后在 CyberGym 定位任务和 Cognition 安全评估的公开重建版本上测试了相同权重。这一步很重要,因为模型在由其开发者创建的基准上往往表现最强。
CyberGym 包含约 1,500 个漏洞,来自 188 个开源项目。其完整基准评估漏洞利用生成,但 Cisco 将其拆分,只测试较早的定位步骤。
Antares-1B 在该定位测试中实现了 67.2% 的召回率。尚未发布的 3B 模型达到 73.7%,而领先的前沿模型达到 89.1%。
这些数字同时展现了迁移能力和持续存在的能力差距。较小模型在外部任务上保留了有用行为,但尚未达到最佳前沿模型的结果。
Cisco 的外部基准测试还包括对 Cognition 安全评估的社区重建版本。原始 50 个测试样例中,只有 34 个可公开获取。
Cisco 通过从公开子集中外推,估算了这一对比的结果。该公司明确表示,这些数字仅具方向性参考意义,并非真正的正面对比评估。
这一限制至关重要。不同的智能体可能使用不同的提示词、命令限制、基础设施、上下文管理方式和停止规则。
即使两个系统接收到同一个代码仓库,周边运行框架也可能对结果产生重大影响。智能体基准衡量的是模型与系统的组合,而非孤立的智能水平。
不过,其经济性论点仍然可信。本地模型可以避免按量计费的 token 消耗,并允许在不导出源代码的情况下反复分析。
这使得专业化模型对于高吞吐量筛查很有吸引力。随后,更大的模型可用于处理那一小部分需要深入调查的代码仓库或文件。
因此,可能的架构是分层式的。低成本的专业模型负责大范围定位,而高成本系统和人类专家则审查模糊案例。
这种方法与成熟的安全运营模式相似。组织早已使用低成本自动化控制手段筛选活动,再将不确定的发现升级处理。
Antares 并未将前沿模型排除在流程之外。它改变的是团队可能将这些模型预留用于何处。
基准测试的胜利伴随着警告
Cisco 最有力的证据也表明,在进行大量本地验证之前,Antares 不能成为一道安全闸门。
Antares-3B 与 GPT-5.5 的标题级对比听起来令人印象深刻。但绝对分数讲述了一个没那么令人安心的故事。
VLoc Bench 上表现最好的系统,File F1 也仅达到 0.229。File F1 在将预测文件与已知补丁所修改的文件进行比较时,结合了精确率和召回率。
低分可能反映出遗漏了相关文件、提出了无关建议,或两者兼有。任何一种失败都会给接收结果的安全团队带来额外工作或风险。
该基准的已发布结果显示,在全部受评模型中,500 项任务里有 190 项始终未被解决,占完整集合的 38%。
从最小代码仓库到最大代码仓库,性能还下降了十三倍。Cisco 得出结论:结构复杂度对难度的预测能力强于漏洞类别。
这一发现构成了故事中的核心反转。专业化能帮助小模型与大得多的模型竞争,但并不能让仓库级漏洞发现变得可靠。
同样的局限也体现在产品边界上。Antares 会识别候选文件,但分析师仍必须判断漏洞是否真实存在,以及是否能够被利用。
一个代码仓库可能包含同一模式的多种实现。生成代码、封装层、测试、供应商依赖项和兼容层都可能干扰搜索。
安全补丁也只是并不完美的真值形式。维护者有时会修改并非直接存在漏洞的辅助文件,或在初始修复中遗漏相关位置。
因此,基准测试可能会奖励与历史补丁的一致性,却无法完整衡量安全理解能力。它们仍然有用,但其分数不应被视为通用检测率。
Cisco 的外部测试降低了对其完全过拟合基准的担忧。但这并未消除在企业代码仓库中进行独立复现的必要性。
采用 Antares 的组织应从回溯案例开始。团队可以提供此前已修复的漏洞,并衡量模型能否识别出已知文件。
他们还应记录无关建议、遗漏文件、命令使用情况、运行时间和分析师审查时间。不同代码库会产生不同的错误模式。
模型的上下文窗口并不保证其能完整理解整个代码仓库。Antares 通过终端命令进行导航,因此其成功与否取决于能否选择正确的搜索方式和证据。
大型单体仓库带来了特殊挑战。一项漏洞描述可能适用于多个服务、生成的客户端、共享库和多种实现语言。
该基准证实了这一代码仓库规模问题。它也表明,仅仅增加参数数量并不能消除所有结构性障碍。
安全负责人应避免将模型置信度转化为政策授权。Antares 不应独立阻止发布、关闭漏洞工单或认证补丁。
谨慎的实施方式应将其输出视为建议。排名靠前的文件将获得更早的人类关注,而传统控制手段仍会继续检查更广泛的代码库。
独立报道得出了类似结论。一项部署评估指出,这些模型既不确认漏洞,也不判定严重程度或生成修复方案。
该报告还强调了隔离分析环境的必要性。本地执行会让代码留在本地,但不会自动保护周边系统。
具有终端访问权限的模型仍会与敏感代码仓库和推理依赖项交互。管理员需要遵循最小权限原则的访问控制、网络限制、日志和经过验证的模型制品。
开放权重带来了检查和部署选择,但并不保证不会遭到篡改、发生不安全集成或授予不恰当权限。
开放权重并不意味着可以毫无保留地信任
Cisco 正在平衡更广泛的防御性访问与安全模型可能协助攻击者的风险。
该公司称 Antares 为开放权重模型,因为符合条件的用户可以获得训练后的参数。随后,模型行为便可在 Cisco 托管服务之外的基础设施上运行。
不过,下载已发布模型需要提供联系信息并获得批准。Cisco 表示,它会审核访问请求,以降低犯罪分子获得这些工具的可能性。
这种受控分发使通常的开放与封闭之争变得更为复杂。Antares 提供本地部署和可检查的权重,但不允许匿名、即时访问。
据报道,Cisco 曾就模型安全和发布决策咨询美国政府机构。这反映了漏洞研究的双重用途属性。
定位模型可以帮助防御者找到暴露的代码。同样的能力也可以帮助攻击者在可访问的代码仓库中缩小已知漏洞的搜索范围。
Cisco 的模型止步于漏洞利用生成之前,但这一边界并不能消除滥用风险。找到相关文件往往是开发漏洞利用的重要第一步。
发布报道将 Antares 描述为迈向开放安全工具更广泛趋势的一部分。同一时期,Capital One 发布了另一款专注于漏洞的智能体。
开放安全研究长期以来一直具有价值。共享规则、基准和测试用例使防御者能够复现发现并比较系统。
它也会增加审查力度。研究人员可以识别评估错误、隐藏假设和不安全的默认配置,而封闭服务可能会掩盖这些问题。
当工具获得更多自主性时,风险会增加。仅对文件进行排序的模型,其权限低于能够执行代码、访问网络或修改代码仓库的智能体。
部署团队应维持这种有限权限。只读代码仓库访问、沙箱执行、受限命令和可审查轨迹应继续作为默认控制措施。
Cisco 更广泛的研究进一步印证了这一谨慎态度。其对 15 个专有前沿模型的评估发现,单轮攻击与自适应多轮攻击之间存在巨大差异。
多轮攻击成功率介于 7.89% 至 88.30% 之间。同一组模型的单轮成功率则介于 2.19% 至 64.91% 之间。
多轮研究认为,单提示词安全测试无法代表那些会在每次被拒绝后调整策略的攻击者。这一教训同样适用于防御型智能体。
代码仓库搜索智能体通过一系列观察与行动运行。测试单一孤立输出,无法揭示每一种不安全轨迹或权限失效情况。
这使 Antares 的基准策略比单纯的模型发布更值得关注。Cisco 正在构建模型、任务专用评估,以及受控智能体系统的规范。
这些组成部分共同构成了关于应如何采购 AI 安全能力的论点。买方需要有关明确工作流、攻击条件、权限和失败率的证据。
模型卡或通用排行榜无法回答这些运营层面的问题。一条正面的 Google News 标题同样不能。
安全团队需要与其代码仓库和约束相似的评估制品。他们还需要记录模型何时改变方向,以及为何选择某个文件。
这些证据可以支持审计和事件复盘。它还可以揭示模型何时依赖了表面的名称,而非有意义的代码关系。
开放权重让这类本地测试更容易。不过,受控访问会限制社区参与,并可能减缓独立复现。
Cisco 需要证明其审查流程能让合法研究人员获得切实可行的访问权限。否则,有关开放性的主张仍会比这一标签所暗示的范围更窄。
安全团队接下来应关注什么
接下来的三个信号将决定专业化安全模型会成为基础设施,还是仍停留在令人印象深刻的研究演示阶段。
第一个信号是独立基准复现。研究人员应在 Cisco 未选择的代码仓库、语言和漏洞类别上运行 Antares。
分布外的 CyberGym 结果已经提供了有用证据。更广泛的测试应在一致的运行框架下衡量精确率、假阴性、运行时间和分析师工作量。
有利的结果将强化 Cisco 的专业化论点。性能大幅下降则可能表明,这些模型学到的是基准特定的搜索模式,而非可迁移的调查技能。
第二个信号是生产集成。当安全平台能够将其排名文件放入现有调查和修复工作流时,Antares 才会在运营层面变得有意义。
团队应关注其与持续集成系统、静态扫描器、通报管理平台和标准化 SARIF 发现结果的集成。SARIF 是交换静态分析结果的常用格式。
集成本身并不等于采用。Cisco 或其合作伙伴必须证明,分析师能在不接受更多遗漏漏洞的前提下更快结案。
最有用的证据将比较部署前后的分析师耗时。案例研究还应披露代码仓库规模、语言覆盖范围和人工审查流程。
开展试点的组织应保留自己的评估笔记、代码上下文、通报和审查者决策。一个可搜索的知识库可以帮助团队在反复测试中留存这些证据。
第三个信号是竞争性回应。Microsoft、Google、OpenAI、安全厂商和开源研究人员都在探索专业化网络安全模型或智能体。
关注他们是否发布具有可复现运行框架的任务级基准。也要关注其系统是否将定位、验证、利用和修复分开处理。
清晰的分离将支持 Cisco 对安全智能体的模块化观点。若捆绑式系统持续展现出更强的端到端结果,则会削弱专用定位模型的理由。
Antares-3B 是这一趋势中的另一项具体测试。Cisco 在发布 7 月评测时纳入了其结果,但尚未公开其权重。
一旦权重可用,独立研究人员便可测试其接近前沿水平的 VLoc Bench 表现能否迁移至不同代码仓库。他们也可以将其行为与已发布的 350M 和 1B 版本进行比较。
安全采购方不应等待一个放之四海而皆准的赢家。现有证据已表明,模型选择将取决于任务范围、隐私要求、代码仓库复杂度以及审查能力。
Google News 将继续把这些发布压缩为模型公告和基准排名。实践者应提出一个更棘手的问题:该系统能否在不掩盖新失效模式的前提下,减少经过验证的安全工作?
针对历史案例开展范围受控的试点,保留每一条搜索轨迹,并将结果与你现有的控制措施进行比较。这些证据将揭示,专业化 AI 是否适合纳入你的安全流程。


