top of page

Anthropic Simon Willison 引述令 Opus 5 的提示注入声明面临检验

7 月 25 日,关于 Anthropic Simon Willison 的报道披露了一项引人注目的说法:Claude Opus 5 是 Anthropic 迄今最不易遭受提示注入的模型。Claude Code 的创建者 Boris Cherny 强调,这一结果比模型在主要评测中的分数更重要。

这一说法之所以重要,是因为提示注入仍是构建可信 AI 智能体最棘手的障碍之一。功能强大的模型可以浏览网站、读取消息、编辑代码并调用工具,而这些能力同样为恶意内容劫持智能体提供了机会。

Cherny 的表态将 Opus 5 的叙事重点从基准测试领先转向安全性,但这也带来了严苛考验。更强的模型抵御能力必须转化为更安全的实际部署系统,而不只是 Anthropic 评测环境中更高的分数。

Boris Cherny 如何评价 Opus 5

Cherny 将提示注入抵御能力视为比传统能力分数更重要的 Opus 5 成果。

在模型发布材料出现后不久,Simon Willison 发布了这段 Boris Cherny 引述。Cherny 表示,Opus 5 是 Anthropic “迄今最不易遭受提示注入的模型”。

他补充说,在提示注入评测和红队演练中,成功攻击都很困难。红队测试是指在对手于生产环境中发现弱点之前,刻意攻击系统以暴露漏洞的做法。

Cherny 也承认,这一结果“在系统卡中埋得有点深”。Willison 指向 Opus 5 系统卡第 73 页,Anthropic 在那里描述了其提示注入测试。

这一位置耐人寻味。模型发布通常会突出编码、推理或智能体基准测试,因为这些数字便于比较和营销。深藏于技术文档中的安全评估,很少得到同等关注。

Cherny 颠倒了这种优先级。他传达的核心意思是:抵御恶意指令,值得比又一次小幅领先的基准成绩获得更多关注。

这一判断反映了 Claude 日益广泛的使用方式。Claude Code 可以检查代码仓库、执行获批准的命令,并处理长周期开发任务。其他基于 Claude 的智能体则可以浏览外部页面或处理企业文档。

每增加一个上下文来源,就多出一道信任边界。模型必须区分来自用户的指令、来自开发者的规则,以及来自外部来源的不可信文本。

提示注入正是对这种区分的攻击。攻击者会将指令嵌入智能体将要读取的内容中,例如网页、电子邮件、代码注释或共享文档。

智能体可能将这些指令当作命令执行。被攻破的智能体可能泄露信息、修改文件、滥用已连接工具,或悄然改变其回答。

直接提示注入来自用户输入。间接提示注入则通过智能体在完成其他任务时获取的内容进入系统。对于使用工具的智能体而言,后者构成了更大的挑战。

编码智能体可能在依赖文件中遇到恶意指令,研究智能体可能在网页中发现它,邮件助手则可能在一封看似普通的消息中处理敌意文本。

这解释了为何 Anthropic Simon 的讨论吸引了超出又一次模型发布之外的关注。Cherny 描述的并非表面的安全功能,而是限制用户能够安全委托多少权限的一项弱点。

不过,他的措辞仍是一项企业内部的比较性声明。“最不易遭受提示注入”意味着,在该公司的测试中,它比 Anthropic 早期模型更具抵御能力;这并不意味着它对所有攻击免疫,也不意味着在每种产品配置中都安全。

这一差别揭示了核心张力。Opus 5 可以代表有意义的进展,同时提示注入仍是一个尚未解决的系统级问题。

为什么 Anthropic Simon 的报道改变了模型叙事

Opus 5 的声明将竞争焦点从原始智能转向在敌对条件下的可靠行为。

前沿模型公告往往通过基准测试表展开竞争。厂商比较编码表现、推理、工具使用、搜索和专业任务能力。这些指标帮助买家估计模型能完成什么工作。

但它们较少揭示:当智能体遇到蓄意误导的内容时会发生什么。一个能够解决复杂任务、却会服从隐藏指令的智能体,其能力越强,风险反而可能越大。

这导致能力与风险之间形成一种令人不安的关系。更强的浏览能力扩大了智能体能够触及的信息范围,更强的工具使用能力扩大了它能够采取的行动范围。

更长的自主运行时间也创造了更多被操纵的机会。工作流早期一次成功的注入,可能影响后续的搜索、文件、摘要和工具调用。

因此,提示注入抵御能力改变了模型质量在实践中的含义。可靠性不仅是给出正确答案,也包括在外部内容试图取代用户意图时,仍能维护用户意图。

Anthropic 在其公开的 模型系统卡中,持续将这一问题列为重点。早期系统卡描述了隐藏在网站或消息中的恶意指令,而智能体会代表用户处理这些内容。

Opus 4.5 评估解释了这类攻击为何能够规模化:公共页面上的一个恶意载荷,可能触及处理该页面的每一个智能体。

Opus 5 的出现,正值这一威胁变得更加具体之时。如今,智能体能够操作浏览器、终端、开发环境和企业连接器,其潜在后果远不止误导聊天机器人的一次回答。

对于开发者而言,成功的抵御能力可以减少智能体遵循不可信数据中指令的频率,也可以降低对搜索可疑短语的脆弱过滤器的依赖。

对于企业而言,这项声明回应了部署中的核心担忧。公司希望智能体能检索内部知识并完成有用工作,同时不让任意内容重定向这些智能体。

知识访问进一步提高了风险。一名助手可能在同一个上下文窗口中结合私有文档与外部搜索结果。模型必须同时使用两类来源,并尊重不同的信任等级。

这正是组织需要谨慎开展知识管理的原因。连接更多信息会提升实用性,但也要求明确的权限和来源边界。

Cherny 的强调也对竞争模型提供商施加了压力。买家可以询问竞争对手的系统卡是否包含可比较的提示注入评估、真实的智能体环境,以及多重防御下的结果。

单一的头部能力分数已不足以决定选择。重视安全的团队需要获得关于攻击抵御能力、误拒率、工具边界以及遭遇操纵后恢复能力的证据。

然而,可比证据仍难以获得。厂商可能采用不同的攻击方式、威胁假设、工具、评分规则和缓解措施。两个看似出色的百分比,可能描述的是截然不同的实验。

底层测试也可能迅速过时。一旦防御措施公开,攻击者便会调整措辞和投递方式。静态测试集可能奖励模式识别,却无法衡量普遍的抵御能力。

因此,Anthropic 的声明之所以有价值,部分在于它邀请外界审视。发布系统卡让研究者获得了比单独的发布声明更多可供分析的材料。

不过,更有力的主张仍需要 Anthropic 之外可重复的测试。独立研究人员需要访问具有代表性的系统、攻击集,以及清晰的成功定义。

在这些证据出现之前,Opus 5 应被视为一项有前景的安全改进,而不应成为移除模型外围防御措施的理由。

模型抵御能力与分层智能体安全

真正的较量并非 Opus 5 与另一款模型之争,而是模型级抵御能力与完整智能体系统复杂性之间的较量。

模型位于更大的架构之中。该架构包括系统指令、检索内容、记忆、工具、权限、应用代码、过滤器和用户确认步骤。

改进模型很重要,因为模型会解释所有这些输入。它决定哪些信息相关,以及哪些看似是指令的内容值得服从。

然而,模型无法仅凭文本可靠地判断每个来源的可信度。恶意指令可以伪装成政策通知、管理员消息或工具结果。

格式化提供的保护有限。攻击者可以把指令隐藏在 HTML、编码文本、图像、文档元数据,或对人类读者看似无关的内容中。

智能体也可能在行动前转换恶意内容。它可能先总结网页,将该摘要保存到记忆中,并在另一项任务中再次检索。

这形成了一条延迟攻击路径。最终的有害行动可能发生在原始内容进入系统很久之后。

近期研究开始考察这一持久性问题。Bad Memory 研究评估了智能体系统中基于记忆的提示注入风险,其中包括 Claude Code 和 OpenAI Codex 的配置。

即使具体模型结果会发生变化,其更广泛的启示仍然重要。记忆可以把一次短暂暴露转化为影响后续会话的持久因素。

模型抵御能力可以中断这条链路。能够可靠识别不可信指令的模型,不太可能保存、重复或将它们用作未来的指导。

应用层控制仍然必不可少,因为识别可能失败。最安全的架构假设:部分恶意内容会绕过每一项单独的防御。

其中一层应将指令与数据分开。另一层应限制模型能够调用哪些工具。权限检查则应限制这些工具可以访问或修改的内容。

高影响操作应要求确认。发送消息、更改账户设置、暴露私有数据或执行陌生代码,都应设置比读取公开信息更强的边界。

开发者还应限制检索系统的输出。检索到的文档可以携带来源信息、信任标签和有限的作用范围,而不是作为未经区分的文本直接进入提示词。

工具需要具备狭窄的接口。负责总结邮件的智能体,不应自动获得转发消息、删除记录或检查无关账户的权限。

日志是另一道关键防线。团队需要能够重建模型看到了哪些内容、有哪些可用的推理信号、它调用了哪些工具,以及之后发生了哪些变化。

部署后也应持续检测。攻击模式会演变,而真实用户会让系统接触到发布前测试无法完全复现的各种组合。

同样的逻辑也适用于个人 AI 工作流。可搜索的第二大脑随着本地文档和会议纪要的积累会变得更有价值,但它同样需要围绕外部内容和自动化操作设置可预测的边界。

一个可搜索的知识库可以让相关工作基于受控来源,从而减少不必要的暴露。这种设计无法消除注入风险,但能够缩小攻击面。

安全团队通常将这种做法称为纵深防御。其原则是:单一控制措施失效不应立即导致系统遭到攻陷。

Opus 5 可能成为尤其有价值的一层,因为模型行为会影响 Agent 循环的每一个阶段。更强的抵抗能力可以减轻过滤器、策略和人工审核人员的负担。

它也可能改善可用性。激进的外部过滤器往往会拦截无害请求,因为它们缺乏区分合法指令与恶意指令所需的上下文。

辨别能力更强的模型或许可以在拒绝攻击的同时,不会拒绝普通文档。这种平衡很重要,因为会干扰日常工作的防御措施,往往会面临被削弱或停用的压力。

因此,Anthropic 必须展示的不只是更低的攻击成功率。买家还需要了解,Opus 5 是否能够避免对合法内容抱有过度怀疑。

把每一条不寻常指令都标记为敌对行为的模型,在某些评估中看起来会很安全。但在真实的编程、研究和支持工作流中,它会令人沮丧。

真正有价值的目标是选择性抵抗。Opus 5 应保留获授权的任务,使用相关外部信息,并仅拒绝试图转移控制权的行为。

这比屏蔽一份恶意短语清单更难。它要求模型能够推理权威性、来源、权限以及用户的原始目标。

Cherny 的说法表明,这个问题或许已有进展。系统层面的证据将决定这种改进能否经受复杂应用场景的考验。

Opus 5 System Card 单独无法证明什么

Anthropic 的评估支持一种方向性的主张,但无法独立证明普遍的抵抗能力或生产环境安全性。

System Card 是由厂商制作的文档。它们提供了有用的透明度,但模型开发者自行选择评估方式、攻击集、部署假设和呈现方式。

这并不意味着这些发现不可信。它意味着读者应将其理解为 Anthropic 报告的证据,而非独立认证。

“极难通过提示注入成功攻击”这一说法也需要明确成功条件。轻微偏离指令,与数据被窃取或未经授权的工具操作并不相同。

攻击严重程度很重要,攻击者可尝试的次数也同样重要。当一个载荷能触及大量 Agent 时,即使成功率很低也可能带来重大风险。

Anthropic Simon 的引述本身并未提供这些细节。读者必须审视 System Card 的方法论、局限性和各项评估设置。

红队覆盖范围也带来另一项不确定性。熟练的测试人员可以发现非常规攻击,但没有任何团队能够代表所有攻击者、语言、文档格式或产品集成方式。

自动化攻击能够提供规模,但它们可能会对已知模式过拟合。人类攻击者会适应防御、组合技术,并利用模型之外的应用行为。

提示注入在不同环境中的表现也不同。纯聊天界面的攻击路径少于具备身份验证、记忆和文件访问能力的浏览器 Agent。

即使底层模型保持不变,工具设计也可能改变结果。宽泛的权限可能将一次轻微的指令遵循失败转化为严重事件。

相反,狭窄的权限能够在相同模型失败发生后防止损害。这使得产品配置与模型安全密不可分。

因此,独立测试应涵盖完整工作流。研究人员应衡量攻击是否会改变规划、触发工具、暴露信息、修改记忆,或延续到后续会话。

他们也应报告误报情况。合法内容中可能含有命令、代码示例、安全警告或引用的攻击文本。

编程 Agent 往往必须检查那些恰恰看起来像攻击的材料。拒绝每一个可疑文件会削弱它的用途。

公开基准也有其局限性。一旦示例进入训练数据,优秀表现可能反映的是熟悉度,而不是普遍防护能力。

评估者需要持续更新攻击样本和隐藏测试集。他们还需要透明的评分方式,让买家理解报告中的改进实际意味着什么。

OWASP GenAI project维护的威胁分类将提示注入视为应用风险,而不仅仅是模型基准问题。这一框架支持采用分层部署控制。

还存在沟通风险。“最不容易被提示注入”可能会在社交媒体帖子和产品营销传播中变成“提示注入已解决”。

Cherny 并未提出这一更宽泛的主张。他的措辞仍是比较性的,并且提及了 Anthropic 的评估和红队测试。

负责任的报道应保留这一边界。Opus 5 即使显著更好,仍可能在评估中未包含的攻击下失败。

最有力的解读是,模型训练已经提高了防御基线。基于 Opus 5 构建的应用,在抵抗能力上可能会比使用早期 Claude 模型的应用拥有更好的起点。

最弱的解读则是,某一套测试偏向了较新的模型。外部复现将有助于区分这两种可能性。

企业在扩大 Agent 权限之前,应要求提供详细证据。有用的问题包括:测试了哪些注入渠道,以及模型是否能够访问敏感工具。

买家还应询问哪些防护措施处于启用状态。纯模型结果不同于由分类器、提示转换、浏览器隔离和策略检查共同产生的结果。

Anthropic 可以通过发布可复现的评估组件来强化这一主张。即使只提供部分测试工件,也能帮助研究人员在一致条件下比较模型。

竞争对手可以通过发布可比结果来强化更广泛的市场。共同的评估实践将使采购阶段更容易评估提示注入抵抗能力。

在此之前,团队不应依据单一安全声明对产品进行排名。相关问题是每个完整系统如何应对组织实际的威胁模型。

将检验 Anthropic 主张的三个信号

Opus 5 的叙事将由独立复现、生产环境表现和竞争对手反应决定。

第一个信号是针对新攻击的独立测试。研究人员需要使用并非由 Anthropic 选择的提示和投递方式来评估 Opus 5。

这些测试应涵盖网站、消息、源代码仓库、文档、图像、工具响应和持久记忆,并区分无害偏差与具有后果的操作。

如果 Opus 5 在这些环境中保持较低的攻击成功率,Cherny 的主张就会获得相当大的分量。如果其表现脱离 Anthropic 的测试套件后迅速崩溃,这一主张就会变得更狭窄。

研究人员应发布足够的方法论以支持比较。报告需要说明 Agent 配置、可用工具、权限模型、攻击预算、防御措施和评分标准。

第二个信号是生产环境经验。Claude Code 用户和企业团队将让 Opus 5 面对实验室评估无法完全模拟的复杂环境。

应关注涉及错误的注入警告、被忽略的合法指令、遭污染的代码仓库、意外工具调用或记忆遭破坏的报告。单个案例无法解决这个问题。

跨多个部署的模式更重要。Anthropic 的响应流程同样重要,包括其调查失败的速度以及更新缓解措施的方式。

强劲的生产记录将支持这样一种观点:模型层面的抵抗能力可以提高日常 Agent 安全性。通过类似渠道反复出现的失败,则会暴露盲区。

第三个信号是竞争对手的反应。OpenAI、Google 和其他模型提供商可以通过自己的提示注入评估和系统级防御作出回应。

可比的披露将把单一厂商主张转化为竞争性的安全类别。这将帮助买家要求可衡量的抵抗能力,而非笼统保证。

沉默同样会传递信息。如果竞争厂商强调 Agent 能力,却不发布敌对内容测试,安全团队可能会将这份缺失的证据视为采购风险。

这些信号应在组织赋予 Agent 更广泛权限之前出现。正确的部署问题并不是 Opus 5 是否看起来比其前代更安全。

而是剩余的失败率是否与失败的后果相匹配。起草摘要的助手,与控制基础设施的 Agent 所带来的风险并不相同。

团队可以在低影响工作流中更快推进,同时对敏感系统维持严格边界。只有在观察到稳定行为和可靠恢复能力后,才能扩大权限。

Anthropic Simon 的讨论最终指出了正确的标准。模型智能很重要,但可靠的控制能力决定了用户能安全委派多少工作。

Cherny 的兴奋可以理解,因为提示注入一直难以通过简单方案解决。模型层面真正的改进将强化建立在其上的每一个应用。

这一主张仍需接受外部压力测试。System Card 提供的是证据,而非免疫力;红队也无法预见每一个生产环境。

未来三个月,首先关注独立攻击结果,其次是部署模式,第三是竞争对手披露。它们共同将表明 Opus 5 改变的是 Agent 安全,还是仅仅改变了其基准叙事。

对开发者而言,眼下的行动很直接:使用源自自身工作流的内容测试 Opus 5。包括代码仓库、消息、文档、记忆以及每一个已启用的工具。

对买家而言,应要求供应商解释模型抵抗能力和应用控制措施。要求明确的权限边界、审计日志、确认步骤和事件处置流程。

对日常 AI 用户而言,应让敏感操作保持可审核。更强的抵抗能力值得关注,但有意义的信任来自可见的控制措施,以及在发布周期之外收集的证据。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page