top of page

Anthropic、OpenAI 和 Google 尽管加密仍面临 AI 推理轨迹窃取问题

尽管对隐藏的模型思维进行了加密,Anthropic、OpenAI 和 Google 仍面临共同的安全失效。研究人员发现,AI 推理轨迹可在不同模型、会话和用户之间被窃取。

这次攻击并非通过窃取密钥或传统密码分析来破解加密。攻击者转而通过一个能够在内部读取明文的较弱模型,重放有效的加密轨迹。随后,越狱提示会迫使该模型泄露其解码的内容。

这种区别使这项研究不只是又一次提示注入演示。各家提供商虽保护了每个推理数据块不被直接查看,却允许兼容模型处理来自无关上下文的数据块。加密隐藏了数据,却未能可靠地将其绑定至原始模型、用户或对话。

研究人员称,他们从公开 agent 日志中发现的加密数据块里恢复了凭证和个人信息。他们还演示了模型提取、有害内容暴露以及不可见的提示注入。

据研究团队称,受影响的提供商确认已收到相关披露。文档记录的攻击据称在提供商收紧验证后不再能够复现。不过,这一事件揭示了一个更大的问题:开发者在围绕可移植、不透明的模型状态构建 agent 时,将面临潜在风险。

AI 推理轨迹窃取利用了可移植的模型状态

关键失效不在于加密强度不足,而在于对有效加密数据块可流转范围给予了过度信任。

推理模型通常会在给出可见答案前,先进行内部的逐步计算。提供商一般会隐藏这类思维链,且可能只提供摘要。这一策略既保护模型知识产权,也限制对敏感或有害内部内容的直接访问。

无状态 API 带来了工程上的复杂性。当客户禁用存储或自行管理历史记录时,提供商无法依赖永久保留在服务器端的对话记录。客户端必须返还足够的状态,模型才能延续此前的工作。

OpenAI 在推出加密推理项时曾公开说明这一设计。符合条件的客户可以在请求间携带推理内容,而无需将这些内容存储在 OpenAI 服务器上。复用这些内容的目的也是在减少重复计算的同时保留推理能力。

Google 通过思维签名记录了类似机制。这些机制是内部思维的加密表示,可在多步骤交互中保留推理上下文。使用原始 REST 请求的开发者可能需要原样返还这些内容。

这些设计使加密推理数据块成为可操作对象,而非被动密文。提供商接收数据块、验证并解密它,然后将恢复的内容置入模型上下文。模型随后便可从此前状态继续执行任务。

研究团队发现,获接受的数据块未被充分限制在其原始上下文中。在测试系统内,一个会话生成的数据块可以在同一提供商模型生态的其他位置被接受。

这种兼容性为绕过最强模型防护创造了路径。攻击者可以从前沿模型获取加密轨迹,再将其提供给拒绝行为较弱的低价同系模型。

该同系模型成为安全研究人员所称的解密预言机。它无法泄露提供商的加密密钥,却能处理加密内容并输出所得明文。

因此,这次攻击结合了两项单独看似合理的特性。首先,加密状态必须足够可移植,以支持无状态对话。其次,兼容模型需要访问此前推理,才能继续完成任务。

两者结合后,攻击者便可将受保护的推理跨越安全边界转移。攻击者从未需要越狱生成该轨迹的更强模型。

根据完整论文,研究人员在 Anthropic、OpenAI 和 Google API 上演示了这一方法。他们瞄准的是多个专有模型家族共有的架构模式,而非某个孤立端点。

这也是为什么 AI 推理轨迹安全不能止步于选择强加密算法。系统还必须验证数据块所对应的目标模型、会话、账户及其在对话中的位置。

如果每位员工都能让一位经过授权但易受操纵的同事把密封文件朗读出来,这份文件依然危险。加密本身有效,但周边的授权模型失效了。

更弱的同系模型成为解密路径

同一模型家族中不均衡的防护措施,使兼容性变成了权限升级路径。

前沿模型接受了广泛训练,以避免泄露隐藏推理。提供商希望用户看到答案、摘要和工具结果,而非获得原始思维链。这些限制也会阻碍试图获取高质量训练数据的竞争者。

较小模型受到不同约束。它们优先考虑速度、可用性和效率,而其抵御特定越狱手法的能力可能与旗舰系统不同。

研究人员利用了这一差距。他们先用更强的源模型生成加密推理数据块,将其移入另一项请求,再指示一个较弱的兼容模型转录底层推理。

源模型的拒绝训练依然完好。它从未收到提取提示。即使监控聚焦于该前沿端点,也未必会发现可疑的解码交互。

研究团队针对每个测试模型配置,评估了 120 道 Codeforces 编程题。他们将源模型报告的思维 token 数,与解码后恢复的 token 数进行比较。

根据研究人员的披露说明,三家提供商的中位数比率均为 1.00。在 82% 至 89% 的轨迹中,恢复长度与原始报告长度相差不超过 5%。

这些测量结果表明恢复程度广泛,但需要谨慎解读。开发者通常无法查看隐藏的原始内容,因此 token 数量一致并不等同于与真实内容进行逐字符直接比较。

研究人员将提供商报告的推理长度作为实用特征。恢复轨迹若具有几乎相同的长度,尤其是在内容与任务相符且能连贯延续时,可构成有力证据。

不过,这一结果不应被描述为对每个恢复词语的独立密码学验证。在将安全预印本研究转化为运营结论时,这一区别至关重要。

即便存在这一限制,该攻击仍改变了模型提取的经济性。最终答案只提供模型产出结果的样本。推理轨迹则暴露出更丰富的中间选择、修正、计划和被放弃的方法序列。

这些材料可成为蒸馏训练数据,即一个模型从另一个模型的输出中学习行为。因此,提供商将隐藏推理视为有价值的知识产权。

论文称,解码后的轨迹包含的推理内容约为向客户端提供摘要的五倍。收集这些轨迹的竞争者将获得比仅收集答案更密集的信号。

该方法还将生成成本与提取成本分离。可能已有其他人为前沿模型在公开会话日志中生成推理付费。攻击者只需通过更廉价的兼容端点解码既有数据块。

这并不意味着任何外部人士都能解密任意服务器流量。攻击者仍需获得有效的加密数据块。公开日志、共享轨迹、缓存会话和暴露的应用历史记录可提供这类材料。

因此,受影响范围不仅限于模型供应商。开发者一直被鼓励保留完整响应对象,以确保工具调用和多轮推理能正确延续。

这种常规集成模式可能保留开发者和用户都无法查看的不透明内容。若攻击者发现兼容的解码路径,同样的内容日后便可能变得有价值。

眼下的教训属于架构层面。安全团队必须评估每个能够消费受保护状态的模型,包括更廉价的同系模型和旧版端点。最强生产模型的防护措施,并不能定义整个模型家族的安全性。

加密保护了提供商 IP,却隐藏了用户暴露风险

这一设计优先保护机密推理,却使用户无法审计自己的日志中包含了什么。

当开发者审查对话记录时,不透明的推理数据块看起来很安全。一长串编码字符不会明显暴露密码、私有文档或访问 token。因此,传统脱敏流程可能不会触及该数据块。

然而,模型的隐藏推理可能会重述其上下文中的信息。它可能在规划部署时列出凭证,在处理预订任务时重复个人信息,或在撰写已脱敏答案前引用检索到的文档。

可见响应可以保持干净。加密轨迹仍可能保留敏感材料,因为模型在决定说什么或做什么时使用了这些内容。

此前的隐私研究已挑战了内部推理是安全私有工作空间的假设。该研究发现,即便最终答案变得更谨慎,更长的推理仍可能增加敏感数据暴露。

这项新攻击将该内容风险与可移植加密状态联系起来。用户无法查看或脱敏的轨迹,可通过另一个模型被恢复。

研究人员从 6,708 条公开可用的 agent 轨迹中收集了 315,320 个加密推理数据块。解码后,他们分类出 367 项个人可识别信息痕迹和 182 项凭证。

凭证集包括 62 个 API 密钥和 33 个密码。对真实用户会话进行的更广泛扫描共发现 704 项痕迹,其中 64 项据称未出现在可见历史记录的任何位置。

这些数量描述的是研究样本,而非整个公开互联网。它们并不能证明有多少凭证仍然有效、每项内容是否都唯一,或有多少所有者遭到了利用。

但它们仍展示了一种具体的泄露模式。公开对话记录可能携带发布者实际上无法审查的信息。

这种情况颠倒了一项熟悉的安全承诺。加密通常帮助数据所有者限制可读取其信息的对象。这里,加密也阻止用户发现模型究竟保留了哪些关于他们的信息。

只有提供商能通过其 API 基础设施解密轨迹。在重放攻击出现之前,用户只能相信不透明数据块中不含任何他们会后悔分享的内容。

这种不对称性对部署编码 agent 的公司构成了最直接的压力。编码 agent 在完成任务时,可能会检查环境文件、部署配置、数据库地址和代码库机密。

团队常常会归档智能体历史记录,用于调试、评估或协作。研究人员也会发布轨迹记录,以比较智能体性能或复现实验。

组织可能会在发布前清理可见的提示词和输出内容。但除非组织能够解密并扫描,否则这一过程无法移除嵌入在密文中的机密信息。

研究人员所描述的最安全的即时应对措施,是在共享历史记录转录稿前移除加密推理块。这一选择可能降低可复现性,或导致恢复后的对话无法保留原有推理状态。

因此,开发者面临着真实的权衡。保留该区块有助于维持连续性,而删除它则能限制一种不透明的信息泄露通道。

即使可见文本看似无害,组织也应将智能体历史记录视为敏感档案。日志应具备访问控制、保留期限、密钥扫描机制,以及明确规范对外发布的规则。

一个可搜索的知识库可以帮助工程团队整理已获批准的技术上下文。它不应沦为无法审查的模型状态对象的堆放场。

关键的运营问题不再是转录稿是否明显包含机密。团队必须追问:智能体是否访问过敏感数据,以及其导出的状态是否可能以不可见的方式保留了这些数据。

隐藏推理也成为提示注入通道

使提取成为可能的同一种可移植性,也可能将不可见的指令带入另一个智能体的可信上下文。

提示注入通常通过模型读取的内容进入。恶意网页、文档、电子邮件或工具结果会指示模型忽略自身任务,转而执行攻击者的目标。

防御方有时可以检查这些内容。他们可以过滤可疑文本、隔离不受信任的来源、限制工具权限,或要求用户批准具有实质影响的操作。

加密推理块改变了可见性问题。客户端看到的是不透明字符串,而模型则将明文作为其先前推理上下文的一部分接收。

研究人员创建了一个概念验证,其中恶意指令被嵌入此类区块中。当另一个会话恢复该轨迹时,模型将该指令视为自身先前的推理。

这种位置可能赋予载荷异常强的影响力。模型通常依赖先前推理来维持计划、记住中间结果,并决定下一步采取何种工具操作。

在报告的演示中,一项无关请求要求编写用于编辑演示文稿的代码。隐藏指令导致生成的脚本包含了额外的数据传输行为。

该载荷无需出现在可见对话中。仅检查提示词、工具输出和最终答案的审阅者,可能会错过恶意行为的来源。

这种攻击不同于窃取 AI 推理轨迹以进行模型蒸馏。提取是读取机密状态;投毒则是通过接收方无法检查的状态写入或传输敌对目标。

两者都依赖于同一条失效的边界。来自一个上下文的推理块不应自动成为另一个上下文中的可信推理。

这一场景对于交换、缓存或发布完整轨迹的智能体系统尤为重要。团队越来越多地将保存的会话用于评估、演示、调试,以及自动化工作者之间的交接。

一个用户导出的会话可能被另一位用户恢复。某个智能体框架可能会针对多个模型重放记录的历史。某个基准测试可能会分发参与者视为惰性测试数据的轨迹。

如果加密推理随这些工件一同传递,接收者就无法独立验证其内容。他们必须依赖提供商的验证,以及生成该区块的系统的完整性。

仅靠输出过滤并不足够。过滤器或许能检测到可疑的最终命令,但无法解释模型为何选择该命令。微妙的载荷还可能产生在请求任务范围内看似合理的行为。

工具权限仍然是更强的边界。无法传输文件、读取生产凭证或执行任意代码的智能体,能将隐藏指令转化为损害的途径更少。

如果人工审批覆盖实际副作用,同样会有所帮助。审批界面应展示目标地址、文件、命令和变更后的权限,而不应仅展示模型撰写的摘要。

推理监控面临更复杂的挑战。提供商之所以隐藏原始思维链,部分原因是公开它可能暴露知识产权、敏感数据或具有误导性的内部推测。

客户仍需要证据证明某项工具操作遵循其指令。这一要求更适合通过可检查的行动计划、结构化工具请求、来源记录,以及隐藏推理之外的策略检查来满足。

该研究并未证明每一条加密轨迹都仍可携带不可见注入。提供商据称在披露后修改了验证机制,文档所述攻击已无法复现。

不过,智能体开发者不应因为不透明状态由提供商生成,就假设它是安全的。任何会影响未来模型行为的可移植对象,都应像可执行状态或序列化状态一样受到审视。

协同修复缩小了攻击面,但未终结设计争论

报告中的漏洞已在很大程度上得到缓解,但无状态隐私与上下文绑定之间的张力依然存在。

研究人员表示,他们在发表前向 Anthropic、OpenAI、Google、Microsoft 和 Hugging Face 披露了研究发现。该团队称,每一家受影响的提供商都确认收到了报告。

截至 8 月 10 日的发表日期,所述提取攻击据称已无法针对测试 API 复现。研究人员将这一变化归因于更严格的推理块验证。

一项核心缓解措施是上下文绑定。提供商可以在密码学上将一个区块与其原始账户、会话、模型和对话位置的相关信息关联起来。

这种绑定改变了成功认证的含义。一个有效区块不再仅意味着提供商创建了它,且无人篡改其密文。

它还意味着当前请求与获准使用该区块的环境相匹配。将区块转移到能力较弱的同系模型或无关会话时,验证将会失败。

密码学工程师 Matthew Green 在完整攻击出现前便探讨过可移植性问题。他在 5 月 29 日发布的推理分析中,研究了为何不透明思维数据会通过客户端管理的 API 历史记录传递。

后续研究将这一架构观察转化为实际的提取和投毒演示。这一过程表明,好奇的互操作性测试为何能够发现正式 API 描述中缺失的安全边界。

上下文绑定本身也会带来权衡。客户可能确实希望在兼容模型间迁移对话、分叉会话、重放基准测试,或在无需提供商端存储的情况下恢复工作。

将每个区块严格锁定到一条请求链,可能会干扰这些工作流。提供商需要提供明确、可审计的授权转移机制,而非依赖通用兼容性。

密钥轮换和版本变更也需要谨慎处理。与某个端点绑定得过窄的区块,可能会在模型升级后无法使用,从而增加长期运行的智能体和已存储工作流的复杂性。

提供商可以提供范围受限的转移令牌或受控重加密。这类机制应保留清晰记录,说明谁授权了转移,以及哪个目标可以使用该状态。

即使存在密码学绑定,模型层面的保障措施仍然必不可少。获准使用的模型不应仅因为周边封装验证正确,就可以自由复现原始隐藏推理。

同样,加密无法移除模型在内部生成的敏感内容。它只能控制这些内容能够流向何处,以及哪些系统可以处理它。

这意味着修复包含多个层面。提供商必须限制可移植性、加固所有兼容解码器、监控异常重放模式,并尽量减少推理中的机密信息。

客户必须管理转录稿暴露风险、限制智能体权限,并避免将隐藏状态视为无害元数据。任何一方都无法将整个问题完全交给另一方处理。

怀疑论者的观点很直接。关于修复效果的公开证据主要来自研究人员,他们称攻击在披露后已无法复现。

这很有意义,但外部人士无法全面审计专有验证逻辑。提供商未必已发布关于修复措施或其如何处理历史区块的完全一致的技术说明。

因此,客户不应宣称该问题已被永久解决。未来的模型、兼容性桥接层、旧版 API 或迁移功能,都可能重新开启类似的跨上下文路径。

AI 推理轨迹安全依赖于一项持续不变的原则:只有预期的主体和模型应使用每个受保护的状态对象。每一项新的互操作性功能都必须维护这条规则。

三个信号将显示修复是否有效

下一项考验在于,提供商能否保留有用的模型连续性,同时不再重建普遍且不可见的信任。

第一个信号是对推理块作用域更严格的公开文档。开发者需要知道,一个区块是否绑定到账户、项目、模型家族、精确模型、会话或请求序列。

清晰的验证错误将增强信心。被移出授权上下文的区块应可预测地失败,而不是被悄然接受或降级处理。

文档还应说明受支持的迁移路径。如果提供商允许切换模型,就应描述授权边界,而非让开发者通过实验自行推断。

缺少此类指导会削弱安全论证。客户无法围绕未被记录的可移植性制定安全的保留和共享策略。

第二个信号是对新发布与旧版模型进行独立复测。安全研究人员应测试,强模型的轨迹是否仍无法通过较小的同系模型、预览端点、区域部署和兼容层使用。

如果修复覆盖了当前旗舰路径,却遗漏了旧版解码器,核心失败就仍然存在。模型家族变化频繁,安全行为也可能因版本而异。

独立确认还将澄清保真度问题。研究人员需要采用受控方法,将恢复的内容与已知明文或经过仪器化的测试系统进行比较,而不能只看令牌数量是否一致。

持续无法跨上下文重放轨迹,将强化所报告的修复效果。新的提取结果则会表明区块验证仍然碎片化。

第三个信号是智能体平台如何处理历史记录和共享转录稿。成熟产品应从导出内容中移除不需要的加密状态,在用户分享前发出警告,并将可恢复会话与发布格式分离。

安全控制应默认将不透明推理视为敏感信息。即使导出工具无法显示其明文,也应将保留状态明确标示为一类风险。

当暴露的智能体历史记录涉及生产环境机密时,组织还应轮换凭证。移除公开日志并不能证明此前没有人复制过其中的加密区块。

对当下的开发者而言,务实的应对始于盘点。明确哪些系统会保留完整的模型响应、这些响应记录在哪里,以及谁有权下载它们。

随后,应将运营连续性与长期记录区分开来。活跃中的智能体可能需要受保护的推理状态,而审计归档可能只需保存提示词、工具调用、输出结果和结构化决策摘要。

不要让模型凭据出现在不必要的上下文中。按最小权限原则限制工具权限,隔离敏感环境,并对外部传输或破坏性命令要求审批。

最重要的是,不要把加密视为可移植对象已获得正确授权的证明。加密回答的是:在特定密钥条件下,谁可以读取或修改数据。它并不会自动回答这些数据应归属于何处。

“Stealing AI Reasoning Traces”事件暴露了三大主要服务商生态系统中缺失的这一关键区分。据报道,直接攻击已被封堵,但这一架构层面的教训将比任何一代模型都更长久。

今后,只要 AI 平台返回不透明状态,开发者都应提出一个更难的问题:当这个对象被重新带回系统时,它能够授权哪些身份、模型和未来操作?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page