Tomáš Bruckner 的 LLM 行为指纹技术可通过随机数发现 API 模型调包
Tomáš Bruckner 测试了 165 个 AI 模型,发现 LLM 行为指纹技术只需约 120 个单 token 响应,即可识别可疑的 API 模型替换。
这种方法从一个近乎幼稚的请求开始:说出一个 1 到 100 之间的随机数。然而,模型给出的答案并不随机。GPT-4o 偏爱 42、37 和 57,而 Claude Sonnet 5 的答案高度集中于 47。Qwen3-Max 在 30 次试验中每次都返回 42。
当 API 提供商承诺提供某个模型,却通过不透明的服务链返回响应时,这些偏好便能发挥作用。Bruckner 的实验表明,重复使用低成本提示词可以在不访问权重、logits,也不需要提供商配合的情况下,揭示行为上的不匹配。
这并不意味着单凭一个数字就能确凿证明欺诈。重要的信号在于多个答案、提示词和语言中的分布情况。在这个模型名称往往只是一个未经验证标签的市场中,它为买家提供了一种独立核验手段。
单 token 答案产生了鲜明的模型指纹
该实验将可预测的模型偏差转化为实用的身份信号。
布拉格经济与商业大学的研究员 Bruckner 于 2026 年 7 月 11 日发布了其指纹研究的初始版本。他考察了通过 OpenRouter 提供服务的模型。OpenRouter 是一个将客户与众多模型及上游推理提供商连接起来的聚合平台。
该研究最初纳入了 7 月 6 日获取的 342 个目录条目。研究人员依据既定规则,剔除了专用系统、不稳定别名、重复检查点、非聊天模型,以及强制进行隐藏推理的端点。经过这一流程,最终留下了 165 个模型,涵盖 19 个有文档记录的模型家族和 53 家服务提供商。
每个模型都收到十项简单任务,分别使用英语、俄语、中文和阿拉伯语进行。这 40 个任务—语言组合涵盖随机数字、字母、颜色、动物、城市、单词和抛硬币。
在主要采样配置下,研究人员为每个组合请求了 30 个响应。每条提示词都要求模型给出一个单词的答案,并在端点支持的情况下关闭可选推理。
在完整普查中,研究共收集了 326,047 个响应,涉及 2,330 万个输入 token 和 116 万个输出 token。该实验的设计使每个可见答案都极为简短。
97.6% 的响应有效。模型有效输出率的中位数为 99.6%,不过一些系统更频繁地忽略了指定格式。
随机数结果提供了最直观的例证。GPT-4o 的许多答案分布在 42、37 和 57 之间。Claude Sonnet 5 集中选择 47,而 Llama 3.3 偏爱 53。在论文展示的 30 次英语试验中,Qwen3-Max 每次都选择了 42。
这些选择反映了常见的语言模型行为。模型不会仅仅因为用户提到“随机”一词,就调用安全的随机数生成器。它会根据训练和对齐所塑造的模式,预测可能的文本续写。
人类文化也会影响这些预测。数字 42 有着著名的文学典故,而以 7 结尾的数字往往会让人主观上觉得更随机。此前的受控采样研究发现,语言模型难以可靠地复现目标分布。
Bruckner 的贡献不只是再次证明模型不擅长掷骰子。他将每一种反复出现的偏差视为有关生成该偏差之系统的证据。
单个答案几乎毫无意义。三十次相同或分布相近的尝试便开始显现规律。结合多个分布,可以构建出更完整的行为画像,并将其与可信参考进行比较。
该研究将每个任务—语言配对称为一个探针单元。指纹由这些单元中的经验答案分布构成,而不是任何一个单独的高频答案。
这一区别对于标题中的主张至关重要。随机数提示词提供了最令人印象深刻的例子,但单独一个数字无法可靠地识别模型。真正可用的方法依赖重复采样和更广泛的测试组合。
LLM 行为指纹技术为何会对 API 转售商构成压力
模型买家通常只会得到一个模型名称和一个答案,却没有直接证据证明二者确实相关。
第一方开发者可以通过自己的 API 提供模型。聚合平台随后可能通过多个上游提供商路由请求,而每个提供商使用的硬件、服务软件或模型变体都可能不同。
聚合平台与最终应用之间还可能存在更多转售商。每增加一层,采购都会变得更加便利,但客户对服务栈的可见性也会随之降低。
不诚信的运营商有多种替换方式。它可以将流量路由至更小的检查点、使用更旧的版本,或提供经过激进量化的模型。量化通过降低数值精度来减少资源需求,有时会改变输出行为。
运营商可以在响应元数据中保留对外宣称的模型标识符。即使底层模型已经改变,检查普通 API 日志的客户也可能看不出任何异常。
这在提供商的声明与可观察到的服务之间制造了尖锐的商业矛盾。买家为特定名称模型的预期行为付费,却通常无法检查其权重或部署配置。
模型替换并非纯粹的理论威胁。此前一项经过同行评审的模型一致性审计发现,在 31 个宣称提供 Llama 模型的商业端点中,有 11 个在统计上与参考部署存在差异。
该结果并未证明每种情况都存在恶意。配置差异、量化、版本漂移和服务变更都可能造成偏差。不过,它表明对外宣称的标签并不总能代表与参考模型等效的服务。
新方法降低了检测这些偏差的操作门槛。现有测试可能需要完整的生成段落、访问 token 概率,或使用经过特殊设计的提示词。
Bruckner 的探针只要求给出普通而极短的答案。它们可以用于纯文本 API,也不要求模型所有者预先嵌入水印。
这对于管理多个端点的开发者十分重要。团队可以从可信的第一方部署中登记一个指纹,然后定期将中间商的响应与该基线进行比较。
该测试也可以与生产监控同时运行。运营方无需等到用户报告模糊的质量下降,而是能在路由变更后不久检测出统计漂移。
对企业买家而言,该问题的影响远超基准测试分数。被替换的模型可能改变工具选择、格式一致性、安全拒答或指令遵循。这些变化即使在日常聊天响应看似正常时,也可能扰乱工作流程。
它们还可能破坏内部评估的有效性。团队可能批准了一个检查点,却在部署过程中不知不觉地运行了另一个。其原有的安全性和可靠性测试将无法再准确描述生产系统。
因此,LLM 行为指纹技术会迫使转售商提高服务细节的透明度。轮换部署的提供商可能需要披露这些变化,或发布独立验证结果。
它也会给模型开发者带来压力。只有当客户拥有稳定的参考端点和清晰的版本标识符时,外部审计系统才能区分未经授权的替换和获得授权的更新。
这种方法并没有消除信任。它只是将部分信任从提供商的标签转移到可重复、由客户掌控的测量结果上。
指纹存在于分布中,而非某个神奇数字中
其核心机制是测量每个答案出现的频率,然后将这一模式与可信模型的模式进行比较。
语言模型会为可能的下一个 token 分配概率。训练数据、分词方式、偏好调优和解码规则都会影响这些概率。
要求给出一种随机颜色时,一个模型可能偏爱“蓝色”,另一个则可能偏爱“红色”。随机城市提示词可能会以不同频率反复生成巴黎、东京或伦敦。
这些偏差并非开发者有意植入的独特秘密,而是模型构建过程留下的行为残余。Bruckner 的技术会聚合这些残余,直到它们变得可以测量。
论文使用 Jensen-Shannon 散度来比较答案分布。这是一种有界统计度量,能以对称方式衡量两个概率分布之间的差异程度。
散度越低,表明响应模式越相似。散度越高,则说明两组答案可能源自不同的行为分布。
同一模型的两组独立样本,其单元级散度中位数为 0.075。来自不同模型的样本中位数为 0.489。这一差距足以支持通过完整测试组合进行身份验证。
这些分布明显不均匀。在 6,572 个可用单元中,熵的中位数为 1.00 比特,最常见答案所占比例的中位数达到 71%。
从 100 个数字中进行真正的均匀选择,其熵应接近 6.64 比特。模型远低于这一水平的结果表明,其答案高度集中于少数几个偏好选项。
这种集中性使测量具有经济可行性。如果每个模型都进行均匀采样,那么除非发起海量请求,否则答案几乎无法揭示其身份。
模型特有的峰值构成了信号。通过重复采样,可以估计这些峰值所在的位置及其主导程度。
更广泛的测试组合也避免了该方法完全依赖 42 或其他文化典故。使用四种语言完成十项任务,可以探测训练和后训练行为的不同侧面。
语言差异可能揭示不同的分词和语料库效应。即使询问的是同一概念,任务的中文版也可能产生不同于英文版的分布。
因此,该指纹包含了对模型的 40 个相关视角。替代模型必须匹配的不仅是某个著名答案,而是完整的模式。
该研究还测试了模型家族归类。最近邻分类器以 59.5% 的准确率将未见过的模型归入其文档记录的家族,而按频率加权的随机准确率仅为 18.4%。
不同家族的表现各异。GPT 模型的召回率达到 90%,GLM 模型达到 83%。Claude 的召回率为 58%,Gemini 则为 55%。
这些数字有一定参考价值,但也存在局限。验证任务询问某个端点是否与特定的已登记参考模型匹配。家族归类则要回答一个更困难的问题:一个未知模型属于哪个家族。
第一项任务对 API 审计具有直接价值。第二项任务可以提供调查线索,但无法对每个模型谱系都实现可靠识别。
其他研究采取了不同路径。LLMmap 使用经过设计的查询来区分模型版本,并报告了在 42 个模型上的出色结果。其 USENIX 论文展示了经过精心选择的提示词如何提取具有高度区分力的行为。
Bruckner 以单次查询的独特性换取不引人注意的重复。随机颜色、数字和城市比一组固定且不同寻常的审计字符串更像普通流量。
这种权衡正是该方法的吸引力所在。它不如完美的身份预言机准确,但更容易针对仅开放常规聊天端点的提供商部署。
约 120 次查询将错误率降至 10.6%
这项研究最具实践意义的结果,是测得了查询量与验证错误之间的关系。
评估将验证视为生物识别检查。一组样本用于注册参考身份,另一组样本则用于测试所声明的端点是否与之匹配。
真实试验比较同一模型响应的不同半组。冒充者试验则比较属于不同模型的半组。
阈值可能会拒绝真实端点,也可能接受冒充者。等错误率(EER)表示这两种错误率相等时的数值。
使用一个随机选择的探测单元时,EER 为 23.3%。四个单元将其降至 13.2%,八个单元则达到 10.6%。
在拆分样本评估中,每个单元重复 15 次。因此,八个单元需要约 120 次单 token 查询。
十六个单元将 EER 降至 9.5%。使用 32 个单元时为 8.4%,完整的 40 单元测试组则达到 7.3%。
在约 16 至 24 个单元后,改进幅度趋于平缓。这让运营方可以在频繁的轻量检查与频率较低、范围更广的审计之间作出务实选择。
10.6% 的 EER 不足以支持自动作出欺诈判定。约十分之一的错误仍不可忽视,尤其是在后续可能导致账户停用或合同执行的情况下。
但它仍可用作警报。团队通常会使用带有噪声的信号来触发更深入的调查,前提是不把每次警报都视为最终证据。
如果一个端点在多次独立审计中反复失败,就值得进一步检查。客户可以重新运行测试组、比较另一个可信部署,并检查质量或延迟变化。
与其他证据结合时,该方法可能会更强。token 使用量、延迟分布、基准任务、提供商元数据以及合同部署记录,都可以支持或质疑指纹识别结果。
Bruckner 对生态系统的研究结果表明了这种分层方法为何重要。在由不同提供商提供同一命名模型的 34 对端点中,有十对的差异超出了研究规定的冒充者边界。
最极端的一对是分别通过 Cloudflare 和 Parasail 提供的 Llama 3.2 3B Instruct。其跨提供商距离达到 0.716,使这对端点深入落入冒充者区间。
即使是 GPT-4,在 Azure 与 OpenAI 第一方部署之间也存在差异,报告距离为 0.392。不同的服务技术栈可能产生显著差异,但这并不能证明任一提供商有意替换了模型。
在所有可比较的配对中,跨提供商距离的中位数为 0.227。该数值高于单一部署的噪声基线,但低于冒充者距离 0.463 的中位数。
换言之,提供商选择通常对指纹造成的影响小于更换模型。然而,例外情况的差异足够大,足以使自动执法变得复杂。
论文还发现了一个格外引人注目的异常。Writer 的 Palmyra X5 端点生成的指纹与 Qwen3 235B A22B 2507 仅相距 0.141。
该距离与同一模型真实样本之间的距离中位数相同。论文称,在其测量方法下,这两个服务分布在统计上无法区分。
这并不能证明 Writer 有意虚假陈述其模型。相似的训练谱系、经授权的技术使用、后训练选择或未公开的服务安排,都可能产生相关行为。
作者明确将此类发现描述为统计偏差,而非欺诈指控。原始数据和服务元数据已经发布,以便受影响的组织对结果提出异议或作出澄清。
所有实际应用都应遵循这种谨慎态度。LLM 行为指纹识别可以发现值得调查的理由,但无法独立确定主观意图、合同违约或服务器上实际运行的确切权重。
模型更新和具备适应能力的提供商仍是主要限制
行为指纹是一个不断变化的统计参考,而非永久性的序列号。
模型会发生变化。供应商会更新安全层、系统提示词、tokenizer、推理设置和路由策略。即使是合法更新,也可能使答案分布偏离旧有基线。
因此,参考注册必须定期刷新。论文测量了短期稳定性,但并未确定指纹在数月时间跨度内的表现。
审计方还需要一个可信的所声明模型部署。没有这一参考,他们可以将端点与公共数据库比较,但无法保证配置等效。
这一限制对于闭源模型尤为重要。客户无法检查权重,而模型系列标签依赖供应商文档。
强制推理带来了另一个缺口。当前一些模型会先执行隐藏或可见的推理过程,然后才返回所要求的词语。
如果无法禁用推理,研究便会排除相关端点。其最终答案来自与该方法定义的直接单 token 采样不同的生成过程。
一些端点还会忽略禁用推理的请求。实验排除了 14 种模型与提供商组合中受影响的 2,486 条响应,占普查总量的 0.76%。
据报告,其他旗舰端点虽然只显示一个词,却消耗了 40 至 60 个补全 token。隐藏计算使研究人员无法确认可见答案是否代表直接采样。
提供商也可能识别已公开的审计提示词。它可能将这些请求路由到真实模型,同时在处理普通流量时替换成另一个系统。
论文通过释义、不同语言和普通语义任务来应对这一问题。审计方可以用多种方式表达“说出一种随机颜色”,并将探测请求混入真实流量。
不过,该研究将专门的释义不变性实验留待未来开展。它尚未证明提示词在发生多大变化后,参考指纹会失去可比性。
复杂的提供商可能会学习识别潜在的探测类别,而非精确措辞。它可以将随机数字、颜色、城市和抛硬币作为一组进行特殊处理。
扩大测试组会增加提供商规避的难度,但也需要新的参考数据和更谨慎的校准。
服务层的响应缓存也可能制造出表面上的指纹。反复播放同一条已存储答案,会人为压缩输出分布。
研究检查了延迟和使用量元数据,以寻找响应级缓存的证据。尽管部分流量中出现了提示词前缀缓存,但在整个普查范围内并未发现令人信服的响应级缓存特征。
大量后训练同样可能抹去模型系列线索。Nvidia 的 Llama 3.3 Nemotron 衍生模型与 Qwen 模型的距离,比它与任何受测 Llama 检查点的距离都更近。
这一结果并不会使特定模型验证失效,但它确实表明,在大量额外训练后,行为谱系与文档所述的模型血统可能发生分歧。
该研究也只涵盖了一个聚合平台。协议本身并不依赖 OpenRouter,但其生态系统研究结果可能无法代表其他市场平台或直接转售商。
最后,这篇论文目前仍是 2026 年 7 月发布的 arXiv 预印本。其公开材料支持复现,但独立团队仍需跨时间、供应商及不断变化的模型世代测试该协议。
这些限制并不意味着这项技术毫无用处。它们界定了监测工具与密码学保证之间的差异。
基于硬件的证明可以为已部署的代码和权重提供更有力的证据。另一项替换分析主张建设此类基础设施,因为普通的输出检查仍容易受到非确定性和适应性行为的影响。
行为检查处于另一个层面。它们可以立即针对普通 API 部署,而更强的证明则需要提供商和基础设施运营商的配合。
最可信的未来系统很可能会将两者结合起来。证明机制可以验证经授权的部署,而行为监测可以检测漂移、路由错误或实际响应中无法解释的变化。
API 客户接下来应关注什么
三个信号将决定这项研究是成为实用的审计标准,还是仅停留在引人入胜的实验室成果层面。
第一个信号是独立复现。其他研究人员需要注册可信的第一方模型、审计不同提供商,并复现论文所报告的错误曲线。
复现研究应涵盖 OpenRouter 之外的端点,还应跨越数月时间,在供应商更新和推理基础设施变化的情况下测量指纹。
如果同一模型与自身的测量距离始终小于它与替代模型的距离,人们对其常规部署的信心将会上升。频繁出现且无法解释的漂移则会削弱该方法的实际应用价值。
第二个信号是提供商的响应。聚合平台和转售商可以公布部署标识符、量化详情、上游路由记录和版本变更通知。
它们还可以提供客户可见的证明或参考指纹。此类披露有助于区分经批准的服务差异与未经披露的替换。
缺乏透明度会让第三方测量变得更加重要。反之,清晰的路由记录可能无需统计推断,就能解释许多异常。
第三个信号是抵御适应性规避的能力。未来测试应在保持分布可比的同时,随机调整任务措辞、语言、时间和探测类别。
研究人员应测量模型在面对注册期间从未见过的释义时,能否保留可识别的指纹。他们还应测试会主动尝试识别审计的提供商。
如果成功,将加强论文的核心主张。如果失败,则表明公开的行为检查主要只能应对粗疏的模型替换。
团队无需等到正式标准出台,便可改进自身监测。他们可以保留模型版本元数据、归档有代表性的输出,并在出现无法解释的行为变化后重新运行评估。
知识密集型工作流尤其需要这类历史记录。模型漂移可能会改变摘要、项目建议、研究综合和既有决策的检索,而不产生明显的服务中断。
结构化的 AI 知识库可以保存重要模型辅助工作中的提示词、源文档、输出和审核注释。这些记录有助于团队调查端点变化是否影响了实际决策。
核心结论很简单,但比广为流传的说法更为有限。一个随机数字无法揭示 AI 模型的身份,而微小答案的重复分布,则可以在 API 的行为与其所声明的参考模型不一致时,提供实用且成本低廉的预警。
对于开发者和企业买家而言,下一步并不是在看到 42 后就指控提供商,而是建立可信基线、开展定期审计,并结合多种证据调查持续存在的偏差。



