TRM Labs AI 代理支付研究发现:x402 的自主性叙事领先于现实
TRM Labs 分析了 1.989 亿笔 x402 结算,发现支付活动与实际 AI 自主性之间存在明显冲突。其 AI 代理支付研究估计,按价值计算,代理仅产生了经筛选商业活动中的 0.6% 至 7.5%。
这一区间挑战了代理式商业最具吸引力的叙事之一。区块链能够证明软件发起了一笔支付,却无法证明 AI 模型是否选择了商家、评估了替代方案,或独立采取了行动。
这一差异至关重要,因为 Coinbase、Amazon、Google、OpenAI、Stripe 和主要支付网络都在围绕机器发起的交易建设基础设施。它们的支付通道正日益成熟。但自主代理是否正以具有实际商业意义的规模使用这些通道,相关证据仍薄弱得多。
TRM 的发现并不意味着代理式商业已经失败。它们表明,基础设施采用、自动化支付量和智能经济活动是三种不同的衡量指标。将它们视为可互换的概念,会扭曲市场图景。
TRM Labs AI 代理支付研究将 headline 交易量削减一半
TRM 最重要的发现并非 x402 缺乏活动,而是其中大量活动不能被视为普通商业行为。
这家区块链情报公司审查了 Base、Solana 和 Polygon 上已知的 x402 facilitator。这些 facilitator 负责验证已签名的支付授权、广播结算交易并承担区块链网络手续费。
自 2025 年 5 月以来,该数据集包含约 1.989 亿笔结算,总额约为 5,270 万美元。乍看之下,这些数据展现出一个交易频率可观、已经成形的机器支付网络。
随后,TRM 对数据进行了筛选,剔除看似并非真实商业活动的交易。其筛选条件排除了向自身地址付款的行为、由一两个付款方主导的大额批量流,以及买家不足十个独立地址的卖家。
这些排除项将可能属于商业活动的资金池缩减至 2,562 万美元。换言之,在 TRM 甚至尚未尝试判断是否涉及 AI 代理之前,约一半的观测价值已经消失。
完整的链上分析解释了为何这第一层筛选必不可少。定时流程、压力测试、自我交易、代币活动和普通软件都可能生成有效的 x402 结算。
因此,一笔技术上成功的支付只能回答一个狭窄的问题:它确认某个地址按照协议规则授权了一笔转账。它无法证明谁控制了该地址,或这笔支付为何发生。
在识别出可能的商业活动后,TRM 面临了更棘手的归因问题。AI 代理与传统脚本可以遵循完全相同的支付序列。它们在公开区块链上的交易看起来可能毫无差别。
该公司通过两种模型应对这一不确定性。宽松模型将由 facilitator 广播、金额可变且平均低于一美元的支付计入其中。
严格模型则要求这些模式在多个月内持续出现,还要求存在公开的代理注册信息,或向不止一个卖家付款。
将这些测试应用于经筛选的商业资金池后,得出了 0.6% 至 7.5% 的估计结果。这一宽泛区间反映的是分类方法的不确定性,而非对每一名代理的精确普查。
这一限定是报道的核心。TRM 并未声称识别出每一笔自主支付,而是在仍不完整的行为信号基础上估计一个合理区间。
研究还发现,USDC 主导了结算。在不受限制的资产分析中,5,268 万美元中的约 5,247 万美元,即 99.6%,使用了这一稳定币。
这种集中度让 x402 活动更容易被描述为一个稳定币支付市场,但并未让底层买家更容易被归类为智能代理。
这一结果改变了 x402 headline 数据的含义。它们记录了对可编程支付的需求,却无法独立证明存在来自自主 AI 买家的需求。
为何 x402 活动并不能证明代理式商业
x402 可以让支付变得可供机器读取,却不能让付款机器变得智能。
该协议将标有“Payment Required”的 HTTP 状态码 402 转化为可运行的支付步骤。客户端请求数字资源,服务器则返回付款条件。
客户端签署授权,并在附带该证明的情况下重复请求。facilitator 验证授权、在链上结算支付,并返回可交付资源的证明。
这一设计免除了传统结账页面。它允许软件在正常请求流程中购买 API 响应、数据查询、模型推理或其他数字服务。
这一机制对 AI 代理很有用,因为它将支付保留在代理的执行循环中。代理无需打开浏览器、填写银行卡表单,或请求人工批准每一笔微小购买。
然而,这些步骤中没有任何一步必然需要推理能力。开发者可以编写确定性软件,按固定时间表请求同一个端点、支付相同金额并存储响应。
压力测试系统也可以以更高频率完成同样的操作。服务运营方同样可以生成自付款或促销活动,在并不代表外部需求的情况下抬高交易次数。
TRM 的分类将价格变化视为代理性的一项信号。其逻辑是,探索多项服务的代理应会遇到不同价格,而反复调用单一端点的脚本通常支付固定金额。
这一假设有其合理性,但也造成了盲点。一个合法的单一用途代理可能会反复以相同价格购买同一服务。TRM 的模型可能将这类活动归类为传统自动化。
相反的错误也同样可能发生。脚本可以轮换调用不同端点、改变交易金额,或模仿探索式支付模式,而实际并未使用 AI 模型。
仅凭区块链数据无法解决这一问题。链上记录的是地址、资产、金额、时间戳和合约交互,却不会记录每项授权背后决策过程的可靠解释。
公开代理注册表提供了另一项信号,但注册仍属自愿。钱包所有者可以声明某个地址归属于代理,但该声明未必得到独立验证。
TRM 表示,目前多数参与者并未使用这些注册表。这使研究人员缺乏一套一致的身份层,无法将钱包与代理、运营者、模型或被委托用户关联起来。
这一分析问题类似于自动化网络流量。服务器能够观察到机器请求了一个页面,但还需要额外证据,才能区分搜索爬虫、恶意机器人、测试工具和 AI 助手。
支付提高了风险,因为分类会影响欺诈监控、制裁筛查、争议处理和责任认定。当软件能够以机器速度转移资金时,错误标签的后果更加严重。
因此,x402 的发现暴露出一个衡量缺口:市场拥有可靠的结算数据,却缺乏同样可靠的归因数据。
这一缺口解释了为何交易总额不应替代采用指标。真正的代理式商业需要证明存在受委托的权限、目标导向的选择,以及具有经济意义的购买行为。
真正的对手是代理式商业的承诺
主要冲突并非 x402 与银行卡网络之间的竞争,而是自主商业的承诺与普通自动化证据之间的落差。
科技公司已花费一年多时间,拼凑出代理购物和支付所需的各项要素。即使当前交易数据尚无法证明广泛采用,这些投入仍是真实存在的。
Google 于 2025 年 9 月推出了 Agent Payments Protocol,即 AP2。AP2 提供了一个共享框架,用于在代理、商家和支付提供商之间传达用户授权、购买意图和问责信息。
AP2 框架推出时获得了 60 多家科技、零售和金融机构的支持,其中还包括面向基于加密货币的代理支付的 x402 扩展。
OpenAI 和 Stripe 则通过 Agentic Commerce Protocol 采取面向消费者的路径。其初始 Instant Checkout 体验仍要求用户确认购买,尽管 ChatGPT 负责产品发现以及与商家的沟通。
该结账协议说明了一个重要差异:AI 辅助商业可以具备商业相关性,却不必赋予模型完整的消费自主权。
用户仍须确认商品、配送信息和付款详情。商家仍负责接受订单、处理付款、履约以及支持客户。
Amazon 在自主软件采购方面走得更远。Amazon Bedrock AgentCore payments 于 2026 年 5 月进入预览阶段,并于 8 月全面上市。
该服务让开发者连接受支持的钱包、设定消费限额,并允许代理为 API、Model Context Protocol 服务器、内容及其他数字资源付款。Model Context Protocol,即 MCP,是一项用于将 AI 系统与外部工具和数据连接起来的标准。
根据AgentCore 发布公告,该基础设施能够协商 x402 支付、执行限额并记录交易活动。这些控制措施旨在应对仅凭原始钱包访问无法独自解决的企业级问题。
这些发布展示了供应端的强劲投入。在自主需求变得易于衡量之前,大型公司已在构建协议、身份机制、钱包、商家连接和治理控制措施。
这一顺序在基础设施市场中很常见。开发者需要可靠的通道才能构建应用,而支付提供商需要可信的应用,交易量才会具备经济意义。
风险在于将就绪状态与采用情况混为一谈。一项协议可以支持自主购买,即使其当前大多数用户只是脚本、测试或功能范围有限的编程服务。
TRM 的结果促使基础设施提供商报告更有力的证据。当同一支付通道同时服务于代理、普通自动化和异常活动时,交易次数和结算价值已无法提供足够的背景。
有价值的报告应将外部商业活动与自生成资金流区分开来,也应区分 AI 辅助购买、确定性机器支付和目标导向的自主决策。
这种程度的分类很困难,但也必不可少。否则,代理式商业可能沦为适用于任何软件生成支付的标签。
乐观的解读是,企业正在提前建设以迎接需求。怀疑论的解读则是,市场已经为极少到来的买家打造了复杂的管道系统。
两种解读都符合现有事实。下一阶段取决于开发者是否会部署代理,使其能够在具有实际意义的一系列独立卖家之间发现并购买资源。
从模型看不见的部分解读 Agent Payments
TRM 的区间估计之所以有价值,是因为它让不确定性变得可见;但其行为测试无法提供决定性的归因。
宽松模型和严格模型划定的是边界,而不是最终答案。这种做法比将每一笔 x402 结算都视为 agent 活动更可信。
不过,较低和较高估计都依赖于有关智能 agent 应如何行为的假设。会探索多个卖家并遇到浮动价格的 agent,更容易符合该模型。
功能单一的 agent 则不那么契合。设想一个每天早晨购买同一份专业数据集的自动化研究 agent。它可能会评估当前情况,判断该购买仍有用,并反复向同一提供商付款。
其链上模式可能看起来像一个定时脚本。智能处理可能发生在付款之前,而结算本身仍保持一致。
更复杂的脚本也可能产生相反的印象。它可能通过固定规则在多个提供商之间进行选择,产生金额不一的付款,并持续活跃数月。
即使不使用生成式 AI,该系统也可能通过多项行为筛查。基于交易的分类会高估自主 agent 的参与程度。
TRM 承认了这一局限。其报告称,价格波动测试可能会低估那些反复向单一服务付款的单一用途 agent。
观测窗口也带来另一项限制。x402 主要支持面向数字资源的机器原生支付。它并未涵盖由 AI 产品发起或协助的所有银行卡购买。
Visa 和 Artemis 区分了宏观商业与微观商业。宏观商业包括旅行或订阅等常见购买,agent 通过现有商户系统代表个人行动。
微观商业则涵盖 API、算力或数据的小额软件对软件付款。这类付款可以频繁发生,且金额低于传统银行卡交易的经济门槛。
其支付研究显示,截至 2026 年 4 月 21 日,经调整后的 x402 活动约为 1,500 万美元,涉及 1.096 亿笔交易。不同的总额和日期说明,在比较研究时,方法论为何至关重要。
TRM 使用了更晚的观测期,并覆盖三个网络中的已知 facilitator。它还应用了自身的商业与自主性筛查标准。所得数据不应被合并,仿佛它们衡量的是同一群体。
两套数据都未涵盖所有形式的 AI 辅助购物。消费者可能让 ChatGPT 比较商品,随后在零售商网站上手动完成购买。
这笔交易体现了 AI 的影响,但并非自主消费。将其称为 agentic commerce,会混淆商品发现、推荐、结账协助和委托购买。
这种区分对商户很重要。AI 生成的引荐会影响消费者考虑哪些商品,即使最终付款仍通过传统结账流程完成。
支付基础设施提供商面临的是另一个问题:他们需要知道软件何时有权发起交易,以及结果违背用户指令时由谁承担责任。
因此,研究人员需要多项指标,而不是单一指标。实用类别包括 agent 辅助发现、人工确认结账、确定性机器购买,以及自主目标导向消费。
这种分类也会改善银行卡系统和稳定币系统之间的比较。它可以避免将基础设施选择误认为智能程度的差异。
在这些衡量标准出现之前,应将 TRM 的区间理解为对可见 x402 行为的有界估计。它并不是对整个互联网中每一笔 AI 介导购买的裁定。
可用的支付轨道仍缺乏 Agentic 问责机制
最紧迫的问题已不再是软件能否传递资金,而是每笔付款是否都带有可信的授权与责任证据。
传统在线商业假设由个人控制购买会话。反欺诈系统、确认页面、收据、争议处理和退款机制都建立在这一假设之上。
自主 agent 改变了这一顺序。个人可能授予一个宽泛目标,而软件无需针对每笔交易请求批准,就自行选择卖家、金额、时机和资源。
这种安排形成了多层责任。用户定义目标,agent 平台执行目标,模型进行解读,钱包完成签名,商户履行请求。
如果 agent 买错了资源,各参与方都可能将责任指向别处。用户可能归咎于模型,平台可能援引委托授权,而商户可能依赖有效签名。
恶意指令会带来更棘手的情况。提示词注入是指不受信任的内容操纵 AI 系统,使其采取非预期行动。
浏览外部资源的 agent 可能遇到旨在重定向付款的指令。有效的区块链结算只能确认交易已执行,而不能确认其意图正当。
IMF 强调了概率性 AI 决策与确定性支付系统之间的这种矛盾。其支付评估将授权可追溯性、网络安全、责任不清和自动化行为的相关性列为新兴风险。
消费上限可以降低风险敞口,但无法说明交易为何发生。日志能改善调查,但日志必须连接用户授权、agent 推理以及最终付款。
身份是另一项挑战。支付地址可以是匿名化的,而公共注册表条目可能出于自愿,或未经验证。
TRM 认为,agentic commerce 需要准确的注册信息、交易对手声誉,以及针对高交易笔数设计的监测机制。传统控制措施往往聚焦金额,因为人工付款的频率较低。
Agent 付款颠倒了这一模式。一个 agent 可以产生大量小额转账,单笔金额仍低于常见审查阈值。
这种交易量与金额的不匹配可能掩盖运营问题。数千笔错误的小额付款可能只造成很小的即时财务损失,却暴露出 agent 已受损或政策存在缺陷。
行业需要机器可读的授权书,用于说明 agent 可以购买什么、向谁购买、可在何种限制内购买,以及授权持续多久。这些授权还必须可撤销。
商户需要可验证的 agent 身份,以及所请求购买符合授权范围的证据。运营方需要保留意图、决策、授权与结算之间关联的日志。
用户需要易于理解的控制方式。如果个人无法看清授予了什么权限,或无法迅速停止它,一次技术性的 wallet 签名几乎无法带来安心感。
采用可交易 agent 的团队也应保留自身的证据链。跨提示词、审批和输出的可搜索记录,能够让复杂的 AI workflows 更易于审查。
这些控制措施都无法证明需求必然增长。但它们能让实验更安全,也让衡量更可信。
问责层将决定 agent 付款能否走出受控的开发者环境。没有它,更大的结算量可能带来更多模糊性,而非更多信任。
三个信号将显示 x402 Agent Payments 是否正在成为现实
下一阶段应根据经过验证的 agent 行为、独立商户需求和更强的归因能力来判断,而不是原始交易总量。
第一个信号是跨独立卖家的持续消费。TRM 的严格模型已将多卖家活动视为更强的自主性证据,因为这意味着存在发现和选择过程。
未来数据应显示,注册 agent 是否会在数月内反复从互不相关的提供商处购买。更广泛的商户组合将强化这样一种判断:agent 正在做出与情境相关的选择。
集中度则会削弱这一判断。如果大部分价值持续流经一个支付合约、一个 router,或一小群关联地址,基础设施活动仍将难以与真正的市场需求区分开来。
第二个信号是可验证授权和 agent 身份的采用。Google 的 AP2、wallet 提供商、注册表和企业平台正从不同方向处理这个问题。
决定性的进展将是一份共同记录,将个人或组织、获授权的 agent、允许采取的行动以及由此产生的结算连接起来。仅靠自愿标签还不够。
经过认证的交易显著增加,将强化 TRM 的较高估计。即使总交易量上升,注册率持续偏低也会保留当前的不确定性。
第三个信号是大型平台的生产环境证据。Amazon 的 AgentCore payments 于 2026 年 8 月全面可用,为开发者提供了管理式的交易 agent 路径。
相关指标并不是目录中出现了多少 endpoint,而是外部 agent 是否会在强制预算约束下购买有用资源,并保持低错误率和重复需求。
公开案例研究应披露不同外部买家的数量、卖家集中度、重复使用情况、失败交易和人工干预。这些数据将有助于区分功能演示与可持续商业。
消费者商业也需要类似的清晰度。需要个人按下确认按钮的购买仍有价值,但它属于不同于自主消费的类别。
开发者和企业买家应询问供应商,其产品支持哪一类别。他们还应询问提供商如何区分 AI 决策与传统自动化。
目前,TRM Labs 的 AI agent payments 研究支持一个审慎的结论:x402 已证明,软件原生结算可以在公共区块链上以高频率运行。
但它尚未证明自主 AI agent 占据了其中大部分活动。现有最佳估计显示,它们占经过筛查的 x402 商业活动的比例介于 0.6% 和 7.5% 之间。
这一差距并不只是品牌表述之争。它会影响投资决策、商户优先事项、安全控制,以及新兴市场的可信度。
支付轨道已经可用,但买方仍难以识别。在接下来的几个月里,应关注多商户行为、可验证的委托授权,以及独立报告的生产环境使用情况。
这些信号将揭示 agentic commerce 是否正从已准备好的基础设施迈向真正的经济自主性。在此之前,每一个巨大的交易总额都值得追问:有什么证据表明,AI agent 确实做出了这一决策?



