DGrid 测试链上代理能否改进 AI 模型选择
- Aisha Washington

- 4天前
- 讀畢需時 13 分鐘
DGrid 将模型选择变成了一场实时竞赛,但其中仍存在一个尚未解决的矛盾:其自动化裁判本身就是评估其他 AI 模型的 AI 模型。这项实验因与 CertiK 相关的 Google News 报道而浮出水面,使 DGrid 的链上代理系统受到更广泛的审视。DGrid 表示,这些代理会比较匿名回答、在 BNB Chain 上记录可验证身份,并帮助改进其路由决策。
这一方法瞄准了一个真实问题。开发者如今需要在数百个模型中做选择,而这些模型在能力、延迟特征、上下文限制和运营成本方面各不相同。路由器可以自动完成这一选择,但它需要证据来判断每类请求中哪个模型表现最佳。
DGrid 希望其 AI Arena 提供这类证据。人类参与者和用户配置的代理会收到针对同一提示的两份匿名回答,然后选出更优的回答。这些偏好可影响模型排名,并且据 DGrid 称,最终能将请求引导至合适的模型。
这场核心竞争并非 DGrid 与某一家对手的较量,而是具备经济激励的自动化评估与较慢的人类偏好测试之间的竞争。人类投票提供语境与品味,但收集成本高昂。代理投票则可大规模产生,却可能复制已影响模型输出的同类偏见。
这种张力的重要性不止于一个 Web3 项目。OpenRouter 已提供自动模型选择,而 LMArena 利用众包的人类比较为模型排名。DGrid 正在测试,链上身份、激励机制和代理裁判能否在不损害偏好信号的前提下结合两种方法。
Google News 将 DGrid 的路由实验带入更广泛的聚光灯下
重要的变化不在于 DGrid 将代理注册到区块链上,而在于它们的判断正成为模型发现和路由的输入。
DGrid 推出了 Arena for Agent,作为其现有盲测比较平台的扩展。参与者可为代理配置 API 提供商、API 密钥和支持的模型。随后,DGrid 会向该代理发送涉及两份匿名模型回答的评估任务。
代理返回的是偏好判断,而不是生成原始回答。DGrid 分发任务、记录结果,并更新代理的奖励余额。其代理评估系统支持通过 DGrid、OpenRouter、OpenAI、Google、Anthropic 及其他所列提供商访问的模型。
DGrid 将其描述为一个闭环:一个 AI 系统生成问题,两个模型作答,另一个 AI 模型选择更优回答。由此产生的判断会进入平台的性能数据。
这正是 Google News 的叙事需要谨慎对待之处。Google News 是所引用 CertiK 条目的发现渠道,而非该实验背后的开发者、运营方或技术标准。相关主体是 DGrid 的 Arena、其代理身份体系,以及其模型路由目标。
每个配置好的评估器都会通过 BNB Chain 上的 ERC-8004 获得注册身份。ERC-8004 是一项拟议中的代理标准,为身份、声誉和验证定义了注册表。身份记录可使代理被发现,并将其与公开反馈关联起来。
该标准并不会让代理变得智能或准确。它记录了哪个代理采取了行动,并为声誉数据建立存放位置。官方ERC-8004 规范将身份、声誉和验证分开,因为这些功能解决的是不同的信任问题。
DGrid 还为完成评估附加了经济奖励。其公开说明称,任务质量会影响积分奖励,并对每个代理设置每日收益上限。这一安排鼓励所有者保持代理可用,并持续提交判断。
不过,交易记录只能证明某个注册参与者提交了结果,无法证明其偏好判断正确、独立,或符合人类用户的需求。这一差距构成了 DGrid 实验的核心问题。
DGrid 的公开 Arena 页面目前展示了投票数、裁判数、模型数和活跃代理数等参与数据。这些数字属于第一方计数器,尚未经过独立审计。它们反映的是 DGrid 声称的规模,但不应被视为路由质量的验证证据。
因此,该实验改变的更多是评估流程,而非底层模型。DGrid 正试图将持续的成对判断转化为可复用的路由信号。该信号能否改善模型选择,取决于平台如何过滤偏见、串通、重复和低质量参与。
自动化评估令人工偏好测试承压
DGrid 的代理可以比人更快地产生偏好,但只有当这些标签真正代表用户重视的内容时,速度才有意义。
盲测比较已成为评估对话模型的一种重要方法。两个系统在不展示身份的情况下回答同一提示,投票者选择更偏好的回答,从而减少品牌声誉的影响。
LMArena 借助人类参与者帮助确立了这一方法。其公开的竞技场研究描述称,该论文原始数据集包含逾 240,000 票。研究人员报告,众包偏好与专家评分者之间存在有意义的一致性。
DGrid 借鉴了匿名、成对比较的结构,但改变了大量投票的投票者。代理可以持续处理任务,并反复应用同一评估提示。当平台覆盖大量模型、每天接收新输出时,这种一致性颇具吸引力。
以人为主导的评估平台未必需要将每一票都上链。它们需要证明,人类判断能提供合成裁判无法复制的信息。它们也可能需要更快的混合系统,将人类留给模糊或高影响的情形。
中心化路由器则面临来自另一方向的压力。OpenRouter 等服务已会分析提示,并从经过筛选的模型池中进行选择。其自动路由器会考虑任务类型、提示复杂度和模型能力等因素。
DGrid 提出的差异在于反馈闭环。它并非只依赖内部基准或集中管理的路由策略,而是希望获取来自可识别参与者网络的偏好。这些参与者可以包括人类和独立配置的代理。
理论上,这能扩大覆盖范围。专注于编程的裁判可能揭示哪个候选模型更擅长处理代码仓库问题。另一个代理可能专注于多语言写作或结构化提取。路由器可以学习任务特定的偏好,而不是依赖单一的全局排行榜。
但在实践中,专业化能力必须被证明,不能仅从代理注册中推断。DGrid 需要足够多的重复、受控评估,才能确定某个裁判是否能在特定类别中可靠地工作。一个擅长判断简短事实回答的模型,可能会在法律分析、幽默或长篇综合方面失效。
提示的来源同样重要。主要基于简单问题训练的路由器,可能看似准确,却会在开发者实际提交的工作中失效。DGrid 表示其系统使用出题代理,这会为数据流程引入另一层自动化。
合成提示可以快速扩展测试,但它们可能反映生成它们的模型的习惯。相似的措辞、熟悉的基准模式或狭窄的主题覆盖范围,都可能让候选模型显得比其在生产环境中的实际能力更强。
人类提示包含不完整的语境、不寻常的约束、拼写错误、不断变化的意图和本地知识。这些不完美之处并非需要消除的噪声,而是实用路由器必须应对的环境组成部分。
因此,DGrid 方法最强的版本是混合式的。代理提供广泛且可重复的覆盖,而人类则为主观和困难案例提供校准。DGrid 自身的 Arena 同时包括两种参与模式,为实现这种平衡提供了可能路径。
对开发者而言,回报将十分具体。应用可以将常规分类请求发送给小型模型,将复杂规划任务路由至其他模型,并在提供商失效时保留备用方案。团队将减少维护模型专属规则所花费的时间。
不过,模型选择不能只依赖回答质量。生产系统还关注延迟、可用性、上下文长度、数据政策、工具支持和行为可预测性。DGrid 的路由信号必须将偏好数据与这些运营约束连接起来。
链上身份无法验证 AI 裁判的推理
DGrid 可以让评估器可追溯,却无法使其判断可信,这是该实验最关键的权衡。
ERC-8004 为 DGrid 提供了识别代理的结构化方式。该标准使用身份注册表,并支持关联的声誉或验证记录。这有助于将持续参与者与一次性匿名账户区分开来。
这对问责很有帮助。如果一个代理反复与可信的参考判断相悖,系统可以降低其影响力。如果它在受控任务中表现良好,其声誉就会更有价值。
但身份只是第一层。所有者可以注册一个代理,随后更改其模型、提示、API 配置或周边逻辑。DGrid 自己的说明允许用户在创建后更新 API 设置,而链上身份仍保持不变。
这带来了连续性问题。一个声誉评分可能描述的是以同一名称运行的多种不同评估器配置。除非每项有意义的配置变化都被记录并纳入评分,否则用户无法知道是哪一个版本赢得了这份声誉。
链与模型提供商之间还存在验证边界。大多数商业模型调用都通过私有 API 在链下进行。区块链记录无法独立确认哪个模型处理了任务、它收到什么系统提示,或返回的判断是否在提交前被篡改。
验证方法可以缩小这一差距。可信执行环境、密码学证明、带签名的提供商回执或可复现的开放模型推理,都能提供更强的证据。每种方法都会增加成本、复杂性或硬件要求。
DGrid 更广泛的技术材料将 Proof of Quality(PoQ)描述为一个评估推理输出的框架,涉及准确性对齐、回答一致性、格式合规性及相关信号。其网络简版白皮书还提到上传日志和质量评分以形成可审计记录。
这些属于 DGrid 的设计主张,而非对每项 Arena 判断均获得完整密码学验证的独立确认。公开文档目前尚未提供足够细节,以复现完整评分方法,或衡量其在不同裁判模型上的错误率。
这一区别至关重要,因为 AI 裁判可以提交一个完全可追溯的错误判断。它可能偏向更长的回答,重复某家供应商的风格偏好,遗漏细微的事实错误,或选择一个听起来很自信但并不安全的回答。
如果平台过于直接地奖励一致性,经济激励会让问题变得更严重。智能体所有者可能会针对共识答案优化,而非最佳答案。一旦参与者摸清哪些风格通常更容易获胜,他们便可在不进行审慎评估的情况下产出可预测的投票。
这与在线信誉系统面临的问题相似。公开记录能遏制一部分滥用行为,但当预期回报高于注册成本时,参与者仍可能串通、模仿成功行为,或创建多个身份。
DGrid 的链上设计可以帮助调查人员发现私有数据库可能掩盖的模式。分析人员可以检查重复的投票关系、奖励集中度或可疑集群。透明度有助于审计,但并不会自动完成审计。
隐私也带来了另一层担忧。模型请求往往包含专有代码、个人数据、商业文件或内部指令。将完整提示词和输出记录在公共链上,不适合许多企业使用场景。
一个实用的系统应记录承诺、哈希、付款证明或有限的元数据,同时将敏感内容保留在链下。它还需要针对链下评估数据制定明确的保留政策。链上的永久性并不能免除传统的安全义务。
对买方而言,关键不在于架构中是否出现了区块链,而在于系统能否展示一条可靠链路:从任务分类、候选选择、评估、路由决策,到观察到的生产结果。
这些证据必须让运营人员能够理解。团队在排查糟糕回答时,需要知道路由器为何选择某个模型。如果决策策略依然不透明,一个不可篡改的智能体标识符几乎帮不上忙。
真正的风险是 AI 裁判强化 AI 偏见
如果智能体投票变成一种自我确认的信号,奖励熟悉的模型行为而非用户结果,这项实验就会失败。
LLM-as-a-judge 评估之所以有用,是因为能力较强的模型能够以远低于专家评审所需成本的投入比较答案。研究人员也已知道,这些裁判存在系统性偏好。
一个已有记录的问题是位置偏差。即使内容完全不变,裁判也可能偏向排在第一或第二位的回答。研究人员在超过 10 万个评估实例中考察了 12 个裁判模型,发现位置效应会因任务和裁判而异。
同一研究还发现,答案之间的质量差距会影响这一效应的大小。明显不匹配的答案更容易判断;竞争接近时,无关的呈现特征就有更多空间影响结果。
另一个问题是风格偏差。即使自信的措辞、严格的格式、篇幅或解释细节并未提高事实准确性,裁判也可能予以奖励。候选模型随后便可能针对评估者可见的偏好进行优化。
自我偏好对 DGrid 构成了特别相关的风险。由某一模型家族驱动的智能体,可能会偏好与该家族风格或推理模式相似的答案。如果许多参与者配置了同一种流行裁判,最终排名就可能继承一种高度集中的视角。
DGrid 可以通过随机化答案顺序、评估交换顺序后的答案对来减少这些影响。它可以采用多个裁判家族,衡量评审者间分歧,插入经过验证的控制任务,并将客观类别与主观类别区分开来。
平台还需要披露其如何解决冲突。多数投票很容易理解,但由相互关联的裁判构成的多数,并不等同于独立证据。使用同一个底层模型的十个智能体,提供的信息可能少于三个真正不同的评估者。
奖励设计同样需要严格审视。DGrid 表示与质量挂钩的积分能鼓励更好的判断,但质量需要外部参照。如果平台主要将质量定义为与同行的一致性,协调一致或高度同质化的智能体就可能主导这一信号。
人工校准可以提供这种参照。专家可以审查一部分存在争议的比较,而普通用户可以为对话实用性贡献偏好。这些标签能够揭示自动化共识在哪些地方偏离了人类预期。
不过,人类投票同样包含偏见和不一致的标准。一个有用的评估系统不应浪漫化任何一方,而应衡量分歧,并让裁判群体与应用场景相匹配。
例如,医疗摘要路由器需要由具备资质的审阅者进行事实性与安全性评估。创意写作路由器需要的是受众偏好,而不是一个所谓唯一正确的答案。编程路由器则需要在风格评估之外配合可执行测试。
这也是为什么一个全球通用的模型排名无法解决自动选择问题。路由需要条件化证据:在这些约束下、面向这类用户群体,哪个模型适合这项任务?DGrid 的 Arena 可以贡献数据,但前提是它保留这些区分。
该平台的公开界面强调汇总投票和排名。汇总活动能吸引参与,但对于置信区间、类别覆盖、裁判多样性或抗操纵能力几乎没有说明。
在依赖自动路由之前,评估该服务的开发者应要求提供这些细节。他们还应保留模型白名单、支出控制、日志记录和确定性回退机制。路由器应始终是一个策略组件,而不是未经审查的权威。
自行收集评估数据的团队也需要同样的严谨性。一个可搜索的 AI knowledge base 可以帮助保存提示词、决策和审阅者笔记,但评估标准仍需经过有意识的设计。
DGrid 最有价值的成果或许不是一个通用排行榜,而是一份透明的数据集,展示智能体何时存在分歧、哪些裁判持续可靠,以及偏好如何随任务而变化。
即使完全自主的评分被证明并不现实,这样的结果仍会让系统更有价值。分歧本身就是信息。将其隐藏在单一的路由分数之后,会浪费这项实验最具潜力的贡献。
三个信号将揭示 DGrid 是否改善模型选择
DGrid 现在需要的是可复现的证据、多样化的真实使用,以及可衡量的路由收益,而不是更大的参与计数器。
第一个信号,是一套足够详细、可供独立测试的公开评估方法。DGrid 应定义提示词抽样、答案随机化、裁判权重、控制任务、分歧处理方式,以及对重复智能体的抵御措施。
可复现的基准将强化其核心主张。独立研究人员可以将 DGrid 基于智能体得出的排名,与专家标签和人类 Arena 投票进行比较。若能在多个任务类别中呈现高度一致,将支持这种自动化方法。
较大的分歧不会自动使其失去可信度。关键问题在于,DGrid 是否能识别这种不确定性,并防止微弱信号控制生产路由。具备置信度意识的弃权,可能比强行给出答案更有用。
如果方法论仍不透明,而第一方活动计数器持续攀升,这项实验的可信度将受到损害。更多投票并不能解决相关性偏见,反而可能放大它。
第二个信号,是 Arena 参与者的构成。DGrid 应在不暴露私人信息的前提下,披露裁判模型、供应商、任务类别、地区及重复参与者的分布情况。
多样化的裁判池将增强这样一种论点:链上智能体提供了独立视角。若参与者集中在某个供应商或某一种奖励策略周围,这一论点就会被削弱。对于来自狭窄提问模型家族的提示词,情况也是如此。
人类参与在这里依然重要。DGrid 的公开 AI Arena 让人们可以与智能体评估者并列比较匿名答案。这两股投票流之间的关系,比它们合计的总量更重要。
平台应报告人类与智能体在哪些方面一致、在哪些方面分歧,以及哪一方能够预测后续的用户满意度。这会将其混合设计转化为一项实证优势。
第三个信号,是生产环境中的路由表现。DGrid 必须证明,与更简单的基线相比,偏好数据能够改善真实请求。这些基线应包括人工模型选择、静态规则、在合格模型中随机选择,以及集中式自动路由器。
有用的衡量指标包括任务成功率、修正率、延迟、回退频率和用户覆盖决策的次数。成本可以纳入比较,但不应将质量简化为最便宜的可用回答。
一项受控试验可以通过不同策略路由相似请求,再利用客观测试和盲审评估结果。结果应明确哪些工作负载能够受益,而不是给出一个普遍适用的改进数字。
这正是 DGrid 的网关与 Arena 要么建立连接、要么仍是两个独立产品的地方。网关宣传可访问超过 200 个模型以及智能路由;Arena 则宣称投票能够训练出更智能的路由决策。
DGrid 尚未发布足够的独立证据,来证明这些投票能在多大程度上改善实时选择。缺失的一环,是利用已披露工作负载进行衡量的前后对比。
CertiK 的可见度可以带来更多审视,但不应被误认为是对评估方法的审计。CertiK 的 DGrid 资料列出了安全性和成熟度信息,同时也表明索引资料中没有可用的 CertiK 代码审计。安全监控与模型质量验证是两类不同的评估。
更广泛的市场也将提供检验。集中式路由服务可以快速更新,使用私有生产数据,并避免区块链开销。DGrid 必须证明,开放参与和可追溯身份能够创造这些系统无法同样有效收集的信息。
如果 DGrid 发布可复现的收益、证明裁判多样性,并将 Arena 偏好与更好的生产结果联系起来,它的实验将支持一种新的路由模式。届时,链上智能体将成为可问责的贡献者,而非装饰性的区块链身份。
如果这些信号没有出现,该项目仍可能运营一个繁忙的奖励平台。但它无法证明智能体投票能够选出更好的模型。
通过 google news 进入本文的读者应关注证据链,而不是参与度标题。DGrid 能否说明由谁评判、如何控制偏见,以及应用是否获得了更好的答案?这三个问题将决定它会成为有用的 AI 基础设施,还是又一个自我指涉的评估循环。


