top of page

DGrid、オンチェーンエージェントがAIモデル選択を改善できるかを検証

DGridは、未解決の矛盾を抱えたままモデル選択をライブコンテストへと変えた。その自動審査員が、ほかのAIモデルを評価するAIモデルだからだ。この実験は、CertiKに関連するGoogle Newsの報道を通じて注目を集め、DGridのオンチェーンエージェントシステムはより広い検証の対象となった。DGridによれば、これらのエージェントは匿名化された回答を比較し、BNB Chain上で検証可能なIDを記録し、ルーティング判断の改善を支援する。

このアプローチは、実際に存在する課題を狙っている。現在、開発者は強み、レイテンシ特性、コンテキスト制限、運用コストが異なる数百のモデルから選択している。ルーターはこの選択を自動化できるが、リクエストの種類ごとにどのモデルが最も優れているかを示す証拠が必要になる。

DGridは、自社のAI Arenaでその証拠を提供したい考えだ。人間の参加者とユーザー設定済みのエージェントは、同一プロンプトに対する2つの匿名回答を受け取り、より優れた回答を選ぶ。その選好はモデルランキングに影響を与え、DGridによれば、最終的には適切なモデルへのリクエスト誘導に役立つ可能性がある。

このコンテストの本質は、DGridと単一の競合他社の対決ではない。経済的な報酬を伴う自動評価と、より低速な人間による選好テストの対比である。人間の投票は文脈や好みを捉えられるが、収集コストが高い。エージェントの投票は大規模に集められる一方、すでにモデル出力に影響しているバイアスを再現するおそれがある。

この緊張関係は、単一のWeb3プロジェクトにとどまらない。OpenRouterはすでに自動モデル選択を提供しており、LMArenaはクラウドソーシングによる人間の比較でモデルを順位付けしている。DGridは、オンチェーンID、報酬、エージェント審査員を組み合わせ、選好シグナルを損なうことなく両アプローチを統合できるかを試している。

Google NewsがDGridのルーティング実験に広い注目を集める

重要な変化は、DGridがブロックチェーン上でエージェントを登録したことではない。その判断が、モデル発見とルーティングの入力データになりつつあることだ。

DGridは、既存のブラインド比較プラットフォームの拡張としてArena for Agentを立ち上げた。参加者はAPIプロバイダー、APIキー、対応モデルを指定してエージェントを設定する。その後、DGridは2つの匿名モデル回答を含む評価タスクをそのエージェントへ送る。

エージェントは元の回答を生成するのではなく、選好を返す。DGridはタスクを配分し、結果を記録し、エージェントの報酬残高を更新する。同社のagent evaluation systemは、DGrid、OpenRouter、OpenAI、Google、Anthropic、その他の掲載プロバイダーを通じて利用するモデルをサポートしている。

DGridはこれを閉ループとして説明する。あるAIシステムが質問を生成し、2つのモデルが回答し、別のAIモデルがより良い回答を選ぶ。その判断がプラットフォームの性能データに反映される。

ここで、Google Newsという枠組みは慎重に扱うべきだ。Google Newsは、参照されるCertiKの記事を見つけるための経路であり、この実験の開発者、運営者、技術標準ではない。根本的な対象は、DGridのArena、エージェントID、そしてモデルルーティングに関する同社の構想である。

設定済みの各評価者には、BNB Chain上でERC-8004を通じて登録されたIDが付与される。ERC-8004は、ID、評判、検証のためのレジストリを定義する提案中のエージェント標準だ。IDレコードはエージェントを発見可能にし、公開フィードバックに結び付けられる。

この標準は、エージェントを知的または正確にするものではない。どのエージェントが行動したかを記録し、評判データの置き場を作る。公式のERC-8004 specificationは、これらの機能が異なる信頼課題を解決するため、ID、評判、検証を分離している。

DGridは完了した評価に経済的報酬も付与している。公開された説明では、タスク品質がポイント付与に影響し、各エージェントに1日の獲得上限を設けているという。この仕組みは、所有者にエージェントを利用可能な状態に保ち、一貫して判断を提出するよう促す。

ただし、トランザクション記録が証明できるのは、登録済み参加者が結果を提出したことだけだ。その選好が正確で、独立しており、人間のユーザーのニーズに沿っていることまでは証明しない。この隔たりが、DGridの実験における中心的な問いを形作っている。

DGridの公開Arenaページは現在、投票数、審査員数、モデル数、アクティブエージェント数に関する参加指標を掲示している。これらは当事者によるカウンターであり、独立監査は受けていない。DGridが主張する規模を示すものではあるが、ルーティング品質の検証済み証拠として扱うべきではない。

したがって、この実験が変えるのは、基盤となるモデルそのものよりも評価パイプラインだ。DGridは、継続的なペアワイズ判断を再利用可能なルーティングシグナルへ変換しようとしている。そのシグナルがモデル選択を改善するかどうかは、プラットフォームがバイアス、共謀、反復、低品質な参加をどのように除外するかに左右される。

自動評価が人間による選好テストに圧力をかける

DGridのエージェントは人間より迅速に選好を生み出せるが、そのラベルがユーザーが実際に価値を置くものを表す場合にのみ、速度には意味がある。

ブラインド比較は、会話型モデルを評価する有力な手法になっている。2つのシステムが、IDを表示せずに同じプロンプトへ回答する。投票者は好ましい回答を選ぶことで、ブランド評価の影響を抑える。

LMArenaは、人間の参加者を使ってこの手法の確立に貢献した。同社が公開したarena researchでは、論文の元データセットに24万票超が含まれていた。研究者は、クラウドソーシングされた選好が専門評価者と有意な一致を示したと報告している。

DGridは匿名のペアワイズ構造を取り入れつつ、多くの票を誰が投じるかを変えている。エージェントはタスクを継続的に処理し、同じ評価プロンプトを繰り返し適用できる。この一貫性は、プラットフォームが多数のモデルを扱い、毎日新たな出力を受け取る場合に魅力的だ。

人間主導の評価プラットフォームに求められる対応は、必ずしもすべての票をオンチェーンに載せることではない。合成的な審査員では再現できない情報を、人間の判断がなぜ提供できるのかを示す必要がある。また、曖昧なケースや影響の大きいケースに人間を割り当てる、より高速なハイブリッドシステムも必要になる可能性がある。

中央集権型ルーターは別の方向から圧力を受けている。OpenRouterのようなサービスはすでにプロンプトを分析し、厳選されたモデルプールから選択している。そのautomatic routerは、タスクの種類、プロンプトの複雑さ、モデルの能力などの要素を考慮する。

DGridが提案する違いはフィードバックループにある。内部ベンチマークや中央管理のルーティングポリシーだけに依存するのではなく、識別可能な参加者ネットワークから選好を得ようとしている。その参加者には、人間と独立して設定されたエージェントの両方が含まれ得る。

理論上、これはカバレッジを広げる。コーディングに特化した審査員は、どの候補がリポジトリに関する質問を適切に処理できるかを明らかにするかもしれない。別のエージェントは、多言語ライティングや構造化抽出を専門とする可能性がある。ルーターは、単一のグローバルリーダーボードに依存するのではなく、タスク固有の選好を学習できる。

実際には、専門性はエージェントの登録から推測するのではなく、実証されなければならない。DGridは、審査員がカテゴリー内で信頼性高く機能するかを判断するため、十分な反復的かつ統制された評価を必要とする。短い事実回答を適切に審査できるモデルでも、法的分析、ユーモア、長文の統合では失敗する可能性がある。

プロンプトの出所も重要だ。主に単純な質問で訓練されたルーターは、開発者が実際に送る作業では失敗しながらも、正確に見える可能性がある。DGridによれば、そのシステムは質問設定エージェントを利用しており、データパイプラインにもう1つの自動化レイヤーを導入している。

合成プロンプトはテストを迅速に拡大できるが、それを生成するモデルの習慣を反映する可能性がある。似た言い回し、よく知られたベンチマークパターン、狭いトピック範囲により、候補モデルが本番環境よりも有能に見えることがある。

人間のプロンプトには、不完全な文脈、珍しい制約、タイプミス、変化する意図、地域的な知識が含まれる。これらの不完全さは取り除くべきノイズではない。有用なルーターが扱うべき環境の一部である。

したがって、DGridのアプローチの最も強力な形はハイブリッドだ。エージェントが広範で反復可能なカバレッジを提供し、人間が主観的で困難なケースの較正を担う。DGrid自身のArenaには両方の参加モードが含まれており、この均衡に至る道筋となる可能性がある。

開発者にとって、その利点は具体的だ。アプリケーションは定型的な分類リクエストを小規模モデルへ送り、複雑な計画タスクを別のモデルへルーティングし、プロバイダー障害時にはフォールバックを維持できる。チームは、モデル固有のルールを維持する時間を減らせる。

それでも、モデル選択は回答品質だけに依存できない。本番システムでは、レイテンシ、可用性、コンテキスト長、データポリシー、ツールサポート、予測可能な挙動も重視される。DGridのルーティングシグナルは、選好データをこうした運用上の制約と結び付ける必要がある。

オンチェーンIDではAI審査員の推論を検証できない

DGridは評価者を追跡可能にできるが、その判断を信頼に足るものにはできない。これがこの実験を特徴付けるトレードオフだ。

ERC-8004は、DGridにエージェントを識別するための構造化された手段を提供する。この標準はIDレジストリを使用し、関連する評判または検証レコードをサポートする。これにより、継続的な参加者を使い捨ての匿名アカウントから区別しやすくなる。

これは説明責任に役立つ。あるエージェントが信頼できる参照判断と繰り返し食い違う場合、システムはその影響力を下げられる。統制されたタスクで良好な成績を示せば、その評判はより価値あるものになり得る。

ただし、IDは最初の層にすぎない。所有者はエージェントを登録した後、モデル、プロンプト、API設定、周辺ロジックを変更できる。DGrid自身の説明では、オンチェーンIDを維持したまま、作成後にAPI設定を更新できるとしている。

これは継続性の問題を生む。評判スコアが、1つの名前の下で運用される複数の異なる評価者設定を表す可能性がある。意味のある設定変更がすべて記録され、スコアリングに組み込まれない限り、ユーザーはどのバージョンがその評判を得たのか把握できない。

チェーンとモデルプロバイダーの間には、検証上の境界もある。商用モデル呼び出しの大半は、非公開APIを通じてオフチェーンで実行される。ブロックチェーン記録では、どのモデルがタスクを処理したか、どのシステムプロンプトを受け取ったか、返された判断が提出前に改変されたかを独立して確立できない。

検証手法はこの隔たりを狭められる。信頼実行環境、暗号学的証明、署名付きプロバイダー領収書、再現可能なオープンモデル推論は、より強い証拠を提供し得る。それぞれの手法にはコスト、複雑性、またはハードウェア要件が加わる。

DGridのより広範な技術資料では、Proof of Quality、すなわちPoQを、正確性の整合、応答の一貫性、形式準拠、関連シグナルを通じて推論出力を評価するフレームワークとして説明している。同社のnetwork litepaperでも、監査可能な記録のためにログと品質スコアをアップロードする仕組みが説明されている。

これらはDGridの設計上の主張であり、すべてのArena判断が完全な暗号学的検証を受けているという独立した確認ではない。公開ドキュメントには、完全なスコアリング手法を再現したり、審査モデル全体でのエラー率を測定したりするのに十分な詳細は、まだ示されていない。

この区別は重要だ。なぜなら、AI審査員は完全に追跡可能な誤りを提出し得るからである。より長い回答を好んだり、プロバイダーの文体上の好みを繰り返したり、微妙な事実誤認を見落としたり、自信ありげに聞こえる安全でない回答を選んだりする可能性がある。

プラットフォームが合意をあまりにも直接的に報酬化すると、経済的インセンティブがこれを悪化させる可能性がある。エージェント所有者は最善の回答ではなく、コンセンサスの回答を最適化するかもしれない。参加者がどのスタイルが通常勝つかを学習すれば、慎重な評価を行わずに予測可能な投票を生み出せる。

これは、オンラインのレピュテーションシステムが直面する問題に似ている。公開記録は一部の悪用を抑止するが、期待される報酬が登録コストを上回れば、参加者は依然として協調したり、成功した行動を模倣したり、複数のアイデンティティを作成したりできる。

DGridのオンチェーン設計は、非公開データベースでは隠れてしまう可能性のあるパターンを調査者が把握する助けになる。分析者は、繰り返される投票関係、報酬の集中、不審なクラスターを調べられる。透明性は監査を支援するが、監査を自動的に実行するものではない。

プライバシーも別の懸念をもたらす。モデルへのリクエストには、しばしば専有コード、個人データ、業務文書、内部指示が含まれる。完全なプロンプトと出力をパブリックチェーンに記録することは、多くのエンタープライズ用途には不適切だろう。

実用的なシステムは、コミットメント、ハッシュ、支払い証明、または限定的なメタデータを記録する一方、機密コンテンツはオフチェーンに保持すべきである。また、オフチェーンの評価データについて明確な保持ポリシーも必要になる。オンチェーンの永続性は、従来のセキュリティ義務をなくすものではない。

購入者にとっての問いは、アーキテクチャにブロックチェーンが含まれているかどうかではない。タスク分類から候補選定、評価、ルーティング判断、実運用で観測された結果まで、信頼できる連鎖を示せるかどうかである。

その証拠は、運用担当者にとって理解可能であり続けなければならない。不適切な回答をデバッグするチームは、ルーターがなぜそのモデルを選んだのかを知る必要がある。判断ポリシーが不透明なままであれば、不変のエージェント識別子はほとんど役に立たない。

真のリスクは、AI審査員がAIバイアスを強化することだ

エージェントの投票が、ユーザーの成果ではなく見慣れたモデルの振る舞いを報いる自己確認的なシグナルになれば、この実験は失敗する。

LLM-as-a-judge評価が有用なのは、有能なモデルが専門レビュアーに必要な労力のごく一部で回答を比較できるためだ。一方で研究者は、こうした審査員に体系的な選好があることも把握している。

文書化されている問題の一つが、位置バイアスである。内容が変わらなくても、審査員は先頭または2番目に表示された回答を好む可能性がある。12の審査モデルを10万件超の評価インスタンスで調査した研究者は、位置効果がタスクと審査員によって異なることを見いだした。

同じ研究では、回答間の品質差が効果の大きさに影響することも分かった。明確に不一致な回答は判断しやすい。接戦では、無関係な見せ方の特徴が結果に影響する余地が大きくなる。

もう一つの問題は、スタイルバイアスである。事実の正確性を高めない場合でも、審査員は自信に満ちた表現、厳格な書式、長さ、説明の詳しさを評価する可能性がある。その結果、候補モデルは評価者の目に見える好みに合わせて最適化できる。

自己選好はDGridにとって特に関連性の高いリスクだ。あるモデルファミリーで動作するエージェントは、そのファミリーのスタイルや推論パターンに似た回答を好む可能性がある。多くの参加者が同じ人気の審査員を設定すれば、得られるランキングは偏った視点を受け継ぐことになり得る。

DGridは、回答順をランダム化し、入れ替えたペアを評価することでこうした影響を減らせる。複数の審査モデルファミリーを使い、評価者間の不一致を測定し、検証済みのコントロールタスクを挿入し、客観的なカテゴリと主観的なカテゴリを分けることもできる。

プラットフォームは、対立をどのように解決するかも開示する必要がある。多数決は理解しやすいが、相関した審査員の多数派は独立した証拠と同等ではない。同じ基盤モデルを使う10のエージェントは、真に異なる3人の評価者よりも情報量が少ない可能性がある。

報酬設計にも同様の精査が必要だ。DGridは品質に連動したポイントがより良い判断を促すとしているが、品質には外部基準が必要である。プラットフォームが品質を主に同業者との一致として定義するなら、協調した、あるいは同質的なエージェントがシグナルを支配できる。

人間によるキャリブレーションは、その基準を提供できる。専門家は争いのある比較のサンプルをレビューでき、一般ユーザーは会話としての有用性に関する選好を提供できる。こうしたラベルは、自動化されたコンセンサスが人間の期待からどこで乖離しているかを明らかにできる。

ただし、人間の投票にもバイアスや一貫しない基準が含まれる。有用な評価システムは、どちらか一方を理想化すべきではない。不一致を測定し、審査員集団を用途に適合させるべきだ。

例えば、医療要約ルーターには、有資格のレビュアーによる事実性と安全性の評価が必要になる。クリエイティブライティングのルーターには、唯一の正解とされる回答ではなく、オーディエンスの選好が必要だ。コーディングルーターには、文体評価に加えて実行可能なテストが必要になる。

これが、単一のグローバルなモデルランキングでは自動選択を解決できない理由である。ルーティングには条件付きの証拠が必要だ。このタスク、この制約、このユーザー集団に対して、どのモデルが機能するのか。DGridのArenaはデータに貢献できるが、それはこうした区別を維持する場合に限られる。

プラットフォームの公開インターフェースは、集計投票とランキングを強調している。集計された活動は参加を呼び込めるが、信頼区間、カテゴリの網羅性、審査員の多様性、操作への耐性についてはほとんど明らかにしない。

サービスを評価する開発者は、自動ルーティングに依存する前にこうした詳細を求めるべきである。また、モデルの許可リスト、支出管理、ロギング、決定論的なフォールバックも維持すべきだ。ルーターは、レビューされていない権威ではなく、ポリシーコンポーネントであり続けるべきである。

自前の評価を収集するチームにも、同等の規律が必要だ。検索可能なAIナレッジベースは、プロンプト、判断、レビュアーの注記を保存するのに役立つが、評価基準には依然として意図的な設計が必要である。

DGridから得られる最も価値ある成果は、ユニバーサルなリーダーボードではないかもしれない。エージェントがいつ意見を異にするのか、どの審査員が信頼性を保つのか、選好がタスクごとにどう変化するのかを示す透明なデータセットかもしれない。

完全自律の採点が非現実的だと判明したとしても、その成果はシステムをより有用にする。不一致は情報である。それを一つのルーティングスコアの背後に隠すことは、この実験が持つ最も強い貢献可能性を無駄にするだろう。

DGridがモデル選択を改善するかを示す3つのシグナル

DGridに今必要なのは、より大きな参加カウンターではなく、再現可能な証拠、多様な実利用、測定可能なルーティング改善である。

第一のシグナルは、独立したテストに十分な詳細を備えた公開評価手法である。DGridは、プロンプトのサンプリング、回答のランダム化、審査員の重み付け、コントロールタスク、不一致の処理、重複エージェントへの耐性を定義すべきだ。

再現可能なベンチマークは中心的な主張を強化する。独立研究者は、DGridのエージェント由来ランキングを専門家ラベルや人間によるArena投票と比較できる。複数のタスクカテゴリで強い一致が見られれば、自動化アプローチを支持する根拠となる。

大きな不一致があっても、自動的に信頼性を失うわけではない。重要なのは、DGridがその不確実性を特定し、弱いシグナルが本番ルーティングを支配するのを防げるかどうかだ。強制された回答より、信頼度を考慮した棄権の方が有用な場合がある。

手法が不透明なまま、ファーストパーティの活動カウンターだけが増え続ければ、この実験は信頼性を失う。投票数が増えても相関バイアスは解消されない。むしろ増幅され得る。

第二のシグナルは、Arena参加者の構成である。DGridは、非公開情報をさらすことなく、審査モデル、プロバイダー、タスクカテゴリ、地域、反復参加者の分布を開示すべきだ。

多様な審査員プールがあれば、オンチェーンエージェントが独立した視点を加えるという主張は強まる。一つのプロバイダーや一つの報酬戦略への集中は、それを弱める。同じことは、狭い範囲の出題モデル群から生成されたプロンプトにも当てはまる。

人間の参加もここでは重要である。DGridの公開AI Arenaでは、人々がエージェント評価者と並んで匿名の回答を比較できる。その二つの投票ストリームの関係は、合計数よりも重要だ。

プラットフォームは、人間とエージェントがどこで一致し、どこで乖離し、どちらが後のユーザー満足度を予測するのかを報告すべきである。それにより、そのハイブリッド設計は実証的な優位性へと変わる。

第三のシグナルは、本番ルーティングの性能である。DGridは、より単純なベースラインと比較して、選好データが実際のリクエストを改善することを示さなければならない。ベースラインには、手動のモデル選択、静的ルール、適格モデル間のランダム選択、集中型の自動ルーターを含めるべきだ。

有用な測定指標には、タスク成功率、修正率、レイテンシ、フォールバック頻度、ユーザーによる上書きが含まれる。品質を利用可能な最安値の回答に矮小化せずに、コストを比較の一部にすることもできる。

対照試験では、類似したリクエストを異なるポリシーに振り分け、その結果を客観的テストとブラインド化されたレビュアーの双方で評価できる。結果は、単一の万能な改善率を示すのではなく、どのワークロードが恩恵を受けるのかを特定すべきだ。

ここで、DGridのゲートウェイとArenaが接続するか、別個の製品のままにとどまるかが決まる。ゲートウェイは200を超えるモデルへのアクセスとインテリジェントルーティングを宣伝している。Arenaは、投票がより賢いルーティング判断を訓練すると主張している。

DGridは、これらの投票がライブ選択をどの程度改善するかを確立するのに十分な独立した証拠を、まだ公開していない。欠けているつながりは、開示されたワークロードを使った測定可能なビフォーアフター比較である。

CertiKによる可視性は精査を加え得るが、評価手法の監査と誤解すべきではない。CertiKのDGridプロフィールにはセキュリティと成熟度に関する情報が掲載されている一方、インデックス化されたプロフィールではCertiKのコード監査は利用できないことも示されている。セキュリティ監視とモデル品質の検証は別個の評価である。

より広い市場も試金石となる。集中型ルーティングサービスは迅速に更新でき、非公開の本番データを利用でき、ブロックチェーンのオーバーヘッドを回避できる。DGridは、オープンな参加と追跡可能なアイデンティティが、そうしたシステムでは同等に効果的に収集できない情報を生み出すことを示さなければならない。

DGridが再現可能な改善を公開し、審査員の多様性を実証し、Arenaの選好をより良い本番成果につなげられれば、その実験は新たなルーティングモデルを支持するものとなる。そのときオンチェーンエージェントは、装飾的なブロックチェーン上のアイデンティティではなく、説明責任を負う貢献者として機能するだろう。

こうしたシグナルが現れなければ、このプロジェクトは依然として活発な報酬プラットフォームを運営できるかもしれない。しかし、エージェントの投票がより良いモデルを選ぶことを確立したとは言えない。

google news経由で訪れた読者は、参加の見出しではなく、証拠の連鎖を見るべきだ。DGridは、誰が判断し、バイアスをどう制御し、アプリケーションがより良い回答を受け取ったかを示せるのか。この3つの問いが、これが有用なAIインフラになるのか、あるいはまた一つの自己言及的な評価ループになるのかを決める。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page