top of page

AIベンチマークは破綻している:リーダーボードが現実世界のパフォーマンスを予測できなくなった理由

AIベンチマークは、モデルが実際の業務でどのように機能するかを予測できなくなった。MMLUやHumanEvalのスコアは、タスク完了に関する実際のユーザー報告から乖離している。

MMLUはかつて、幅広い知識テストでモデルをランク付けしていた。HumanEvalは短い関数でのコード生成を測定した。Chatbot Arenaはユーザーからのペアワイズ投票を収集した。プロダクションチームは、同じモデルを展開した際に異なるランキングを報告している。

ベンチマークの汚染がミスマッチの一因となっている。 訓練データには現在、多くの試験問題やベンチマーク項目が含まれている。モデルは一般的なスキルを学ぶのではなく、パターンを暗記する。2025年の研究では、MMLUの質問の30%以上が事前学習に使用された公開ウェブクロールに登場していたことが判明した。

Goodhartの法則が残りを説明する。 チームが指標に最適化すると、その指標は本来の目標を測定しなくなる。ラボは公開リーダーボードでのわずかな向上を追い求める。彼らはプロンプトとポストトレーニングデータをテスト分布に合わせて調整する。その結果、テスト分布が変わると消えてしまう膨らんだ数字が生まれる。

実世界での評価は、これらのスコアとの相関が弱い。ある企業研究では、カスタマーサポートチケットでのモデル出力を追跡した。MMLUで上位のモデルは、解決率と顧客満足度では中位に留まった。リーダーボードで下位のモデルは、エッジケースをより確実に処理した。

Contamination Spreads Faster Than Labs Admit

テストセットは、繰り返しのウェブスクレイピングを通じて訓練コーパスに漏洩する。複数の大学の研究者らは、2023年と2024年のCommon CrawlスナップショットにMMLUのセクション全体を発見した。これらのスナップショットで訓練されたモデルは、根本的な概念を理解せずに同じ項目に正しく回答する。

HumanEvalも同様の問題を抱えている。ベンチマークのコードスニペットは、訓練実行に使用されるGitHubリポジトリに登場する。モデルはアルゴリズムについて推論するのではなく、事前学習中に解答を見たためにテスト関数を完了できる。

Chatbot Arenaは、新鮮なユーザープロンプトからの投票のため、汚染リスクをある程度低減する。ここでも、ラボは結果を操作できる。彼らは一般的なトピックでは良好だが、本番で重要な稀なクエリでは遅れるファインチューニング版をリリースする。

Goodhart's Law in Practice

チームは現在、リーダーボード最適化に大量のコンピュートを割り当てている。ポストトレーニング実行はMMLUに登場する特定の質問スタイルを狙う。その結果、新しいタスクに転移しない狭い改善が生まれる。

購入者は内部テストを実行した際にギャップに気づく。MMLUで85点を獲得したモデルが、プライベートな顧客データでは65点に落ちる可能性がある。一方、MMLUで78点だった別のモデルは、リーダーボード特化のチューニングが少なかったため、同じプライベートセットで80点を維持する。

高い数字を公開するプレッシャーが、逆インセンティブを生む。 ラボは飽和したベンチマークで最先端の結果を報告する論文を公開する。彼らは同じモデルをより困難なプライベート評価で公開することはほとんどない。これにより、真の性能上限が隠蔽される。

What Better Evaluation Looks Like

一部の組織は、オンラインに一切登場しないプライベートなホールドアウトセットに移行した。他の組織は自社製品内でライブA/Bテストを実行している。これらの手法はコストと時間がかかるが、ユーザーフィードバックと一致するランキングを生み出す。

エージェントベースの評価は、多段階タスクの完了を測定する。 単一ターンの質問ではなく、計画、ツール使用、修正を必要とする目標をモデルに与える。初期結果はMMLUテーブルとは異なるモデル順序を示している。

ドメイン専門家からの人間フィードバックは、最も強力なシグナルであり続ける。財務チーム、法務部門、エンジニアリンググループはそれぞれ異なる強みを必要とする。単一のリーダーボードはこれらのニーズを一度に捉えられない。

How Buyers Should Test Models

自社のドキュメントとワークフローでモデルを実行する。ユースケースで重要なエラータイプを追跡する。公開された平均に頼らず、出力を並べて比較する。

調達時に汚染の兆候を確認する。 ベンダーに、どの公開ベンチマークが訓練データに入ったかを尋ねる。モデルリリース日以降に収集されたデータセットでの性能数値を要求する。これらの数値は、スコアが暗記を反映しているか真の能力を反映しているかを明らかにする。

自社のトラフィックパターン下でのレイテンシ、コスト、信頼性をテストする。リーダーボードはこれらの要素を無視する。高スコアのモデルがコストが高すぎたり応答が遅すぎたりすると、本番システムは失敗する。

The Path Forward for Evaluation

将来のベンチマークには、継続的な更新とプライベートなテスト分割が必要になる。オープンのリーダーボードは依然として迅速なフィルターとして機能できるが、実際のタスクでの内部検証に取って代わることはできない。自社の評価パイプラインに投資する組織は、どのモデルが実際に成果を改善するのかについてより明確なシグナルを得る。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page