top of page

AnthropicとGoogleのモデルがPelicanmaxxingテストに挑む、そしてベンチマーク理論は崩れ去る

AnthropicとGoogleのモデルは、AIラボが有名な単一プロンプト向けにひそかに最適化しているかを検出するために設計された、1,008枚の画像テストを受けた。AnthropicとGoogleの比較では、Claude、Gemini、あるいは他の5モデルがペリカンに特化した訓練を受けたという説得力ある証拠は見つからなかった。しかし、この結果はより重大な問題を生む。標的を絞った最適化と広範な能力向上を区別できないなら、広く使われるAIベンチマークの信頼性は依然として判断が難しい。

研究者のDylan Castilloは、Simon Willisonによる非公式な課題「自転車に乗るペリカンのSVGを生成せよ」のバリエーションを用い、7モデルをテストした。この実験では8種類の動物と6種類の乗り物を掛け合わせ、48のプロンプトを作成した。各モデルはそれぞれのプロンプトに3回回答した。

この研究は、出力が改善した理由として最も面白い説明を退けている。AIラボが、おそらく自転車に乗るペリカンで訓練を埋め尽くしているわけではない。ただし同時に、Anthropic、Google、OpenAI、そして競合各社を評価するには、見慣れたテストを繰り返すだけでは不十分であることも示している。

冗談のベンチマークが統制実験になった

Castilloは、インターネットで繰り返し語られるジョークを、ベンチマーク固有の最適化を検証する構造化されたテストへと変えた。

Willisonは、主要な言語モデルのリリースを評価する際、数年にわたりこのペリカンのプロンプトを使ってきた。SVG(scalable vector graphic)は、テキストベースの図形と座標によって画像を記述する形式だ。生成には、コーディング、空間推論、物体認識、視覚的な構図設計を、ひとつの応答の中でこなす必要がある。

この組み合わせにより、このプロンプトは予想外に有用なものとなった。弱いモデルは、無効なマークアップ、壊れた車輪、誤った位置の手足、あるいはペリカンに見えない鳥を生成しがちだ。より強いモデルなら、正しくレンダリングされ、指定された関係性も保った画像を返せる。

このプロンプトは、異例なほど広く知られるようにもなった。Willisonは自身のpelican benchmarkタグのもとに100本以上の記事を蓄積している。その結果は、新モデルを巡る公開討論で頻繁に取り上げられる。

注目度の高さは、インセンティブの問題を生む。開発者は、認知度の高いプロンプトがリリースのたびに待ち受けていると分かれば、それに最適化できる。Benchmaxxingとは、他の領域で同等に幅広い改善を生み出すことなく、公開ベンチマークで高い成績を出すようシステムを調整することを指す。

Pelicanmaxxingは、その懸念をコミカルに表したものだ。ラボはペリカンと自転車の例を訓練データに入れたり、ポストトレーニングで類似タスクを加えたり、見慣れた構図に一致する出力を報酬で強化したりできる。その結果得られる画像は印象的に見える一方、一般的な能力についてはほとんど示さない。

Castilloは、このパターンを明らかにし得る実験を設計した。彼の統制研究には、ペリカン、フラミンゴ、サギ、カワウソ、アライグマ、レイヨウ、クジラ、ネコが含まれた。乗り物には、自転車、一輪車、スケートボード、スクーター、飛行機、ボートが含まれた。

彼はGPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Proをテストした。研究では、温度1.0でモデルとプロンプトの各組み合わせにつき3つの生成を行った。

この計算で1,008枚の画像となる。48プロンプトに3サンプル、さらに7モデルを掛けた数だ。元の応答に利用可能なSVGがなかったため、再試行を要した生成は11件のみだった。

評価パイプラインは3段階で構成された。まず、すべてのSVGをPNG画像としてレンダリングした。次に、GPT-5.6 Lunaが動物、乗り物、行動の整合性を1から5で評価した。

第三に、Gemini 3.1 Flash-Liteが可視的な特徴を抽出した。認識された動物、乗り物、向いている方向、繰り返し現れるシーン要素などである。続いてCastilloは、統計分析の補助にClaude Fable 5を用いた。

この設定が重要なのは、見栄えのよい単一のペリカン画像だけでは、ベンチマークのゲーム化を立証できないからだ。むしろこの実験は、各モデルがペリカン全般、自転車全般、あるいはその厳密な組み合わせで異常に優れた性能を示すかを問う。

この区別により、逸話は検証可能な仮説へと変わる。標的訓練が行われていたなら、異なる難易度を考慮した後でも、有名なプロンプトは近縁のプロンプトを上回るはずだ。

AnthropicとGoogleの結果はペリカン優位を示さない

ClaudeもGeminiも、意図的なpelicanmaxxingに期待される広範なパターンを示さなかった。

最も単純な結果は、すぐにこの理論に不利に働いた。モデル全体でスコアを集計すると、ペリカンは8種類の動物中6位だった。ネコ、クジラ、アライグマ、サギ、レイヨウの方が高い動物評価を受けた。

自転車の成績はさらに悪かった。6種類の乗り物中5位で、飛行機をわずかに上回っただけだった。判定モデルは、自転車画像のおよそ3分の2で、欠落または切り離された自転車部品を特定した。

ただし、これらの順位だけで結論を出すことはできない。ペリカンはネコより表現が難しく、自転車には2つの車輪、接続されたフレーム、ハンドル、ペダル、座席が求められる。特別な訓練は、難しい題材を1位へ押し上げずとも改善し得る。

そこでCastilloは、一定のグループ差と調査対象の固有効果を分離する統計モデルである固定効果回帰を当てはめた。このモデルは、動物と乗り物のあらゆる組み合わせに固有の難易度を考慮した。

その上で、ラボごとに3種類の効果を推定した。ひとつはすべてのペリカンプロンプトでの性能、もうひとつはすべての自転車プロンプトでの性能、最後はペリカンと自転車の厳密な組み合わせを切り出すものだ。

各ラボのペリカン推定値は、判定スコアでマイナス0.11からプラス0.14の範囲に収まった。統計的有意性に近づくものはなく、報告された最小のp値は0.25だった。

厳密な組み合わせで統計的に有意な上昇を示したラボはなかった。GLM-5.2は0.35ポイントで最大の正の推定値を記録したが、p値は0.12だった。この結果は依然として偶然と整合する。

難易度調整前では、この有名な組み合わせは48通りの組み合わせ中42位だった。大規模な特別準備を受けたプロンプトが、通常は比較グリッドの下位近くにとどまるべきではない。

自転車の結果には、ひとつの見かけ上の例外があった。Gemini 3.5 Flashは0.27ポイントの自転車効果を示し、p値は0.022だった。この値を単独で見れば、慣例的な0.05の閾値を下回る。

しかし、研究では関連する統計検定を21回実施している。0.05の閾値では、ランダムな変動だけでも平均して約1件の見かけ上の陽性結果が生じる。Geminiの効果は、まさにその単一の結果だった。

また、多くの仮説を検定する際に有意性の閾値を引き下げるBonferroni補正も通過しなかった。補正後の閾値はおよそ0.002で、Geminiの0.022を大きく下回る。

このため、AnthropicとGoogleの対比は、キーワードを意識した見出しが示唆するほど劇的ではない。Claudeはペリカン固有の優位性を示さなかった。Geminiの単独の自転車結果も、多重比較に対する標準的な補正を通過しない。

OpenAI、xAI、Qwen、Z.ai、DeepSeekも、予想された特徴を示せなかった。一部のモデルは全体としてよりよい画像を描いたが、全般的な品質は狭い範囲での最適化を立証しない。

この発見は、目視に基づく主張を抑制すべきことを示している。洗練された出力は、コーディング、構図、指示追従の向上を反映している可能性がある。記憶されたベンチマーク素材を自動的に示すわけではない。

Castilloは実験リポジトリも公開しており、読者はパイプラインと基礎となる結果を検証できる。この透明性により、この研究は成功した生成だけを集めたギャラリーよりも大きな価値を持つ。

結論は適切に限定されている。この実験は、これらの条件下におけるこれらのモデルに明白なpelicanmaxxingの証拠をほとんど見いださなかった。どのラボも関連例で訓練したことがない、と証明したわけではない。

見慣れた画像は記憶を証明しない

繰り返される視覚パターンは疑わしく見えるが、比較グリッドは、その多くが通常の描画慣習から生じることを示している。

21枚のペリカンと自転車の画像は、すべて右を向いていた。他の組み合わせで完全な方向一致を達成したものはなかった。これだけを見ると、記憶された構図の強い兆候に見える。

より広いデータセットでは、その意味が変わる。1,008枚の画像全体の60%が右を向いていた。自転車はサンプルの81%で右を向き、スクーターでは83%に達した。

ペリカンも画像の78%で右を向いていた。レイヨウも同じ比率で、サギは77%だった。これらの題材は、正面姿勢では特徴が見えにくくなるため、自然と横向きの構図を促す。

自転車は、両方の車輪が見える方が認識しやすい。ペリカンも、長いくちばしと喉袋が見える横顔の方が適している。この2つの傾向を組み合わせれば、方向の一貫性は驚くべきことではない。

他にも、全会一致に近づいた組み合わせが複数あった。スクーターに乗るレイヨウと、スクーターに乗るペリカンは、21サンプル中20で同じ方向を向いていた。自転車に乗るサギでは21サンプル中19だった。

繰り返し現れる小道具も同様の傾向を示す。フラミンゴとボートのすべての画像には太陽が含まれていた。カワウソと飛行機の画像では38%にスカーフが現れ、ネコと自転車の画像では38%にバスケットが現れた。

ペリカンと自転車のシーンにも繰り返し現れる要素はあったが、特に際立つ水準ではなかった。モデルは有名なプロンプトだけでなく、多くのプロンプトにまたがる一般的な視覚的連想を利用しているように見える。

この区別は、AnthropicとGoogleを巡るベンチマーク論争の中心にある。生成モデルは、特定の訓練例を取り出さなくても、似た構図へ収束し得る。学習済みの分布は、見慣れた配置、色、ポーズ、装飾要素を好む。

訓練データは依然として重要だ。無数のイラストが、動いているキャラクターを横顔で、しばしば左から右、または右から左へ移動する姿として描いている。モデルは、ひとつの識別可能な画像を記憶しなくても、こうした規則性を吸収できる。

逆もまた真である。モデルは完全な複製を返さずとも、訓練の影響を受けたパターンを再現できる。出力の類似性はスペクトラム上に存在し、小さな画像グリッドでは、すべての結果がそのどこに位置するかを特定できない。

この不確実性こそ、視覚的な類似だけでは弱い証拠となる理由だ。太陽、スカーフ、バスケット、あるいは右向きの鳥は、学習された慣習を示している可能性がある。より狭い範囲で繰り返された例の集合を示している可能性もある。

より強い主張には、追加の検証が必要となる。研究者は、文言、構図、方向、芸術スタイル、出力形式を変えられる。また、モデル内部の確率を比較したり、既知の訓練コーパスから近い例を検索したりすることもできる。

クローズドモデルでは、外部の研究者の大半がそうしたより深いシグナルを調べられない。一般の人々は挙動をテストできるが、AnthropicやGoogleの完全な訓練データの構成やポストトレーニング手法を検証することはできない。

この情報格差により、非公式ベンチマークは異例の影響力を持つ。ユーザーは同じプロンプトを実行し、目に見える出力をすぐに比較できる。一方で、なぜあるシステムの性能が高かったのかを簡単に判断することはできない。

ペリカン実験は、比較対象を広げることでこの状況を改善している。魅力的な物語が既成事実として受け入れられる前に、統制された代替案でその物語を検証できることを示している。

本当にあり得るのはSVGmaxxingだ

この研究は狭義のペリカン理論を弱める一方、広範なSVG最適化の可能性は十分に残している。

SVGmaxxingとは、ひとつの有名なプロンプトを狙い撃ちするのではなく、多くの題材にわたるベクターグラフィック生成を改善することを意味する。この方法で学習したモデルは、Castilloのグリッド全体でより良い性能を発揮するはずだ。その改善は、真に汎用的な能力の証しとなる。

これは、この実験で最も重要な死角だ。その統計設計は、各研究所内における異例のペリカン、自転車、または組み合わせ効果を検出できる。しかし、48通りすべての組み合わせを一斉に引き上げる学習は特定できない。

Castilloは、Google DeepMindがSVG生成の改善に関する取り組みを公に議論してきたと指摘する。このため、ペリカンの例で満たされた秘密の倉庫よりも、一般的な最適化という説明の方が信頼できる。

一般的なSVG学習が、ただちにベンチマーク対策を意味するわけではない。ベクターグラフィックは、アイコン、図解、グラフ、インターフェース素材、教育資料、編集可能なイラストなどで実用的に使われる。性能向上は多くの現実的な作業に役立ちうる。

境界を分けるのは汎化だ。多様な要求に対して有効で編集可能なグラフィックを生成するようモデルを学習させることは、有用な能力を育てる。一方、予想される評価プロンプトの狭い系列で学習させることは、誤解を招くスコアを生む。

外部の観察者は、研究所がその両極のどこに位置するのかを知ることはめったにない。公開されるモデル文書は通常、広範な評価結果を説明する一方、詳細なデータ混合や強化シグナルは非公開のままだ。

AnthropicとGoogleの比較は、この曖昧さを明確に示している。ClaudeとGeminiは、どちらもペリカンに特化した学習を受けていなくても、全体的なSVG品質で差が出る可能性がある。その差は、コーディング能力、空間推論、あるいは特化したグラフィック開発を反映しているかもしれない。

一般的な改善であっても、デモ向けに最適化されることはある。研究所は、どの能力が目を引くソーシャル投稿を生むかを知っている。鮮明なSVGは、微妙な推論能力の向上よりも共有しやすい、即座に分かるビフォーアフター比較を生む。

そのインセンティブは能力そのものを無効にするわけではない。ただし読者は、製品としての有用性とローンチ当日の見世物を区別すべきだ。モデルは印象的な自転車を作れても、写真映えしにくい作業では失敗することがある。

したがって開発者は、実際のワークフローに照らしてグラフィックモデルをテストすべきだ。製品チームには、寸法が一貫した再利用可能なアイコンが必要かもしれない。研究者には、関係性がラベル付けされた正確な図解が必要かもしれない。

こうした要件は、気まぐれな動物を描くこととは異なる。有効なマークアップ、編集可能性、アクセシビリティ、座標の正確さ、スタイルの一貫性は、視覚的な愛嬌よりも重要になりうる。

同じ原則はSVG生成以外にも当てはまる。コーディングエージェントは公開ソフトウェアの課題では優れていても、企業の非公開リポジトリでは苦戦する場合がある。推論モデルは学術的な質問で高得点を出しても、不完全な職場の証拠を誤って扱うことがある。

チームには、代表的な業務と非公開のテストケースを中心に構築された評価が必要だ。また、どのプロンプト、情報源、出力が意思決定に影響したのかを示す記録も必要になる。

検索可能なAIナレッジベースは、こうした評価成果物を人間の観察結果とともに保存できる。モデル更新によって挙動が変わった際、その記録は価値を持つ。

より広い教訓は、公開ベンチマークが無用だということではない。公開ベンチマークは共有可能な基準点を提供し、性能後退を可視化する。しかし、研究所や利用者がそれらを中心に最適化するにつれ、その価値は下がっていく。

有名なベンチマークは、徐々に自らが測定する環境の一部となる。研究者はそれを議論し、開発者は目にし、生成例はオンラインで流通する。将来の学習データセットは、そうした議論や出力を取り込む可能性がある。

このフィードバックループにより、汚染を避けることは難しくなる。意図的な操作がなくても、よく知られたテストは、それに直面するシステムから統計的に独立しにくくなりうる。

Pelicanmaxxingが面白いのは、影響が些細に見えるからだ。その背後にある仕組みはそうではない。同様の汚染は、コーディング、数学、安全性、事実性、そして重大な購買判断に使われるエージェント評価に影響しうる。

1つのLLM判定だけでは結論を出せない

調査結果は有益だが、サンプル数と評価手法には、より小さな効果や測定誤差が入り込む余地が残る。

すべてのスコアは、GPT-5.6 Lunaが一度に1枚の画像を判定して得られたものだ。Castilloは、同じ画像を繰り返し提示した場合に判定者がどれほど一貫して採点するかを測定していない。

信頼性の低い判定者は、すべての推定値にノイズを加える。スタイル上の好みが、特定のモデル群に有利に働く可能性もある。Lunaは、テスト対象のシステムのひとつであるGPT-5.6 Terraと同じ、より広いモデル群に属している。

研究内のモデル内比較は、その懸念を軽減する。Lunaが単にTerraのスタイルを好むなら、Terraのグリッド全体が高く評価されるはずだ。分析が焦点を当てるのは、特定のセルがそのモデルの通常の性能を上回るかどうかである。

それでも、判定者の挙動はコンテンツと相互作用しうる。Lunaは、ある動物を他よりも確実に認識するかもしれない。視覚的にすっきりした簡潔さを評価する一方で、解剖学的な誤りを見落とす可能性もある。

人間による評価は、別の検証手段になる。複数の独立した評価者が、動物の同定、乗り物の構造、動作の一貫性、全体的な品質を評価できる。一致度スコアによって、どの判断が主観的なままなのかが明らかになる。

第2の独立したモデル判定者も役立つ。異なるモデル群の判定者が、同一のレンダリング画像を同一の評価基準で採点できる。大きな不一致は、脆弱な結論を示すことになる。

予算の制約により、実験はセルごとに3サンプル、判定は1回に限られた。Castilloによると、全体の実行にはおよそ80ドル分のAPIクレジットを使った。その結果得られた信頼区間は、平均して判定者スコアのプラスマイナス約0.6ポイントだった。

これらの区間は、控えめなベンチマーク特化の改善を隠しうるほど広い。研究所が小さな優位性を得ていても、この実験にはそれを検出する統計的検出力が不足している可能性がある。

この研究では、すべてのプロンプトが使用可能なSVGを生成するまで、無効な出力を再生成した。再試行は11回しか発生していないため、この選択の影響はおそらく限定的だった。しかし、再試行という挙動は、最終画像スコアから信頼性の差の一部を取り除く。

本番環境の評価では、最初の応答を数えるかもしれない。利用者は、モデルが修正なしで要求された形式に従うかを重視する。自動化されたワークフローでは、レンダリング失敗が視覚品質と同じくらい重要になりうる。

「plane」の使用は、別の既知の問題を生んだ。一部のモデルはこの語を航空機ではなく、平らな幾何学的面として解釈した。特徴抽出器は、168枚のplane画像のうち25枚で乗り物を検出しなかった。

plane画像の20%には、乗り物スコアとして1または2が付いた。自転車では5%に達した一方、ボート、スクーター、スケートボードには、そこまで低いスコアはなかった。

この表現上の誤りは、中心的な結果を覆すものではない。すべてのモデルには同じプロンプトが与えられ、回帰分析では組み合わせの難易度が考慮されている。ただし、ひとつの曖昧な用語がベンチマークを歪めうることは示している。

OpenRouterを通じたモデルアクセスも、別の考慮点を加える。実験は、その実行時点で利用可能だったモデルのバージョンとルーティング挙動を反映している。提供者は、外部研究者にすべての変更を完全に可視化しないままシステムを更新できる。

したがって、この研究は恒久的な判決ではなく、有力な初期テストとして扱うべきだ。慎重な設計により、大きな効果が見られなかったことには意味がある。ただし、より小規模な、あるいは以前の最適化の試みをすべて除外することはできない。

この慎重な位置付けは、結果を広めた元記事にも当てはまる。Willisonは7月のコメント記事で、Castilloの作業は自身の以前の簡易チェックよりも入念だと述べた。彼はこれを、ベンチマーク対策が決して起きないことの証明としては提示していない。

読者は、「ここでは明確な証拠がない」を「研究所は潔白だ」に変換することに抵抗すべきだ。検出されないことは、プロンプト、サンプル、判定者、統計モデル、利用可能な検出力に左右される。

より良い結論は方法論にある。ベンチマーク対策に関する主張には、統制された比較、公開データ、複数の評価者、明示的な不確実性が必要だ。スクリーンショットだけでは、その責任を担えない。

Anthropic、Google、モデル購入者が次に注目すべきこと

次に有用な証拠は、追試、より広範なSVGテスト、そしてリリース間における挙動変化から得られる。

まず、研究者はより多くのサンプルと独立した判定者で研究を追試すべきだ。より大規模な実行により信頼区間が狭まり、小さな効果が反復評価でも持続するかが明らかになる。

人間の評価者は、文書化された評価基準のもとで代表的なサブセットをレビューすべきだ。少なくとも別のモデル群に属する1つの判定者が、データセット全体を採点すべきである。手法をまたいだ一致は、この知見を強める。

ペリカン、自転車、組み合わせの効果がゼロ近辺にとどまるなら、狭義のpelicanmaxxing説は弱まる。ある研究所で効果が繰り返し現れるなら、調査者はより明確な検証対象を得る。

次に、将来のテストでは動物と乗り物の漫画を超えて課題を広げるべきだ。モデルには、技術図、インターフェースアイコン、地図、ラベル付きのプロセス、幾何学図形、一貫した素材群を生成させられる。

こうしたプロンプトは、より良いSVG出力が有用な業務へ移転するかを検証する。また、一般的なグラフィック学習と、視覚的に馴染みのあるプロンプト群を中心とした最適化を区別することにもつながる。

研究者は見た目以上のものを測るべきだ。初回試行での有効性、編集可能性、アクセシビリティラベル、要求された寸法、オブジェクト数、空間的な正確さはいずれも独立した評価に値する。

これは、AnthropicとGoogleに対し、リリース間でモデルが何を改善したのかを明確にする圧力となる。多くの非公開SVGタスクで性能を向上させるモデルは、より強い汎用能力の証拠を提供する。

第三に、観察者は大規模ローンチ前後の不連続な変化を追うべきだ。有名なプロンプトでの急激な向上は、同じ条件下で実行された近接する非公開タスクと比較する価値がある。

Simon Willisonのアーカイブは有用な公開履歴を提供するが、今後の評価には未公開のプロンプトセットも必要だ。非公開テストは、直接的な最適化と偶発的な汚染を減らす。

モデル購入者も、1,000枚規模の画像研究を構築せずに同じアプローチを適用できる。まず印象的に見える公開デモから始める。次に、基礎となるスキルを維持した複数の統制されたバリエーションを作る。

対象、形式、制約、表現を変える。性能が通常の変動を乗り越えて維持されるかを見るのに十分なサンプルを実行する。最初の試行と修正後の出力の両方を保存する。

AnthropicとGoogleの調達判断では、勝者となるモデルは、ひとつの有名な公開課題ではなく、代表的な非公開タスクで成功すべきだ。購入者はモデル更新後にも再テストすべきである。

ペリカン研究は実用的なテンプレートを示している。疑われる近道を定義し、近接する代替案を構築し、難易度を統制し、成功とともに失敗も公開する。そして、その設計で検出できないものを明示する。

この基準が重要なのは、AI評価がエンジニアリング計画、ベンダー選定、職場の自動化にますます影響を及ぼしているためだ。ベンチマークスコアは、複雑な挙動を売り込みやすい1つの数字に圧縮できる。

ひとつの数字でモデルを完全に説明することはできない。それでも統制された実験は、説得力のある物語が証拠を追い越したときに、それを明らかにできる。

当面の答えは安心材料であると同時に、不完全でもある。Castilloは、主要な7モデルが自転車に乗るペリカンに特別な優位性を与えられていたという強い兆候を見いださなかった。Googleの単独の自転車に関する結果は、多重検定補正を行うと消える。

より大きな課題は未解決のままだ。広範な最適化、汚染されたテスト、非公開の学習選択、主観的な判定者は、真の進歩と評価戦略の境界をなお曖昧にしうる。

次に話題を呼ぶモデルのデモを鵜呑みにする前に、その周囲に小さな比較表を作ってみてほしい。主張されている能力が、対象・形式・制約を変えても通用するのかを問い直すべきだ。Anthropic Google pelican testは、誰かがその話を繰り返すのではなく実際に検証しさえすれば、ばかばかしいプロンプトが深刻な評価上の問題を浮き彫りにし得ることを示している。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page