top of page

Anthropic Simon Pelican Test: Claude Fable 5.1はより良く見えるが、それははるかに長く考えた後だった

9月2日
読了時間: 19分

Anthropicは、科学ベンチマークで52.6%を記録したとされるClaude Fable 5.1を公開した。しかしanthropic simon pelican testは、異なる性能の物語を浮かび上がらせる。Simon Willisonはこのモデルに、自転車に乗るペリカンのSVGを生成するよう依頼した。最も説得力のある結果が得られたのは、最大の推論努力で、はるかに多くの時間と出力トークンを費やした後だった。

この対比により、この実験は荒唐無稽な前提から想像される以上に有用なものとなる。AnthropicはFable 5.1を、コーディング、ナレッジワーク、長時間にわたる課題のためのモデルとして提示している。Willisonのペリカンは、そうした能力が、明確な物理的制約を持つ小規模な視覚プログラミング課題にぶつかったとき何が起きるかを試している。

この結果は、Anthropicの正式な評価に代わるものではない。それらの背景にあるトレードオフをコンパクトに示したものだ。Fable 5.1は自らの作業を点検し、修正し、改善できるが、推論を増やしても一律に向上するわけではない。最良の出力ははるかに高い計算努力で得られ、低い設定では目に見える熟考はほとんど見られなかった。

Anthropicは作業を継続するために設計されたモデルを投入した

Claude Fable 5.1は、ひとつのプロンプトに素早く答えることよりも、細部が整合するまで課題を続けることに重きを置いている。

Anthropicは2026年9月1日にClaude Fable 5.1とClaude Mythos 5.1を発表した。同社は両者を、異なる安全策を備えた同一の基盤モデルだと説明している。Fableは一般提供される一方、Mythosは承認済みの研究プログラムに限定される。

同社の発表資料は、コーディング、研究、長時間に及ぶナレッジワークを中心に据えている。Anthropicによれば、Fable 5.1は表面的な修正を避け、自らの作業を検証し、数時間から複数アプリケーションにまたがるプロジェクトでも有効性を保つという。

こうした主張が重要なのは、現在のAIの失敗の多くが有望な出だしの後に起こるためだ。モデルはもっともらしい計画を書き、機能するコードを生成しても、その後の修正で制約を見失うことがある。長時間にわたる性能は、状態の維持、中間結果のテスト、先行する作業を損なわずにエラーを修正することに左右される。

Anthropicのベンチマーク結果は、複数の既存テストで中程度の改善を示している。報告された最大の伸びは、ターミナル環境を通じて完了する科学タスクを評価するTerminal-Bench-Science 0.1で見られた。

Anthropicの設定では、Fable 5.1は52.6%を記録した。同社は同一比較で、Fable 5が24.7%、Opus 5が29.0%、GPT-5.6 Solが22.4%だったと報告している。Anthropicはまた、各モデルの標準誤差が3.5〜4.5ポイントであることも開示している。

その他の結果の差はより小さかった。Fable 5.1はTerminal-Bench 4.0で55.8%に達し、Fable 5の42.0%を上回った。AutomationBenchでは31.4%を記録し、Fable 5は17.1%だった。

これらは同社報告の数値であり、モデル品質の普遍的な尺度ではない。Anthropicは、安全策が一部の評価タスクに影響したことも指摘している。フラグが立った一部のリクエストにはゼロが与えられ、別のリクエストは異なるClaudeモデルに振り分けられた。

この開示は直接比較を複雑にする。ベンチマークは、基盤モデル、実運用の安全システム、エージェントのハーネス、あるいはその3つすべての組み合わせを測定し得る。企業ユーザーが接するのは統合された製品であるため、こうした運用上の詳細は性能を論じる際に含めるべきだ。

Anthropicの初期顧客は、補足的な事例を提供した。MongoDBは、同モデルが数日かけてプロトタイプを構築する前に、同社のサービスとドキュメントを調査したと述べた。Millenniumは、以前のモデルが原因を見落とした後、Fable 5.1がまれなクラッシュを外部ライブラリまで追跡したと述べた。

これらの報告は有用だが、選ばれたローンチパートナーによるものだ。成功した導入がどのようなものかを示してはいるが、すべてのコードベースやワークフローにおける平均的な結果を示すものではない。

Willisonのペリカンは、評価スペクトラムの反対側に位置する。企業システム、研究所、大規模な文書コレクションはない。その価値は、モデルの挙動を可視化することにある。

Simon Willisonが今もモデルにペリカンを描かせる理由

ペリカンのプロンプトが価値を持つのは、課題が些細に聞こえても、成功には多数の小さな関係が同時に機能する必要があるからだ。

Willisonは繰り返し、言語モデルに自転車に乗るペリカンのSVGを生成させてきた。SVGはテキストベースの画像形式であるため、言語モデルは構造化されたマークアップと描画指示を書くことで、画像全体を作成できる。

もっともらしい結果には、認識できる車輪、自転車のフレーム、ハンドル、ペダル、そしてペリカンが必要になる。良い結果では、それらが正しく結びついていなければならない。鳥の足はペダルに届き、翼はハンドルに接し、身体はフレームの上に収まるべきだ。

こうした関係性は、計画性と空間的一貫性を試すコンパクトなテストとなる。モデルは有効なSVGコードを生成しても、実際の場面の描写に失敗する可能性がある。つながっていない脚、配置を誤った車輪、不可能な接合部、あるいは単に自転車の上に浮かぶ動物を描くかもしれない。

このテストが広まったのは、初期の改善が容易に見て取れたからだ。より優れたモデルは、よりクリーンなコード、より整合的な幾何形状、より高いプロンプト遵守を示す傾向があった。1枚の画像が、長いベンチマークレポートでは集計スコアの陰に隠れ得るエラーを明らかにできた。

Willisonは後に、この関連性への確信を弱めた。彼は7月の再評価で、ペリカンの品質は以前ほど一般的なモデル品質を確実に追跡しなくなったと論じた。画像作成のスタイル、学習上の傾向、推論設定が結果に与える影響を増しているという。

この限界は、ベンチマークの目的を変える。あるモデルが別のモデルより普遍的に優れていると宣言するには弱い証拠だ。一方で、近縁のモデル、推論レベル、類似条件下での反復実行を比較する用途には依然として有用である。

Claude Fable 5.1の実験は、このより狭いアプローチに従っている。Willisonは低、中、高、超高、最大という5つの推論設定を試した。Fable 5.1には、推論を完全に無効化する設定はなかった。

低い努力では、モデルはクリーンで認識可能なイラストを生成した。Willisonが記録したトランスクリプトには要約された推論は表示されなかったが、応答には1,998出力トークンが含まれ、23.8秒を要した。

中程度の努力でも挙動は似ていた。出力は1,977トークンで、23秒を要し、やはり推論の要約は表示されなかった。最終画像は、低い設定の結果に対して明白な優位性を示さなかった。

高い努力で、ようやく小さな計画の痕跡が現れた。モデルは自転車、ペリカン、背景、車輪、身体の配置を含む意図した場面を説明した。2,612出力トークンを使用し、29.6秒で完了した。

目に見える改善は依然として控えめだった。この結果が重要なのは、推論コントロールが単純な品質ダイヤルとして提示されることが多いためだ。この実験では、低から高への移行は比例的な改善を生まなかった。

超高では挙動が劇的に変化した。モデルは36,767出力トークンを生成し、7分51秒にわたって作業した。その推論では、鳥の比率、足、ペダル、翼の位置、視覚的な特徴が論じられた。

最大の努力では、このプロセスはさらに延長された。65,927出力トークンを使用し、13分54秒を要した。Willisonはこの結果を、Anthropicモデルから見た中で最高のペリカンだと評した。

画像には青いヘルメット、魚のバスケット、整合的な自転車、そして鳥と機械とのより慎重な接触が含まれていた。その視覚的な細部は、一回限りの生成ではなく、繰り返しの点検を反映していた。

この進行こそが実際の実験だ。プロンプトは安定したまま、モデルが利用できる熟考量だけが変化した。Fable 5.1は、設定を上げるたびに単純により良いペリカンを描いたわけではない。最上位付近で、異なる作業モードへ移行した。

Anthropic Simon Testが示す努力の差

最高のペリカンはより強い自己修正を示すが、同時に品質が推論時の努力にどれほど急激に依存し得るかも明らかにする。

anthropic simon testは、ひとつのモデルファミリー内の比較として扱うときに最も有益だ。低、中、高では、目に見える差が限られた許容可能なイラストが生成された。超高と最大では、はるかに長い推論と、より慎重な修正が引き起こされた。

最大の努力では、モデルは描く必要がある物体を列挙しただけではない。それらの物体がどう相互作用すべきかを検討した。推論の記録では、ヘルメットの配置、くちばしの重なり、羽毛の形、ハンドルの細部、自転車のフロントフォークの曲線が検討された。

この挙動は反復的なデザインレビューに似ている。モデルは構造を生成し、起こり得る欠陥を点検し、個々の構成要素を調整した。また、明瞭さを損なう恐れがある場合には、不必要な追加を退けた。

ある記録では、ペリカンの識別しやすい冠羽を妨げる可能性があるとして、自転車用ヘルメットを再考している。別の記録では、フォークの曲線が不正確であることを特定し、その方向性を改善するため制御点を変更した。

こうした判断は小さいが、より大きな能力を示している。有用な長時間稼働エージェントは、自身の最初の試みが単にもっともらしいだけであることを検出しなければならない。次に、他のすべてを不安定にせず弱点を特定し、修正する必要がある。

この仕組みがペリカンを実際のコーディング作業につなぐ。ソフトウェアエージェントは、基本テストには合格するがアーキテクチャ上の制約に違反する機能を作るかもしれない。リサーチエージェントは、ひとつの前提が結論を損なうことに気づく前に分析を完了するかもしれない。

より難しい問題は、より多くのテキストを生み出すことではない。追加の計算を適切なチェックに費やすことだ。Fable 5.1の最大設定の記録は、少なくともこの視覚的コーディング課題の範囲では、その挙動に進展が見られることを示唆している。

ただし、この実験は不均一な努力曲線も示している。中は高い設定であるにもかかわらず、低を意味のある形で上回らなかった。高では多少の計画が加わったものの、画像を変革するには至らなかった。目に見える改善の大半は、かなり後になって現れた。

したがって開発者は、すべての推論ステップが同等の品質をもたらすと考えるべきではない。追加の努力がほとんど変化を生まない閾値の下に、あるワークロードがとどまる可能性がある。別のワークロードでは、モデルに十分な余地があり、繰り返し点検できる場合にのみ恩恵を受けるかもしれない。

これは評価上の課題を生む。チームがデフォルト設定だけをテストすれば、モデルに可能なことを過小評価する恐れがある。最大の努力だけをテストすれば、通常利用には遅すぎる構成を測定することになるかもしれない。

Anthropicによれば、Claude CodeではFable 5.1は高い努力がデフォルトとなり、その他のClaudeインターフェースでは中程度が使われる。Willisonの結果は、インターフェースのデフォルトが、モデルに対するユーザーの印象全体を左右し得ることを示唆している。

このテストは、出力品質と運用効率も切り分けている。最大設定のペリカンはより良かったが、低努力版よりも大幅に多くのトークンと時間を必要とした。このトレードオフは、記事で具体的な価格を扱わない場合でも重要だ。

長時間稼働エージェントは、計画、ファイルの点検、ツール呼び出し、テスト実行、作業の修正を行う間に計算資源を消費する。難しい課題では、成功した結果がその努力を正当化し得る。同じプロセスは、使い捨てのイラストや定型的な変換には過剰だろう。

実務上の問いは、最大の推論が良いかどうかではない。追加の作業が判断を変えるのか、後続レビューを減らすのか、あるいは高くつく失敗を防ぐのか、ということだ。

その違いは、Anthropicと競合各社にプレッシャーをかけている。OpenAI、Google、その他のモデル提供企業は、推論の制御機能を公開したり、計算資源を自動配分したりするケースを増やしている。購入者は、そうした制御がワークロードの価値に明確に結び付く証拠を必要としている。

ペリカンは、その対応関係がなお不規則であることを示している。設定値が高いからといって目に見えて優れた結果が保証されるわけではなく、最高設定は実質的に別製品のように振る舞うことがある。

科学ベンチマークが重要性を高める

Anthropicの科学スコアはFable 5.1を重要な存在にしているが、ペリカンはそのスコアに運用上の文脈が必要な理由を示している。

Terminal-Bench-Science 0.1は、エージェントがターミナル環境で実行する科学ワークフローを対象に設計されている。タスクは生物学、化学、物理学、地球科学、数学、工学などの分野をカバーする。

science benchmarkは、Fable 5.1の直前に公開された。科学者が提供した70件のタスクで構成され、その結果は管理された環境内で検証できる。

この構造は、イラストを評価するよりも厳密だ。タスクでは、エージェントがソフトウェアを操作し、データを扱い、科学ツールを利用し、検証可能な結果に到達することが求められる。実際の研究作業の一部に似せることを意図している。

Anthropicの52.6%という結果は、Fable 5に対して報告した24.7%のスコアを2倍以上に引き上げているため注目に値する。この差は、開示された標準誤差を大きく上回っている。

ただし、この比較にはなお注意が必要だ。Anthropicは独自の評価設定で、以前のモデル結果を再現した。公開リーダーボードではOpus 5が30.0%、Fable 5が21.4%だったのに対し、Anthropicの測定値はそれぞれ29.0%と24.7%だった。

同社によれば、こうした違いは想定される統計的ノイズの範囲内に収まる。それでも読者は、公開リーダーボードでの実行結果とベンダー主導の比較を区別すべきだ。

新しいベンチマークには、蓄積された検証履歴も限られている。研究者は、開発者がそのタスクを巡ってプロンプト、ハーネス、ツールをどれほど速く最適化するかをまだ観察していない。また、ベンチマークの改善と測定可能な科学的成果を結び付ける長期的な記録も不足している。

これは結果が重要でないことを意味しない。確定した判定ではなく、初期シグナルだという意味だ。

公式ベンチマークとペリカンテストは、異なるものを測定している。Terminal-Bench-Scienceは、エージェントが定義済みの科学ワークフローを完了できるかを問う。ペリカンは、可視化された制約問題を解く過程で、モデルがどのように努力を配分するかを明らかにする。

両者を合わせると、より限定的な結論が支持される。Fable 5.1は、持続的なツール利用型の作業でより優れているように見え、その最も強い挙動は中間結果を確認するのに十分な計算資源があるときに現れる。

Anthropicはベンチマーク以外にも複数の科学的事例を提示している。同社によれば、そのモデルはタンパク質バインダー、惑星マッピング、生物学モデル向けGPU最適化に取り組んだ。これらの主張は、モデル出力を外部ツールと組み合わせ、場合によっては実験室での検証も伴っている。

同社はまた、Fable 5.1がニューラルネットワークを訓練し、金星の3分の1をカバーするより高解像度の標高地図を生成したと述べている。Anthropicによれば、その地図は10〜20キロメートルではなく、2〜3キロメートル単位の詳細を解像する。

こうした事例は、一発のプロンプトよりも慎重な検証に値する。科学的な成果は、データ選定、ツール設定、検証方法、人間の監督に左右される。モデルは重要な作業を担う可能性があるが、発見プロセス全体に責任を負うとは限らない。

この区別は、企業導入にとって重要だ。購入者が導入するのはベンチマークスコアではない。権限、独自データ、レビュアー、予算、安全策、障害対応手順を備えたシステム内にモデルを導入する。

最も強い証拠は、チームが完了率、修正時間、人間によるレビュー要件を比較できる反復可能なワークフローから得られる。高得点でも大規模な検証を必要とするモデルは、期待より低い価値しか生まない可能性がある。

逆に、難しいエラーを防げるなら、より遅いモデルにも価値がある。Anthropicのローンチパートナーは、まれな失敗、複数サービスにまたがるコード変更、無人の研究作業に関する事例を強調している。こうしたケースこそ、追加の推論がもっともらしい見返りをもたらす領域だ。

科学ベンチマークは、新たなエージェント評価で目に見える優位性を確立したため、OpenAIとGoogleへの圧力を高めている。しかし、より大きな競争は一つのリーダーボードではない。モデルが長時間の推論を、信頼でき監査可能な作業へと変えられるかどうかだ。

ペリカンが証明しないこと

洗練されたSVGは成功した1回の実行の証拠であり、Claude Fable 5.1が無関係なタスク全般で信頼して推論できる証明ではない。

最初の制約はサンプル数だ。Willisonは、5段階の努力設定にわたる1つのシーケンスを示した。プロンプトと構成が変わらなくても、モデル出力は実行ごとに変動し得る。

より強力な比較では、各設定を複数回繰り返すべきだ。レビュアーは物理的一貫性、コードの妥当性、視覚品質、実行時間、出力長を評価できる。これにより、最高設定の結果が典型的だったのか、例外的に優れていたのかが明らかになる。

2つ目の制約は主観的な判断だ。最高設定のペリカンのほうが完成度が高いことには、多くの閲覧者が同意できるかもしれない。しかし視覚的な魅力は、単一の測定可能な特性ではない。ある人はミニマルなイラストを好み、別の人は装飾的な細部を評価するかもしれない。

3つ目の制約は汚染だ。ペリカンのプロンプトは長期間にわたり公開されてきた。モデル開発者はその例を目にでき、関連画像が学習データや評価データに含まれている可能性もある。

Anthropicがこのプロンプト向けにFable 5.1を明示的に最適化した証拠はない。それでも、多くの出力や議論が公開されると、よく知られたテストは独立した指標としての有用性を失っていく。

Willison自身も、このベンチマークと一般的なモデル品質との関係は弱まったと認めている。現在残る最良の用途は、特に単一プロバイダーのモデルファミリー内における、統制された比較だ。

4つ目の制約は可視化された推論に関するものだ。推論要約が表示されないからといって、モデルが内部推論を行わなかったとは断定できない。製品はトレースを隠したり、圧縮したり、選択的に表示したりできる。

Willisonは、低設定と中設定について「推論を省略しているように見える」と慎重に表現した。この報道上の区別は維持すべきだ。記録されたインターフェース上の挙動は観察可能だが、モデル内部のプロセスは完全には利用できない。

5つ目の制約は、長いトレースが誤った確信を生み得ることだ。多くの細部を論じるモデルでも、基本的なミスを犯すことがある。熟考を増やせばエラー検出は改善し得るが、不必要な修正を生んだり、欠陥のあるアプローチを合理化したりすることもある。

アニメーション付きの続編は、そのリスクを可視化している。Hacker News requestでは、完成したペリカンをアニメーション化できるかが問われた。Willisonは、最高設定のSVGをFable 5.1に戻し、高い努力設定でアニメーション化するよう指示した。

モデルは26,201出力トークンを使い、アニメーション版を生成した。Willisonは、元のSVGでは正しく見えたものの、動画への変換後には車輪が逆方向に回転しているように見えたと指摘した。

この続編は単なる冗談ではない。動作を追加しつつ、機能している成果物を維持できるかを試している。このパターンは、追加機能が元の実装にはなかった問題を露呈させるソフトウェア保守に似ている。

Willisonの完全なpelican experimentも、最終成果物には直接の検査が必要な理由を示している。有効なSVG、一貫した推論トレース、成功したアニメーションコマンドがあっても、エクスポート後にすべての視覚的関係が保たれたとは保証されない。

6つ目の制約は、ベンチマークとの整合性に由来する。ペリカンは主にSVG生成、空間的関係、反復的なデザインを検証する。事実の信頼性、セキュリティ判断、科学的判断、非公開の企業データにおける性能については、ほとんど何も語らない。

Anthropicの正式な評価はそれらの領域の一部を扱っているが、多くの結果は依然としてベンダー報告にとどまる。ローンチパートナーの推薦コメントも、統制された失敗率ではなく、選択された成功事例を説明している。

そこには重要な検証上の空白が残る。Fable 5.1はより持続的な作業が可能に見えるが、チームには自らのタスクで構成した独立テストがなお必要だ。最良のセッションがどれほど印象的かではなく、モデルがどれほど頻繁に正しく完了するかを測定すべきである。

有用な評価には、曖昧な要件、ツール障害、古い文書、敵対的コンテンツを含めるべきだ。長時間稼働するエージェントは、目標を黙って変更することなく、こうした条件に対応しなければならない。

したがって、中心的な緊張は未解決のままだ。Fable 5.1は出力の改善にかなり長い時間を費やせるが、ユーザーには、その努力が正当化されるときとモデルが停止すべきときを判断する信頼できる方法が必要だ。

Fable 5.1が成果を示すかを判断する3つのシグナル

次の試金石は、Fable 5.1のベンチマークおよびデモでの改善が、反復、実際のワークフロー、競争圧力の中でも維持されるかどうかだ。

第1のシグナルは、Terminal-Bench-Science 0.1の独立した再現だ。研究者は、文書化されたハーネスと同等のツールアクセスを使い、複数の試行でFable 5.1を実行すべきである。

Anthropicの52.6%に近い結果が得られれば、同社の主張は強化される。公開スコアが大幅に低ければ、評価設定、プロンプティング、または非公開構成が、見出しの数字が示す以上に寄与していた可能性を示唆する。

実行間のばらつきも重要になる。平均成績は良くても予測不能に失敗するモデルは、わずかに低いが安定した結果を出すモデルとは異なる運用プロファイルを示す。

第2のシグナルは、開発者や企業チームによるワークロード単位の証拠だ。最も示唆に富む指標には、正常完了率、レビュー時間、修正された欠陥、中断された実行、人間の介入頻度が含まれる。

チームは同一の社内タスクで、高設定と最高設定の推論を比較すべきだ。また、追加の努力が何も変えない、あるいは結果を悪化させるケースも記録すべきである。

その証拠は、anthropic simon effort gapを運用上の問題へと変える。最高設定の推論が高コストな失敗を一貫して防ぐなら、より長い実行時間は正当化できる。改善が選ばれたデモでしか現れないなら、最高設定を正当化するのは難しいままだろう。

第3のシグナルは、競合モデルがどう応じるかだ。Anthropicの科学比較では、OpenAIのGPT-5.6 SolはFable 5.1を下回っている一方、Googleのモデルは視覚表現力の高いSVG生成で依然として強い。

競合は複数の方法で応じられる。公開科学リーダーボードでFableを上回る、推論の自動配分を改善する、同等の結果に必要な時間を短縮する、あるいはより強力な独立ワークフロー評価を公開することだ。

最も意義ある対応は、品質と予測可能性を組み合わせたものになる。開発者が必要としているのは、驚くべき成果物を生成できるモデルだけではない。タスクにどれほどの努力が割り当てられ、なぜシステムが停止したのかを伝える制御機能も必要だ。

ナレッジワーカーにとっても、同じ原則がリサーチや文書分析に当てはまる。より長い回答が、必ずしもより良い回答とは限らない。有用なシステムとは、証拠を確認し、欠けた制約を捉え、不確実性を明確に示すものだ。

anthropic simon pelican testはClaude Fable 5.1に印象的なデモを与えているが、その教訓はベンチマークが解決済みになったということではない。持続的な自己レビューが今や目に見えてより良い仕事を生み出す一方で、そのレビューのコストは依然として不均一だということである。

開発者は、検査可能な成果物と、すでに理解している失敗事例でモデルを試すべきだ。同じタスクを複数の努力レベルで実行し、最終結果を比較し、追加の推論が結果を変える箇所を記録するべきである。

次に注目を集める実演は、もう一羽の完璧な鳥である必要はない。Fable 5.1が、毎回最大限の労力を求めることなく、反復的かつ重要な作業でも同じように慎重な修正を実現できることを示すべきだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page