top of page

AnthropicとGoogleがAIコンテキストウィンドウの限界をテスト

Anthropicは今月、Claudeのコンテキストウィンドウを100万トークンに引き上げた。GoogleもGeminiで同等のアップデートを実施した。両社はいずれも、モデルが1回の処理で本全体やコードベース全体を保持・推論できると主張している。

この変更により、競争の焦点は回答の質だけでなくメモリ容量へと移行した。長いウィンドウは文書全体のリコールを必要とするタスクで優位性をもたらすが、コストと精度に関する新たな失敗モードも生み出す。競争は単に最大長を宣伝するのではなく、極端な負荷下で信頼できる精度を維持することに集中している。The Vergeの報道によれば、これらの発表は、コンテキスト長を二次的な仕様とみなしていた調達チームの間で新たな予算議論をすでに引き起こしている。

具体的な変更内容

Anthropicは6月10日にClaudeを100万トークンに拡張した。Googleは2日後にGemini Advancedで同等の数値に到達した。今回のアップデート以前は、両サービスの大多数のユーザーにおける上限は20万トークンだった。

この新上限により、モデルは技術マニュアル全体と数ヶ月分の関連チャットログを一度に取り込めるようになる。この規模の範囲で検索を行うと、クエリがコンテキストの中央付近にある場合に重要な事実が欠落する傾向があると、機能テスト中の製品チームは報告している。複数のスタートアップのエンジニアは、400ページの仕様書を含む100万トークンのプロンプトで実験したところ、最初の100ページと最後の100ページから抽出した質問には正しく回答できたが、トークン位置45万〜55万付近の資料については不完全または捏造された要約を生成したと述べている。

Anthropicのリリースノートによると、100万トークン tier は当初、限定的なエンタープライズ顧客向けにロールアウトされ、その後より広範な提供が予定されている。Googleの発表は既存のGemini Advancedコンシューマー tier との統合を強調し、個人開発者や小規模チームにとってより即座に利用可能であるかのように位置づけている。両社とも同様の位置エンコーディング拡張とアテンション最適化を用いて新規模を実現しているが、精密なアーキテクチャ変更は査読付き論文の形で公開されていない。

さらにロールアウトの詳細を見ると、Anthropicは利用量の閾値でアクセスを制限し、拡張 tier への明示的なオプトインを求めている一方、GoogleはGemini Advancedの全サブスクライバーに対して即座に機能を有効化した。この配信戦略の違いは、対照的な哲学を浮き彫りにしている。Anthropicは失敗モードに関するテレメトリー収集のため管理された評価に注力しているのに対し、Googleは多様なドメインにわたる迅速なユーザーフィードバックループを優先している。NDAのもとで共有された初期内部テレメトリーでは、Anthropicが限定リリースの最初の2週間で複数文書推論精度が12%低下したことを観測し、より広範なロールアウト前に追加の安全ファインチューニングを実施したことが示唆されている。

コンテキストウィンドウの背景

コンテキスト長とは、モデルが単一のフォワードパスで処理できるトークンの最大数を指す。初期のTransformerモデルであるGPT-2は1,024トークンで動作していた。その後のリリースでは4,096トークン、32,768トークン、そして最近では128,000〜200,000トークンへと増加してきた。各段階で位置埋め込み、アテンション機構、トレーニングハードウェア上のメモリ管理の改善が必要だった。

100万トークンへの到達は、以前の実用上限から約5倍の増加を意味する。この規模により、モデルは小説1冊全体、テストスイート付きの完全な法務コードリポジトリ、または複数四半期分の決算トランスクリプトを連結したものを受信できる。ただし、標準アテンションの2次スケーリングにより、計算量とメモリ要件は急速に増大するため、ユーザーが数十万トークンを超えると価格とレイテンシのペナルティが即座に現れる。

歴史的経緯を見ると、コンテキスト長の各マイルストーンはハードウェアの進歩——GPU上の大容量HBMメモリプールとアクセラレータ間の相互接続帯域幅の改善——と一致してきた。100万トークンの閾値は現在のアクセラレータクラスタの限界に迫っており、プロバイダーはアクティブアテンションウィンドウ外のトークンに対して積極的なKVキャッシュ削除ポリシーを実装せざるを得なくなっている。たとえば2023年の128kから200kトークンへの移行ですでにカスタムFlashAttentionカーネルが必要だったが、さらに5倍にスケールするにはカーネル融合とメモリページングのさらなる革新が求められる。

拡張コンテキストを支える技術的仕組み

モデルは複数の手法を組み合わせて長いコンテキストを実現する。Rotary Position Embeddings (RoPE) とその拡張版は、トレーニング時に見た長さを超えて相対位置情報を一般化できる。スライディングウィンドウアテンションやその他のスパースパターンはトークン間比較の回数を削減する。一部の実装では、コンテキストの前半部分をサマリーベクトルやメモリ使用量の少ないキーバリューキャッシュに圧縮している。

AnthropicとGoogleはいずれも、これらの手法と長い文書に対する継続事前学習を組み合わせているようである。非公式に共有された内部ベンチマークでは、アクティブコンテキストが宣伝されている最大値の約40%を超えると一貫性が低下し始めると示唆されている。この低下は、エンティティの欠落、1度しか述べられていない事実に関する矛盾した記述、関連する箇所が深く埋もれている場合の汎用的表現への回帰傾向の増加として現れる。

その他の仕組みとして、ALiBiスタイルの線形バイアスや、両社が推論時スケーリング向けに適応したFlashAttention-2などのメモリ効率の高いアテンション変種が挙げられる。独立した研究者による実験では、スパースアテンションマスクを過度に適用すると重要な文書間参照が意図せず剪定され、マルチホップ推論精度の測定可能な低下を招くことが示されている。Ring AttentionやInfini-Transformerなどの新しい拡張は、複数GPUにまたがる分散アテンションを可能にする一方で、市販ハードウェア上でのエンドツーエンドレイテンシを2倍にする同期オーバーヘッドをもたらす。

プレッシャーを感じるのは誰か

検索システムを構築するチームは、新たな長いウィンドウに依存するか、別個のベクトルストアへの投資を継続するかの直接的な選択を迫られている。検索拡張生成ツールを販売するスタートアップは、顧客から有料の長文コンテキストオプションが自社製品を完全に置き換えるかどうかを尋ねられるケースが早期に報告されている。

大企業はコンプライアンス要件との兼ね合いで同じ判断を下している。100万トークンの単一コールはAPI料金で数ドルかかるため、財務チームはより広範なロールアウトを承認する前に詳細な利用予測を求めている。法務部門は、モデルプロバイダーがプロンプトレベルの削除保証を提供していても、社内Wikiや顧客履歴全体を1つのプロンプトに格納することがデータ所在ポリシーに違反しないかを追加で問うている。

Fortune 500企業の調達サイクルには、コンテキストウィンドウテスト専用の予算項目が含まれるようになり、セキュリティレビューによりタイムラインが4〜6週間延長されている。類似のリソースを持たない小規模スタートアップは、ベクトルストアを主要な検索レイヤーとして維持し、最終的な合成ステップでのみ長文コンテキストモードを呼び出すハイブリッドアーキテクチャにデフォルトで移行することが多い。Series-Bのコーディングアシスタントスタートアップの1社は、既存のRAGパイプラインをネイティブの100万トークンプロンプトに置き換えると月間推論支出が340%増加することを算出し、選択的キャッシング戦略への方向転換を余儀なくされた。

実世界のユースケースと事例

開発チームは、コードレビューとコードベースオンボーディングで最も明確な近-termの成果を報告している。リポジトリ全体とコミット履歴を含む単一のプロンプトにより、ClaudeやGeminiは「非推奨の認証モジュールを参照している関数はどれか、最近のプルリクエストに示されている移行パスは何か」といった質問に回答できる。関連するコードと議論が数千トークン離れた異なるファイルに現れる場合でも、回答は正確に保たれる。

リーガルテック企業は契約分析を大規模にテストし始めている。ある企業は60件のマスターサービス契約とすべての修正を100万トークンのウィンドウに読み込み、データ処理に関する補遺を規定するすべての条項を抽出するようモデルに依頼した。モデルは対象条項の93%を正しく特定したが、最も長い文書の中央3分の1に位置する2つの条項を見逃した。200ページの臨床試験プロトコルを分析する学術チームも、付録に埋もれた有害事象表はページ範囲のヒントを明示的に与えない限り見落とされるという同様のパターンを観測している。

科学文献の要約を探求する研究グループも類似の傾向を確認している。40本の関連論文の全文を入力した場合、モデルは抄録や結論に現れるテーマについては一貫した論文間比較を生成するが、トークン系列のより深い位置にある補足セクションにのみ記述された手法の統合には苦戦する。

コストとリコールのトレードオフ

トークン価格は最も明確な制約である。現在の料金では、完全な100万トークンリクエストは標準的な10万トークンコールの約10倍のコストがかかる。Anthropicのエンジニアが共有した内部テストによると、コンテキストが40万トークンを超えるとモデルの幻覚発生率も上昇する。

GoogleはGeminiの実装が新規模でより強い一貫性を維持すると主張しているが、独立したベンチマークは複数のドメインでその主張を確認していない。合成ニードル・イン・ア・ヘイスタックテストを用いた初期のサードパーティ評価では、挿入された事実がコンテキストのいずれかの端に現れる場合、両プロバイダーともほぼ完璧なリコールを達成するが、事実が中央付近に置かれた場合にはパフォーマンスが15〜30ポイント低下することが示されている。9to5Googleの報道でも指摘されているとおりである。詳細なコストモデリングによると、1日あたり50件を超える長文コンテキストクエリを実行する組織は、実験用に割り当てられた月間予算をすぐに使い果たす。キャッシュされたプロンプトプレフィックスの探索を始めているチームもあり、大規模なコードベースを一度読み込んでキャッシュ状態に対して増分クエリを発行するが、AnthropicとGoogleのいずれも完全な100万トークンレベルで安定したキャッシングAPIをまだ公開していない。

開発者と企業への実践的示唆

移行を検討する組織は、まず自社のワークロードが実際に必要とするコンテキスト長を測定すべきである。多くの検索拡張生成パイプラインは、高品質なチャンク化とリランキングを用いることで2万〜5万トークンで十分な精度をすでに達成している。100万トークンのプロンプトに移行するのは、タスクが本当にすべての文書セクションを同時に見ることで恩恵を受ける場合にのみ意味がある。

開発者はまた、重要になりそうなコンテキスト部分のみを読み込むプログレッシブ検索戦略を実装すべきである。階層的要約——以前の会話ターンや文書セクションの凝縮版を生成する——などの手法は、重要な詳細を保持しつつ実効コンテキストサイズを削減できる。長文コンテキスト機能が実験から本番に移行する際には、リクエストごとのトークン数とコストダッシュボードの監視が不可欠になる。コンプライアンス監査を実施する企業は、これらの拡張ウィンドウに投入されるすべてのトークンの明示的なログ記録を求めるようになり、運用オーバーヘッドのさらなる層が加わる。

限界とリスク

100万トークンでの精度は依然として文書タイプによって異なります。コードリポジトリは、混合された会議ノートやスライドデッキよりも優れています。この長さでの法的契約や財務モデルのエラーレートを測定した公開研究はありません。

規制当局は、長文脈モデルが同じウィンドウに保存された機密情報の漏洩リスクを高めるかどうかを問い始めています。両社はプロンプトレベルの制御で露出を制限できると主張していますが、エンタープライズのセキュリティチームは移行前に独立した証明を求めていると、Bloombergの報道によります。もう一つの懸念は位置バイアスです。モデルは文脈の最初と最後の10%に提示された情報を過大評価する傾向があり、これらの高視認性位置に誤解を招く指示を配置するプロンプトインジェクション攻撃を可能にする可能性があります。レイテンシも顕著に増加します。現在のインフラでは100万トークンのリクエスト完了に30〜90秒かかることがあり、コストが主な障壁でない場合でもインタラクティブなユースケースを制限します。研究者らはさらに、文脈ウィンドウが公開文書の大部分の長さを超えると、学習データ汚染のリスクが急激に上昇すると指摘しています。

Comparative Analysis with Other Providers

OpenAIは現在GPT-4oに対して128,000トークンの文脈ウィンドウを提供しており、即時の長さ拡大ではなく検索ツールへの継続的な投資を示唆しています。AnthropicとGoogleの動きは一時的な差別化を生み出し、OpenAIに反応を促す可能性があります。一方、Gradientの100万トークンLlama派生モデルやTogether AIの長文脈ホスティングなどのオープンソースの取り組みは、この機能が主要クラウドプロバイダー以外でも利用可能になりつつあることを示していますが、安定性とサポートは異なります。MetaのLlama 3.1 405Bリリースにはネイティブ128kサポートが含まれており、コミュニティ拡張により500kを超えるものもあり、長文脈技術がプロプライエタリとオープン両方のエコシステムに急速に拡散していることを示しています。

Enterprise Adoption Challenges

大規模組織はまた、これらのモデル機能に先立つ内部ガバナンスフレームワークを乗り越える必要があります。データガバナンス担当者は、長文脈呼び出し中にどのトークンがオンプレミスシステムから離れるかを正確に示す明示的なデータフロー図を必要としています。監査証跡は最終回答だけでなく、すべての中間KVキャッシュ退避決定を捕捉する必要があります。これはほとんどのベンダーがまだツールで対応していないエンジニアリング負担です。

What Remains Uncertain

極端な長さでの精度は依然として不完全にしか特徴づけられていません。文書タイプのばらつき、モデル固有のアーキテクチャ選択、およびドメイン固有のファインチューニングの有無がすべて結果に影響します。文書のジャンル、重要事実の配置、クエリの複雑さを体系的に変化させる公開ベンチマークは依然として不足しています。

もう一つの未解決の問題は最適な価格モデルです。現在のトークン単位の価格設定は長い文脈に線形にペナルティを課しますが、追加トークンの限界価値は収穫逓減曲線に従う可能性があります。両プロバイダーは最終的に段階的価格設定や文脈圧縮クレジットを導入し、比例したコスト増加なしに採用を促す可能性があります。

What to Watch Next

3つのシグナルが、長文脈ウィンドウが標準的な慣行になるかどうかを示します。第一に、今後8週間以内に50万トークンの文書にわたる想起をテストする公開ベンチマークに注目してください。第二に、OpenAIが同等の制限で応答するか、代わりに検索ツールを強調するかを観察してください。第三に、新しいウィンドウに本番ワークロードを移行したチームからのAPIコスト報告を追跡してください。計画数を超える継続的な支出は採用を遅らせるでしょう。永続的メモリシステムをすでに探求しているチームは、同じ文書セットを両方のルートでテストすることで、新しい文脈オプションをremio.aiと比較できます。

FAQ

Does a 1-million-token window replace the need for vector databases?

完全に置き換えるわけではありません。ベクトル検索は単純なルックアップタスクでは依然として高速で安価です。長文脈ウィンドウは、推論がコーパス全体にわたる関係を同時に考慮する必要がある場合に威力を発揮します。

How should teams test the new limits responsibly?

代表的な文書タイプで合成ニードル・イン・ア・ヘイスタック評価から始め、その後、精度指標とトークン消費の両方を監視しながら現実的なワークロードに移行してください。

Are there differences in behavior between Anthropic’s and Google’s implementations?

初期のユーザー報告では、Geminiはナラティブテキストでやや優れた一貫性を維持し、Claudeはコードでより信頼性が高いことが示唆されています。包括的なヘッドツーヘッド研究はまだ出てきていません。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page