top of page

AnthropicとGoogleのAIコンテキストウィンドウをめぐる対立

Anthropicは先週、Claude 4向けに100万トークンのコンテキストウィンドウを発表した。GoogleはすぐにGeminiのアップデートで同等の長さに到達し、これに対抗した。

両社はモデル知能だけでなく、同じ次元で競争を繰り広げている。両アップデートはわずか4日間で発表された。

生のコンテキスト長は、もはや「あれば便利」な機能ではなくなった。今や各社が技術的リーダーシップを主張する最も明確な手段となっている。

Anthropicの発表では、拡張シーケンス向けにtransformerアーキテクチャを最適化した専用トレーニングランを実施し、Claude 4がコードリポジトリ全体、数百ページに及ぶ法的契約書、または数日分の会話履歴を単一のフォワードパスで取り込めるようになったと強調した。Googleの対抗リリースでは、100万トークンでの同等性だけでなく、50万トークンを超えるセグメントを動的にインデックス化する補助検索レイヤーを追加し、手動チャンクの必要性を低減したと強調した。この急速な応酬は、OpenAIのGPT-4シリーズが128,000トークンで一時的に優位に立ち、他社が32,000または200,000トークンで遅れを取っていた過去数年からの転換を示している。

Anthropicの動きは、断片的な分析ではなく全体的なコードベース理解を必要とする開発者ワークフローへの戦略的賭けも示している。全リポジトリの取り込みを可能にすることで、同社は以前は複数の専門エージェントを必要としたアーキテクチャレビュー向けツールとしてClaude 4を位置づけている。Anthropicの初期内部テストでは、200,000トークンの前モデルと比較して大規模リファクタリングタスクの所要時間が34%短縮されたと報告されている。

新たな基準を設定した動き

AnthropicはClaude 4に、約75万語に相当するテキストを1パスで読み取る能力を与えた。同社は、この変更が長文シーケンスに特化した新しいトレーニングランを通じて実現したと述べている。The Vergeの報道によれば、このアップデートにより、単一プロンプトに合理的に含められる内容についての業界の期待が急速に変化した。

Googleはトークン数を一致させ、50万トークンを超えるドキュメント向けに新しい検索レイヤーを追加したGeminiアップデートで応じた。両リリースとも、各社ブログに掲載された公式モデルカードから発表された。Googleの公式ブログ記事では、ハイブリッドアテンション機構とエンタープライズドキュメント処理への影響について詳述している。

新上限をテストしたユーザーからは、完全なコードベースや数時間の会議トランスクリプトの要約が、小さなチャンクに分割することなく単一プロンプトに収まるようになったとの報告がある。NYTimesの分析では、初期のエンタープライズ実験ですでに複数段階のレビューサイクルの短縮が確認されていると指摘している。

Anthropicのエンジニアリングブログ記事では、トレーニングカリキュラムでシーケンス長を32,000から1,000,000トークンまで数週間にわたって段階的に増加させ、カリキュラム学習と特殊な位置埋め込み調整を採用した方法が詳述されている。エンジニアは、極端な距離でもアテンションスコアを安定させるため、学習済み温度パラメータでスケーリングされたロータリー位置埋め込みを挿入した。その結果、以前の200,000トークンモデルで中間コンテキストのリコールが崩れていた合成ベンチマークで安定した性能を発揮した。

Googleのアプローチは、スケールとアーキテクチャ拡張を組み合わせたものだった。更新されたGeminiリリースには、長い範囲の依存関係をスパース検索インデックス経由でルーティングし、直近の128,000トークンについては高密度アテンションを保持するハイブリッドアテンション機構が組み込まれた。発表で引用された内部ベンチマークでは、75万トークンの法的供述書で検索レイヤーを有効にした場合、事実根拠の18%改善が示された。両社は、さまざまな深さで「針と干し草の山」テストを再現する小規模評価スイートをオープンソース化し、コミュニティが完全なモデルにアクセスせずに主張を検証できるようにした。

初期のエンタープライズ採用者は、拡張されたウィンドウのストレステストを直ちに開始した。あるフィンテック企業は3ヶ月分の規制提出書類と決算トランスクリプトをClaude 4に読み込ませ、以前は別々の検索拡張生成パイプラインを必要としたドキュメント間の不整合をモデルに検出させた。ソフトウェアコンサルティングの別のチームは42万行のコードを含むモノレポ全体をアップロードし、Claudeは依存関係グラフを生成し、静的解析ツールが見逃していた非推奨API使用パターンを指摘した。これらの実世界の検証により、生のトークン容量がワークフローの圧縮につながるのは、基盤となるアテンション品質が全範囲で高い水準を維持した場合のみであることが明らかになった。メディア企業の追加テストでは、18ヶ月分の編集ガイドラインとストーリーアーカイブを読み込ませることで、Claudeが明示的な検索ステップなしに文体の一貫性を強制でき、リビジョンサイクルをほぼ半減させることが示された。

Googleのエンタープライズ顧客も、100万トークンを超える規制コンプライアンスドキュメントでデュアル検索設定の実験を同時に行い、オンザフライインデックスとコアコンテキストウィンドウを組み合わせた。ある物流プロバイダーは14年分の配送契約を単一セッションで処理し、自動再交渉アラートをトリガーする重複条項を特定した。ハイブリッドシステムは、関連するパッセージが70万トークン以上離れていても事実根拠を維持する点で特に強みを発揮し、これは純粋な高密度アテンションモデルが依然として苦戦する領域である。

企業は新しいウィンドウサイズに合わせてプロセスを再設計することで、ツール関連の予算に測定可能な変化が生じていると報告しています。以前は複数のベクトルデータベース呼び出しを必要としていた検索拡張生成スタックは、100万トークン未満のワークロードでは簡素化または廃止可能です。この簡素化により、埋め込みモデルやベクトルストアへのインフラ支出は削減されますが、コンテキスト全体を大規模言語モデルで処理する必要があるため、トークンあたりの推論コストは増加します。

チームは新たなガバナンス上の課題にも直面しています。プロジェクトの全履歴が単一のプロンプトに含まれる場合、アクセス制御はより細かくなります。組織は、会話の参加者全員が機密性の高い過去のスレッドを閲覧できるようにするのか、それともモデルプロバイダーがプロンプト単位の編集機能を提供するのかを決定する必要があります。初期の採用企業のいくつかは、コンテキストを組み立てる前に個人を特定できる情報を自動的に削除するミドルウェアを実装しており、これにより一部の期待されるワークフロー改善効果が相殺されるエンジニアリングオーバーヘッドが発生しています。あるグローバル銀行では、取引パターンを保持しつつクライアント識別子を編集する前処理レイヤーを開発し、コンプライアンスチームがデータ所在地の違反を起こさずに完全な監査証跡をクエリできるようにしています。

Limitations and Risks

長さに関するマーケティングの焦点にもかかわらず、いくつかの厳しい制約は依然として残っています。現在のハードウェアでは、推論レイテンシはコンテキストサイズにほぼ比例して増加するため、100万トークンのプロンプトでも最適化されたクラスターで初回トークンまでの時間に8〜12秒を要することがあります。メモリ消費も同様に増加するため、プロバイダーは積極的なKVキャッシュ圧縮を実装せざるを得ず、これ自体が品質のばらつきを引き起こす可能性があります。規制当局の監視も強まっており、欧州AI法の草案では、大規模な個人情報や著作権保護された資料を明示的な保護措置なしに処理できるコンテキストウィンドウを持つモデルに対して「システムリスク」を指摘しています。

もう一つのリスクは知的財産の漏洩です。ユーザーがプロプライエタリなコードベース全体や機密戦略文書を貼り付けた場合、プロバイダーが厳格なデータ分離を保証しない限り、その内容が将来のモデルの学習データに意図せず取り込まれる可能性があります。AnthropicとGoogleはいずれもデータ取り扱いポリシーを更新して公開していますが、それらの主張に関する独立した監査は依然として限定的です。

What the Numbers Still Leave Unclear

これまでの独立したテストは、合成的な「針と干し草の山」タスクに依存しています。これらのテストは操作が容易で、典型的な企業の文書構成を反映していません。

実際のユーザー報告はフォーラムや非公開のSlackチャンネルに散在しています。検索精度と最終出力品質の両方を全ウィンドウにわたって測定した統制比較を実施した組織はほとんどありません。

第三者によるベンチマークがなければ、リーダーシップに関する主張は企業側の声明のみに依存することになります。

What to Watch Next

両社の次回の四半期モデルリリースでは、現在の100万トークンの上限がさらに引き上げられるのか、それとも新サイズでの品質安定に焦点が移るのかが明らかになるでしょう。

9月に予定されている企業利用レポートでは、チームが実際にフルコンテキストプロンプトを中心にワークフローを変更するのか、それとも信頼性の理由からチャンク化に戻るのかが示されるでしょう。

規制当局はすでに両社に対し、規制産業における出力の一貫性に長いコンテキストがどのように影響するかのデータ提供を求めています。これらの文書は7月に公開される予定です。

Frequently Asked Questions

How should teams decide between Anthropic and Google for long-context workloads?

最大トークン数だけに頼るのではなく、代表的な社内文書に対する中間コンテキストの精度を評価してください。60万トークンの運用ポイントでレイテンシと事実の一貫性の両方を測定する並行パイロットを実施してください。

Will context windows continue expanding indefinitely?

ハードウェアの制約と2次関数の注意コストから、200万トークンを超える意味のある改善には、状態空間モデルや階層的注意などの新しいアーキテクチャが必要になると考えられます。向こう1年以内に150万〜200万トークンへの段階的な拡大はあり得るでしょう。

What safeguards exist against data leakage in long prompts?

両プロバイダーとも、顧客のプロンプトは明示的にオプトインしない限り学習に使用されないと述べています。それでも組織はデータ最小化を適用し、機密情報を読み込む前に各プロバイダーのSOC-2およびISO-27001の認証を確認すべきです。

モデル変更を注意深く追跡しているユーザーは、次のシグナルをまず価格ページで気づくでしょう。両社ともコンテキスト長に連動した新しいレート制限をほのめかしていますが、正確なしきい値はまだ公開されていません。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page