top of page

Anthropic、拡張コンテキストとエージェントモードを備えたClaude 4 Opusをリリース

AnthropicがClaude 4 Opusを発表し、100万トークンのコンテキストウィンドウとチェーンされたタスク向けに設計されたエージェントモードを導入しました。この動きは、より短いウィンドウと手動のプロンプトチェーンに依存するプロバイダーにプレッシャーをかけています。

同社は今回のリリースを、コードベース全体や研究ライブラリを絶えずリセットせずに扱いたいというユーザーの要望に応えたものだと位置づけました。この変更は、数十ステップにわたる永続的なメモリを必要とするエージェントシステムをすでにテストしている複数のチームの動きと重なります。

Release Details and Context Expansion

AnthropicはClaude 4 Opusの新しいコンテキスト上限を100万トークンに設定しました。このサイズは、1回のセッションで約75万語のテキストをカバーします。ユーザーは、年次報告書全文、複数の会議トランスクリプト、関連コードファイルを別々の呼び出しに分割せずに読み込めるようになりました。

このアップデートには、ウィンドウの末尾におけるリコール精度の向上も含まれています。以前のモデルは10万トークンを超えると詳細を失うことが多くありました。内部ベンチマークでは、Claude 4 Opusが検索テスト中に全長にわたって正しい参照を維持したことが示されています。Anthropic's official announcement.

エージェントモードでは、モデルが人間の介入を減らして複数ステップのシーケンスを計画、実行、修正できます。システムはツールを呼び出し、中間結果を確認し、見つかった内容に基づいて次のアクションを調整します。初期テスターは、以前のバージョンと比べてステップの脱落が少ないと報告しており、ある法律チームがこのモードを使って12件の契約書にわたる200の条項を単一のスレッドで調整した事例も含まれます。The Verge's early access review.

How the Agent Mode Changes Daily Work

製品要件ドキュメントに取り組むチームは、数ヶ月分のメモや顧客通話を1つのプロンプトに投入できます。モデルはすでに議論された決定に基づいた構造のドラフトを返し、一般的なテンプレートではなくなります。ユーザーは依然としてレビューと修正を行いますが、初期の骨子は社内言語により近く一致します。

文献レビューを扱う研究グループは、数十本の論文を一度に読み込めます。エージェントモードは矛盾する発見を特定し、ギャップにフラグを立て、フォローアップ検索を提案します。プロセスは別々のチャット間を行き来することなく、単一の会話スレッド内で完結します。バイオテックスタートアップの初期テスターの1人は、エージェントモードを活用して85本の論文から知見を統合し、後にラボで検証された3つの標的実験仮説を生成しました。coverage in Reuters.

同じモードはコード移行プロジェクトにも現れます。開発者は古いリポジトリと現在のドキュメントをモデルに指示します。モデルは移行手順を作成し、サンドボックス環境でテストし、コードがコミットされる前に競合を表面化させます。

Pressure on Competing Context Strategies

OpenAIとGoogleはこれまでのリリースでコンテキストを拡大してきましたが、どちらもほとんどのエージェントタスクでは短めの集中セッションを重視しています。このアプローチにより、呼び出しごとのコンピュートコストを低く抑えられます。Anthropicは、単一の呼び出しがより多くのリソースを消費する場合でも、リセットを減らすことをユーザーが好むと賭けています。

エージェントオーケストレーションレイヤーを提供する小規模ラボは、別の問題に直面しています。彼らの製品は複数の短いコンテキスト呼び出しを縫い合わせることに依存しています。一度ベースモデルがより長いスパンを確実に扱えるようになれば、縫い合わせレイヤーの価値は一部失われます。

Limits and Remaining Questions

100万トークンのウィンドウは依然として慎重なプロンプト設計を必要とします。Claude 4 Opusはノイズの多い入力が与えられると無関係なセクションを表面化させることがあります。ユーザーはソース資料に明確な構造を適用し続けなければならず、そうしなければ回答が希薄になるリスクがあります。

エージェントモードのパフォーマンスはタスクの複雑さによって異なります。単純なシーケンスは初期テストで高い一貫性を示しました。変化するデータソースにわたる外部ツール呼び出しを必要とするタスクでは、より大きなばらつきや occasional loops が見られます。Anthropicはこれらのケースに関する失敗率の統計をまだ公開していません。

コストは依然として変動要因です。長いコンテキストの呼び出しは平均してより多くのトークンを使用します。チームはセッション再起動の削減と呼び出しごとの支出増を比較検討する必要があります。公開価格の詳細はまだリリースされていません。

Signals to Watch in the Next Quarter

採用数はまずAPI使用量グラフに現れます。20万トークンを超える呼び出しの持続的な増加は、拡張されたウィンドウに対する実需を示すでしょう。横ばいの増加であれば、ほとんどのユーザーが依然として作業を分割していることを示唆します。

競合他社の反応が重要です。OpenAIまたはGoogleが90日以内に同等のコンテキスト増加または新しいエージェントツールを発表した場合、市場はClaude 4 Opusの優位性が持続するかどうかを試すことになります。どちらかの企業の遅れは、Anthropicに長期コンテキストエージェント実験での一時的なリードを与える可能性があります。

企業からのフィードバックはケーススタディを通じて表面化します。法務・財務チームからの初期報告は、大規模でのリコール精度がラボのベンチマークと一致するかどうかを明らかにします。これらの報告は、他の企業が短いモデルのファインチューニングと長いウィンドウへの移行のどちらを選ぶかに影響を与えます。

すでにパーソナルコンテキストレイヤーを構築しているナレッジワーカーにとって、このリリースはツールを横断した永続的なメモリの価値を再確認させるものです。remioのようなシステムは会議メモ、ドキュメント、過去のAIやり取りを蓄積し続けるため、エージェント呼び出しはすでに履歴が存在する状態で開始できます。このセットアップにより、新しいモデルが登場してもコンテキストを再供給する必要性が減ります。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page