top of page

Claude Opus 4.7 がリリースされました。Claude Agent を構築する上で実際に変わったことはこちらです。

更新日:6月17日

Anthropicは4月16日にClaude Opus 4.7をリリースしました。コンテキストウィンドウは100万トークンで、新しい xhigh専用のClaudeコードレビューコマンドと、トークン使用量を減らしながら長時間のAIエージェントワークフローで14%の改善を謳うエフォートティア。

リスト価格は変わりませんでした。しかし、新しいトークナイザーが同じプロンプトにかかるトークン数を静かに変更したため、Claudeエージェントを実行する実際の請求額は変動しました。Anthropicはまた、通常よりも明確に、4.7が内部で開発されているフロンティアモデルではないことを認めました。それはまだMythosと呼ばれており、出荷されていません。

本番環境のエージェントを構築している場合、SWE-benchのジャンプはこのリリースで最も興味のない部分です。重要なのは、Anthropicのスタック上でエージェント開発が実際にはどのようなものになるかを再定義する3つのAPIサーフェス変更と、ローンチ時の報道のほとんどが見落とした、1つの未公開のコストシフトです。

4月16日の出荷内容

Opus 4.7は新世代ではありません。これは、モデルの重みよりもエージェントのサーフェスエリアが重要になる、Anthropic初のリリースです。

Claude Opus 4.7の発表 は、APIモデルIDのヘッドライン番号をリストアップしています。claude-opus-4-7、1M入力/128K出力コンテキスト、およびOpus 4.6と同一の、入力トークン100万あたり5ドル、出力トークン100万あたり25ドルに据え置かれた価格設定。同日、AWS Bedrock、Google Cloud Vertex AI、Microsoft FoundryでGAがロールアウトされました。Cursorは初日にデフォルトモデルとして採用しました。GitHub Copilot CLIは数時間以内に統合しました。

興味深い追加点はモデルカードにはありません。開発者向けインターフェースにあります。

最初のものはxhigh、これはhighmaxの間の新しいエフォートティアです。Claude CodeのPro、Max、Teams、Enterpriseサブスクリプションでは既にデフォルトとなっています。フラグを変更せずにアップグレードした開発者は、1週間前よりも高いコンピューティングティアで実行されています。

2つ目はタスク予算で、パブリックベータ版として提供されます。エージェントループ全体(思考、ツール呼び出し、出力を含む)の合計トークンターゲットをモデルに渡し、モデルは実行中にカウントダウンを認識します。これにより、探索に予算を使い果たすのではなく、優先順位付けが行われます。オプトインするには、task-budgets-2026-03-13 のベータヘッダーを使用してください。

3つ目は、Claude Code のスラッシュコマンドである /ultrareview です。これは、各パスで新しいコンテキストを持つ専用のマルチステージコードレビューをトリガーします。Pro および Max ユーザーは期間ごとに 3 回まで無料で実行でき、それ以降は従量課金となります。

Vision も向上しました。サポートされる画像解像度は、長い辺で最大 2,576 ピクセル(約 3.75 メガピクセル)に達し、これは以前の Claude の上限の約 3 倍です。Anthropic 自身の数値によると、長時間の剤の信頼性は、複雑なマルチステップワークフローでトークン使用量が少なく、Opus 4.6 の約 3 分の 1 のツール呼び出しエラーで 14% 向上しています。これらの数値は、独立したベンチマークではなく、ローンチパートナーとの内部テストから得られたものです。

エージェントビルダーにとって、実用的な点は、Anthropic が開発者インターフェースに 3 つの新しいプリミティブと、モデルに 1 つの機能差分を出荷したということです。プリミティブはコードを変更するものであり、モデルの差分はマーケティングを変更するものです。

Claude エージェントビルダーが実際に気にする 3 つのこと

タスク予算、xhigh effort、および `/ultrareview` が実際の製品です。モデルの重みはテーブルステークです。

タスク予算から始めましょう。これは、エージェントの価格設定方法を静かに変えるからです。従来の一般的なエージェントループには、入力トークンと出力トークンの2つのコスト面がありました。4.7では、ループ自体の長さという3つ目が追加されました。タスク予算を使用すると、上限を設定でき、モデルは実行中にそれを認識するため、探索に予算を費やすのではなく、アクションを割り当てます。結論に達するために14万トークンを消費していたリサーチエージェントは、現在8万トークンの予算内で終了するように指示でき、自己切り捨てを行い、どのツール呼び出しを保持し、どの呼び出しをスキップするかを選択します。

Anthropicが予算を請求上のアーティファクトではなく、インバンドシグナルとして扱ったのはこれが初めてです。long-running agent economicsのディープダイブはそれをよく表しています。長期間実行されるエージェントにとって、タスク予算と新しいトークナイザーは、ヘッドライン価格の変更がなくても、コストモデルを大きく変えます。ループに「Nターン後に停止」というアドホックなロジックを記述してきたビルダーは、今や同じアイデアのためのファーストクラスのプリミティブを手に入れました。

xhigh effort は静かなデフォルトの変更です。Claude Code は xhigh を新しいベースラインとしてリリースしました。これは、Claude Code で実行されている既存のエージェントがすべて、より高いコンピューティングティアで動作していることを意味します。それに伴う品質の向上は、消費トークンの比例的な増加を伴います。明示的に effort=high を渡さない場合、本番環境の実行は先週よりも高価になっています。Claude Code を意味のある規模で実行しているチームにとって、これは無視するのではなく監査する価値のある設定変更です。

/ultrareview は Anthropic 初の専用 Claude Code レビューサーフェスです。各パスは新しいコンテキストで実行されるため、1つのファイルに対するフィードバックは、長いセッションの以前の脱線を汚染しません。Pro および Max ユーザーは期間ごとに 3 回の無料実行ができます。それ以降は従量課金制になります。これは、レビューの品質(独立したテストが必要になります)のためというよりも、Anthropic が一般的なモデルのアプリケーションとしてではなく、特定の剤モードを個別の従量課金製品として切り出していることを示しているため、より重要です。

実際のエージェントビルダーが検証したい機能に関する主張は、Cognition の Scott Wu からのもので、彼のチームは Devin の Agent Preview で Opus 4.7 を稼働させています。Wu は、Devin Agent Preview post, Anthropicは「Claude Opus 4.7を長期間の自律性向けに明確に最適化し、以前は確実に実行できなかった深い調査作業のクラスを解除した」と述べました。つまり、数時間一貫して動作するということです。これは具体的な能力の主張であり、4.7が実際のAgentで何ができ、何ができないかのシグナルとしてSWE-benchの数値よりも価値があります。

具体的な採用データポイントはCursorです。内部ベンチマークCursorBenchはOpus 4.6の58%から4.7では70%に12ポイント上昇し、Cursorチームはモデルを初日からデフォルトにした際にこれを引用しました。開発環境でCursorを使用している場合、すでにアップグレードを実行しています。

Anthropicのローンチポストでも言及されているReplitは、同じ品質でログ分析、バグハンティング、修正提案のコストが低いという、ありきたりだが高価なことを述べました。このフレーミングは、エンタープライズ顧客内の品目ごとの移行を可能にします。そこでは、「このモデルはより賢いか?」ではなく、「請求書に署名するVPに費用を正当化できるか?」という問題になります。Notionは、自社のAgentワークフローで同じ+14%とツールのエラー削減3分の1という数値を報告しました。これは、Notionがローンチパートナーの中で、Agentの使用ケースが明らかにコーディングの形状をしていない数少ない企業の一つであるため重要です。信頼性の向上コーディング以外でも持続する場合、それは今後1ヶ月で追跡する価値のあるシグナルです。

誰も話題にしていないステルス値上げ

Opus 4.7の定価は4.6と同じです。タスクあたりの価格は異なります。新しいトークナイザーが価格表では対応できなかった作業を行います。

Anthropicは、入力$5 / 出力$25の数値を引き上げませんでした。引き上げる必要はありませんでした。4.7のトークナイザーは異なり、同じ文字列を以前のレートの約1.0〜1.35倍でトークン化します。典型的なコーディングプロンプトは、その密な句読点と繰り返しの識別子により、その範囲の高い方に位置します。

計算は単純です。Opus 4.6で10,000トークンかかったプロンプトは、4.7では12,000〜13,500トークンかかる可能性があります。同じ単語、同じトークンあたりの価格、より高い請求額です。Claude Codeの新しいデフォルトであるxhighと組み合わせると、典型的な開発者は、コードを変更しなくても初日から測定可能なコスト増加を経験します。

コミュニティの反応は、通常のローンチ後のノイズよりも鋭くなっています。それを「最悪のリリース」と呼ぶコミュニティの書き込み3つの不満点が挙げられています。トークナイザーの肥大化、デフォルト設定によるコストシフト、そしてクリエイティブライティングにおける認識された後退です。Redditのトップスレッド「Claude Opus 4.7はアップグレードではなく深刻な後退」は、約2,300件の賛成票を集め、幻覚(悪名高い「ストロベリー」のスペルが復活)、架空の学校を記載した履歴書の書き直し、そしてシグナルを追加せずにトークンを消費する確認ループなどを記録しています。

これら全てが公平というわけではありません。不満の多くは、Anthropicがリリースごとに受ける反応と重複しており、以前のモデルに慣れたユーザーは、プロンプトを調整するまで新しいデフォルト設定を後退と経験します。しかし、トークナイザーの肥大化に関する具体的な主張は、独立して再現可能であり、懐疑的な開発者の記事とAnthropic自身のドキュメントが技術的に一致する、珍しいリリースです。トークナイザーは新しいものです。新しいトークナイザーは異なる方法でトークン化します。請求額はそれを反映します。

リリースノートの正直なバージョンは次のようになります。「トークンあたりの価格は同じ、タスクあたりのトークン数は増加したため、エージェントコードを変更しなくても月々の請求額は増加します。」「価格変更なし」という記載もあります。どちらも真実です。ビルダーにとって意味のあるのは後者です。大規模に実行されるエージェントを出荷する場合、品質向上がトークンインフレに見合うかどうかを判断する前に1週間の本番データが必要であり、Claude Codeの4月30日のプロモーション7.5倍乗数(multiplier)が失効する前にそのデータが必要になります。なぜなら、実際のコスト構造はその日付の向こう側に存在するからです。

4.7はGPT-5.4およびGemini 3.1 Proとどう違うか

Opus 4.7はコーディングとツールの使用において僅差でリードを奪い返しました。ターミナルとブラウジングにおいては、依然として遅れをとっています。

ベンチマークの画像は混在しており、これが正確な評価です。SWE-bench Verifiedでは、Opus 4.7は87.6%を記録し、4.6の80.8%から向上し、GPT-5.3-Codexの85.0%、Gemini 3.1 Proのおおよそ80.6%を上回っています。ツール使用ベンチマークであるMCP-Atlasでは、4.7が77.3%でトップであり、Gemini 3.1 Proの73.9%、GPT-5.4の68.1%を上回っています。これは、このリリースにおけるclaude opus 4ファミリーにとって最も強力な競争上の勝利です。

Terminal-Bench 2.0は異なる結果を示しています。Opus 4.7は69.4%を記録し、GPT-5.4の75.1%に劣っています。BrowseCompはさらに悪く、4.7は79.3%で、4.6の83.7%から4.4ポイント低下しており、Gemini 3.1 Proの85.9%、GPT-5.4 Proの89.3%を大きく下回っています。GPQA Diamond(推論ベンチマーク)では、3つすべてが約94%でほぼ同等です。

僅差で首位を奪還」というフレーズは、その形状を捉えています:「僅差で首位を奪還」。これは世代交代のような飛躍ではありません。一部のベンチマークで勝利し、他のベンチマークで敗北し、競合他社よりも優れた開発者プリミティブを出荷するリリースです。

エージェントビルダー向けの実際的な翻訳:セットアップがコーディング中心でツールが多い場合は、4.7がデフォルトの選択肢です。ターミナルオペレーション中心またはブラウジング中心の場合は、GPT-5.4-CodexまたはGemini 3.1 Proをプライマリまたはセカンドオピニオンとしてローテーションで維持することをお勧めします。

より示唆に富む文脈は、Mythos concessionであり、AnthropicはOpus 4.7が最先端モデルではないことを公に認めています。同社の内部Mythosモデルは、Anthropic自身の評価において4.7を上回っており、まだリリースされていません。主要な研究所が、今日リリースするものが最良のものではないと市場に明示的に伝えるのは珍しいことです。この文脈でリリースを読むと、Opus 4.7は頂点ではなく、通過点であることがわかります。

エージェントツールレイヤーにとっての意味

4.7のリリースは、Cursor、Devin、Replitが1年前に賭けたものを裏付けています。モデルはコモディティであり、エージェントシェルが製品なのです。

Cursor、GitHub Copilot CLI、DevinのAgent Previewでの初日からデフォルトで採用されていることがそのシグナルです。IDEおよびエージェントベンダーは、新しいモデルに切り替える前に開発者の需要を待たなくなりました。彼らはすぐに切り替えます。なぜなら、彼らが販売する差別化はもはや「どのモデルをラップするか」ではなく、「どのシェルがモデルを実際の作業で利用可能にするか」だからです。

Anthropicがローンチ投稿で引用したReplitのフレーミングは単純でした。ログ分析、バグハンティング、修正提案において、同じ品質で低コストであること。これはモデルにとって最もありふれた賛辞ですが、エンタープライズ顧客内の予算ライン移行を解除するものでもあります。投稿で引用されたNotionも、+14%のエージェントワークフロー改善と、内部でのツールコールエラー削減が約3分の1になったと報告しています。

タスク予算と/ultrareviewこの組み合わせは、エンドユーザーがもはや生のAPIで構築しなくなったという現実に対するAnthropicの回答です。彼らはClaude Code、Cursor、あるいはパートナーのエージェントシェルで構築しています。機能をモデルだけでなくシェルに移行することで、Anthropicは顧客が実際に活動している場所で競争しています。

競争上の意味合い:OpenAIのCodexとGoogleのGeminiエージェントは同じ仮定に基づいています。競争は「どのベースモデルが最も賢いか」から「エージェントが構築されるサーフェスを誰が所有するか」へとシフトしました。Anthropicのスタック上で構築する人にとって、意思決定ツリーはもはや「どのモデルを呼び出すか」ではありません。「どのシェルで構築するか、そしてそのシェルがタスク予算、労力管理、コードレビューをファーストクラスのプリミティブとして公開しているか」です。構造化された「AIネイティブなセカンドブレイン」のようなツールは、研究上の好奇心というよりも、エージェントシェルが実行を裏付けるために必要とするコンテキストレイヤーのように見え始めています。

次は何?

夏前にMythosが登場し、Anthropicはモデルウェイトよりもエージェントサーフェスを押し進め続けると予想されます。

短期的には、Claude Codeでの7.5倍のプロモーションリクエスト乗数は4月30日までです。新しいトークナイザーと新しいデフォルトの労力での実際のコストデータは、5月上旬に登場します。コミュニティは、プロモーション後のクリーンなデータでトークナイザーの肥大化に関する主張を再ベンチマークし、Anthropicはドキュメントの更新またはClaude Codeのデフォルトの静かな調整で対応すると予想されます。

中期的には、3ヶ月から6ヶ月で、Mythosが部屋の中の象です。Anthropicは、より大きなモデルが内部に存在することを明確に認めています。Opus 4.6 → 4.7のリリース間隔は、Mythosクラスのリリースを夏に示唆しています。より興味深いシグナルは、Anthropicが製品の方向性を示唆していることです。次のモデルは、ベンチマーク数だけでなく、それに付随するエージェントサーフェスによっても測定されるでしょう。

長期的には、タスク予算はベータ版から一般提供版(GA)に移行し、エージェントループの価格設定、請求、開発者ツールでの表示方法のデフォルトになる可能性が高いです。/ultrareviewは、専用エージェントモードのテンプレートです。データ分析、リサーチ、オペレーションが、同じモデルの応用ではなく、個別の従量課金製品として現れるのと同じパターンを期待してください。

開発者にとっての未解決の問題は、Anthropicが、モデルのわずかな改善と並行して新しいエージェントサーフェスを出荷するという戦略が、GPT-5.4やGemini 3.1 Proが同等のプリミティブを追加する中で、通用するかどうかです。モデルウェイトの優位性は、製品サーフェスよりも維持が困難です。製品サーフェスは、エコシステムよりも維持が困難です。最終的にclaudeエージェントレイヤー、または競合するCodexおよびGeminiレイヤーを所有することになる者は、ベンチマークで勝利することによってではなく、シェルを構築することによってそれを成し遂げたでしょう。

今日、4.7にアップグレードする価値はありますか?

Claude Codeでコーディング中心のclaudeエージェントを実行している場合、デフォルトのxhighと/ultrareview は、ステルストークナイザーのインフレを考慮しても、アップグレードする価値があります。ブラウジング中心の運用をしている場合は、依然として GPT-5.4-Codex または Gemini 3.1 Pro を使用するのが良いでしょう。いずれにしても、予算を組むべきなのはアップグレード自体ではなく、継続的な監査です。タスクあたりのエージェントのコストは現在いくらで、1週間前はいくらでしたか?その答えが得られたら、モデル自体と同じくらい、エージェントセッション間で作業メモリをどのように「recall your work memory」させるかが重要になってきます。Opus 4.7 は頂点ではなく、通過点です。通過点のために構築してくださいが、それを目的地と混同しないでください。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page