top of page

Anthropic、Claude Sonnet 5.5のキャッシュ料金を引き下げ、OpenAIと同じ0.10ドルに

1 日前
読了時間: 17分

AnthropicはClaude Sonnet 5.5のキャッシュ料金を50%引き下げ、キャッシュ読み取りの料金を100万トークン当たり0.20ドルから0.10ドルへ引き下げた。同社によれば、長い指示やコンテキストを繰り返し再利用するアプリケーションが多いエージェント型の作業では、Sonnet 5.5のコストが大半で約20%低下するという。

この条件付けは重要だ。Anthropicはモデルの通常入力料金や出力料金を引き下げたわけではない。同じシステムプロンプト、ツール定義、リポジトリのコンテキスト、参考資料をエージェントが繰り返し送信する場合に重要となる、一つの料金要素を変更した。

この変更により、Sonnet 5.5のキャッシュ読み取り料金はOpenAIのGPT-6.1 Solと同水準になった。両モデルは現在、通常入力、キャッシュ入力、出力について同一の料金を掲げている。これにより競争の焦点は表面的なトークン単価から、より難しい問いへと移る。すなわち、どのモデルがより少ないリクエスト、より少ない生成トークン、より少ない手戻りで、信頼できるタスク完了を実現できるかという問題だ。

Claude Sonnet 5.5のキャッシュ料金が半額に

今回の変更範囲は限定的だが、長時間稼働するエージェントのワークフローで最大級の継続コストの一つを狙っている。

Anthropicは2026年10月7日、Claude Haiku 5.5のリリースとともに料金引き下げを発表した。同社のモデル発表によると、Sonnet 5.5のキャッシュ読み取りは同日から、100万トークン当たり0.20ドルではなく0.10ドルとなった。

キャッシュ読み取りは、アプリケーションが以前に保存したプロンプト内容を再利用する際に発生する。その内容を通常の入力料金で改めて処理するのではなく、プロバイダーが一致するプレフィックスを取得し、より低いキャッシュ読み取り料金を課す。

この機能が最も重要になるのは、リクエストに大きく安定したプレフィックスが含まれる場合だ。コーディングエージェントは、リポジトリの指示、ツールの説明、コーディング標準、選択したソースファイルを繰り返し送信することがある。リサーチシステムは、多数の質問にわたり長大なポリシーマニュアルや文書コレクションを再利用する可能性がある。

カスタマーサポートのエージェントも同様のパターンを取ることができる。安定したシステムプロンプト、製品カタログ、エスカレーションルール、ツールスキーマを毎ターンに持ち込むことが多い。変わるのは顧客の最新メッセージと、エージェントの最新の作業状態だけだ。

Sonnet 5.5の現行料金では、Anthropicは通常入力を100万トークン当たり2ドル、出力を100万トークン当たり10ドルとしている。キャッシュヒットの料金は現在、通常入力料金の5%であり、従来の10%から下がった。

再利用可能な内容を最初に保存する必要があるため、キャッシュ書き込みは通常入力より高額なままだ。Anthropicは、5分間キャッシュの書き込みを100万トークン当たり2.50ドル、1時間キャッシュの書き込みを4ドルとしている。読み取り料金の引き下げが効果を発揮するのは、アプリケーションが保存済みプレフィックスを十分な回数再利用する場合に限られる。

100,000トークンの安定した内容を100回のリクエストで送信する単純化したワークロードを考えてみよう。キャッシュなしでは、これらの反復トークンは通常入力1,000万トークンに相当する。効果的なキャッシュがあれば、最初のリクエストでプレフィックスを書き込み、その後のリクエストでは大半をキャッシュ読み取り料金で取得する。

新料金は、この例における読み取り部分のコストを半減させる。新規入力、キャッシュ作成、モデル出力、外部ツール、再試行、失敗したタスクのコストは下がらない。

したがって、Anthropicが見積もる20%の削減は、同社が「大半のエージェント型作業」と呼ぶものを表している。Sonnet 5.5のすべてのリクエストに適用される一律割引ではない。短いプロンプト、低いキャッシュヒット率、出力比重の高いワークロードでは、変化はより小さくなる。

今回の値下げは、Sonnet 5.5が9月28日に発表された後に続くものだ。Anthropicは当初のSonnet 5.5リリースで、キャッシュ読み取りを0.20ドルとしており、このモデルは通常Sonnet 5より少ないトークンで済むとしていた。

この発表時点で、効率性は単なるトークン単位ではなく、タスク単位で位置付けられていた。Anthropicは、Sonnet 5.5が前モデルよりタスク当たり最大30%低コストで、出力生成も30%以上高速になり得るとしていた。

キャッシュ料金の調整は、2週間未満のうちにもう一つの効率化要因を加えたものだ。また、孤立したチャットボット応答ではなく、継続的に動くエージェントこそが重要な単位になりつつあるというAnthropicのメッセージも鮮明にしている。

長時間稼働するエージェントでキャッシュヒットの価値が高まる理由

エージェントは同じコンテキストを繰り返し消費するため、通常入力料金のわずかな変更以上に、キャッシュの経済性が重要になり得る。

一般的なチャットボットのリクエストには、短い指示と一つのユーザーメッセージしか含まれない場合がある。一方、エージェント型アプリケーションでは、各モデル呼び出しにより多くの仕組みを持ち込むのが通常だ。

その仕組みには、運用ポリシー、数十のツール定義、タスク履歴、取得したレコード、ソフトウェア文書、先行ステップで組み立てた計画などが含まれ得る。エージェントが検索、ファイル編集、サービス呼び出し、結果検証を行う間も、多くの要素は変わらない。

プロンプトキャッシュは、リクエストから再利用可能なプレフィックスを保存する。後続の呼び出しでは、すべてのトークンを新規入力として課金する代わりに、一致する内容を割引料金で取得できる。

キャッシュは、モデルが情報を永続的に記憶することを意味しない。定義されたキャッシュ有効期間内における、一致するプロンプト内容のための課金・処理メカニズムである。プレフィックスが変更、期限切れ、またはプロバイダーのキャッシュ規則を満たさなくなった場合、アプリケーションは再び書き込む必要がある。

この違いにより、実務上の変数が三つ生まれる。

第一に、開発者は高いキャッシュヒット率を確保する必要がある。安定した指示やツールは、頻繁に変わるメッセージより前に配置すべきだ。キャッシュ済みプレフィックスへの不要な編集は、再利用を無効化する可能性がある。

第二に、アプリケーションはキャッシュ書き込みの割増料金を回収できるだけの反復呼び出しを必要とする。一度しか使われないプレフィックスに読み取り節約はない。数百回使用されるプレフィックスでは、読み取り料金が主要なコスト要素になり得る。

第三に、出力生成も依然として重要だ。Sonnet 5.5の出力料金は100万トークン当たり10ドルで、新しいキャッシュ読み取り料金の100倍に当たる。長い説明を生成し、同じ内容を繰り返し、あるいは再試行ループに入るエージェントは、キャッシュコンテキストが安くなった効果を打ち消し得る。

このため、削減率はアプリケーションによって異なる。Anthropicの20%という数字は、キャッシュ読み取りが当初の請求額に占める比率が大きいものの、支配的ではないワークロードを意味している。

単純なコストモデルで、この関係はより明確になる。以前、キャッシュ読み取りがワークロードのモデル支出の40%を占めていたと仮定する。この要素を半額にすれば、全体は20%下がる。キャッシュ読み取りが10%しか占めないなら、同じ料金変更による総支出の削減は5%にとどまる。

どちらの例も、特定顧客の請求額を予測するものではない。Anthropicの平均的な主張が成り立つために必要な条件を示している。

最大の恩恵を受けるのは、長く再利用可能なプレフィックスと多数の連続呼び出しを持つシステムだろう。リポジトリの指示やツール定義がタスク全体を通じて持続することが多いため、コーディングエージェントはこのパターンに当てはまる。

文書分析も恩恵を受け得る。チームは大きな契約書、技術仕様書、あるいはリサーチ資料をキャッシュ済みプレフィックスに配置し、一連の焦点を絞った質問を行える。

ナレッジワーク向けエージェントにも同様のニーズがある。レポートを作成する間、安定した社内ポリシー、会議記録、プロジェクト文書を繰り返し参照する場合がある。こうしたシステムを構築するチームには、検索可能なエンジニアリングナレッジベースを維持するのと同様に、規律あるコンテキスト選択が求められる。

整理が不十分なコンテキストをキャッシュしても、それ自体が有用になるわけではない。反復送信が安くなるだけだ。検索精度が低ければ、無関係な資料でプロンプトが埋まり、モデルが曖昧さを解消するために出力トークンを費やすことは依然としてあり得る。

Anthropicのプロンプトキャッシュ文書では、静的コンテンツをプロンプトの先頭近くに、動的コンテンツを後方に配置することが推奨されている。この構造により、後続のリクエストが保存済みプレフィックスと一致する可能性が高まる。

開発者は、キャッシュ作成カウンターと読み取りカウンターも別々に監視すべきだ。読み取り対書き込みの比率が低い場合は、短いキャッシュ有効期間、不安定なプレフィックス、ルーティング変更、または保存済みコンテキストを一度も再利用しないリクエストが示唆される可能性がある。

新しいClaude Sonnet 5.5のキャッシュ料金は、こうしたエンジニアリング上の判断の価値を高めるものだ。それらを測定する必要性をなくすものではない。

AnthropicとOpenAIは同じ表面上の料金体系に

今回の値下げはOpenAIの目立つ価格優位性を打ち消し、購入者にタスク全体の完了コストを比較するよう促す。

OpenAIはGPT-6.1 Solを、AnthropicがSonnet 5.5に設定しているのと同じ、入力2ドル、出力10ドルの料金で導入した。ただしGPT-6.1 Solは、キャッシュ入力を100万トークン当たり0.10ドルとして登場した。

Anthropicの値下げ前、これら三つの料金表項目だけを比較するアプリケーションには明確な差があった。Sonnet 5.5のキャッシュ入力コストは2倍だった。

この差は現在なくなった。Sonnet 5.5とGPT-6.1 Solはいずれも、次の料金を掲げている。

  • 通常入力は100万トークン当たり2ドル

  • キャッシュ入力は100万トークン当たり0.10ドル

  • 基本キャッシュ期間のキャッシュ書き込みは100万トークン当たり2.50ドル

  • 出力は100万トークン当たり10ドル

OpenAIによれば、GPT-6.1 Solのキャッシュ入力料金は通常入力料金の5%だ。同社のモデル文書には、105万トークンのコンテキストウィンドウと、複数の推論強度設定のサポートも記載されている。

料金が一致したことで、単純な価格比較の有用性は低くなる。二つのエージェントが同一のトークン料金を持つモデルを使っていても、請求額は大きく異なり得る。

あるモデルは8回の呼び出しでコーディング上の問題を解決できるかもしれない。別のモデルは15回の呼び出しを必要とし、より多くの推論トークンを生成し、追加のツールを起動し、失敗したパッチを繰り返す可能性がある。後者のシステムは、同じ料金表にもかかわらず高コストになり得る。

信頼性は計算をさらに変える。人がエラーを特定し、損なわれた作業を復元し、タスクを再実行しなければならないなら、安価な初回試行の価値は小さい。経済的に意味を持つ指標は、受け入れられた結果を得るためのコストだ。

レイテンシーにもコストがある。より少ない連続ステップで作業を完了するエージェントは、計算容量を解放し、ユーザーの待ち時間を短縮できる。インタラクティブ製品では、トークン支出の小さな差よりも重要になる場合がある。

Anthropicは、Sonnet 5.5をこのタスクレベルの指標で位置付けようとしている。同社は、コマンドライン環境における複数ステップの専門タスクを評価するTerminal-Bench 4.0で、70.6%の結果を報告している。

Anthropicはまた、Sonnet 5.5がSonnet 5より30%以上高速に動作し、同じ作業でより少ないトークンを使用できるとしている。これらは同社が報告した結果であり、本番環境での性能はエージェントハーネス、プロンプト、ツール、タスク分布に依存する。

OpenAIもGPT-6.1 Solについて独自の性能・効率性に関する主張をしている。同社の発表では、標準トークン料金を抑えながら、GPT-6 Astraの能力に近づくモデルと説明している。

どちらの企業のベンチマークスイートも、普遍的な勝者を示すものではない。Anthropicのテストは特定の推論強度設定とエージェント構成を用いている。OpenAIの評価は同社独自の研究環境を用いており、APIの挙動が異なる可能性も認めている。

エンタープライズの購入者にとって、実務的な比較には代表性のある評価セットが必要になった。チームは、成功した完了、人的な受容、ツール呼び出し、キャッシュ済みトークン、キャッシュされていない入力、出力、レイテンシー、再試行を測定する必要がある。

同じ運用制約もテストすべきだ。一方のモデルに追加ツール、異なるコンテキストパッケージ、より寛大な推論設定を与えれば、コスト比較の信頼性は損なわれる。

主な競争は、Sonnetのキャッシュ価格とOpenAIの価格の比較ではもはやない。Anthropicが掲げる効率的なタスク完了という主張と、各顧客の本番ワークロードにおける現実との比較に移っている。

20%の削減という主張には重要な制約がある

Anthropicの試算はキャッシュを多用するエージェントには妥当であり得るが、総運用コストが自動的に下がることを意味するものではない。

最初の制約は、キャッシュの適用条件だ。アプリケーションが低価格の恩恵を受けられるのは、リクエストが実際にキャッシュヒットした場合に限られる。似た内容であっても、同一の内容とは限らない。

ツール定義の移動、タイムスタンプの変更、取得文書の並べ替え、あるいは初期のシステム指示の修正によって、再利用可能なプレフィックスが壊れる可能性がある。したがって、小さなアーキテクチャ上の選択が、告知された料金が適用されるかを左右し得る。

2つ目の制約はキャッシュの有効期間だ。Anthropicは異なる保存期間をサポートしており、書き込み価格もそれぞれ異なる。リクエストの間隔が長いシステムでは、キャッシュ書き込みを繰り返す必要があり、純粋な節約効果が減少する可能性がある。

3つ目の制約は出力コストだ。キャッシュ読み取りは現在安価になっているが、生成トークンは依然としてはるかに高コストである。長い推論トレース、冗長な応答、繰り返される修正が最終的な請求額の大半を占める可能性がある。

4つ目の制約はオーケストレーションのオーバーヘッドだ。エージェントはしばしば検索システム、ブラウザ、データベース、コード実行環境、またはサードパーティAPIを呼び出す。Anthropicによるモデル価格の引き下げは、それらの料金を下げるものではない。

5つ目の制約は人間によるレビューだ。安価でも信頼性の低い作業を出力するモデルは、人件費を増加させかねない。このリスクは、ソフトウェア変更、規制対象のワークフロー、顧客データに影響するアクションで特に重要となる。

Anthropic自身も、Sonnet 5.5の当初発表で、ベンチマークはモデル能力の一側面しか捉えないと注意を促している。同社によれば、持続的な判断を要する複雑でオープンエンドなタスクでは、Opus 5.5の方が依然として強力だという。

これはルーティング上のトレードオフを生む。開発者は、定型的でスコープが明確な作業をSonnet 5.5に割り当て、より難しい判断は大型モデルに委ねられる。ただし、誤ったルーティングでは、システムがエスカレーションする前にSonnetが何度も失敗する可能性がある。

設計の不十分なルーターは、キャッシュ割引による節約額以上のコストを浪費しかねない。チームは、失敗した試行やエスカレーション呼び出しを含むルート全体を測定すべきだ。

GPT-6.1 Solとの比較には、もう一つの複雑さがある。見出し上の価格が一致していても、プロバイダーがキャッシュを同じ方式で実装しているとは限らない。

OpenAIのキャッシュガイドによると、新しいモデルではモデルに応じて明示的または暗黙的なブレークポイントがサポートされている。また、対象となるトークンに影響する最小プロンプト長やレポート規則についても説明している。

Anthropicは独自のキャッシュ制御、期間、ブレークポイント、使用量レポートを用いる。プロバイダー間でエージェントを移行する場合、キャッシュヒット率を比較可能にする前に、プロンプトの再構成が必要になることがある。

クラウド配信は、状況をさらに複雑にする可能性がある。Sonnet 5.5はAnthropicおよびパートナープラットフォームを通じて利用できるが、価格、リージョンでの提供状況、機能提供の時期はプロバイダーごとに異なり得る。

したがって、発表された0.10ドルの料金は、本番環境で使用する特定のエンドポイントで確認すべきだ。クラウドマーケットプレイス経由で運用している企業は、すべてのリージョンサービスが同時に変更を採用したと想定すべきではない。

20%という主張の背景には、測定上の問題もある。Anthropicは、顧客ワークロード全体におけるキャッシュ利用状況の詳細な分布を公表していない。「大半のエージェント型作業」には、コーディング、リサーチ、ブラウザ利用、カスタマーサポートなど、トークンプロファイルの異なるパターンがまとめられている。

最も安全な解釈は明快だ。Anthropicは、確認可能な1つの単価を半額にした。より広い割合は、保証された顧客成果ではなく、同社がモデル化または観測したワークロード構成を示している。

チームは、数週間分の利用状況を比較することで、この主張を検証できる。見るべき指標には、リクエストあたりのキャッシュヒットトークン、キャッシュ書き込み頻度、非キャッシュ入力、出力、成功したタスク、受け入れられたタスクあたりの総支出が含まれる。

キャッシュ支出が減ってもタスクコストが同程度に下がらなければ、別のボトルネックがあることを示す。その要因は、出力長、失敗した試行、外部ツール、または人間による修正時間かもしれない。

開発者とAI購入者が次に注視すべき点

次の段階では、低いキャッシュ料金が本番環境の経済性を改善するのか、それとも競合するエージェントプラットフォームの新たな基準に過ぎなくなるのかが試される。

最初のシグナルは、Anthropicの更新された請求データだ。開発者は、Sonnet 5.5のリクエストに新しいキャッシュ読み取り料金が適用されていること、そしてパートナープラットフォームでも同じ変更が反映されていることを確認すべきだ。

アプリケーションを変更せずに、完了タスクあたりの支出が顧客側で減少すれば、Anthropicの主張は強まる。大半のワークロードで削減幅が小さいにとどまれば、より広範な20%という主張は弱まる。

2つ目のシグナルは競合価格だ。OpenAIのGPT-6.1 Solにおける同額の料金は、キャッシュ済みコンテキストに対してAnthropicが2倍の料金を請求する余地をすでに狭めたように見える。

Googleや他のモデルプロバイダーも、現在は同じ圧力に直面している。購入者は、特に永続的なコンテキストを前提に設計されたエージェントにおいて、キャッシュ済み入力の価格が通常入力のごく一部であることを、ますます期待している。

さらなる価格対応があれば、安価なコンテキスト再利用が標準的な競争機能になったことを示すだろう。対応がなければ、プロバイダーが依然としてモデル品質、インフラ、または独自のキャッシュシステムによって差別化していることを示唆する。

3つ目のシグナルは、独立したタスクレベルのテストだ。トークン価格はプロバイダーが請求額をどう計算するかを示すが、モデルが仕事を終えるためにどれだけの作業を必要とするかは示さない。

有用な評価では、ベンチマーク精度や100万トークンあたりの価格だけでなく、受け入れられた結果あたりのコストを報告すべきだ。また、推論設定、ツールアクセス、再試行ポリシー、キャッシュヒット率、人間によるレビュー基準も開示すべきである。

開発者にとって、直ちに取るべき行動は、理論上のプロンプトサイズにトークン価格を掛けるのではなく、実際の使用状況を確認することだ。代表的なタスクについて、キャッシュ読み取り、キャッシュ書き込み、非キャッシュ入力、出力を分けて分析する。

次に、それらの数値を成果と結び付ける。エージェントがタスクを完了したか、人がそれを受け入れたか、システムがエスカレーションや修復を必要としたかを追跡する。

キャッシュ最適化は、最も大きく安定したプレフィックスから始めるべきだ。システム指示とツール定義の一貫性を維持し、動的コンテンツは後方に置き、再利用可能な素材の前に変動するメタデータを挿入しないようにする。

チームはキャッシュ期限の挙動もテストすべきだ。5分間のキャッシュは密度の高いエージェントループでは有効に機能するが、承認待ちが長いワークフローでは不向きなことがある。より高価な1時間オプションでも、繰り返しの書き込みを防げるなら総コストを下げられる可能性がある。

最終的な購入判断では、少なくとも2つのモデルを同じ社内タスクセットで比較すべきだ。Claude Sonnet 5.5のキャッシュ価格とGPT-6.1 Solの価格が一致したことで、その実験は解釈しやすくなったが、勝者を決めるものではない。

Anthropicの引き下げに意味があるのは、エージェントのワークロードが通常のチャットセッションよりもはるかに頻繁にコンテキストを再利用するためだ。また、モデルベンダーがキャッシュ済みコンテキストを競争の主戦場と見なしていることも確認された。

未解決の問いは、低いキャッシュ価格が成功した作業を本当に安くするかどうかだ。今後1カ月間、キャッシュヒット率、再試行回数、出力量、受け入れられた結果を測定してほしい。完了タスクあたりの総コストがAnthropicの試算に近い水準まで下がれば、この値下げは経済性を変えたことになる。そうでなければ、エージェントの高コスト部分は別の場所にある。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page