top of page

Epoch AIのコストレポート、AI価格がムーアの法則を上回るペースで下落していると示す

4 日前
読了時間: 18分

Epoch AIによると、一定のAI性能水準に到達するコストは2023年以降、四半期ごとに47%下落している。新たなEpoch AIのコストレポートは、このペースが年率で13分の1への低下に相当するとしており、コンピューティングハードウェアにおける歴史的な改善を大きく上回る。

この結果は、すべてのAI料金が同じ割合で下がることを意味するものではない。数学、科学、ゲームを対象とする5つのベンチマークにおいて、定義されたスコアを達成する最も安価な方法を測定したものだ。この違いは重要である。新しいモデルは、より少ないリソースや安価なインフラを使いながら、同等の成果を実現できるためだ。

それでもムーアの法則との比較は際立っている。コンピューティングは数十年にわたり着実に低価格化し、パーソナルコンピューター、スマートフォン、クラウドサービスの実現を後押ししてきた。Epoch AIは、性能調整後のAI価格が現在、コンピューティングの歴史的な低下率の6倍の速さで下落していると主張する。

直接的な恩恵を受けるのは、ワークロードを複数のモデル間で移行できる開発者や組織だ。その一方で、継続的な収益を必要とするOpenAI、Anthropic、Google、そしてサードパーティーのAIサービスには圧力がかかる。プレミアムモデルは優位性を確立できても、その経済的優位は数カ月以内に消える可能性がある。

ここに中心的な緊張関係が生じる。低コスト化した知能は導入の拡大を促すが、同じ下落が価格に基づくロイヤルティを弱め、生のモデルアクセスの価値を圧縮する。持続的な事業は、コンテキスト、ワークフロー統合、信頼、独自データを保持するモデル層の上に位置する可能性がある。

Epoch AIのコストレポートが実際に測定したもの

Epoch AIが測定したのは、単に公表されたAIトークン価格ではなく、成果を得るためのコスト低下だ。

この研究組織は2026年9月22日にコスト分析を発表した。研究者のLuke Emberson氏とDavid Roodman氏は、2023年以降の5つのベンチマークにわたるモデル性能と費用を調査した。

ベンチマークは、数学、大学院レベルの科学、チェス、その他のスキルゲームにおける難問を対象としている。Epoch AIはその後、異なる時点で達成可能な各性能水準に到達する、利用可能な最も安価な経路を推定した。

この境界はパレートフロンティアと呼ばれる。これは、一定の費用に対して最も優れた利用可能な性能を提供するモデルを表す。このフロンティアの外にあるモデルは、より優れた結果をもたらさないにもかかわらずコストが高い。

この手法は、推論予算も考慮に入れる。推論モデルは問題を検討するためにより多くの出力トークンを費やし、正答する可能性を高めることができる。そのため、単純なトークン価格だけではタスク完了にかかる総コストは分からない。

Epoch AIは評価トランスクリプトを用い、異なる予算上限の下で性能がどのように変化するかを推定した。このアプローチは、連邦政府のCenter for AI Standards and Innovation、すなわちCAISIの取り組みに沿ったものだ。モデルを単一の公表価格に還元するのではなく、各モデルについて費用対性能曲線を作成する。

この区別は、2つのモデルでトークンの使い方が異なる場合に重要になる。トークン単価が低いモデルでも、タスクを完了する前に大幅に多くのトークンを生成するかもしれない。質問から正答までを基準に測定すると、見かけ上の価格優位は消える可能性がある。

5つのベンチマーク全体で、Epoch AIは性能調整後の平均下落率を四半期ごとに47%と算出した。この傾向が複利的に続けば、1年でおよそ13分の1の低下に相当する。

ペースは分野ごとに異なった。ゲームベースのパズルでは価格が四半期ごとに約39%から43%下落した。数学ベンチマークでは、およそ50%から52%と、より速い下落が示された。

トークンの定価に頼らずに規模を示す例がある。Epoch AIは、リリース時期が18カ月未満しか離れていない2つのOpenAIモデルを比較した。後発モデルは、先行モデルの費用のおよそ725分の1で同じGPQA Diamondスコアに到達したと報告されている。

GPQA Diamondは、物理学、化学、生物学の大学院レベルの問題を中心に設計された多肢選択式ベンチマークだ。要求の高い推論の一種を捉えるものだが、有用な作業の全領域を網羅するものではない。

したがって、この見出しの数値は、測定された能力の価格指数として読むのが最適だ。学習コスト、企業支出、あるいはすべての顧客請求額を表すものではない。最もコスト効率のよい利用可能なモデルから、ベンチマーク結果をどれだけ安く購入できるかを追跡している。

この結果は、先行する証拠とも一致する。StanfordのAI Indexは、2022年11月から2024年10月の間に、GPT-3.5レベルの性能コストが280分の1超まで低下したと報告している。

Stanfordの調査は、Epoch AIの完全な費用対性能曲線ではなく、幅広い知識ベンチマークであるMMLUを使用した。手法が異なれば低下率も異なるが、どちらも異例に急激な下落を示している。

重要なのは、単一の推定値よりも結果の収束だ。独立したデータセットは、有用なAI能力がその基盤となるハードウェアよりもはるかに速く低コスト化していることを、ますます示している。

AI性能価格がこれほど急速に下落している理由

この下落は、より優れたアルゴリズム、小型で高性能なモデル、改善されたハードウェア、そしてプロバイダー間の激しい競争によるものだ。

ムーアの法則は、トランジスタ密度が時間とともに増加するという歴史的傾向を表す。この表現はコンピューティングコストの低下とも関連づけられるが、トランジスタ数と顧客価格は同一の指標ではない。

Epoch AIは、1940年から2001年の間にコンピューティング価格が年率約1.51倍の複利ペースで低下したと推定している。これに対し、2023年以降のAI性能価格は年率約13分の1に低下していると見積もる。

この差が生まれるのは、AIが半導体の進歩以上の恩恵を受けるためだ。モデル開発者は、アーキテクチャ、学習手法、データ選択、量子化、推論ソフトウェア、ハードウェア活用を同時に改善している。

量子化は、モデルの保存と実行に使う数値精度を下げる手法だ。慎重に適用すれば、有用な性能の大部分を維持しながら、メモリと計算資源の要件を引き下げられる。

Mixture-of-expertsシステムも別の経路を提供する。すべてのパラメーターを使うのではなく、入力ごとにモデルの選択された部分だけを有効化する。この設計により、リクエストごとにネットワーク全体を必要とせず、能力を高められる。

蒸留は、大規模モデルの有用な振る舞いを小規模モデルへ移す手法だ。小規模モデルはその後、より低いレイテンシとリソース使用量で日常的なタスクを処理できる。組織は、追加能力が結果を変える問題に限って大規模モデルを使える。

競争はこうした技術的な向上を増幅する。プロバイダーは、以前のフラッグシップに近い性能を目指す小型モデルを繰り返しリリースしている。オープンウェイトモデルも、独立系ホストが提供効率で競争することを可能にする。

2026年の研究論文The Price of Progressは、Epoch AIとArtificial Analysisのデータを用い、より保守的な結論に至った。比較可能なベンチマーク性能について、年間で5分の1から10分の1への低下を推定している。

著者らは、この下落をハードウェア効率、アルゴリズム上の進歩、経済的競争によるものとした。ハードウェアと市場の影響を分離しようとした後、アルゴリズム効率による年間の進歩をおよそ3倍と推定した。

この推定値は、Epoch AIが示す年率13分の1という見出しの数値を下回る。この差は、どちらの分析も無益であることを意味しない。結果がベンチマーク、性能のしきい値、モデルセット、フロンティアの定義にどれほど強く依存するかを示している。

Epoch AIの指標は、各能力水準で最も安価な利用可能モデルを選ぶ。この枠組みは、市場を定期的に再評価し、現在のコストリーダーへ切り替える非常に能動的な買い手を想定している。

実際の組織は異なる行動を取る。モデルのテスト、プロンプトの書き換え、セキュリティ確認、評価の更新、契約の再交渉に時間を費やす。こうした切り替えコストにより、多くのユーザーは理論上の下落をすべて取り込めない。

この調査では、ある性能水準が初めて登場した直後に価格が最も速く下落することも分かった。5つの主要ベンチマーク全体で、フロンティアに近い性能は当初、四半期ごとに66%安くなった。

性能水準の登場から2年後には、推定される四半期ごとの下落率は32%まで鈍化した。それでも年間では急速な低下を表すが、初期の競争ほど劇的ではない。

Epoch AIは、新しい能力には一時的にプレミアムがつくと示唆する。その後、競合他社がそれを再現または近似し、元のプロバイダーは提供コストを最適化する。能力が一般化するにつれて、プレミアムは縮小する。

このパターンは、集計された下落がムーアの法則を上回り得る理由を説明する。市場は新世代チップを待たない。継続するハードウェアの向上の上に、ソフトウェア、モデル、インフラ、競争による改善を重ねる。

また、AI企業がデータセンターへの支出を増やしながらも、この傾向が続き得る理由も説明する。最強モデルの学習と、確立された能力の提供は異なる経済活動だからだ。

フロンティア研究所は研究にますます多くのリソースを投入する一方で、顧客は昨日の性能に対してより低い料金を支払うことになる。この業界は同時に、最前線の創出コストを高めつつ、既存能力の消費コストを下げている。

低コスト化する知能がモデルベンダーに圧力をかける

急速な価格下落により、生のモデル能力はプレミアム収益を得られる期間が短縮する、価値が減衰していく製品となる。

OpenAI、Anthropic、Googleなどのモデル開発企業は、性能フロンティアの確立を競っている。この地位は注目、企業による試用、そして最も強力な利用可能システムを求める開発者を引き寄せる。

Epoch AIの調査結果は、この優位が経済的価値を急速に失うことを示唆している。5つのベンチマークでは、新たに達成された性能水準の周辺で最も急激な下落が見られた。その後、競合が追いつくにつれ、先行する成果に付随したプレミアムは弱まった。

これは難しい収益上の問題を生む。研究所はフロンティアモデルの学習、評価、セキュリティ確保、運用に多額の投資を必要とする。しかし、固定された能力に対して顧客が受け入れる価格は、そのモデルが長い商業的寿命を享受する前に下落する可能性がある。

元のニュース分析は、顧客ロイヤルティに生じる課題を強調した。同等のモデルが数カ月以内に安くなれば、買い手には代替手段を維持する理由が生まれる。

サードパーティーのAIサービスは、この問題のさらに厳しい形に直面する。1つのモデルへのアクセスを単に再販するだけの製品は、新しいモデルを使う別のサービスに価格で圧倒される可能性がある。

顧客はまた、単一プロバイダーへの長期的なコミットメントに疑問を持つかもしれない。今日選ばれているモデルは、次のリリースサイクルの後には優位性を失う可能性がある。固定的なアーキテクチャは、上流コストの下落を移行圧力に変え得る。

市場の反応はすでに製品設計に表れている。プロバイダーは、コーディング環境、エージェント、ファイルシステム、コネクター、メモリ、セキュリティ制御、デプロイメントの選択肢を通じた競争を強めている。

これらの機能は、ベンチマークでは測定できない価値を生み出す。周辺サービスが企業の権限、用語、文書、レビュー工程を理解している場合、モデルの切り替えはより難しくなる。

信頼性も重要です。回答が安価でも、それによって人によるレビューが増えるのであれば、企業にとって利益にはなりません。有用な指標は、失敗や監督も含め、許容可能な品質の仕事を完了するための総コストです。

レイテンシーも別の違いを生みます。ベンチマークスコアが似通っていても、応答にかかる時間はモデルごとに異なる場合があります。インタラクティブな製品では、推論コストをわずかに下げることより、予測可能な速度が重視されることがよくあります。

プライバシーとガバナンスが価格を上回ることもあります。購入者は、データの送信先、プロバイダーによる保持期間、管理者がアクセスルールを強制できるかを知る必要があります。

こうした要因は、既存ベンダーに純粋な価格競争への防御策を与えます。使い慣れたインターフェース、既存の統合、セキュリティ承認、蓄積されたユーザーコンテキストはいずれも、実務上の乗り換えコストを生み出します。

ただし、こうした防御策が機能するのは、製品がモデル選定を超える価値を提供している場合に限られます。汎用的なプロンプトを載せただけの薄いラッパーは、十分に有能な代替手段が増えれば、ほとんど保護されません。

最も強い独立系サービスは、モデルを置き換え可能なインフラとして扱う可能性が高いでしょう。単純なタスクは効率的なシステムに振り分け、難しい作業にだけプレミアムな能力を充てることができます。

このアプローチには、忠誠心ではなく評価が必要です。開発者は、品質、レイテンシー、失敗率、エンドツーエンドのリソース消費を含む、自らのユースケースを代表するテストを用意する必要があります。

これは、組織がAI調達を捉える方法も変えます。もはや問題は、どの単一モデルがあらゆるベンチマークで勝つかではありません。異なるタスク全体で許容可能な成果を提供するのは、どのポートフォリオかという問いです。

知識集約型の製品には、もう一つの利点があります。ユーザーが信頼する情報を整理するシステムは、基盤モデルが変わっても価値を維持できます。蓄積されたコンテキストは、特定世代のモデルではなく、ワークフローに属するからです。

ここで、AI knowledge base は、生のチャットアクセスよりも持続性の高いものになり得ます。その価値は、検索、整理、権限管理、反復的な作業をまたぐ継続性にあります。

モデルコストの低下は、こうした製品の利益率を改善し得ます。顧客向けコストを上げずにより強力なモデルを使ったり、ワークフロー内のより多くの工程にAIを適用したりできます。

同じ低下は、主にアクセスで競争するサービスには打撃となり得ます。人工知能が安価になるにつれ、差別化は独自のコンテキスト、信頼できる実行、測定可能なビジネス成果へと移ります。

数字が証明しないこと

ベンチマーク調整後の価格低下は確かな証拠ですが、有用または信頼できる仕事を測る万能な尺度ではありません。

Epoch AIは、いくつかの限界を直接指摘しています。主要データセットの対象期間は約3年で、モデルとベンチマークの組み合わせには欠落があり、推定値にはノイズも含まれます。

これは、数十年にわたり測定されてきた技術とAIを比較するには短い期間です。計算能力、バッテリー、シーケンシング、電力は、製品、市場、性能の定義もそれぞれ異なります。

それでも、比較は歴史的な規模感を示します。ただし、ベンチマークの回答は、電力の単位やバッテリー容量ほど物理的に標準化されていません。

ベンチマーク最適化も懸念材料です。開発者は意図的か間接的かを問わず、広く使われる評価に似たタスクでモデルを訓練する場合があります。すると、未知の実世界環境よりもテスト上で性能が速く向上する可能性があります。

Epoch AIはこのリスクを「benchmaxxing」と呼んでいます。ベンチマーク要素をランダム化すれば、認識や記憶の影響を減らせますが、あらゆる形の汚染や標的化された最適化をなくすことはできません。

高スコアも、信頼できる仕事を保証するものではありません。GPQA Diamondは難しい科学問題への回答を測定しますが、モデルがプロジェクトを維持できるか、企業ポリシーに従えるか、高コストなエラーを避けられるかは測定しません。

NISTの評価ガイダンスは、モデル比較がタスク設定、ツール、プロンプト、推論レベル、サンプル数、採点方法に依存することを強調しています。設定の小さな違いが、性能と費用の両方を変える可能性があります。

CAISIの評価も、エンドツーエンド測定が重要である理由を示しています。トークン単価が低いモデルでも、より多くのトークンを消費したり、ツール呼び出しが増えたり、失敗頻度が高かったりすることがあります。その結果、総タスク費用は、見かけ上高価な競合より高くなる可能性があります。

実際のユーザーも、Epoch AIのフロンティア手法が仮定するほど効率的にモデルを切り替えるわけではありません。移行にはテスト、統合作業、リスクレビュー、スタッフ教育が必要です。

ある企業は、すでにセキュリティ要件を満たしているという理由で、より高価なプロバイダーを合理的に使い続けるかもしれません。別の企業は、変更が自動化ワークフローを混乱させるため、安定した出力を重視する可能性があります。

需要が節約分の一部を吸収することもあります。AIタスクが安価になると、開発者は実行頻度を上げ、コンテキストを拡張し、より多くの候補を要求し、検証段階を追加することがよくあります。

これはジェボンズ効果の一種です。効率の向上は単位当たりのコストを下げますが、総消費量が十分に増えれば、総支出は維持または増加し得ます。

推論モデルは、その効果を強めます。より効率的なベースモデルは、回答の確認や代替案の探索に追加の計算を使うことができます。ユーザーはより良い結果を得られる一方、総利用量がそれに比例して減るとは限りません。

このレポートは、フロンティア開発が安価になったことも示していません。新たな先端モデルの訓練には、既知の能力を提供することとは異なるリソースが必要です。

研究チームは、実験、専門人材、データ準備、評価、インフラに費用を支払います。既存タスクの推論が劇的に安くなっても、こうしたコストは上昇し得ます。

この区別は、一見した矛盾を解消します。モデルプロバイダーは巨額のインフラ計画を発表する一方で、その出力の性能調整後価格は下がり続けることができるのです。

したがって、このレポートが支持する結論は限定的ながら重要です。市場フロンティアにおいて、比較可能で測定された能力は大幅に安価になっています。

すべてのワークロードが同じ速度で改善することを証明するものではありません。同等の安全性、信頼性、プライバシー、レイテンシー、統合品質も保証しません。

購入者は、四半期当たり47%という率を予算予測ではなく市場シグナルとして扱うべきです。方向性は十分に裏付けられているように見えます。一方で、正確な速度は測定方法の選択やユーザー行動に左右され続けます。

AIコスト低下を検証する3つのシグナル

次の検証点は、ベンチマーク上の節約が実際のワークロード、ベンダー経済、日常的な乗り換え行動に直面しても維持されるかどうかです。

第1のシグナルは、独立して測定されたエンドツーエンドのタスクコストです。コーディング、調査、カスタマーサポート、文書作成のワークフローを成功裏に完了するために必要な総費用を、より多くの評価で比較すべきです。

こうしたテストには、安定したタスクセット、統制されたツール、明確な品質基準が必要です。再試行、推論トークン、ツール呼び出し、レイテンシー、人によるレビューも含めるべきです。

これらの測定値がEpoch AIの推定に近いペースで低下すれば、レポートが示す商業上の意味合いはより強まります。低下が大幅に遅ければ、ベンチマーク上の節約が実用上の利益を過大評価していることになります。

第2のシグナルは、ベンダーの価格設定と製品パッケージです。モデルプロバイダーは、推論価格の低下に対応して、料金を引き下げたり、利用枠を拡大したり、より広範なサブスクリプションに能力を組み込んだりできます。

また、エージェントプラットフォーム、エンタープライズ向け制御、ストレージ、独自ツールによって収益を守ることもできます。こうした追加は、競争がベースモデルより上の層へ移行していることを裏付けるでしょう。

プロバイダーがプレミアム機能を標準アクセスに置き換える頻度に注目してください。主力機能の独占性が小型モデルへ急速に移行すれば、短命なフロンティアプレミアムに関するEpoch AIの発見を支持します。

第3のシグナルは、顧客の乗り換えです。フロンティアの計算では、購入者が最も安価で十分な能力を持つモデルを繰り返し選ぶと仮定しています。実際の導入データは、彼らが本当にそのように行動するかを示すでしょう。

開発者は、各タスクを適切なモデルへ送るルーティングシステムを採用するかもしれません。企業は長期契約を結ぶ前に、ポータビリティ条項や標準化された評価を求める可能性があります。

一方で、大きな価格差があっても、統合されたワークフローが顧客を単一のプロバイダーにとどめるかもしれません。その結果は、性能価格の低下が自動的にベンダーロイヤルティを壊すという主張を弱めるでしょう。

オープンウェイトモデルは、3つすべてのシグナルに影響します。独立系ホストにデプロイメント最適化の自由度を与え、コスト面でクローズドなプロバイダーに挑戦させます。同時に、セキュリティ、保守、評価に関する責任を運用者へより多く移します。

起こり得る結果は、最安料金を目指す一様な競争ではありません。AI市場は層に分かれていくでしょう。

モデル層では、比較可能な能力は引き続き価格圧力に直面するはずです。アプリケーション層では、ベンダーはコンテキスト、ワークフローの所有権、信頼、実行品質を通じて競争します。

開発者にとって実務上の対応は、選択肢を維持することです。モデルインターフェースをモジュール化し、評価セットを維持し、トークン消費だけでなくタスクの成功完了を測定してください。

エンタープライズの購入者も、コスト安定性に関する前提を短く見積もるべきです。今日効率的に見える契約でも、基盤サービスが十分な能力を保ったまま、すぐに競争力を失う可能性があります。

ナレッジワーカーは、より多くの製品にAI機能が広がると考えるべきです。推論コストの低下により、要約、検索、下書き、分類、バックグラウンド処理が、より多くの場面で経済的になります。

Epoch AIのコストレポートは、この分野がどれほど収益性を高めるかを結論づけるものではありません。しかし、測定された一定水準の知能へのアクセスが、異例の速さで希少性を失っていることは示しています。

すべてのAI製品にとって、問いは今や具体的です。モデル能力が1年以内に13分の1のコストになったとき、どのような価値が固有のまま残るのでしょうか。信頼できるコンテキストと堅実なワークフローを備える製品には答えがあります。モデルへのアクセス以上のものをほとんど売っていないサービスには、なお答えが必要です。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page