top of page

AnthropicとOpenAIの競争、より優れたモデルからより優れたデータへと移行

Anthropicは、AIインフラおよびワールドモデルのスタートアップであるDecartの買収に関与しているとの報道を受け、OpenAIとの競争で新たな試練に直面している。協議は依然として未確認だが、より大きな対立構図を浮き彫りにしている。最先端ラボはより優れたモデルを生み出し続けられるものの、それらを効率的に展開することは別種の課題となっている。

報じられた取引により、Anthropicはトレーニングと推論のワークロードでコンピューティングハードウェアをより効率的に利用するための技術を得る可能性がある。推論とは、学習済みモデルを実行してリクエストに回答させるプロセスである。高コストな初期トレーニングが完了した後でも、利用が増えるほど消費リソースは増大する。

Glasswing Venturesの創業者Rudina Seseriは、報じられた協議についてBloombergのインタビューでこの緊張関係を説明した。彼女は、AnthropicやOpenAIのような企業の成功は、その限界も明らかにしていると指摘した。十分に効率的ではないというのである。彼女のより広い主張は、モデル研究の重要性が失われたということではない。より良いデータ、インフラ、ワークロード最適化こそが、モデルの知能を経済性のある製品へ変えられるかを左右する段階に入ったということだ。

この違いは、投資家、開発者、企業の購買担当者がAnthropicとOpenAIの競争をどう解釈すべきかを変える。目に見える競争は、ベンチマークスコア、コーディング能力、エージェント、推論能力をめぐるものだ。目に見えにくい競争は、各社がチップ、データセット、顧客とのやり取りの一つひとつから、どれだけ有用な仕事を引き出せるかにある。

報じられたDecart協議、効率性を中心課題に据える

Decartに関する報道が重要なのは、AnthropicがClaude自体を改善するだけでなく、その下層にあるシステムをより多く保有することに関心を示しているように見えるためだ。

元の買収報道によると、AnthropicはDecartの買収について協議している。報道時点で、いずれの企業も契約締結を公に確認していなかった。したがって、この交渉は完了済みの取引ではなく、進行中の報道として扱うべきだ。

Decartは、自社の取り組みを相互に結び付いた二つの領域で説明している。一つは、環境とその変化を表すパターンを学習するリアルタイム・ワールドモデルだ。もう一つは、AIのトレーニングと推論をコンピューティングハードウェア全体でどのように実行するかを最適化するソフトウェアである。

報じられた取引において、より戦略的な意味を持つのは同社のインフラスタックだ。Decartは、このスタックが利用可能なプロセッサーをより効果的に活用しながら、推論モデルやエージェントを高速に動作させると説明している。同社はさらに、その基盤の上でリアルタイム動画および物理世界向けのシステムも構築している。

この組み合わせは、Anthropicに複数の利点をもたらす可能性がある。Claudeのワークロード効率を改善し、標準的なソフトウェアレイヤーへの依存を減らし、異なるプロセッサーをまたぐ実験を加速できるかもしれない。また、モデル開発者が通常はチップメーカーやクラウド事業者に委ねるハードウェアレベルの判断に、Anthropicをより近づける可能性もある。

Decartは、自社のAIインフラが最適化されたワークロードとリアルタイム生成システムの双方を支えるとしている。これらの主張は、Anthropic規模の導入全体を通じて完全な独立検証を受けたわけではない。それでも、最先端モデル企業がこの事業を検討する理由は、その製品の方向性から理解できる。

ワールドモデルが注目を集めるのは、生成AIをテキストの先へと拡張するためだ。ワールドモデルは環境がどのように振る舞うかを表現し、システムがその次の状態を予測または生成できるようにする。潜在的な用途には、ロボティクス、インタラクティブメディア、シミュレーション、動画生成が含まれる。

ただし、Decartが重要になるためにAnthropicが動画企業になる必要はない。変化する環境をリアルタイムで生成するための同じエンジニアリングには、メモリ、レイテンシー、プロセッサー利用率の厳密な制御が求められる。こうした能力は、数百万人のユーザーが言語モデルを呼び出す場合にも重要だ。

したがって、報じられた協議はこの記事の中心的な緊張関係を生み出している。Anthropicは、最先端モデル研究とClaudeの採用拡大によって地位を築いてきた。その成功はより重いインフラ需要を生み、効率性を副次的なエンジニアリング目標ではなく、継続的成長の条件へと変えている。

独立系の取引分析も同様の結論に達している。それによると、DecartはAnthropicが計算コストを抑え、大手チップ供給企業が占める技術領域に近づく助けとなる可能性がある。

結末は依然として不確実だ。Anthropicは取引を完了するかもしれないし、提携を選ぶか、見送る可能性もある。しかし、報じられた関心はすでに、同社が戦略的に希少だと考えるものを示している。すなわち、高価な知能を利用可能な能力へと転換するインフラ知識である。

AnthropicとOpenAIの競争はモデルの下層へ移った

AnthropicとOpenAIの競争は今や、モデル品質を超え、データパイプライン、推論の経済性、ハードウェア利用率、製品フィードバックループへと広がっている。

最先端AI企業はかつて、主により大規模なトレーニング実行と、より良いベンチマーク結果によって進歩を伝えていた。これらの指標は今も重要だ。しかし、競争システム全体を説明するものではなくなっている。

モデルは評価で首位に立っていても、収益性を保って展開することが難しい場合がある。また、公開テストでは好成績でも、ノイズの多い企業情報、長期的なワークフロー、未知のユーザー要求には苦戦することがある。より優れたモデルの重みが、こうした問題を自動的に解決するわけではない。

圧力は利用量から生じる。トレーニング実行はモデル開発中に発生する一方、推論は顧客がプロンプトを送信するたび、あるいはエージェントが行動を取るたびに発生する。そのため、採用拡大はプロセッサー、メモリ、ネットワーキング、電力に対する継続的な需要を増やす。

推論モデルは、最終回答を返す前に多数の中間トークンを生成する可能性があるため、この課題を強める。エージェント型製品では、ツール呼び出し、再試行、文書検索、検証のステップが加わる。ユーザーに見える一つのリクエストが、はるかに大きな隠れたワークロードを始動させることがある。

このため、ユニットエコノミクスがAnthropicとOpenAIの競争の中心となる。ユニットエコノミクスは、需要の一単位を提供することに伴う収益とコストを測る。AI企業にとって、その単位はトークン、完了タスク、コーディングセッション、顧客ワークフローになり得る。

効率的な提供者は、既存の能力でより多くの仕事を処理できる。より高速な応答を提供し、より長いタスクを支援し、必要なリクエストにのみ高価なモデルを割り当てることもできる。こうした製品上の選択は、ベンチマーク改善と同じくらい直接的にユーザー体験へ影響する。

OpenAIは、効率性をシステム全体の問題として公に説明している。同社の最近のインフラ戦略では、経済性はデータセンターの追加やモデル設計だけで決まるものではないとしている。ハードウェア、利用率、ルーティング、製品上の判断も、コンピューティング資源から得られるリターンを形作る。

Anthropicも同じ方程式に直面している。Claudeのコーディングおよび企業ワークフローにおける強みは、大規模なリポジトリ、長いコンテキスト、繰り返されるツール呼び出しを含むセッションを行う、要求の厳しいユーザーを引き付ける可能性がある。こうした顧客は価値ある需要をもたらす一方、複雑なインフラ負荷も生み出す。

これが、Seseriが成功は制約にもなると述べた理由を説明する。人気のあるモデル企業は、効率性を研究室内の最適化として扱うことはできない。応答品質、信頼性、安全性、許容可能なレイテンシーを維持しながら、増大する需要に応えなければならない。

求められる対応は垂直統合だ。この言葉は、企業がサプライチェーンのより多くの層を自ら管理することを指す。この場合の層には、モデル研究、トレーニングデータ、推論ソフトウェア、クラウド容量、そして場合によってはプロセッサー設計が含まれる。

OpenAIは幅広いインフラ提携を進め、モデル、製品、コンピューティング能力にまたがるプラットフォームとしての自らをますます位置付けている。Anthropicは、大手クラウド事業者と深い関係を築く一方で、自社のモデルおよび製品レイヤーを開発し続けている。

Decartとの取引が実現しても、Anthropicの外部インフラへの依存がなくなるわけではない。最先端トレーニングと大規模推論には、依然として広範な施設、プロセッサー、電力が必要だ。むしろ、それはAnthropicがその能力を受け取った後に何が起きるかを最適化する、もう一つの手段となる。

この違いは企業の購買担当者にとって重要だ。最大のモデルや最新リリースを持つ提供者が、常に最良の運用結果をもたらすとは限らない。信頼性、レイテンシー、データグラウンディング、ワークフロー全体のコストは、小さなベンチマーク上の優位性より重要になる可能性がある。

開発者はすでに、アプリケーション向けにモデルを選ぶ際にこのトレードオフに直面している。最も強力なモデルは、分類、抽出、定型的なサポートリクエストには不要かもしれない。単純な作業を小規模なシステムへルーティングすれば、結果を損なわずに速度を改善し、リソース使用量を減らせる可能性がある。

したがって、主要ラボは二方向から圧力を受けている。最先端能力を前進させ続けると同時に、実用的な効率性でより安価なシステムと競わなければならない。どちらか一方で後れを取れば、製品全体が弱体化しかねない。

より良いデータは、さらなるスケーリングに勝る可能性がある

中心的な逆転は、トレーニングおよび検索データが弱いシグナルしか提供しない場合、より多くのコンピューティングパワーが生み出す事業価値は逓減するという点にある。

「より良いデータ」は、単により多くの文書を集めることを意味しない。有用な行動を教え、難しいケースをカバーし、システムが実際に実行するタスクを反映する情報を選ぶことを意味する。また、重複、誤り、スパム、誤解を招くパターンを取り除くことも意味する。

トレーニングデータは、展開前にモデルを形作る。その後のポストトレーニングデータは、指示に従う方法、選好を適用する方法、ツールを使う方法、安全でない行動を避ける方法をモデルに教える。評価データは、こうした介入が狭いベンチマークの範囲を超えて機能するかを開発者が判断する助けとなる。

OpenAIによると、その基盤モデルは、公開情報、ライセンスを受けた、または提携を通じて得た素材、ユーザー、トレーナー、研究者が作成した情報を利用している。同社のトレーニングデータ概要では、合成データもモデル開発の一部として挙げられている。

合成データとは、人々や物理世界から直接収集するのではなく、別のモデルやシミュレーションによって生成された情報である。まれなタスク、安全性ケース、構造化された推論のために、狙いを定めた例を提供できる。一方で、開発者に強力なフィルターと評価がなければ、隠れた誤りを再生産する可能性もある。

Anthropicも広範なポストトレーニングおよび安全性研究に依存している。同社の競争上の課題は、OpenAIより大きなコーパスを獲得することだけではない。脆弱な振る舞いや過大な提供コストを招くことなく、価値あるワークフローにおけるClaudeの性能を改善するデータが必要だ。

これは、スケールの意味を変える。従来のスケーリング則は、より多くのデータ、モデルパラメータ、コンピューティングパワーと、より高い性能を結び付けてきた。次の段階では、ラボが各サンプルからより多くを学び、生成される各トークンからより有用な仕事を引き出せるかが問われる。

モデルが既知の公開ベンチマークで飽和に近づくと、データ品質は特に重要になる。同じ分布から追加された例は、改善をあまり生まない可能性がある。慎重に設計されたタスク、専門家からのフィードバック、敵対的なケースは、量だけでは隠れてしまう弱点を明らかにできる。

企業向けアプリケーションでは、この問題が具体的に表れる。汎用モデルは標準的な会計用語を理解していても、企業の最新契約や社内ポリシーにはアクセスできない可能性がある。そうしたモデルを、信頼できる権限管理済みの情報につなぐことは、わずかに新しいモデルへ置き換えるよりも、回答を大きく改善する場合が多い。

検索拡張生成は、リクエスト時に関連文書をモデルのコンテキストへ配置することで、このギャップに対応する。モデルは訓練中に変化し続けるすべての事実を記憶する必要がない。代わりに、回答を生成する際に選別された根拠を受け取る。

このアプローチは、独自のデータ問題も生む。検索の品質が低いと、古い、重複した、または無関係な文章が提示される可能性がある。その結果、高性能なモデルでも弱い根拠に基づいて自信ありげな回答を生成しかねない。

したがって組織には、高性能なモデルと並行して、整備された情報システムが必要となる。検索可能なAIナレッジベースは、アシスタントが利用する前に、従業員がソース資料を整理する助けになる。モデルは依然として重要だが、根拠に基づく業務の上限を決めるのは情報の品質である。

より良いデータには、実際の利用から得られるフィードバックも含まれる。ユーザーが回答を却下したり、生成コードを修正したり、エージェントを途中で離脱したりする場合、そうした結果は製品の弱点を示している。研究所はその証拠を評価基盤や将来の訓練例へ変換できる。

このフィードバックループは、多数のやり取りを処理する大手プロバイダーに有利に働く。一方で、制約にもなり得る。生のユーザー活動が自動的に高品質な訓練素材になるわけではなく、プライバシー管理はプロバイダーによる利用方法を制限する。

プロバイダーは、表面的にもっともらしい結果と、真に成功した結果を区別しなければならない。受け入れられたテキストを生成するコーディングエージェントであっても、隠れた不具合を持ち込む可能性がある。サポートアシスタントはユーザーを満足させつつ、気付かれないままポリシーに違反するかもしれない。

そのため高品質なデータには、判断、ラベリング、評価インフラが必要となる。単により多くのプロンプトを収集することでは実現できない。最も強力なパイプラインは、実際の失敗を代表性のあるテストにつなげ、それらのテストを訓練と製品変更の指針として使う。

この仕組みは、なぜデータと効率が相互に強化し合うのかも説明する。より良い例は、小規模モデルが定型的なタスクを処理する助けになり得る。より良いルーティングは、難しいリクエストだけを高価な最先端システムへ送れる。より良い評価は、顧客成果を改善せずに見出し向けのスコアだけを向上させる変更に、チームが計算資源を費やすのを防げる。

これはまた、DecartのインフラがAnthropicのモデル研究を補完し得る理由でもある。実験の高速化により、研究者はデータ配合や訓練介入をより早く検証できる。より効率的な推論は、評価、エージェント、長時間実行タスクのための容量を増やす。

競争優位はデータだけから生まれるわけではない。データ選定、モデルの振る舞い、評価、ワークロード最適化、ユーザー成果を結ぶ閉ループから生まれる。AnthropicとOpenAIはいずれも、そのループの形を目指している。

AIの低価格化はデータ仮説を証明しない

効率は急速に改善しているが、公開されている証拠だけでは、進歩のどの程度がより良いデータ、小型モデル、ハードウェア、ソフトウェア、あるいは低い利益率によるものかを切り分けることはまだできない。

効率シフトを最も強く裏付けるのは、推論コストの低下である。Stanfordの2025 AI Indexによれば、あるベンチマークでGPT-3.5水準の性能に到達するコストは、2022年後半から2024年後半の間に280分の1超まで低下した。

同じAIコスト分析では、かつてははるかに大規模なシステムに結び付けられていた性能しきい値に、より小さなモデルが到達したことも示された。これらの結果は、有用な能力が時間とともにより安価かつコンパクトになり得ることを示している。

ただし、それはより良い訓練データが改善をもたらした証明ではない。新世代プロセッサ、量子化、モデルアーキテクチャの変更、蒸留、競争、プロバイダーの利益率低下はいずれも価格を下げ得る。公開情報で各要因の正確な寄与が明らかになることはほとんどない。

量子化は、モデルの保存や実行に用いる数値精度を下げる手法である。蒸留は、大規模システムから選択した振る舞いを再現するよう小型モデルを訓練する手法だ。どちらも基礎となる訓練コーパスを変えずに、必要なリソースを削減できる。

ベンチマークも別の不確実性を生む。開発者が類似の例で直接的または間接的に訓練したため、システムが改善することはある。その場合、顧客が未知のタスク、雑然とした文書、変化する状況を提示すると苦戦するかもしれない。

このため、優れたデータに関する主張は慎重に扱う必要がある。AnthropicとOpenAIは訓練情報のカテゴリーを開示しているが、最先端モデルの完全なレシピはいずれも公開していない。外部の人間は、データセットの品質、フィルタリング、合成データ手法、評価範囲を直接比較できない。

Decartの報道にも同様の検証ギャップがある。Decartは、コンピューティングハードウェアからより多くの性能を引き出すソフトウェアを説明している。リアルタイム生成環境の公開デモは低レイテンシーへの意欲を示すものの、Anthropicの本番スタック内での成果を裏付けるものではない。

買収が完了した後でも、統合リスクは残る。インフラソフトウェアは、ハードウェアドライバー、モデルアーキテクチャ、クラウドスケジューラー、信頼性システムと相互作用する。あるワークロードで機能する最適化が、別の規模では異なる挙動を示す可能性がある。

ワールドモデルは戦略上の曖昧さも加える。ロボティクス、シミュレーション、インタラクティブメディアにとって重要になる可能性がある一方、Anthropicがそれを別個のモデル競争として扱えば、Claudeが最も強い市場から同社の焦点を逸らす可能性もある。

より整合的な解釈はインフラに焦点を当てるものだ。Decartのワークロード最適化は、Anthropicの提供上の制約と直接結び付いている。そのワールドモデル製品は、そのインフラが支えられるものを示すが、本稿の効率性に関する論点を置き換えるべきではない。

競合の対応という問題もある。OpenAI、Google、Meta、クラウドプロバイダー、チップ企業はいずれも立ち止まっていない。各社はコンパイラ、ルーティング、小型モデル、カスタムプロセッサ、データパイプラインを改善できる。

Googleは、モデル、カスタムチップ、クラウドインフラ、検索データ、消費者向け製品にまたがり、特に強い立場にある。OpenAIは大規模な製品フィードバックと広範なインフラ提携を持つ。Metaはオープンモデルと消費者向けプラットフォームを使い、改善を広く配布できる。

Anthropicはなお、より深いインフラ所有が測定可能な利益を生むことを示す必要がある。関連する指標には、レイテンシー、モデルの可用性、計算資源単位当たりの有用な出力、長時間タスクを完了するエージェントの品質が含まれる。

購入者も、モデル価格の低下とワークフローコストの低下を同一視すべきではない。繰り返し修正が必要な安価なモデルは、一度でタスクを完了する高性能モデルよりもコストが高くなる可能性がある。人によるレビュー時間も計算に含めるべきだ。

同じ注意はデータにも当てはまる。大規模な非公開コーパスは価値を持ち得るが、それは最新で、許可され、検索可能で、関連性がある場合に限られる。より多くの独自情報が自動的により良い情報になるわけではない。

セキュリティとガバナンスは、この戦略をさらに複雑にする。機微なデータを訓練または検索に利用すると、同意、アクセス制御、削除、監査可能性に関する義務が生じる。合法的または安全に利用できない高品質データセットは、運用上の価値が限られる。

合成データには別のリスクがある。生成例がパイプラインを支配すると、モデルは自らの文体上の癖や誤りを増幅し得る。開発者には、このフィードバックループを検出するための独立した評価と現実世界の証拠が必要となる。

これらの制約はSeseriの主張を無効にするものではない。むしろ精緻化する。より良いデータとインフラが重要なのは、モデル研究や計算資源が不要になったからではなく、生のスケールだけでは不十分だからである。

決定的な証拠は、実運用での性能から得られなければならない。Anthropicがより低いレイテンシーと少ない障害で、より要求の厳しいClaudeワークロードを提供できれば、効率化戦略の信頼性は高まる。利益がデモや社内主張にとどまるなら、この仮説は弱まる。

より良いデータ戦略を検証する3つのシグナル

AnthropicとOpenAIの競争の次の段階は、宣伝用ベンチマークチャートの新たな一巡ではなく、運用上の証拠によって判断される。

最初のシグナルは、報じられたDecart取引の進捗と公表された目的である。契約の完了は、Anthropicが最適化技術の直接所有を望んでいることを確認する。提携であれば、完全統合のリスクを負わずに関心を示している可能性がある。

最も重要な詳細は、AnthropicがDecartのエンジニアとソフトウェアをどのように配置するかである。Claudeの推論、訓練システム、ハードウェア戦略の近くに配置すれば、効率性という解釈は強まる。独立したメディア製品に重点を置けば、それは弱まる。

読者は、契約後に測定可能な変化があるかを見るべきだ。Claudeの応答高速化、需要急増時の可用性向上、または同程度のリソース制約内で動作するより高性能なエージェントは、企業戦略と製品成果を結び付ける。

2つ目のシグナルは、AnthropicとOpenAIにおける製品レベルの効率性である。新モデルは、単に利用可能な最強ベンチマークと比較するのではなく、一定の能力水準で評価すべきだ。問題は、各プロバイダーが同等の作業をどれほど安価かつ信頼性高く完了できるかである。

モデルルーティングもその証拠の一部となる。プロバイダーは、定型的なリクエストを小規模システムに割り当て、難しいタスクをエスカレーションすることでコストを削減できる。成功するルーティングは、最先端モデルへの不要な呼び出しを避けながら、精度を維持しなければならない。

長時間実行エージェントは厳しいテストを提供する。推論、検索、ツール利用、反復的な検証を組み合わせるため、小さな非効率が各段階で積み重なる。そのため、エージェントの完了率は孤立したチャット応答よりも有益な指標となる。

開発者は、モデル品質とともにレイテンシーと信頼性を注視すべきだ。推論能力に優れていても、繰り返しタイムアウトするコーディングシステムは効率的なワークフローを生まない。より高速でも不具合を多く導入するモデルも、同様に試験に失敗する。

企業導入も、別の有用なシグナルとなる。AIシステムがガバナンスと予算の制約内で予測可能な価値を提供するとき、購入者は利用を拡大する。パイロットの発表よりも、実際のビジネスプロセスにおける継続利用の方が重要である。

3つ目のシグナルは、訓練データと評価に関する開示の拡大である。研究所はデータ配合と最適化手法を競争資産と見なしているため、完全な透明性は期待しにくい。それでも、より具体的な報告は外部評価を改善し得る。

有用な開示では、企業が合成データをどのようにテストし、ベンチマーク汚染を防ぎ、未知のタスクを評価するかを説明するだろう。報告では、モデル変更、検索システム、製品レイヤーのルーティングによる改善も区別すべきだ。

OpenAIとAnthropicには、これらの詳細を非公開にする理由がある。価値の高いデータレシピを明らかにすれば、競合が再現する助けになり得る。しかし曖昧な主張では、顧客が信頼性とリスクを評価するのは難しい。

独立した評価は、そのギャップを狭められる。非公開のテストセット、現実的なワークフロー、成果に基づく指標を使用すべきだ。また、単一の平均スコアを完全な判断として示すのではなく、ばらつきも報告すべきである。

これら3つのシグナルには明確な順序がある。まず、Anthropicが報じられた関心をインフラへのコミットメントに変えるかを確認する。次に、そのコミットメントが製品の経済性と信頼性を変えるかを検証する。最後に、改善がどこから生じたのかを説明する証拠を求める。

製品改善を伴わない取引完了は、戦略を弱める。取引なしにClaudeの経済性が改善すれば、Anthropicが別の道を見つけたことを示す。強力なデータおよび評価の開示があれば、いずれの結果も解釈しやすくなる。

開発者にとって実務的な対応は、ブランドではなくワークフローをベンチマークすることだ。代表的なタスクを試し、再試行回数を測定し、レビューに要する時間も含める。検索・参照元を整備し、生成された回答がどこで失敗するかを記録しておくべきだ。

企業の購買担当者は、モデルが企業情報をどのように利用するのか、検索インデックスがどの程度の頻度で更新されるのか、アクセス制御がどのように適用されるのかを提供元に確認すべきだ。また、公表されているトークン単価だけでなく、タスク完了にかかる総コストも比較する必要がある。

ナレッジワーカーも同様の選択に直面している。新しいモデルは役立つ可能性があるが、多くの場合、与える文書の質が回答を左右する。最先端モデルが進化しても、信頼できるコンテキストを整理する価値は変わらない。

AnthropicとOpenAIは、今後もより優れたモデルを発表し続けるだろう。より重要な競争は今や、どちらの企業が知能を信頼でき、手頃な価格の仕事へと変換できるかにある。Decartの対談、実運用における効率性、データに関する開示に注目したい。これらのシグナルを総合すれば、より良いデータとインフラが、もう一段階のスケール拡大を本当に上回るのかが見えてくる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page