top of page

AlibabaとDeepSeek、より安価で強力なモデルでAI競争を再定義

AlibabaとDeepSeekは、西側の研究所が依然として難度の高いベンチマークでわずかに優位を保つなか、より安価な中国製AIモデルでGoogle Newsの見出しを飾った。争点は今、最高スコアが必要なのか、それとも広く導入できる価格の高性能モデルで十分なのかという点に移っている。

DeepSeekは、V3と推論に特化したR1モデルによって、この問いを広く可視化した。Alibabaは2025年の旧正月休暇中にQwen2.5-Maxを発表し、DeepSeek-V3、GPT-4o、MetaのLlama 3.1に直接対抗する位置付けを示した。

これらのリリースが恒久的な勝者を決めたわけではない。AIシステムに対する市場の評価基準が変わりつつあることを示した。OpenAI、Anthropic、Google、Metaは現在、ベンチマークでの首位だけでなく、効率性、入手しやすいモデルウェイト、迅速なリリースサイクルで競うライバルに直面している。

AlibabaとDeepSeekがGoogle Newsで注目を集めた理由

重要だったのは、あるモデルが別のモデルを打ち負かしたことではない。中国のAI業界全体で、コストと性能を巡る競争が急速に加速したことだ。

DeepSeekは2024年12月にV3を公開し、続いて2025年1月20日にR1を発表した。R1は推論モデルであり、回答を生成する前に複数段階の問題を処理するため、追加の計算資源を割り当てる。

同社は、R1が複数の数学、コーディング、推論テストにおいてOpenAIのo1と同等の性能を示したとしている。DeepSeekはMITライセンスの下でモデルウェイトも公開し、開発者が比較的少ない制約でソフトウェアを改変・商用化できるようにした。

こうした主張が注目を集めたのは、DeepSeekが異例に効率的な開発プロセスを説明したためだ。同社のV3技術レポートには、モデルの最終トレーニング工程でH800 GPUを278万8,000時間使用したと記録されている。

この数値は、DeepSeekの研究開発予算全体を表すものではない。初期実験、アーキテクチャ研究、データ作業、人件費、インフラ投資は含まれていない。したがって、これをR1開発の総コストとして扱えば、同社の開示内容を誤って伝えることになる。

この区別は重要だ。より小さいこの数字が、Google Newsで展開された物語の中心になったからである。それは、DeepSeekが主要な米国研究所の能力全体を、ごく小さな総予算で再現したという単純化された結論を促した。

証拠が裏付けるのは、より限定的な見方だ。DeepSeekは極めて効率的な最終トレーニングを設計し、その基盤を用いて競争力のある推論システムを構築した。会計上の一つの推計を企業全体のコスト比較に置き換えずとも、これは依然として重要な成果である。

DeepSeekの技術的アプローチは、複数の効率化手法を組み合わせた。Mixture-of-Expertsモデルは、トークンごとにパラメータの一部だけを活性化し、各応答に必要な計算量を減らす。

同社はまた、推論時に保持される情報を圧縮するために設計された手法、multi-head latent attentionを用いた。トレーニングでは低精度のFP8計算を採用し、GPU間の通信オーバーヘッドを減らすためのエンジニアリングも行った。

Alibabaは2025年1月28日、Qwen2.5-MaxとAlibaba Cloudを通じた提供を発表した。同社によると、このMixture-of-Expertsモデルは20兆トークン超で事前学習されている。

Alibabaは比較の中心にDeepSeekを据えた。同社のQwenベンチマーク結果では、Qwen2.5-MaxがArena-Hard、LiveBench、LiveCodeBench、GPQA-DiamondでDeepSeek-V3を上回ったとしている。

各ベンチマークが測るのは性能の限定的な側面にすぎない。LiveCodeBenchはプログラミング能力を評価し、GPQA-Diamondは難度の高い科学問題を用いる。Arena-Hardは比較評価を通じて人間の選好を近似しようとするものだ。

Alibabaの結果では、Qwen2.5-MaxはGPT-4oやClaude 3.5 Sonnetとも比較されている。ただし、モデル開発者が公表するベンチマークチャートは企業側の主張であり、あらゆる実運用ワークロードを対象とした独立した判定ではない。

タイミングは競争のシグナルをさらに強めた。Alibabaは、中国の多くが休暇に入る旧正月初日に発表を行った。

当時の報道は、このタイミングをDeepSeekの急速な台頭が生んだ圧力の証拠と解釈した。ByteDance、Baidu、Tencentをはじめとする中国のテクノロジー企業も、モデルの更新や商業戦略の見直しを進めていた。

Alibabaは単に米国のライバルに対応していたわけではない。効率性を製品の物語の一部にした、より小規模な国内研究所に対して自社の立場を守っていた。

この変化が、記事の中心的な緊張を生んだ。AI競争は、最大のコンピューティングクラスターと最強のベンチマーク結果を争うものとして語られてきた。DeepSeekとAlibabaは、エンジニアリングの効率性と配布力も同じように決定的になり得ることを示した。

コスト競争が西側のAI研究所にも及ぶ

OpenAI、Anthropic、Google、Metaが圧力を受けているのは、ベンチマークでの首位が、すべてのタスクで顧客がプレミアムを受け入れる保証ではなくなったためだ。

生成AIの第一波では、純粋な能力が重視された。企業は、有用な回答と信頼できない回答の差が大きかったため、単一の最先端モデルを選ぶことが多かった。

競合モデルが収束するにつれ、その計算は変わる。問い合わせ対応、文書分類、定型コンテンツの下書き、フォームからの項目抽出を行う企業は、利用可能な最強の推論システムを必要としない場合がある。

必要なのは、精度のしきい値を一貫して満たすモデルだ。複数の製品がその水準を超えると、応答時間、導入の主導権、運用効率が意思決定において重要性を増す。

ここで中国製モデルは信頼に足る地位を築いている。DeepSeekとAlibabaは、市場に影響を与えるために、あらゆるベンチマークで西側の全モデルを打ち負かす必要はない。商用ワークロードの大きな割合にとって十分な性能を持つことが必要なのだ。

モデルルーティングはこの効果を強める。ルーティングとは、難易度、機密性、要求される速度に応じて選択したモデルへ各リクエストを送る、本番環境での運用手法である。

企業は、複雑なコーディングや複数段階の分析には最先端のクローズドモデルを確保するかもしれない。同じ企業でも、分類や要約の作業はより安価なオープンウェイトシステムに振り分けられる。

このアーキテクチャは、勝者総取りという前提を弱める。互換性のあるモデルAPI間の切り替えは、検索エンジン、ソーシャルネットワーク、企業向けデータベースを置き換えるより容易だ。

オープンウェイトモデルは別の選択肢を加える。オープンウェイトとは、ライセンスの条件に従って、組織が自社のインフラ上でAIシステムを運用できるようにする、ダウンロード可能なモデルパラメータのことである。

セルフホスティングは、一つのAPIプロバイダーへの依存を減らせる。また、機密性の高い資料を組織が選んだ環境内に留められるが、その場合はセキュリティ、監視、キャパシティ計画の責任を組織自身が負うことになる。

開発者にとって実務上の変化は、交渉力の向上だ。チームは自社のタスクを使ってQwenやDeepSeekをクローズドモデルと比較し、品質差がどこで重要になるかを判断できる。

企業の購買担当者にとって、この変化は調達をより細分化する。一つのプロバイダーをすべてのAI活動に選ぶ代わりに、コーディング、顧客サービス、検索、分析、社内ナレッジ業務向けに個別のシステムを評価できる。

これは西側の研究所に直接的な圧力を生む。OpenAIとAnthropicは、特定のワークフローにおいて自社モデルがなぜプレミアムに値するのかを示さなければならない。GoogleはGeminiをクラウドや生産性向上ツールの配布網と組み合わせられるが、それでもこの統合の価値を守る必要がある。

Metaは、ダウンロード可能なLlamaモデルを推進してきたため、異なる立場にある。QwenとDeepSeekの台頭は開発者により多くのオープンウェイトの選択肢を与え、Metaが好む配布モデルの内部で競争を強める。

Nvidiaにとっては、より複雑な結果となる。効率的なトレーニングは、あらゆる進歩に同じほど劇的なコンピューティング支出の増加が必要だという前提を弱め得る。

ただし、モデルの利用が広がれば、新たな推論需要が生まれる可能性がある。推論とは、学習済みモデルが回答を生成する際に使う計算のことで、多くのアプリケーションで利用が増えれば相当なハードウェアが必要になる。

したがって、生じる圧力はコンピューティング需要の単純な崩壊ではない。計算の各単位が何を生み出すのかを、より厳しく見極める方向への転換である。

DeepSeekのR1リリースは、この精査を特に可視化した。同社の公式モデルリリースでは、o1に匹敵する性能、大規模な強化学習、自由に利用できる蒸留モデルについて説明している。

蒸留とは、より大きなモデルの振る舞いをより小さなモデルへ移す手法である。小型システムは、大型モデルの推論能力の一部を保ちながら、導入しやすくなる可能性がある。

こうした蒸留モデルのリリースは、競争上の課題を単一のフラッグシップモデルの枠を超えて広げた。開発者には、異なるハードウェアやレイテンシー制限に適した複数のサイズが提供された。

これが、この話題が当初のGoogle Newsの報道サイクルを超えて続いた理由だ。DeepSeekは、独立した研究所が何を公開できるかについての期待を変えた。Alibabaの対応は、大手クラウドプロバイダーがこの挑戦を緊急のものと捉えていたことを示した。

より安価なAIモデルが導入判断を変える

核心となる逆転は、最高スコアのモデルであっても、わずかに性能が低い代替モデルの方が効率よく拡張できる場合、ワークロードを失う可能性があることだ。

ベンチマークは依然として有用だが、組織の運用環境全体を再現するものではない。科学テストでの数ポイントの差は、研究支援には極めて重要でも、顧客メールの仕分けではほとんど重要でない場合がある。

品質の差は、長いエージェント型ワークフローでは累積する。AIエージェントとは、外部ツールの呼び出しを含め、多数の行動を計画して完了するためにモデルを利用するソフトウェアである。

各ステップに小さな失敗確率があるなら、数十ステップを含むワークフローは信頼できないものになり得る。そのため、コーディングエージェント、金融分析、機微な意思決定支援では、最強の推論モデルがより高い運用負荷を正当化する場合がある。

定型タスクには異なる論理が働く。数百万件の短いリクエストを処理する分類サービスでは、予測可能な出力、迅速な応答、効率的なハードウェア利用が有利になる。

これにより二層構造の市場が生まれる。最先端モデルは、信頼性がわずかに高まるだけでも大きな価値を生むタスクを担う。よりアクセスしやすいモデルは、許容可能な性能が最終的なベンチマークの一点差より重要な大量処理業務で競う。

DeepSeekのアーキテクチャは、この効率性の課題を中心に設計された。V3システムは合計6,710億パラメータを備えるが、トークンごとに活性化するのは370億パラメータだった。

この疎な活性化により、同程度の規模を持つ密なモデルと比べて、各予測に必要な処理量を減らせる。計算が無料になるわけではなく、この規模のモデルを運用するには依然として本格的なインフラが必要だ。

AlibabaもQwen2.5-Maxで、関連するMixture-of-Expertsの手法を採った。同社の発表では、大規模な事前学習データ、教師ありファインチューニング、人間のフィードバックによる強化学習を強調している。

教師ありファインチューニングは、厳選された例を使って事前学習済みモデルを学習させる手法だ。人間のフィードバックによる強化学習は、人間の判断から得られた選好シグナルを使って振る舞いを調整する。

両社は大規模トレーニングと、計算をより選択的に使うことを目的とした手法を組み合わせた。その戦略は、効率性は小型または能力の低いシステムだけのものだという考え方に異議を唱えている。

デプロイメントの制御は、計算効率と同じくらい重要になる可能性がある。ダウンロード可能な重みを使えば、企業はモデルを専門用語に適応させ、社内で評価を実施し、データをどこで処理するかを選択できる。

病院、法律事務所、エンジニアリング企業、政府機関などは、非公開モデルが公開リーダーボードでより高い性能を示していたとしても、その制御性を重視する場合がある。判断は、ワークロード、ガバナンス規則、社内の専門知識に左右される。

オープンウェイトはベンダー依存をなくすものではない。組織は依然として、ハードウェア、提供フレームワーク、セキュリティツール、そしてシステムを管理できる人材に依存する。

また、モデルライセンスや学習データの出所も追跡する必要がある。ダウンロード可能なモデルは、API契約であれば異なる形で割り当てられる法的・コンプライアンス上の問題を持ち込む可能性がある。

ナレッジワーカーも、より小さな規模で同じトレードオフを経験している。各AIシステムには異なる強み、制約、データポリシーがあるため、人々は複数のAIシステムを行き来するようになっている。

この分断により、どのモデルプロバイダーにも依存せずに情報源を整理しておく価値が高まる。個人向けのAIナレッジベースがあれば、好みのモデルが変わっても、メモや参考資料を保持できる。

より大きな仕組みは、クラウドコンピューティングにおける以前の移行に似ている。標準インターフェースによってインフラはより交換可能になった一方、プレミアムサービスは信頼性と統合性を通じて競争を続けた。

AIモデルは、開発者が出力をすぐ比較できるため、より速いペースでその方向へ進んでいる。評価ツールでは、同じプロンプトセットを複数のシステムで実行し、精度、レイテンシー、失敗パターンを測定できる。

AlibabaとDeepSeekは、この比較型アプローチの一般化に寄与してきた。モデルのローンチは今や、誰が首位かという問いを超えた実務的な疑問を投げかける。

そのシステムは顧客が選ぶ環境内で動作するのか。指示に確実に従うのか。顧客の文書に対してどのような性能を示すのか。どのような監視が必要なのか。

こうした問いは、規律ある評価を行う買い手の影響力を高める。同時に、実アプリケーションで信頼できる結果を示さず、広範なベンチマーク主張に頼るプロバイダーには不利に働く。

より安価なAIモデルが自動的に勝つわけではない。その制約が対象ワークロードの要件の範囲外にあるときに勝つ。

この区別は、現在の競争の中心にある。AlibabaとDeepSeekは、買い手がその選択を行えるタスクの数を増やしている。

AlibabaとDeepSeekの主張では決着しないこと

報告上の低コストや強力なベンチマーク結果だけでは、総開発費、実世界での信頼性、セキュリティ、政治的アラインメントは判断できない。

最初の不確実性は会計に関するものだ。広く引用されているDeepSeekのV3の数値は、想定された時間当たりのレンタル料金に基づき、最終的な公式学習プロセスにかかったGPU時間を対象としていた。

技術レポートでは、それ以前の研究や実験は明確に除外されていた。また、企業の構築、データ取得、研究者の採用、インフラ運用にかかる総費用を表すものでもなかった。

技術評価でも、この数値は最終学習実行に紐づく推定値だと指摘されている。したがって、他社の資本予算全体と比較することは信頼できない。

2つ目の不確実性は、ベンチマークの選定に関するものだ。モデル開発者は、公開するテスト、含める競合バージョン、評価の構成を決める。

これは結果に意味がないということではない。買い手は重要なテストを、自社のプロンプト、言語、文書形式、失敗基準で再現すべきだという意味である。

Alibabaは、Qwen2.5-Maxが特定のベンチマークで複数の著名モデルを上回ったと述べた。しかし、Qwenがすべてのコードリポジトリ、エンタープライズ検索システム、エージェントワークフローで優れていることを示したわけではない。

DeepSeekによるo1との比較にも同じ限界がある。R1は注目すべき推論性能を示したが、性能は問題、プロンプト、ツールへのアクセス、採点方法によって変動する。

3つ目の不確実性は安全性に関するものだ。オープンウェイトの配布は導入者に制御を与える一方、より多くの責任も移転する。

非公開モデルのプロバイダーは通常、集中管理された不正利用対策を運用し、サービス全体に更新を適用できる。セルフホスト型モデルでは、導入する組織がフィルタリング、ログ記録、アクセス制御、インシデント対応を設計しなければならない。

経験豊富なエンジニアリングチームにとって、この負担は管理可能である。しかし、主に低い運用コストに惹かれる小規模組織にとっては、より難しい。

4つ目の懸念は、プライバシーと国家安全保障に関わる。データの取り扱いや外国からのアクセスへの懸念を理由に、複数の政府や組織が公式端末やネットワークでDeepSeekを制限している。

こうした制限は、すべてのローカルデプロイメントが安全ではないことを証明するものではない。デプロイ方法が重要であることを示している。機密性の高いプロンプトをホスト型サービスに送信することは、管理された環境内でダウンロード可能な重みを実行することとは異なる。

買い手は、モデル、アプリケーション、ホスティングプロバイダーを区別しなければならない。公開の議論では、これら3つがしばしば1つの製品名の下にまとめられる。

政治的アラインメントも別のリスクをもたらす。モデルは技術的なオープン性を提供しながら、学習データや追加学習ルールによって形成された応答パターンを維持し得る。

研究では、DeepSeekが中国で政治的に敏感な話題について異なる応答をする可能性が示されている。このような挙動は、ジャーナリズム、学術研究、地政学分析、そして対立する視点を表現することが期待されるあらゆる製品にとって重要だ。

ダウンロード可能なモデルは変更できるが、セルフホスティングによって学習済みのバイアスが自動的に消えるわけではない。テストには、顧客にとって重要なコンテンツ領域を含める必要がある。

知的財産に関する問題もある。OpenAIは、DeepSeekが蒸留を通じて自社モデルの出力を利用し、競合システムの学習に用いたかどうかを調査していると述べた。

この主張は、不正行為について公的な認定を確立したものではない。特に利用規約でそうした活動が制限されている場合に、モデル出力を用いて挙動を再現できるかをめぐる未解決の対立を浮き彫りにした。

関連する調査では、DeepSeekの開発プロセスをめぐる不確実性に触れつつ、米国当局者とOpenAIの懸念が報じられた。

西側の研究所にも、独自の透明性の問題がある。非公開モデルは通常、オープンウェイトプロジェクトよりも、学習データ、アーキテクチャ、内部テストについて明らかにする情報が少ない。

したがって比較対象は、透明性のある中国システムと完全に文書化された米国システムではない。すべてのプロバイダーが競争上、法的、あるいは安全保障上の理由で重要な情報を非公開にしている市場である。

賢明な対応は、AlibabaとDeepSeekを退けることではない。両社のモデルは、競争上の反応を引き起こすのに十分な信頼できる結果を生み出している。

同時に、宣伝用チャートや最終実行時の計算量推定を完全な監査として扱うのも賢明ではない。独立評価、透明性のあるインシデント報告、ワークロード固有のテストは依然として必要である。

この懐疑的な見方は、中心的な主張を弱めるのではなく、むしろ強化する。より安価なモデルは、最も広範な主張が未解決のままであっても、買い手の期待を塗り替えられる。

商業的な効果は、買い手が代替案にはテストする価値があると考えたときに始まる。AlibabaとDeepSeekはすでにその閾値を超えている。

次の局面を決める3つのシグナル

次の局面は、実際の導入、検証されたエージェントの信頼性、西側モデルプロバイダーの対応に左右される。

最初のシグナルは、継続的な本番利用だ。ダウンロード数やチャットボットランキングは関心を示すが、企業がテスト後もモデルを使い続けるかどうかは示さない。

クラウド消費量、繰り返されるAPIトラフィック、セルフホスト型のエンタープライズ導入、高ボリュームのワークロードに関する公開事例に注目すべきだ。継続利用が確認されれば、中国モデルが日常的なAI需要を取り込んでいるという見方を支えることになる。

初期の試行後に利用が減少すれば、その結論は弱まる。統合の難しさ、ガバナンス上の懸念、あるいは一貫しない出力が、効率面の優位性を上回っていることを示唆するだろう。

Alibabaには、この点で流通上の優位性がある。確立されたクラウドプラットフォームを通じてQwenを提供し、モデルをストレージ、データベース、ビジネスサービスと接続できる。

DeepSeekには異なる優位性がある。同社の研究機関としてのアイデンティティと寛容なリリース方針は、従来のエンタープライズ営業チャネルの外で大きな開発者の関心を生み出している。

2つ目のシグナルは、長期的なエージェントタスクにおける独立した性能だ。公開ベンチマークは多くの場合、一度に1つの回答を採点するが、本番環境のエージェントは多数のアクションにわたって文脈を維持し、エラーから回復しなければならない。

ソフトウェアリポジトリ、ブラウザ操作、データ分析、ツール呼び出しを含むテストは、小さなベンチマーク差が長期ワークフローで大きな信頼性の差になるかを示すだろう。

QwenとDeepSeekが主要な非公開モデルの完了率に近づけば、その効率性の主張ははるかに強くなる。定型的なテキスト処理だけでなく、価値の高いコーディングや自動化の仕事でも競争できるようになる可能性がある。

長期タスクで差が広がれば、西側の研究所は信頼性を通じてプレミアムな位置づけを守り続けられる。失敗したワークフローに人間の修復が必要なら、安価なトークンの重要性は低くなる。

3つ目のシグナルは、OpenAI、Anthropic、Google、Metaの対応だ。最も明確な対応は、モデル効率、オープンウェイトのリリース、サービスパッケージ、製品統合に表れるだろう。

西側のプロバイダーは、DeepSeekの戦略をそのまま模倣する必要はない。より小さなモデル、キャッシュ、タスク特化型システム、より緊密なソフトウェア統合を利用して、完了した作業の実効コストを下げられる。

GoogleはGeminiを検索、生産性ツール、Android、クラウドインフラと接続できる。OpenAIとAnthropicは開発者エコシステムとエージェント性能を通じて競争できる。MetaはLlamaを通じてオープンモデルでの地位を守ることができる。

デプロイメント上の摩擦が広く低下すれば、AlibabaとDeepSeekが競争行動を変えたことを裏付ける。それは、効率性が副次的なエンジニアリング指標ではなく、主要な製品要件になったことを示すだろう。

対応が限定的であれば、主要プロバイダーがエンタープライズの買い手は依然として最大能力、ガバナンス、統合サービスをより重視すると考えていることを示唆する。

読者は今後のGoogle Newsに関する主張も慎重に扱うべきだ。あるモデルが別のモデルを打ち負かしたという見出しは、狭いベンチマーク結果を普遍的な判断へと圧縮していることが多い。

より良い問いは、そのモデルが許容可能な精度、レイテンシー、ガバナンス、運用要件で、定義されたワークロードを完了できるかどうかだ。その答えは組織ごとに異なり得る。

開発者は、モデルに依存しない評価セットを構築し、失敗事例を文書化することで準備できる。エンタープライズの買い手は、デプロイメントの選択肢を比較する前に、機密性の高いタスクと定型的なタスクを分けることができる。

ナレッジワーカーは、どの単一チャットボットにも依存せずに調査結果を保持し、モデルの好みが変わっても役立ち続ける個人ナレッジシステムを構築できる。

AlibabaとDeepSeekはAI競争を終わらせたわけでも、恒久的な優位性を確立したわけでもない。両社は、その採点基準を変えた。

最も困難な仕事では、最大の知能が依然として重要である。効率性、オープン性、制御性が、その他すべてに誰が対応できるかを決めるようになった。

次にAlibaba、DeepSeek、あるいは西側の研究所がGoogle Newsを席巻したときは、リーダーボードの先を見るべきだ。独立テストが結果を確認しているか、顧客がそのモデルを継続利用しているか、競合他社がそれに応じて製品を変えているかを問うべきである。

この3つのシグナルが、より安価な中国モデルが単に注目を集めているだけなのか、それとも着実にインフラになりつつあるのかを明らかにする。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page