top of page

DeepSeek V4 Pro vs Flash: 発売されたもの、変更されたもの、Huawei Chip

更新日:6月17日

DeepSeek V4 がリリースされました。2026年2月から4月下旬にかけて3度の延期を経て、中国のAIラボは4月24日にHuggingFaceとModelScopeでオープンソースのウェイト、ライブAPIエンドポイント、技術レポートとともに新モデルを公開しました。

今回のリリースには、トップクラスのクローズドソースモデルのパフォーマンスを目指すフラッグシップモデルであるDeepSeek-V4-Proと、レイテンシに敏感な、または高負荷なワークロード向けの、より高速で経済的な代替モデルであるDeepSeek-V4-Flashの2つの異なるバリアントが含まれます。どちらも100万トークンのコンテキストウィンドウをサポートし、標準のノンシンキングモードに加えてシンキングモードも提供します。

公式発表の前に出た詳細で、DeepSeekが発表で触れなかったこと:ロイターとThe Informationは4月初旬に、V4はNvidiaではなくHuaweiのAscendチップでトレーニングされたと報じました。NvidiaのCEOであるジェンスン・フアン氏は、もしそれが事実ならアメリカにとって「ひどい結果」だと述べました。この件は技術的な話と並行しており、別途理解する価値があります。

DeepSeek がリリースしたもの:V4-Pro と V4-Flash

DeepSeek の公式発表では、V4-Pro を主要なパフォーマンスモデルとして説明し、V4-Flash をコスト効率の高い対抗モデルとして位置づけています。

DeepSeek-V4-Pro(フラッグシップモデル):

  • エージェント能力:Agentic Coding ベンチマークにおいて、現在のオープンソースレベルで最高を達成

  • 内部評価:チームの報告によると、V4-Pro はノンシンキングモードで Sonnet 4.5 よりも優れたパフォーマンスを発揮し、Opus 4.6 に迫る性能ですが、シンキングモードでは Opus 4.6 との差が残っています。

  • 世界知識:すべてのオープンソースモデルをリードし、クローズドソースモデルの中では Gemini-Pro-3.1 に次ぐ性能です。

  • 数学、STEM、競技プログラミング:公開評価されたすべてのオープンソースモデルを凌駕

DeepSeek-V4-Flash(高速かつ安価なバージョン):

  • パラメータ数が少なく、トークンあたりのアクティベーションが低いため、推論が高速になり、APIコストが削減されます

  • 推論性能はほとんどのタスクでV4-Proに迫ります

  • シンプルなエージェントタスクではV4-Proに匹敵しますが、高難易度のタスクではまだ差があります

両方のモデルが思考モードをサポートしています(推論の労力 パラメータ受け入れ または 最大) および非思考モード。複雑なエージェントワークフローの場合、DeepSeek は思考モードを 最大 の強度で実行することを推奨します。

API モデル名deepseek-v4-pro および deepseek-v4-flash. 旧モデル名の deepseek-chat および deepseek-reasoner は、それぞれ V4-Flash 非思考モードと V4-Flash 思考モードに現在マッピングされており、2026年7月24日に廃止されます。

DeepSeek は、Claude Code、OpenClaw、OpenCode、CodeBuddy などの主要なエージェントフレームワークとの統合のために V4 を明示的に最適化しました。ドキュメントおよびコード生成タスクは、意味のある改善が見られる分野として挙げられています。

DeepSeek V4 に今すぐアクセスする方法

チャットインターフェース: chat.deepseek.com または公式 DeepSeek アプリにログインし、最新の V4 モデルを選択してください。V4-Pro と V4-Flash の両方がすぐに利用可能です。

API:ベースURLは変更されていません。 model パラメータを deepseek-v4-pro またはに更新してください。deepseek-v4-flashにアクセスして、新しいモデルをご利用ください。どちらもOpenAIのChatCompletionsインターフェースとAnthropicのインターフェースをサポートしており、最大コンテキスト長は100万トークンです。思考モードを有効にするには、以下を追加してください。reasoning_effort: "high" または "max" にリクエストします。DeepSeek は、複雑なエージェントタスクには max を推奨します。

移行に関する注意: 現在 deepseek-chat または deepseek-reasoner を使用している場合、それぞれ V4-Flash 非思考モードと V4-Flash 思考モードを指しています。これらの名前は 2026 年 7 月 24 日に無効になります。強制移行を避けるため、今すぐ明示的なモデル名に切り替えてください。

オープンソースウェイト: remio は HuggingFace の deepseek-ai/DeepSeek-V4-Pro および ModelScope でローカルデプロイが可能です。技術レポートも、重みと共に HuggingFace で公開されています。

100万トークンコンテキストウィンドウの背後にあるアーキテクチャ

標準的なTransformerモデルは、アテンション計算がシーケンス長に対して二次関数的にスケールするため、長いコンテキストを扱うのが困難です。トークンが増えるほど、計算量とメモリは指数関数的に増加します。ほとんどのプロダクションモデルの実用的な上限は、歴史的に100万トークンをはるかに下回っていました。

DeepSeek V4は、トークン次元を圧縮する新しいアテンションメカニズムと、完全なクロス積ではなく関連するトークン関係を選択的に処理するスパースアテンション設計であるDSA(DeepSeek Sparse Attention)を組み合わせています。その結果、100万トークンのコンテキストが、プレミアムコストのかかる機能ティアではなく、すべての公式DeepSeekサービスの標準構成となっています。

DeepSeekは、このアーキテクチャが、従来のフルアテンションアプローチと比較して計算量とメモリ要件を大幅に削減しながら、長文コンテキスト機能でグローバルリーダーシップを達成していると説明しています。実用的な意味合いとしては、コードベース全体、長い研究ドキュメント、または拡張された会話履歴を、チャンキングや検索の回避策なしに単一のコンテキストに収めることができます。

FindSkill.ai による技術分析では、MoE設計はトークン推論ごとに総パラメータのごく一部しかアクティブにしないため、モデル全体の容量が数兆にスケールしても、リクエストごとの計算量は約370億パラメータの密モデルと同等に保たれると指摘されています。スパースアテンションとスパースパラメータアクティベーションの組み合わせにより、V4は同等のクローズドソース製品よりも劇的に低い価格で最先端の機能を提供できます。

Huaweiチップに関する質問

DeepSeek の公式発表にはハードウェアに関する言及はありません。Huawei の話は Reuters と The Information によるもので、4 月初旬に V4 は Nvidia GPU ではなく Huawei の Ascend 950PR チップで実行できるように設計されたと報じました。

その主張が正確であれば、特定の理由で重要です。米国は 2019 年以来、Nvidia の高度なチップが中国の購入者に届かないように輸出規制を課しています。この政策の前提は、これらのモデルに必要なハードウェアへのアクセスを制限することで、中国の AI 開発を遅らせるというものでした。中国製シリコンでトレーニングされた最先端モデルは、その前提に直接異議を唱えます。

The Next Web によると、Huang は、AI モデルが「アメリカのテックスタックとは非常に異なる方法で最適化」されれば、中国は「優位に立つ」だろうと述べ、そのシナリオをアメリカにとって「恐ろしい結果」と特徴づけました。South China Morning Postは、Huang の懸念はハードウェアだけでなく CUDA にも集中していると報じました。これは、開発者が 15 年間にわたって構築してきたソフトウェアエコシステムです。もはや CUDA に依存しない中国のラボは、CUDA サプライチェーンによって制約されなくなります。

TechWire Asia の分析は、中国の AI ラボが Huawei Ascend インフラストラクチャに移行するというより広範なパターンがすでに進行中であり、V4 はこの能力レベルのモデルにそのインフラストラクチャを展開するという点でラボが最も進んだ例であると指摘しました。V4 がこのコンセプトを大規模に証明するか、Huawei の現在の提供の限界を露呈するかは、今後数週間で明らかになるパフォーマンスデータによって答えられるでしょう。

競合コンテキスト: V4 の位置づけ

DeepSeek 独自の内部ベンチマークの枠組みは、その具体性において注目に値します。チームは、抽象的なリーダーボードの順位を引用するのではなく、V4-Pro を Claude Sonnet 4.5 および Opus 4.6 と直接比較しました。これは、これらの特定のモデルに対して制御された評価を実行したことを示唆しています。

浮かび上がってきた像:V4-Proは、社内エージェントコーディング評価においてSonnet 4.5を上回りました。Opus 4.6のノンシンキングモードに迫り、シンキングモードには及びませんでした。オープンソース分野では、数学、STEM、競技プログラミングでトップの座を主張します。世界知識においては、すべてのオープンソースモデルをリードし、Gemini-Pro-3.1のすぐ後ろに位置します。

より小型のバリアントであるV4-Flashは、大幅に低いコストとレイテンシで、V4-Proに近い推論能力を提供します。ベンチマークの数パーセントの違いがスループットや価格よりも重要でなくなるほとんどのプロダクションユースケースでは、V4-Flashがデフォルトの選択肢となるでしょう。

オープンソース版は、コスト面での利点をさらに高めます。重みはHuggingFaceとModelScopeでオープンライセンスの下で利用可能です。推論をローカルまたは独自のクラウドインフラストラクチャで実行できる開発者は、API料金を完全に回避し、モデルのデプロイ方法を完全に制御できます。DeepSeekのAPI上にワークフローを構築したチームにとって、実用的な注意点として、古いモデル名「deepseek-chat」とdeepseek-reasoner は、デフォルトで V4-Flash を指すようになり、2026年7月24日に完全に廃止されます。明示的な更新deepseek-v4-pro または deepseek-v4-flashモデル名が、後々の計画外の移行を回避します。

DeepSeek V4 vs V3: 何が変わったのか

すでに本番環境でDeepSeek V3を使用しているチームにとって、実際的な問題は「V4とは何か」ではなく、「具体的に何が変更され、移行に値するか」ということです。

コンテキストウィンドウ: V3は強力な長文コンテキスト性能を提供しましたが、100万トークンは標準のデフォルトではありませんでした。V4では、APIを含むすべての公式サービスで100万トークンがベースラインとなります。これにより、チャンキングなしで単一の呼び出しで渡せるものが変わります。

アーキテクチャ: V4は、トークン次元で圧縮してからアテンションを計算する新しいアテンションメカニズムであるDSA(DeepSeek Sparse Attention)を導入しています。V3は異なるアプローチを使用していました。実際の結果として、トークンあたりの計算要件が低く、長文コンテキストでのパフォーマンスが向上し、競争力のある価格で100万トークンのデフォルトが可能になります。

モデル構造: V3は単一のモデルでした。V4は2つのモデルで提供されます: V4-Proは最大限の能力を、V4-Flashは速度とコスト効率を提供します。高負荷のワークロードでV3を使用しているチームは、V4-Flashがより近い代替となる可能性があります。一方、複雑な推論やエージェントタスクでV3を使用しているチームは、V4-Proを評価すべきです。

エージェント機能:ギャップが最も重要なアップグレードです。チームがSonnet 4.5およびOpus 4.6と比較したV4-Proの内部評価結果は、V3のエージェントパフォーマンスと比較して大幅な改善を示しています。エージェントコーディングワークフローでV3を使用しており、その制限を受け入れていた場合、V4-Proは直接テストする価値があります。

API移行: ベースURLは同じです。古いモデル名(deepseek-chatdeepseek-reasoner)は現在V4-Flashを指しており、2026年7月24日に期限切れとなります。ほとんどのアプリケーションではV3からV4への移行は現在透過的ですが、明示的なモデル名の切り替えが唯一のアクションアイテムです。

開発者とナレッジワーカーにとっての意味

V4のオープンウェイトリリースと100万トークンのコンテキストウィンドウは、実用的な開発者ワークフローを最も即座に変更する2つの機能です。

コンテキストウィンドウにより、以前は分割、チャンキング、または取得拡張パイプラインを必要としていた長いドキュメントを、単一のプロンプトで渡せるようになりました。数百のファイルを持つコードベース、完全な調査ドキュメント、長いプロジェクトログ:すべてが収まります。モデルは、選択されたウィンドウではなく、入力全体で推論できます。

オープンソースライセンスにより、サードパーティサーバーにデータを送信できない開発者(機密性の高いコードベース、NDA下でのクライアントワーク、機密性の高い研究など)は、モデルをローカルで実行できます。量子化されたバージョンは、コンシューマーグレードのハードウェアで実行できると予想されており、エアギャップ環境やプライバシーが制限された環境で作業する個々の開発者が最先端のモデルを利用できるようになります。

ローカルデプロイメントは1つの制約を解決しますが、別の制約を浮き彫りにします。ローカルにデプロイされたDeepSeek V4は、プロンプトに入力されたものを処理できます。プロンプトにないもの(先週の会議、6ヶ月間のブラウジングで蓄積された研究、作業を特定のものにするコンテキスト)にはアクセスできません。すべてのセッションはゼロから始まります。

ここで、remioのローカルファーストナレッジベースが、最先端モデルが残すギャップを埋めます。remioは、閲覧したウェブサイト、ローカルで録音・文字起こしされた会議、インデックス化されたローカルファイルなど、作業コンテキストをパッシブにキャプチャします。DeepSeek V4セッションが開始されると、関連するコンテキストをremioから取得し、コンテキストもモデル出力もクラウドサービスに送信することなく、直接モデルに渡すことができます。

ローカルにデプロイされたDeepSeek V4とremioを組み合わせたワークフローは、すべてのものをハードウェア上に保持します。remioがコンテキストを構築し、モデルがそれを処理します。どちらのステップもマシンを離れることはありません。

特定のドメインに関する論文、注釈、会議のメモを6ヶ月かけて蓄積してきた研究者を考えてみてください。新しいDeepSeek V4セッションはその履歴を知りません。しかし、remioはそれをローカルにインデックス化しています。研究者はremioに関連するコンテキストをクエリし、それを100万トークンウィンドウを持つV4-Proセッションに渡し、空白の応答ではなく、6ヶ月の蓄積された知識を反映した分析を受け取ります。100万トークンコンテキストウィンドウは、これを大規模に実用的にするものです。蓄積された記録全体が、要約や選択ではなく、プロンプトに入力できます。

今後の展開

独立したベンチマーク検証が次のステップです。DeepSeekの内部評価は意味のあるシグナルですが、標準的な条件下で公開される独立して検証された結果と同等ではありません。コミュニティは、Claude Opus 4.7、GPT-5、Geminiに使用されているのと同じベンチマークに対してV4-ProとV4-Flashを実行し、その結果はポジショニングを確認または修正するでしょう。DeepSeekがSonnet 4.5およびOpus 4.6と比較するというフレームワークは、これらの主張をテストするための招待です。そのテストはすでに進行中です。

既存のワークフローを移行する開発者も、管理すべき短期的な締め切りがあります。古いAPIモデル名deepseek-chatおよびdeepseek-reasonerは2026年7月24日に期限切れとなります。それまではV4-Flashにルーティングされるため、既存のアプリケーションは変更なしで新しいモデルを利用できますが、廃止日までに明示的なモデル名への切り替えを行うことで、予期せぬ動作を回避することをお勧めします。

ハードウェアに関する質問について:もしHuaweiのチップトレーニングの話が、独立した報道やDeepSeekからの技術的な開示によって確認されれば、それは長期的にはより重要な進展となります。V4自体についてというよりも、Nvidiaに依存しないフロンティアモデル開発パスの概念実証を確立するからです。他の中国の研究機関も注視しており、この答えは、政策ツールとしての米国の輸出規制の軌跡にとって重要です。

DeepSeekは、今後すべての公式サービスで1Mコンテキストをベースラインとすることを示しました。これは、同じ分野で競合するすべての研究機関にとって新たな期待を設定し、2026年における「本番対応」の長コンテキスト機能が何を意味するかの基準を引き上げます。特にオープンソースコミュニティにとって、フロンティアレベルのパフォーマンス、オープンライセンス、そして1Mコンテキストウィンドウの組み合わせは、6ヶ月前には利用できなかったパッケージです。採用のペースは速くなるでしょう。

よくある質問

DeepSeek V4-ProとV4-Flashの違いは何ですか?

V4-Proは、複雑な推論、エージェントコーディング、および速度よりも品質が重視されるタスクに最適化されたフラッグシップモデルです。V4-Flashは、APIコストが低く、より小型で高速であり、単純なタスクではV4-Proと同等、ほとんどの推論タスクではそれに迫る性能を発揮します。大量またはレイテンシに敏感なアプリケーションでは、V4-Flashがデフォルトの選択肢となります。複雑なエージェントワークフローには、思考モードを有効にしたV4-Proを使用してください。

DeepSeek V4は無料で使用できますか?

chat.deepseek.com のチャットインターフェースは無料です。API の利用はトークンごとに課金されます。DeepSeek は V4-Pro および V4-Flash の最終的な価格をローンチ時に公開していませんが、モデルは Claude Opus や GPT-5 のような同等のクローズドソース製品よりも大幅に安価になると予想されています。オープンソースのウェイトは、セルフホスト型デプロイメントで無料利用可能です。

V4 のローンチ後も deepseek-chat は引き続き動作しますか?

はい、今のところは。モデル名は deepseek-chat およびdeepseek-reasoner は現在、それぞれ V4-Flash 非思考モードと V4-Flash 思考モードにルーティングされています。これらは 2026 年 7 月 24 日に廃止されます。に切り替えてください。deepseek-v4-pro または deepseek-v4-flash明示的に記述し、予期せぬ移行を回避するため。

DeepSeek V4をローカルで実行できますか?

はい。V4-ProとV4-Flashの両方のオープンソースウェイトがHuggingFaceとModelScopeで利用可能です。INT4またはINT8精度の量子化バージョンは、コンシューマーグレードのハードウェアで実行できると予想されます。正確なハードウェア要件は、量子化レベルとモデルのバリアントによって異なりますが、フルモデルはほとんどの個人開発者がアクセスできるマルチGPUセットアップで実行できます。

DeepSeek V4はClaudeやGPT-5と比較してどうですか?

DeepSeekの内部評価に基づくと、V4-ProはClaude Sonnet 4.5を上回り、思考モード以外ではClaude Opus 4.6に迫り、思考モードではClaude Opus 4.6にわずかに劣ります。数学、STEM、競技プログラミングでは、すべてのオープンソースモデルを上回り、クローズドソース分野のトップクラスに位置します。独立したベンチマーク検証は保留中です。コスト差は大きく、V4はOpusクラスのクローズドソースモデルと比較してトークンあたり10〜50倍安くなると予想されます。

DeepSeek V4がリリースされ、オープンソースであり、チームがテストしたほとんどのタスクで主要モデルと競合しています。ハードウェアに関する話はソースから検証されていませんが、すでに業界によるローンチの受け止め方に影響を与えています。今後数週間で独立したベンチマークが示す内容は、内部数値が維持されるかどうか、そしてモデルがDeepSeekのチームが主張する地位を獲得できるかどうかを決定するでしょう。

開発者にとっての現在の実用的な要点:非推奨のモデル名を明示的なV4識別子に更新し、V4-Proに手を伸ばす前に高スループットワークロードのためにV4-Flashを評価し、1Mコンテキストウィンドウに注意して、単一のAPI呼び出しで達成できることを変更する機能としてください。このコンテキスト長のモデルはまだ新しいため、それらを完全に活用するワークフローはまだ設計中です。

remioは、最先端モデルが実際の作業に基づいた出力を生成するために必要なコンテキストレイヤーを開発者が知識労働者と共に構築するのを支援します。モデルがクラウドで実行されるか、独自のハードウェアで実行されるかに関わらず、コンテキストの問題は同じです。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page