top of page

DeepSeek V4 Flash、エージェントタスクでより大規模な兄弟モデルを上回ったと報じられる

DeepSeekは、はるかに大規模なV4 Proプレビューを上回るエージェントスコアを報告した後、軽量モデルV4 Flashをパブリックベータとして公開した。この主張は、自身の何倍もの規模を持つ別システムを上回ったモデルとして紹介する報道を通じ、すぐにGoogle Newsへと広がった。

注目すべき点は、単に小型モデルが一部のテストで勝ったことではない。DeepSeekによれば、V4 Flashは2840億パラメータのアーキテクチャを維持しつつ、エージェントとしての振る舞いを大幅に向上させた。これは、より優れたAIにはモデルのさらなる大規模化と、リクエストごとの追加計算が常に必要だという馴染み深い前提に圧力をかける。

この比較は慎重に扱う必要がある。DeepSeekが開示した仕様は、ニュース見出しに見られる単純化されたすべての規模比を裏付けるものではない。V4 Proの総パラメータ数は1.6兆、V4 Flashは2840億である。総パラメータ数で見ると、ProはFlashの約5.6倍であり、8倍ではない。

さらに重要なのは、ベンチマークでの優位性はタスク、推論設定、ソフトウェアハーネス、評価手法に左右されることだ。独立したテストではすでに、DeepSeek自身のベンチマーク結果がプライベートテストの結果より強く見える場合があることが示されている。したがって、信頼できる見方はより限定的だが、より重大でもある。特化したポストトレーニングにより、小型モデルが特定のエージェントタスクでより大規模な兄弟モデルを上回れる可能性がある。

Google Newsの見出しが省いている点

DeepSeekは単にV4 Proを小型化したわけではない。ツール駆動の作業において異なる振る舞いをするよう、V4 Flashを訓練した。

DeepSeekは2026年4月、2つのオープンウェイトのMixture-of-Expertsモデルから成るV4ファミリーを発表した。Mixture-of-Expertsモデルは、各トークンをネットワークの一部だけに通すことで、応答ごとに必要な計算量を削減する。

V4 Proは総パラメータ数1.6兆で、各トークンにつき490億パラメータをアクティブ化する。V4 Flashは総パラメータ数2840億で、各トークンにつき130億をアクティブ化する。同社のV4リリースノートによると、両モデルは最大100万トークンのコンテキストウィンドウをサポートする。

当初の位置付けは明快だった。Proがフラッグシップで、Flashは計算需要を抑える代わりにスコアがやや低いモデルだった。DeepSeekは、Flashが推論ではProに迫り、より単純なエージェントタスクでは同程度の性能を示すとしていた。

この関係は、DeepSeekが7月31日に更新版V4 Flashチェックポイントをリリースしたことで変わった。同社によれば、モデルは同じアーキテクチャと規模を維持したまま、エージェント能力を大幅に改善した。また、パブリックベータを通じた公式APIアクセスも開始した。

エージェントとは、ターミナル、ブラウザ、コードリポジトリ、業務アプリケーションなどのツールに接続されたモデルである。1つの回答を出力する代わりに、複数の行動を計画し、実行し、結果を読み取り、次のステップを調整する。

DeepSeekによれば、更新版Flashモデルは現在、複数のエージェントベンチマークにおいて以前のV4 Proプレビューを上回っている。これらの結果は、リポジトリの編集、ターミナル操作、ツール呼び出し、より長いソフトウェアタスクの完了といった作業を対象としている。

これがGoogle Newsで注目を集めた根拠である。ただし、簡潔な見出しは3つの留保を取り除いている。

第一に、この比較は選ばれたエージェントベンチマークに関するものであり、知能のあらゆる尺度を対象とするものではない。モデルはソフトウェアタスクで先行する一方、科学的推論、事実知識、敵対的テストでは遅れを取る可能性がある。

第二に、DeepSeekが比較したのは更新版FlashリリースとProのプレビュー版である。この結果は、すべての小型モデルがすべての大型モデルを上回れることや、V4 Flashが現在のすべての最先端システムをリードしていることを示すものではない。

第三に、モデル規模には複数の定義がある。総パラメータ数はネットワーク全体を表し、アクティブパラメータ数は各トークンの処理にネットワークのどの程度が参加するかを表す。いずれの測定値だけでも、学習品質、推論コスト、実用性能を捉え切ることはできない。

DeepSeek V4 Flashは、開示された両方の指標でV4 Proより小さい。しかし公開仕様から得られる比率は、総パラメータ数で約5.6倍、アクティブパラメータ数で約3.8倍である。8倍という主張には、明確に文書化されていない別の比較または測定方法が必要となる。

この食い違いは更新の意義を消し去るものではない。ただし読者は、報じられた比率を確定した技術的事実ではなく、ニュース上の主張として扱うべきだ。

DeepSeek V4 Flash、ポストトレーニングを主役に据える

モデルのアーキテクチャが変わっていないことは、DeepSeekが生の能力を追加するのではなく、学習とツール利用からさらなる性能を引き出したことを示唆する。

事前学習は、大量のテキストとコードに触れさせることで、言語モデルに一般的な統計的理解を与える。続くポストトレーニングでは、モデルが指示に従い、推論し、ツールを使い、フィードバックに応答する方法を形作る。

この第二段階は、コーディングモデル間の競争において中心的な要素となっている。モデルが正しいプログラミング概念を知っていても、エージェントとして失敗することはある。早すぎる段階で止まったり、失敗したコマンドを繰り返したり、リポジトリの状況を見失ったり、ツールが返したエラーを誤解したりする可能性がある。

DeepSeekの更新は、こうした失敗を念頭に設計されたように見える。同社によれば、V4 Flashは現在Responses API形式をネイティブにサポートしており、より長いワークフローにわたってツール呼び出しと中間状態を維持しやすくなっている。

この違いが重要なのは、ソフトウェアエンジニアリングのベンチマークがコード補完以上の能力を試すからだ。モデルはファイルを調べ、計画を立て、適切なコンポーネントを変更し、テストを実行し、失敗を診断し、依頼から逸脱せずにこのプロセスを繰り返さなければならない。

DeepSeekは以前、DSecという強化学習環境について説明している。強化学習はスコア付きの試行を通じて振る舞いを学習させるもので、DSecは大規模なツールベース学習のためにコンテナ、マイクロ仮想マシン、完全仮想マシンを提供すると報じられている。

V4アーキテクチャの技術分析によると、DeepSeekは数十万のサンドボックスを同時に実行するためにDSecを構築した。このシステムは中断された軌跡を保持し、完了済みのツール呼び出しを繰り返すことなく再開できる。

このインフラにより、DeepSeekはベースモデルのパラメータ数を変えずにエージェントを改善できる。研究チームはより現実的なソフトウェアタスクを生成し、失敗を収集し、回復の成功を報酬化し、モデルが推論の労力を配分する方法を洗練できる。

このアプローチは、ベンチマークの改善がエージェントタスク周辺に集中しうる理由の説明にもなる。一般知識は主に事前学習データとモデル容量に依存する。ツール利用は、ポストトレーニング、ワークフロー設計、環境からのフィードバック、推論設定により直接的に依存する。

DeepSeekはV4向けに複数の推論モードを提供している。最も高い労力のモードでは、回答や行動を出力する前に、モデルが問題の検討により多くのトークンを費やせる。難しい問題の結果を改善できる一方、より少ない推論予算を使うモデルとの比較を複雑にする。

周辺ソフトウェアも同じくらい重要である。ハーネスとは、モデルの出力をツール呼び出しに変換し、観測結果を返し、タスク状態を管理するシステムだ。同じ基盤モデルであっても、ハーネスが異なればスコアも変わりうる。

DeepSeekは、コーディングエージェントの結果で同社の最小限のハーネスと最大努力設定を使用したと開示している。これは有益な文脈だが、独立評価者が報告された優位性を再現するには、なお同じ実装が必要となる。

このため、今回の更新は単一のリーダーボードを超えて重要である。モデル開発者は、学習環境、アクション形式、推論ポリシーを変更することで、大幅な改善を引き出せることを示している。パラメータ数の増加は、数あるレバーの一つにすぎない。

企業の購入担当者にとって、この知見はモデル選定を変える。自動化されたコーディングワークフローを導入するチームは、モデル名やパラメータ総数を比較するのではなく、システム全体をテストする必要がある。リポジトリの設定、許可されたツール、コンテキスト管理、再試行ポリシー、人によるレビューが、エージェントの成功を左右しうる。

これらのシステムを評価するチームには、要件と過去の意思決定を信頼できる形で記録することも必要だ。検索可能なエンジニアリングナレッジベースはこの文脈を保持できるが、直接的なモデルテストに取って代わるものではない。

小型モデルが規模優先戦略に圧力をかける

DeepSeek V4 Flashは、モデル規模とプレミアムな位置付けによって製品価値を正当化してきたプロバイダーに最も大きな圧力をかける。

ここ数年、主流の開発路線はスケーリングだった。研究所はより大きなデータセットでより大規模なネットワークを学習させ、その後、拡張し続けるアクセラレータクラスタ上に展開してきた。パラメータの増加は、財務面とエネルギー面の必要量が増す一方で、しばしばより強い汎用性能をもたらした。

Mixture-of-Expertsアーキテクチャは、この計算を変えた。各トークンでネットワーク全体をアクティブ化することなく、大規模なパラメータ群を保持できるからだ。DeepSeekは以前の世代でこの構造を採用し、両方のV4モデルにも引き継いだ。

Flashは、Proと比べて総容量とアクティブ容量の両方を削減しているため、この課題をより鮮明にする。より小型のシステムが一般的なエージェントワークロードでより大規模なシステムに匹敵、あるいは上回れるなら、開発者がフラッグシップを選ぶ理由は、それが大きいということだけでは足りなくなる。

これはスケールが機能しなくなったことを意味しない。V4 Proはより大きな容量を保持しており、初期のベンチマーク結果では、複数の知識・推論テストでFlashを上回っていた。より大規模なシステムは、ポストトレーニングが対象にしなかった特殊なタスクでも優位性を保てる可能性がある。

圧力の源は、実用面での収益逓減にある。多くの企業は、平均スコアが最も高いモデルを必要としているわけではない。レイテンシ、信頼性、セキュリティ、インフラに関する許容範囲内で、繰り返し発生する業務を完了できるモデルを必要としている。

コーディングエージェントは、このトレードオフを可視化する。失敗するツール呼び出しを減らしながら、より多くのリポジトリタスクを完了するモデルは、行動に苦しむ一般的にはより賢いモデルより大きな価値を生み出せる。購入者が目にするのは、パラメータ数ではなく完了した仕事である。

効率化を追求しているのはDeepSeekだけではない。Googleは、より高速で低リソースな推論を軸にGemini Flashラインを構築している。OpenAIは大量処理アプリケーション向けに小型バリアントを提供している。Moonshot AI、Alibaba、Zhipu AIを含む中国の研究所も、疎なアーキテクチャと対象を絞ったポストトレーニングを活用している。

Anthropicも、Claudeモデルがコーディングと長時間稼働するエージェント作業で強い評価を築いているため、重要な比較対象である。DeepSeekが報告した結果は、公開されたウェイトを持つモデルで同等の性能を実現したと主張することで、その優位性を狙っている。

オープンウェイトにより、開発者はライセンスに従ってモデルをダウンロードし、運用できる。すべてのリクエストをベンダー管理のサービスに送る必要はない。これにより、組織はデプロイメントをカスタマイズし、一部のワークロードを自社インフラ内に保持できる。

ただし、オープンウェイトだからといって、自動的に安価または容易なシステムになるわけではない。V4 Flashにはなお2840億パラメータが含まれており、完全なデプロイメントは一般的なワークステーションの能力を超える。量子化、分散推論、専用アクセラレータには、それぞれ独自のエンジニアリング上の負担が伴う。

より大きな変化は、交渉力にある。複数のモデルが同じタスクで十分な性能を発揮する場合、アプリケーション開発者はプロバイダー間で作業を振り分けられる。高価または低速なモデルは難しいケースのために確保し、定型的な行動はより軽量なシステムに送ることができる。

その構造は、ベンチマーク上の優位性と商業的な支配力の結びつきを弱める。研究所が最先端スコアを伸ばすために多額を投じても、数か月後には小規模な競合がポストトレーニングによって差を縮める可能性がある。

DeepSeekは2025年初頭、R1でこの圧力をすでに示した。この推論モデルは西側の最先端システムへの需要を終わらせたわけではないが、モデル能力の開発・提供コストを市場が見直すきっかけとなった。

V4 Flashは、この議論を推論からエージェントへと広げる。その主張は数学の問題に答えることよりも、一連の行動を通じて有用な振る舞いを持続できることにある。これは、多くの企業が自動化したいと考える業務により近い。

DeepSeekのベンチマーク主張には依然として独立検証が必要

中心的な不確実性は、V4 Flashが改善されたかどうかではない。報告された優位性が、中立的なハーネス、非公開タスク、本番ワークロードでも維持されるかどうかだ。

企業によるベンチマークは有用だ。開発者は自社モデルの設定方法を熟知しているためである。推奨システムプロンプト、推論モード、サンプリング設定、ツール形式を選択できる。こうした選択により、意図された条件下でのモデル性能が明らかになる。

同じ自由度はリスクも生む。企業は自社システムに適したテストを強調したり、有利なツールハーネスを使ったり、競合モデルより多くの推論トークンを割り当てたりできる。意図的な操作がなくても、わずかな設定差が順位を変え得る。

V4 Proに対する米国の独立評価は、慎重さが必要な理由を示している。National Institute of Standards and Technologyの一部門であるCenter for AI Standards and Innovationは、サイバーセキュリティ、ソフトウェアエンジニアリング、科学、推論、数学にわたり同モデルをテストした。

DeepSeekの報告結果では、V4 Proはより新しい米国の最先端モデルに近い位置にあった。しかしCAISIは、総合的な能力が約8か月前にリリースされたシステムに相当すると判断した。同機関はその差異を独立評価で説明している。

結果が一様に低調だったわけではない。CAISIの設定では、V4 ProはSWE-bench Verifiedで74%を記録し、より小規模なOpenAIの参照モデルの73%を上回った。また、複数の科学・数学テストでも高い性能を示した。

より大きな差は、非公開または半非公開の評価で見られた。V4 ProはCAISIのホールドアウトされたソフトウェア移植ベンチマークで44%を記録し、AnthropicのOpus 4.6は60%だった。半非公開の抽象推論セットでは、V4 Proが46%に達した一方、Opusは63%だった。

これらの結果はV4 Proに関するものであり、V4 Flashの7月アップデートに関するものではない。したがって、DeepSeekの新しい主張を否定するものではない。ただし、重要な前例は示している。公開され、開発者が選定したベンチマークは、ホールドアウト評価よりも有利な像を描く可能性がある。

V4 Flashにも同様のテストが必要だ。評価者はまずDeepSeekの設定を再現し、その後は一度に一つの変数だけを変更すべきである。企業のハーネスと中立的なフレームワークを比較し、可能な限り推論予算を揃えるべきだ。

本番テストでは、ベンチマークスコアに隠れる失敗も測定すべきである。エージェントはタスクを通過しても、危険な変更を加えたり、認証情報を露出させたり、プロジェクト規約を無視したり、保守コストの高いパッチを生成したりする可能性がある。

長いコンテキストも別の不確実性をもたらす。両V4モデルは100万トークンをうたうが、コンテキスト容量は完全な想起を保証しない。モデルは巨大な入力から関連する詳細を取り出し、適切な手順で正しく使わなければならない。

V4アーキテクチャは、圧縮されたアテンションによってメモリ負荷を軽減する。ある分析によれば、V4 Flashは100万トークン時、DeepSeek V3.2が使う単一トークン推論演算の10%、キー・バリューキャッシュの7%しか必要としない。

キー・バリューキャッシュは、生成の各ステップで会話全体を再計算しなくて済むよう、先行トークンの情報を保存する。このキャッシュを圧縮すれば、長時間にわたるエージェントセッションをより実用的にできる。

一方で、圧縮は有用な詳細を捨てる可能性もある。DeepSeekが報告した検索精度は、コンテキストが100万トークンの上限に近づくにつれて低下した。最大コンテキスト数値よりも、大規模リポジトリを含む実運用テストの方が有益である理由はそこにある。

セキュリティにも同等の注意が必要だ。エージェントはコマンドを実行し、信頼できない文書、ウェブサイト、課題トラッカーのコンテンツを取り込める。持続性が改善されたモデルはより多くの作業を完了できるが、その同じ持続性が誤った指示や悪意ある指示の影響を増幅することもある。

研究者たちは、文書内のテキストがエージェント本来のルールを上書きしようとする間接的プロンプトインジェクションを記録している。ツール利用に最適化された軽量モデルにも、権限境界、隔離された実行環境、ログ、機密性の高い操作に対する人間の承認が必要である。

したがって、最も安全な解釈は限定的なものになる。DeepSeekは、新たなポストトレーニング後、V4 Flashが選定されたエージェントベンチマークでV4 Proプレビューを上回ったとしている。タスクやデプロイ設定を横断する一般的な性能優位は、独立した証拠ではまだ確立されていない。

DeepSeek V4 Flashと実際に競合するモデル

重要な競争は、効率的なエージェント性能とスケール優先のデプロイメントとの間にあり、DeepSeekがあらゆる大規模モデルに普遍的に勝利したという話ではない。

V4 FlashはV4 Proに直接挑む。両モデルは同じファミリー、コンテキスト上限、広範なアーキテクチャ設計を共有しているためだ。このため、無関係なシステム同士のリーダーボード対決よりも、この比較は有益である。

DeepSeekが4月に公表した情報では、V4 Flashの総パラメータ数は2840億、V4 Proは1兆6000億だった。アクティブパラメータ数はそれぞれ130億と490億である。したがって小さいモデルは、各トークン処理時にエキスパート層で必要とする計算量が少ない。

7月のアップデートは、エージェントワークロードにおける社内製品階層を変える。開発者が両者から選ぶ際、「Proは最高の挙動を提供し、Flashは品質を効率と引き換えにする」という単純な判断基準はもはや成り立たない。

AnthropicのClaudeファミリーは別種の課題を提示する。Claudeの最強モデルは、ソフトウェアエンジニアリング、ターミナル利用、長時間の自律タスクで依然として存在感が大きい。DeepSeekは、V4 Flashをこうした同じワークロードの候補として認識させようとしている。

初期報道によれば、更新後のFlashモデルは複雑なコーディングおよび自律型ソフトウェアテストでClaude Opus 4.8に迫る。また、クラウドソース型のフロントエンドコーディング・リーダーボードの一つでは上位に入ったとも報じられている。これらの結果は有望だが、一つのリーダーボードだけで全体的な信頼性を決めることはできない。

GoogleのGemini Flash戦略は、最も近い製品上の類似例を提供する。両社は、速度と効率を軸に設計されたモデルにFlashという名称を使う。Googleは広範なクラウドおよびアプリケーション配信ネットワークを支配する一方、DeepSeekはオープンウェイトと独立デプロイメントを重視している。

Moonshot AIのKimiラインは別の方向から圧力を加える。最近のモデルでは、長時間のエージェントセッション中に必要なメモリを減らすことを意図した疎な活性化とアテンション技術が採用されている。これはDeepSeekのアップデートが孤立した成果ではなく、より広いアーキテクチャ競争の一部であることを示唆する。

競争はますますモデル層の上で起こるようになる。エージェントフレームワークはタスクの難度に応じてモデルを選び、失敗した試行をより強力なシステムへ送信し、結果を共有ワークフローに保存できる。

このルーティングパターンはブランドロイヤルティの価値を抑える。V4 Flashが大半のコード変更を処理しても、難しいアーキテクチャ上の問題で失敗した場合、アプリケーションはそのリクエストだけをエスカレーションできる。複数のモデルが貢献していても、ユーザーには一つの製品として見える。

モデル提供者は、ベンチマークスコアだけでなく統合性を改善することで応じるだろう。安定したツール形式、可観測性、キャッシュ、権限、予測可能な挙動は、公開テストでのわずかな優位より重要になり得る。

ナレッジワーカーにとっても、同じ原則はコーディング以外に当てはまる。小規模なエージェントでも、会議の要約、文書の分類、調査の収集を効果的に行える可能性がある。より大規模なモデルは、より深い統合を要する判断のために利用可能なままにできる。

この組み合わせには適切な情報管理が必要となる。ユーザーは、どの情報源がエージェントの回答を支えたか、ワークフロー中に何が変わったか、いつ人間が結果を承認したかを把握する必要がある。明確な情報源追跡と併用すれば、個人向けのAI second brainがその記録を支援できる。

したがって実務上の問いは、V4 Flashが最も賢いモデルかどうかではない。その性能が定義された業務に十分かどうか、そしてその効率性が全体としてより良いシステムを生むかどうかである。

DeepSeek Google Newsの急増後に注目すべき点

V4 Flashの物語が持続的な変化になるのか、それとも短命なベンチマーク見出しに終わるのかは、三つのシグナルで決まる。

第一のシグナルは、DeepSeekのエージェントスコアが独立して再現されるかどうかである。評価者には、同社が約束した最小限のハーネス、正確なモデルチェックポイント、文書化された推論設定へのアクセスが必要となる。

再現に成功すれば、ポストトレーニングによって変更されていないFlashアーキテクチャがエージェントタスクでProプレビューを上回ったというDeepSeekの中心的な主張が強化される。一致した条件下で大きく低下すれば、その主張は弱まる。

その後、中立的なテストは公開コーディングセットを超えて広がるべきである。非公開リポジトリ、新たに作成されたターミナルタスク、非公開のセキュリティ評価は、学習データが結果に影響したリスクを抑える。

第二のシグナルは本番採用である。ダウンロード数やオンライン上の熱狂は関心を示すが、持続的な利用はモデルが信頼できる仕事を提供できるかを明らかにする。開発者は、ルーティングプラットフォーム、クラウドデプロイメント、フレームワーク統合、実際のリポジトリでモデルを使うチームから繰り返し報告される内容を注視すべきだ。

採用の拡大は、小規模なエージェントモデルが定型業務においてフラッグシップシステムを置き換えられるという考えを裏付ける。高い離脱率、広範な再試行、より大きなモデルへの頻繁なエスカレーションは、ベンチマークと実用的な自動化の間により大きな隔たりがあることを示すだろう。

第三のシグナルは競合の反応である。Anthropic、Google、OpenAI、Moonshot AI、Alibabaが、規模を増やすだけでなくエージェントの挙動を軸に小型モデルを調整するなら、DeepSeekの成果はより重要になる。

新しいコンパクトなチェックポイント、改訂されたツールAPI、より長く信頼できるコンテキスト、強化されたサンドボックス学習は、競合がDeepSeekの前提を受け入れていることを示す。一方で、より大きなフラッグシップへの継続的な注力は、提供者が依然として能力を信頼できる改善へのより安全な道と見ていることを示唆する。

DeepSeek自身の次期Proリリースも、このシグナルの中で重要だ。現在の比較対象はプレビュー版である。完全に更新されたProモデルは、期待される階層を回復させ、Flashの優位性が不均一なリリーススケジュールによるものだったことを示す可能性がある。

Google Newsは、「軽量なDeepSeekモデルが8倍大きいモデルを打ち破った」という最も分かりやすい物語を引き続き評価するだろう。証拠が支持する結論はより正確だ。V4 Flashは、標的を絞ったポストトレーニング後、選定されたエージェントテストでより大きな兄弟モデルを上回ったと報告されている一方、公開されている規模の数値と独立検証はなお不完全である。

このより限定的な知見にも、依然として重要な意味がある。焦点を、研究所がどれだけ多くのパラメータを集められるかから、モデルが現実の環境でどれだけ効果的に行動できるかへと移すからだ。

本番スタックを変更する前に、V4 Flashを自社のタスクでテストし、推論予算を揃え、すべての失敗を記録すべきである。その上で、完了した作業、レイテンシ、監督、セキュリティ要件を比較する。ベンチマークが自社のリポジトリ、文書、リスクになったとき、この小規模モデルは優位性を維持できるだろうか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page