top of page

DeepSeek Flash 0731、オープンモデルのトップ3入り。ただしベンチマーク首位は検証が必要

DeepSeek Flash 0731はArtificial Analysis Intelligence Indexで50を記録し、新たに公開されたモデルはオープンウェイトシステムの上位3モデルに入った。

independent testingによると、この結果は従来のDeepSeek V4 Flashのスコアを10ポイント上回る。DeepSeekが小型のFlashアーキテクチャを維持しながら、今回の更新をエージェントの振る舞いに集中させた点で、この伸びは重要だ。

今回のリリースは、Zhipu AI、Moonshot AI、Alibabaなど中国の研究所が手がける、より大規模なオープンモデルへの圧力も強める。総パラメータ数やアクティブパラメータ数を増やすことが、より強力なエージェントへの最も確実な道だという前提にも疑問を投げかける。

ただし、複合スコアだけでこの議論に決着はつかない。DeepSeekは、公表された複数のコーディング評価で自社の未公開エージェントハーネスを用いた。引用されている評価のうち2件も、社内テストセットに基づいている。

したがって重要なのは、DeepSeekと特定の1社との対決ではなく、小規模なオープンウェイトエージェントとより大きなシステムとの競争だ。Flash 0731は小型路線の説得力を高めたが、報告された効率性は今後、外部のワークロードで確認される必要がある。

DeepSeek Flash 0731で何が変わったのか

DeepSeekはモデルの基本アーキテクチャよりも振る舞いを変え、その成果をMITライセンスで公開した。

DeepSeekは0731を、従来のプレビュー版を置き換える正式版DeepSeek V4 Flashリリースと説明している。同社のmodel cardによれば、この更新でエージェント能力は大幅に向上した。

エージェント型モデルは、単独のプロンプトに答えるだけではない。タスクを遂行する過程で、手順を計画し、ツールを呼び出し、結果を確認し、アプローチを修正する。

モデルはV4 Flashの構造を維持しており、総パラメータ数は2840億、各トークンで有効化されるパラメータは約130億だ。この設計はMixture of Experts(MoE)であり、各トークンを選択された専門コンポーネントに振り分ける。

この違いは重要だ。総パラメータ数はモデルが保持する能力を示す一方、アクティブパラメータ数は1回の順伝播で使われる計算量をより適切に近似する。

DeepSeekは、付属の投機的デコーディングモジュールDSparkも維持した。投機的デコーディングでは、ドラフト用コンポーネントが複数のトークンを提案し、その後メインモデルが検証する。予測が受け入れられれば、生成速度を改善できる。

公開されたチェックポイントは、FP4とFP8を混在させた精度を採用する。エキスパートの重みには4ビット表現を用い、それ以外の大半のパラメータには8ビット表現を用いる。

数値精度を下げることでストレージとメモリの要件は減るが、実際の性能は依然としてハードウェア対応とランタイム実装に左右される。リポジトリは公開ファイル全体でおよそ167GBを占める。

DeepSeekはこれらの重みをMITライセンスで公開した。このライセンスは一般に、限られた義務のもとで改変、再配布、商用利用を認める。学習データや完全な学習コードが公開されていないモデルにとって、「オープンソース」は依然として不完全な呼び方だ。

「オープンウェイト」の方が正確である。開発者はチェックポイントを調査、実行、改変、再配布できるが、公開された資料だけからその作成過程を完全に再現することはできない。

DeepSeekは更新後のモデルを公式APIでも提供した。既存の利用者は、別の0731エンドポイントへ移行せずに、deepseek-v4-flashというモデル識別子を引き続き使える。

APIはOpenAI互換およびAnthropic互換のリクエスト形式をサポートする。この互換性により、一般的なチャット補完やエージェントのインターフェースをすでに利用しているチームは、統合の負担を抑えられる。

DeepSeekによれば、アーキテクチャと商用条件は従来のFlashサービスと整合している。したがって同社は0731を、新たなプレミアム製品ではなく能力向上として提示している。

この組み合わせが中心的な緊張関係を生む。開発者は、より大きなアクティブモデル、制限的な重みライセンス、新たなAPI統合を受け入れることなく、報告上はより強力なエージェントを得られる。

スコア50がオープンモデル競争を変える理由

このスコアが重要なのは、比較的小さなアクティブモデルを、これまでより大規模なオープンシステムと結び付けられてきた層へ押し上げたからだ。

Artificial Analysisによると、DeepSeek Flash 0731はIntelligence Indexで50を記録した。同じ組織の評価フレームワークでは、従来のDeepSeek V4 Flashは40だった。

この指数は、複数の推論、知識、数学、コーディング評価にまたがる性能を集約している。共通の比較軸にはなるが、あらゆる導入ワークロードを表せる複合指標は存在しない。

10ポイントの改善は、モデル選定をめぐる議論を変えるには十分に大きい。測定ノイズに埋もれる小さな改訂にすぎないわけではない。

報告によれば、この結果によりモデルは、同組織が測定したオープンウェイト製品の中で最も強力な3モデルに入った。また、アクティブ規模が大幅に大きい複数の有力システムにもFlashは近づいている。

これは、モデル規模で競争するプロバイダーに即座の圧力をかける。エージェントを評価する購入者が重視するのは、総パラメータ数よりも、完了した作業、レイテンシー、ホスティング要件、制御性であることが多い。

小さなアクティブモデルは、品質が独立検証に耐えるなら、こうした経済性を改善できる。生成トークン当たりの計算量が少なければ、より高いスループットや低いインフラ要件を実現できる可能性がある。

ただし、MoEの効率性は導入の容易さと同義ではない。2840億のパラメータはすべてストレージを必要とし、実装ではエキスパートの重みをアクセラレータ間で効率よく移動させなければならない。

そのため公式チェックポイントは、一般的なコンシューマーGPUの範囲をなお超えている。DeepSeek自身のデプロイ例では、4基のGB300アクセラレータを搭載した単一ノードを使用している。

コミュニティによる量子化はメモリ要件をさらに下げられるが、別の変数も持ち込む。積極的な量子化は、精度、ツールの挙動、長文コンテキスト性能を変える可能性がある。

それでもオープンウェイトのリリースは、クローズドAPIにはない選択肢をチームにもたらす。組織はプロンプトを管理下のインフラ内に置き、推論の挙動を変更し、ドメイン固有の適応を構築できる。

また、機密情報を外部のモデルプロバイダーに送ることなく、プライベートな評価セットで出力を検証できる。これは独自リポジトリを扱うコーディングエージェントにとって有用だ。

今回のリリースは、別の形でも大規模オープンモデルに圧力をかける。開発者は追加のアクティブ計算が、なぜより高い信頼性、知識、あるいは複雑なエージェント実行につながるのかを、今後説明する必要がある。

より大きなモデルが依然として正しい選択であり得る。DeepSeek自身の結果でも、Flashがすべてのプロプライエタリシステムや比較対象に勝つわけではないことが示されている。

問題は性能差だ。小さなモデルが大きな競合に近づくと、購入者は残る差が追加のハードウェアと運用の複雑さを正当化するかを問う。

この問いは、反復的なエージェントワークロードでとりわけ重要になる。1つのタスクで、モデルは数千トークンを生成し、何度もツールを呼び出し、長い履歴を保持する場合がある。

こうした工程では、小さな効率差が積み重なる。したがって、信頼できる130億アクティブのモデルは、短いチャットボットのやり取りよりもエージェントループにおいて大きな意味を持ち得る。

スコア50が万能の勝者を決めるわけではない。同程度の測定知能を提供しながら、より多くのリソースを消費するモデルに対する立証責任を変えるものだ。

DeepSeek Flashアップグレードを支える仕組み

DeepSeekは0731を新たな基盤アーキテクチャとして提示することなく、ポストトレーニング、推論制御、エージェント実行を改善した。

同社によると、Flash 0731は従来のV4 Flash DSparkモデルと同じ構造を持つ。つまり、報告された改善は主に学習と振る舞いの洗練によるものだ。

ポストトレーニングは、事前学習済みモデルが指示に従い、推論し、ツールを使い、フィードバックに応答する方法を形作る。基礎となるパラメータ数を変えずに、実用性能を大きく変えられる。

DeepSeekは0731の完全な学習レシピを公開していない。利用可能な証拠は成果とランタイムインターフェースを示すが、すべてのデータセットや最適化の判断までは明らかにしていない。

今回のリリースでは、low、high、maxという3つの推論努力設定が導入された。これらの設定は、最終回答を生成する前にモデルがどれだけ熟考するかを制御する。

この制御はエージェント製品にとって重要だ。単純な書式設定の依頼に、リポジトリのデバッグや複数ステップの調査タスクと同じ推論予算を費やすべきではない。

DeepSeekは負荷の高い作業にはhighまたはmaxの努力設定を推奨している。モデルの指示によると、これらのモードでは最大384,000トークンの出力長もサポートする。

出力上限が長いからといって、すべてのタスクがその規模に近づくべきという意味ではない。推論を長くするとレイテンシーが増え、モデルが軌道から外れる機会も増える。

モデルはV4ファミリーの100万トークンのコンテキストウィンドウも維持している。コンテキストとは、プロンプト、ファイル、ツール結果、これまでの推論を含む、1回のやり取りで利用可能な情報である。

DeepSeekの元のtechnical reportでは、この長いコンテキストをより効率的に扱うために設計されたハイブリッド注意機構が説明されている。注意機構は、どの過去トークンが現在の計算に影響するかを決める。

100万トークンのウィンドウには、大規模なコードベース、長いツールトレース、技術文書の集合を収められる。実用的なコンテキスト容量は、依然として検索精度と指示保持に左右される。

アーキテクチャでは、圧縮スパースアテンションと高圧縮アテンションを併用する。これらの手法は、長い系列を処理する際の計算量とメモリ使用量を減らす。

DeepSeekは、ネットワーク内の情報フローを安定化するため、mHCと呼ばれる多様体制約ハイパーコネクションも使用している。この用語は、従来の残差接続に代わる構造化された手法を指す。

V4の学習スタックには、Muonオプティマイザも組み込まれている。オプティマイザは、システムが誤差を最小化する過程で、学習中にモデルパラメータをどのように更新するかを制御する。

こうしたアーキテクチャ上の選択は、元のV4プレビューで導入されたものだ。0731の焦点は、DeepSeekが既存の基盤からどれほど多くの性能を引き出したかにある。

DSparkは、別の効率化の仕組みを提供する。複数の次トークン候補を予測し、メインネットワークがそれらをグループ単位で受け入れるか拒否するかを決める。

公式のvLLM設定では、一度に7つの投機的トークンを提案する。提案が受け入れられれば、メインモデルの検証を置き換えることなく出力速度を高められる。

デプロイには、対応するソフトウェアサポートも必要だ。DeepSeekは、大規模言語モデルの提供で一般的に使われる2つのエンジン、vLLMとSGLang向けの手順を文書化している。

このリリースには、従来型のJinjaチャットテンプレートは含まれていない。代わりにDeepSeekは、OpenAI形式のメッセージをモデルが必要とする入力形式に変換するPythonエンコーディングスクリプトを提供している。

この選択は、重みを直接提供するチームに統合作業を追加する。API利用者は、同じ低レベルの書式設定責任を負わない。

実用上の主張は明快だ。DeepSeekは、スパース計算、低精度の重み、投機的デコーディング、強化されたポストトレーニングを用いて、Flashをそのアクティブ規模以上の水準で競争させた。

各コンポーネントには前例がある。DeepSeekが好むハーネスの外部でこの結果が再現されれば、それらの組み合わせは小規模なオープンエージェントに、より強いアーキテクチャ上の根拠を与える。

DeepSeekのエージェントベンチマークには独立した監査が必要だ

公表された結果は印象的だが、最も強い主張は、外部評価者がまだ完全には再現できていないテスト条件に依存している。

DeepSeekによると、Flash 0731はTerminal-Bench 2.1で82.7を記録した。同社比較では、プレビュー版は61.8、V4 Proプレビュー版は72.1だった。

Terminal-Benchは、コマンドライン環境内でタスクを実行するエージェントを評価する。静的な選択式テストより実際のソフトウェア業務に近い一方で、周辺のハーネスが結果に影響する。

DeepSeekによれば、Flash 0731はNL2Repoでも54.2を記録した。プレビュー版は39.4、大型のProプレビュー版は38.5だった。

CyberGymでは、DeepSeekは38.7から76.7への上昇を報告している。CyberGymは、制御された環境でサイバーセキュリティ関連のエージェント挙動を評価する。

報告された最大の変化はDeepSWEに見られる。Flash 0731は54.4で、Flashプレビュー版の7.3、Proプレビュー版の12.8と比較される。

これらの数値は、コーディングエージェント性能に大きな変化があったことを示唆する。ただし、その改善のうちどれだけがモデル、プロンプト、推論予算、ハーネスによるものかは切り分けられていない。

DeepSeekは、DeepSeek Harnessの最小モードを用いて公開コードエージェントタスクを評価したとしている。このフレームワークはまだ公開されていない。

同社は指定されたサンプリング構成で、最大の推論努力度も使用した。他社では、より短い推論予算や異なるツールスキーマにより、異なる結果が出る可能性がある。

追加の2評価であるDSBench-FullStackとDSBench-Hardは、DeepSeekの内部テストセットだ。外部研究者は現時点で、その完全な構成を確認したり、スコアを独自に再現したりできない。

DeepSeekは、フルスタックセットで68.7、ハードセットで59.6を報告している。いずれもプレビュー版の結果を大幅に上回る。

内部ベンチマークが自動的に無効になるわけではない。公開リーダーボードでは見落とされる難しい挙動をテストできる。

制約は透明性にある。読者は、汚染、タスク選定、採点の一貫性、同社が好むエージェント設定への感度を評価できない。

Artificial Analysisは、価値ある独立した対抗指標を提供している。同社の50というスコアは、改善がDeepSeek独自の表だけに現れているわけではないことを裏付ける。

ただし、この指標も集計値である。モデルは、チームの実際のワークフローと一致しないタスクで改善することで、ポイントを得る場合がある。

初期ユーザーの反応は、その隔たりを示している。一部の開発者はコーディングやリサーチの挙動が強化されたと述べる一方、未完了タスクでの冗長さや自信に満ちた推測を報告する人もいる。

こうした報告は逸話的なものだ。テストの仮説としては重要だが、統制された評価の代替にはならない。

エージェントシステムでは、冗長さに特に注意する必要がある。より長く推論するモデルは精度を高められる一方、レイテンシーを増やし、より多くの出力トークンを消費する。

自信に満ちた完了も別のリスクだ。エージェントは、欠落したフィールド、利用できない認証情報、曖昧な要件、不完全なデータを返すツールにしばしば遭遇する。

正しい挙動は、停止して質問することかもしれない。行動を続けるよう最適化されたモデルは、代わりに値を捏造したり、安全でないデフォルトを選んだり、取り消せない操作を送信したりする可能性がある。

したがって、チームは最終回答の正確性だけをテストすべきではない。評価では、不必要なツール呼び出し、エラー後の復旧、捏造された状態、権限処理、停止挙動を測定すべきだ。

セキュリティテストも不可欠である。オープンウェイトは防御側により大きな制御を与えるが、プロンプトインジェクションや危険なツール使用への耐性を保証するものではない。

適切な結論は、DeepSeekのベンチマーク主張が誤っているということではない。証拠は有意な改善を支持している一方、その改善の規模は依然としてワークロードに左右される。

オープンウェイトはベンチマーク結果をデプロイメントの問題へ変える

MITライセンスでの公開により、開発者は自らのインフラでDeepSeekの主張を検証できる。これにより0731は、API限定のリーダーボード項目以上に重要な存在となる。

クローズドモデルでは、ユーザーはプロバイダーの提供環境、更新スケジュール、保持条件、地域での利用可能性を受け入れる必要がある。オープンウェイトは、より多くのデプロイ選択肢を生む。

企業は、自社のセキュリティ境界内でFlash 0731をホストできる。ネットワークアクセスを制限し、ツール呼び出しを記録し、組織固有の承認ルールを適用することも可能だ。

こうした制御はコーディングエージェントにとって重要である。高性能なモデルは、ソースファイルの読み取り、コマンド実行、リポジトリの変更、内部ドキュメントへのアクセスを行う可能性がある。

セルフホスティングは運用リスクをなくすわけではない。モデルを運用する組織に、より多くの責任を移す。

チームは推論ソフトウェアにパッチを適用し、エンドポイントを保護し、認証情報を管理し、生成されたアクションを監視しなければならない。また、完全なチェックポイントに必要なアクセラレータメモリと帯域幅も確保する必要がある。

167GBのリポジトリサイズは出発点にすぎない。ランタイムメモリには、キャッシュ、一時的な活性化、サーバーのオーバーヘッド、選択したコンテキスト長も含まれる。

キー・バリューキャッシュは、履歴全体を再計算せずに後続トークンを生成するために必要な情報を保存する。非常に長いコンテキストでは、このキャッシュが大きなメモリ消費要因になり得る。

DeepSeekは、vLLMの例でFP8キャッシュサポートを推奨している。また、MoEエキスパートを複数のアクセラレータに分散するエキスパート並列化も使用している。

この構成はトレードオフを浮き彫りにする。トークンごとに活性化されるパラメータは130億にすぎないが、エキスパートプール全体には依然として協調的なアクセスが必要だ。

多くのチームにとって、クラウドAPIの利用は依然として簡単である。DeepSeekのmodel endpointは既存サービスを通じてFlashを提供しており、ウェイト変換やクラスタ管理を回避できる。

APIは現在、一般的なチャット完了リクエストとResponses API形式の両方をサポートしている。Responses形式のインターフェースは、エージェントアプリケーション内でツール、状態、複数ステップの出力を調整するのに役立つ。

APIの利便性は、データ処理、サービス可用性、地域コンプライアンスに関する別の問題を生む。購入者は、それらをベンチマーク品質とは独立して評価すべきだ。

オープンデプロイメントは、そうした制約が受け入れられない場合の代替手段を提供する。また、モデルの挙動を特定のチェックポイントに固定しやすくする。

ホストされた識別子はアプリケーションの裏側で変更される可能性があるため、このバージョン管理は重要だ。DeepSeekは既存のFlash識別子を更新し、0731を指すようにした。

静かな能力向上は有益に聞こえるが、本番チームには回帰テストが必要である。より強い推論でも、書式、ツール選択、レイテンシー、拒否挙動を変える可能性がある。

セルフホスト利用者は、プレビュー版と0731のチェックポイントを並べて保持できる。移行前に、同一のプロンプトで両モデルを比較できる。

MITライセンスは、特化型の適応も許可する。組織は、社内のコード規約、構造化されたワークフロー、狭い専門領域向けにモデルをファインチューニングできる。

ファインチューニングには、独自の検証負担が伴う。馴染みのあるタスクでの改善が、一般性を低下させたり、別の場所で安全性の挙動を弱めたりする可能性がある。

したがって、このリリースはトレードオフをなくすのではなく、制御の幅を広げる。開発者はモデルを検証、変更、提供する能力を得る一方で、より多くの技術的責任を負う。

エンタープライズ購入者にとって、この制御は決定的になり得る。小規模チームにとっては、公式APIや信頼できるホスティングプロバイダーの方が、引き続き実用的な選択肢となるだろう。

いずれにせよ、オープンウェイトは抽象的なスコアをテスト可能な成果物に変える。競合他社は、同等のアクセス、より明確な優位性、あるいは信頼性に関するより強い証拠で応じなければならない。

0731が地位を維持するかを決める3つのシグナル

独立したエージェントテスト、本番環境でのトークン挙動、競合他社の対応が、DeepSeek Flash 0731が持続的な転換を示すかどうかを決める。

最初のシグナルは、中立的なエージェントハーネスでの再現だ。研究者は、DeepSeekの未公開フレームワークを使わずに、Terminal-Bench、リポジトリタスク、ツール利用スイートでFlash 0731を実行する必要がある。

同社の数値と一致すれば、ポストトレーニングがモデル自体を変革したという主張が強まる。大幅に低下すれば、改善のより大きな部分をハーネスが担っていたことが示される。

テストでは、プロンプト、ツール定義、推論設定、再試行ポリシー、採点手順を公開すべきだ。これらの制御が隠されたままでは、エージェントスコアの解釈は難しい。

2つ目のシグナルは、本番環境での効率性である。チームは、1時間当たりの完了タスク数、生成トークン総数、エラーからの復旧、人間の介入を測定すべきだ。

モデルが異常に長い推論トレースを必要とするなら、50ポイントの知能スコアの重要性は下がる。Flashがより大きな競合モデルより少ないリソースで作業を完了するなら、その価値は高まる。

開発者は、裏付けのない仮定も追跡すべきである。欠落情報を捏造する高速なエージェントは、確認を求める低速なモデルより多くのレビュー作業を課す可能性がある。

レイテンシーは、短いコンテキストと長いコンテキストで分けて測定する必要がある。MoEルーティング、キャッシュの増加、投機的デコーディングは、エージェントの履歴が拡大するにつれて異なる挙動を示す可能性がある。

3つ目のシグナルは、競合するオープンモデル開発者の反応である。Zhipu AI、Moonshot AI、Alibaba、その他の研究所は現在、より小型でエージェント重視のモデルを改善する圧力に直面している。

直接的な対応は、より強力なポストトレーニング、より効率的な推論、より広範なウェイト公開、独立検証済みのエージェント評価を通じて現れる可能性がある。

競合他社が首位を取り戻すために大幅に大きなアクティブモデルを必要とするなら、DeepSeekの効率性に関する主張は強まる。より小型の競合がすぐに0731を上回れば、このスコアは一時的なものに見えるだろう。

プロプライエタリなプロバイダーも、重要な補足的文脈であり続ける。DeepSeekが公開した複数の比較を含め、その最高性能モデルは依然として一部の複雑なコーディングおよびエージェント評価で先行している。

オープンな経路がすべてのベンチマークで勝つ必要はない。制御性とデプロイの柔軟性が残る品質差を上回るほど、十分に信頼できるものになる必要がある。

今後3か月間、購入者は一つのランキングを調達判断として扱うべきではない。実際のリポジトリ、ツール、権限、障害条件から評価を構築すべきだ。

既知の答えがあるタスクを使いつつ、曖昧なケースも含める。エージェントが情報不足を認識し、安全でない行動を取る前に停止するかを測定する。

すべてのモデルバージョンとランタイム設定を記録する。同じ公開モデル名でも変更されたホスト済みチェックポイントを指す可能性があり、ローカル量子化は異なる挙動を生む場合がある。

DeepSeek Flash 0731が真剣な注目を集めているのは、独立テストが大幅な改善を支持しているためだ。そのオープンウェイトは、より深い検証を理論上ではなく可能にする。

次の一手は開発者と評価者に委ねられている。最も難しく再現可能なワークフローでモデルをテストし、完了した成果を比較し、他者が結果を再現できるだけの詳細を公開してほしい。

これらのテストがベンチマーク上の地位を裏付けるなら、より小さなアクティブなオープンモデルは、多くのエージェントシステムで信頼できるデフォルトになるだろう。そうでなければ、0731は、より限定的なデプロイメントの物語を伴う際立ったスコアとして残る。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page