top of page

DeepSeek ProはFable 5に迫るが、ベンチマークの差は未決着

DeepSeek Proは8月13日、新しいAPIモデルビルドを受け取り、報告されたベンチマーク結果は複数のテストでAnthropicのFable 5に近づいた。この変更はDeepSeekのAPI向けモデル情報に現れているが、詳細なリリース発表や完全な評価報告書はまだ公開されていない。

この組み合わせこそが本質的なニュースだ。DeepSeekは単なる段階的なモデル改善を主張しているのではない。既存のAPIエンドポイントを通じて、中国発のオープンウェイトモデルが主要なクローズドモデルに迫れるかどうかを、開発者に検討するよう促している。

初期の比較チャートによれば、DeepSeek V4 Pro 0813は、選定された推論・コーディング評価群でFable 5に近い位置にある。これらの結果は、広範な独立再現検証をまだ受けていない。また、信頼性、コンピュータ利用、安全性、レイテンシー、長時間に及ぶ本番業務の全体で同等であることを示すものでもない。

それでもこの更新は、Anthropicやほかの最先端ベンダーに圧力をかける。外部評価者が結果を再現できれば、主要モデルの競争優位をベンチマークスコアだけで定義することは難しくなる。

DeepSeek Pro APIで何が変わったのか

8月13日の変更は、既存API名の背後にあるモデルを置き換えるものとみられ、新たな統合を必要とせずに開発者へ新しい挙動を提供する。

DeepSeekのAPIドキュメントでは、より大規模なV4システムのモデル名としてdeepseek-v4-proが示されている。開発者はOpenAI互換インターフェースまたはAnthropic互換インターフェースを通じて、この名称を呼び出せる。

新たに確認されたバージョンは、一般にDeepSeek-V4-Pro-0813と識別されている。この接尾辞は日付ベースの命名パターンに従い、8月13日のビルドを示す。ただし、更新が確認された時点で、DeepSeekの公開API変更履歴には、すべての変更を説明する詳細な項目は掲載されていなかった。

これは重要だ。モデル名とモデルバージョンは異なる役割を担う。アプリケーションはdeepseek-v4-proへのリクエストを送り続けながら、DeepSeek側では、そのリクエストを受け取る基盤ビルドを変更できる。

この方式は移行作業を減らす。一方で、同じ公開モデル名を使った2回のベンチマーク実行でも、異なる基盤バージョンに到達し得るため、再現性を複雑にする。

DeepSeekは2026年4月24日にV4ファミリーを導入した。同社の当初のV4リリースノートでは、各トークンに対して総パラメータの一部だけを活性化する、2つのmixture-of-expertsモデルが説明されていた。

DeepSeekによると、より大規模なV4 Proプレビューは総パラメータ数1.6兆、アクティブパラメータ数490億だった。V4 Flashは総パラメータ数2840億、アクティブパラメータ数130億だった。

両モデルは100万トークンのコンテキストウィンドウをサポートした。コンテキストウィンドウとは、モデルが1回のリクエスト内で処理できるテキストやその他のトークン化された素材の最大量を指す。

4月のリリースでは、長いコンテキストに必要な計算量とメモリを削減することを目的としたアテンション設計、DeepSeek Sparse Attentionも導入された。DeepSeekは、このアーキテクチャがトークンレベルの圧縮と選択的アテンションを組み合わせると説明した。

これらの4月時点の主張により、V4 Proはファミリー内で精度重視のモデルとして位置付けられた。Flashはより高速で経済的な選択肢となった。

DeepSeekが8月上旬、公開テスト向けに新しいV4 Flash APIビルドをリリースした後、この区分は不明瞭になった。DeepSeekは、そのFlash更新でエージェント性能が向上したと述べる一方、Pro APIは変更されていないとしていた。

当時、DeepSeekは最終版のV4 Proリリースが後に続くと示していた。そのため、完全な発表がなくても、0813バージョンの登場は想定されていた製品展開と一致する。

開発者にとって実務上の変更は明快だ。既存アプリケーションは、同じ基本APIアドレスとモデル識別子を引き続き使用できる。それでも、この更新は重大な依存関係の変更として扱うべきだ。

チームは、ツール呼び出し、構造化出力、指示追従、長い会話について回帰テストを再実行する必要がある。総合スコアの向上は、モデルが既存アプリケーションで期待される挙動を維持する保証にはならない。

DeepSeekが公開したAPI仕様では、JSON出力、ツール呼び出し、プレフィックス補完、中間補完がサポート機能として挙げられている。また、thinkingモードとnon-thinkingモードについても説明されている。

thinkingモードでは、モデルが応答に追加の推論処理を費やせる。non-thinkingモードは、より直接的な回答を優先する。設定により精度、レイテンシー、出力長が変わり得るため、性能比較ではどちらのモードを使用したかを明示しなければならない。

したがって、8月の更新には2つの層がある。初期テストに基づくモデル品質の主張と、実際のAPI利用者に影響する運用上の変更だ。

後者だけは、モデルの挙動とAPIメタデータを通じて直ちに検証できる。Fable 5への近接性に関するより広範な主張は、依然としてテストの選定・実行方法に左右される。

Fable 5との比較が重要性を高める理由

Fable 5は、特に長く複雑な作業において、Anthropicが従来の一般提供モデルを上回るものとして位置付けたため、厳しい基準点となる。

Anthropicは2026年6月9日にClaude Fable 5をリリースした。同社はこれを、追加の安全策を備えて一般提供されるMythosクラスのモデルと説明した。

AnthropicはFable 5の発表で、このモデルがテストした能力ベンチマークのほぼすべてで首位に立ったと述べた。同社はソフトウェアエンジニアリング、ナレッジワーク、ビジョン、科学研究、より長い自律タスクを強調した。

Fable 5は、単純なチャットボットのアップグレードとして提示されたわけではない。Anthropicはこれを、大規模なコードベース、拡張されたコンテキスト、複数のツール、繰り返しの意思決定にまたがる作業のためのモデルとして位置付けた。

この位置付けにより、DeepSeek ProにとってFable 5は価値の高い比較対象となる。短い推論テストで差を縮めることも注目に値するが、継続的な業務でFable 5に並ぶことには、より大きな商業的意義がある。

Anthropicは、この違いを示すいくつかの事例を報告している。Stripeは、5000万行のRubyコードベースを伴う移行作業でFable 5をテストした。Anthropicによると、このモデルはチームが手作業で行えば2カ月以上かかる作業を1日で完了した。

この結果は初期顧客によるものであり、外部から再現するのは依然として難しい。それでも、Anthropicが購入者にFable 5と結び付けてほしいと考える種類のタスクを捉えている。

同社はまた、Fable 5が長時間タスクにおいて数百万トークンにわたり集中を維持できると述べた。永続的なメモは、戦略ゲームにおける性能をOpus 4.8よりも大きく改善したと報告されている。

これらの事例は回答精度を超えるものだ。モデルが状態を保持し、誤りから回復し、ツールを使い、長期的な目標を完遂できるかを試している。

初期のDeepSeek V4 Pro 0813チャートでは、選定された複数テストにわたり同モデルがFable 5に近い位置にあると報じられている。一部で流通している要約では、総合結果の差は1ポイント未満とされる。

この小さな差は決定的に聞こえるが、総合値はその背後にあるタスク構成を隠している。数学的推論、コーディング、指示追従、検索、エージェントタスクを1つのスコアにまとめることがある。

モデルは全体では別のモデルと同点でも、強みが大きく異なり得る。数学では先行する一方、ツール利用では遅れ、長いワークフローではより頻繁に失敗するかもしれない。

比較は推論設定にも左右される。評価者はプロンプト、thinking予算、再試行方針、サンプリングパラメータ、ツール構成、採点規則を開示しなければならない。

小さな実装上の選択でさえ重要だ。あるモデルにより長い回答を許せば、レイテンシーを増やしながら推論結果を改善できる。あるシステムにより多くの再試行を与えれば、初回試行の信頼性を高めずにタスク完了率を上げられる。

Fable 5にも評価上の複雑さがある。Anthropicによると、分類器は一部の機微なリクエストをOpus 4.8へ振り分ける。つまり、提供されるサービスはリクエスト内容に応じて複数のモデルを含む可能性がある。

Anthropicは、これらの安全策が平均してセッションの5%未満で発動するとしている。また、無害なリクエストでも時として発動する可能性があると警告している。

したがって、サイバーセキュリティ、生物学、化学、モデル蒸留に触れるベンチマークでは、Fable 5単体ではなく、製品のルーティングシステムをテストしている可能性がある。責任ある比較では、置き換えが起きた時点を記録する必要がある。

浮上しつつあるDeepSeek V4 Proの比較は、最先端の性能には主要な米国研究所によるクローズドサービスが必要だという前提に挑むため、意味がある。ただし、その挑戦はまだ決着していない。

独立した証拠はすでに、DeepSeekの社内報告と外部測定の間に差があることを示している。5月、米国のCenter for AI Standards and Innovationは、当初のV4 Proプレビューを評価した。

CAISI評価は、V4 Proを、その時点で同センターがテストした中で最も高性能な中国モデルと呼んだ。しかし、非公開・公開の評価では、このモデルは主要な最先端モデルからおよそ8カ月遅れていると位置付けられた。

CAISIは、DeepSeekの自己報告結果により、V4はCAISIの評価が裏付けるよりも新しいモデルに匹敵するように見えたと述べた。同センターは、自身の評価群ではGPT-5に近い性能を確認した。

この先行調査は0813ビルドを測定したものではない。しかし、公式チャートだけでは議論を決着できない理由を示している。

DeepSeek Proはコスト効率を能力競争へ変える

中心的な逆転は、DeepSeek ProがFable 5に圧力をかけるために、もはやすべてのベンチマークで首位に立つ必要はないということだ。残る差を運用上重要でないものにすればよい。

モデルの購入者がリーダーボードだけでAPIを選ぶことはほとんどない。能力、信頼性、レイテンシー、デプロイメント制御、統合の労力、容量、利用制約のバランスを取る。

DeepSeekは、このより広い方程式で積極的に競争してきた。V4ファミリーは使い慣れたAPI形式と非常に長いコンテキストウィンドウをサポートし、オープンウェイトのリリースは技術チームに別のデプロイメント経路を提供する。

オープンウェイトとは、組織が該当ライセンスの下で検査・実行できる、ダウンロード可能なモデルパラメータを指す。これは、学習データや完全な学習プロセスを自動的に明らかにするものではない。

この違いは重要だ。DeepSeekは公式ホストAPIを提供しつつ、第三者が別の場所でモデルを運用することも可能にできる。AnthropicはFable 5を管理サービスの背後に置いている。

これらの経路は、顧客によって異なる価値を生む。機密性の高いソースコードを扱う企業は、より大きなデプロイメント制御を好む可能性がある。別の企業は、Anthropicの管理された安全システム、サポート、統合された開発者環境を重視するかもしれない。

新しいDeepSeek Proビルドが一貫してFable 5に迫るなら、購買判断は変化する。チームは、特定のワークロードにおいて、Fableに残る優位性がクローズドプラットフォームへの依存を正当化するかを問えるようになる。

重要なのは「特定のワークロード」という言葉だ。自動コーディングエージェントを構築するチームには、孤立したコーディング問題での高い正答率だけでは足りない。

そのモデルは、関連ファイルを見つけ、編集を計画し、ツールを正しく呼び出し、テスト失敗を解釈し、無関係なコードを損なわないようにしなければならない。また、元の目標を見失わずに、多くのターンにわたってこれらの手順を実行する必要がある。

リサーチアシスタントには異なる要件がある。強力な検索、引用の規律、文書理解、適切に調整された不確実性が必要となる。

カスタマーサポートのエージェントには、一貫したポリシー遵守が求められます。予測可能な構造化出力を生成し、不確実なケースでは即興で対応せずエスカレーションしなければなりません。

DeepSeekの100万トークンのコンテキストは、アプリケーションによる大規模リポジトリや文書コレクションの取り込みに役立つ可能性があります。しかし、コンテキスト容量とコンテキスト活用は同じではありません。

モデルは大量の入力を受け取れても、その中に埋もれた重要な詳細を取り出せない場合があります。また、より適切な検索で除外できたはずの資料の処理に、過剰な計算を費やすこともあります。

そのため、チームは自らのタスク履歴を用いてDeepSeek Proをテストすべきです。有用な評価セットには、成功事例、過去の失敗、曖昧なリクエスト、敵対的入力が含まれます。

開発者はまた、各ケースについて正確なプロンプト、モデルのバージョン、ツール定義、期待される出力を保存すべきです。その記録がなければ、APIの更新によって本番品質が気付かないうちに変化する可能性があります。

同じ規律は、検索可能なナレッジベースにも役立ちます。チームは、評価メモ、モデル出力、技術文書、インシデントレビューを、追跡可能な一つのワークスペースに保持できます。

DeepSeekのAPI互換性は、直接テストを行うコストを下げます。すでにOpenAI形式のチャット補完向けに設計されたアプリケーションなら、インターフェースの変更は限定的で済む可能性があります。

Anthropic互換性も、Claude形式のメッセージとツールを中心に構築されたエージェント・エコシステムを対象としています。Fable 5の優位性は、その周囲のワークフローにも一部依存しているため、これは戦略的に重要です。

開発者がモデルをエージェントに組み込むと、それはもはや生のニューラルネットワークとして競争するものではありません。エージェントには、プロンプト、メモリ、ツール定義、権限管理、再試行ロジック、人間によるレビューが含まれます。

DeepSeekは、V4がエージェント型コーディング向けに最適化され、Claude CodeやOpenCodeを含むシステムと統合されたと述べています。より広範な本番環境での証拠が蓄積されるまでは、これらは企業側の主張です。

それでも、これらはDeepSeekの狙いを示しています。同社はベンチマーク上での同等性だけを追求しているわけではありません。競合他社によって形作られたワークフローの中で、自社モデルを代替として採用してもらうことを目指しています。

APIが馴染みのある慣例を維持していれば、その代替はより現実的になります。プロバイダー間で挙動が異なったり、詳細なバージョンノートなしにモデル更新が届いたりすれば、実現可能性は下がります。

したがって、Fable 5との競争には二つの戦線があります。一つはモデルの知能に関するものです。もう一つは、開発者がその知能を予測可能な形で得られるかどうかです。

Fable 5には、安全策、顧客トライアル、製品挙動を説明する公開資料がより多くあります。DeepSeekはモデルアーキテクチャの詳細とAPIドキュメントを公開していますが、0813アップデートには、より明確な評価パッケージが必要です。

それが提供されるまで、最も強い結論は見出しの主張よりも限定的です。DeepSeek Proは初期テストで十分に近い性能を示しており、本格的なAPI利用者による直接評価を正当化するように見えます。

それだけでも圧力になります。フロンティアベンダーは今後、ローンチ時のチャートに現れる優位性だけでなく、顧客の非公開ベンチマークでも維持される優位性を示さなければなりません。

初期ベンチマークの数値では分からないこと

独立した実行、完全な方法論、長期タスクからの証拠がなければ、限定的なベンチマーク差だけで本番環境における同等性を証明することはできません。

最初の不確実性は出所です。DeepSeekの公式ドキュメントはV4 Pro製品と対応するAPI機能を確認していますが、初期の0813比較グラフィックには安定した一次情報源が必要です。

正式なリリースパッケージには、すべてのベンチマーク、モデル設定、プロンプトテンプレート、評価日、採点方法を明記すべきです。ライセンスが許す場合には、生の出力も提供すべきです。

二つ目の不確実性は汚染です。訓練データに問題、解答、または近い変種が含まれている場合、ベンチマークの情報価値は下がります。

モデル開発者は評価資料を訓練コーパスから除外しようとしますが、外部の人間がそのプロセスを容易に監査することはできません。最近作成された非公開テストは、このリスクの低減に役立ちます。

三つ目の不確実性は選択です。企業は自社モデルが有利に見えるテストを公表しがちです。この慣行が結果を虚偽にするわけではありませんが、省略された評価の重要性を高めます。

DeepSeekの4月の技術資料は、推論、コーディング、エージェントタスクにおいてV4 Proを強力なモデルと比較しました。CAISIは後に、自らのスイートではより弱い相対的位置を示しました。

この違いはベンチマーク感度を示しています。信頼できる二つの評価者でも、異なるタスクと集計方法を用いるため、異なる結論に達する可能性があります。

四つ目の不確実性は信頼性です。平均精度では、モデルが重大な失敗をどの程度の頻度で起こすかは分かりません。

9件のコーディングタスクを正しく完了しても、10件目でリポジトリを破損させるモデルは、より安全な失敗モードを持つ少し弱いモデルより有用性が低い場合があります。本番チームに必要なのは平均値だけでなく、失敗の分布です。

五つ目の不確実性はバージョン管理です。日付付きビルドはモデルの識別に役立ちますが、開発者にはそのバージョンを固定する手段、または変更前に通知を受ける仕組みが必要です。

モデルの無告知置き換えは、検証済みのプロンプトを無効にする可能性があります。応答の長さ、ツール選択、拒否、フォーマット、根拠のない主張の発生可能性を変えることもあります。

六つ目の不確実性はプロバイダー差です。オープンウェイトモデルは、量子化、提供ソフトウェア、コンテキスト制限、推論設定が異なる複数のホスティングサービスを通じて提供されることがよくあります。

量子化は、モデルウェイトの保存や計算に用いる数値精度を下げます。ハードウェア要件を下げられますが、積極的な設定は出力品質も変える可能性があります。

DeepSeek V4 Proと表示されたサードパーティーのエンドポイントは、DeepSeekの公式エンドポイントと同じようには動作しない可能性があります。比較では、プロバイダーと提供設定を明記しなければなりません。

Fable 5にも慎重なラベリングが必要です。Anthropicの安全性ルーティングは、選択されたリクエストをOpus 4.8に渡す場合があります。そのため、公開製品のテストは基盤となるFableモデルのテストとは異なる可能性があります。

七つ目の不確実性は、現実世界での自律性に関するものです。Anthropicの公開主張は、コードベース移行や長時間のリサーチを含む長期タスクに大きく焦点を当てています。

DeepSeekの初期比較には、同等の証拠が必要です。短いベンチマークでは、モデルが数時間にわたるツール使用の中で一貫した計画を維持することは証明できません。

独立したエージェント評価はここで有用ですが、周囲のハーネスを制御しなければなりません。より優れたツール設定によって、弱いモデルが強く見えることがあります。

人間の介入も報告すべきです。繰り返しヒントを受けて完了するエージェントは、単一の仕様から同じタスクを完了するエージェントと同等ではありません。

セキュリティも、もう一つの分岐点です。Anthropicは、モデル挙動と安全策を含め、Fable 5とMythos 5を扱う詳細なシステムカードを公開しました。

DeepSeekの4月リリースには、アーキテクチャと能力に関する技術情報が含まれていました。8月のビルドには、安全性テストと挙動の変更に関する同等の開示が依然として必要です。

これらの隔たりはアップデートを無効にするものではありません。ベンチマーク上の主張が調達上の結論となるまでに必要な作業を定義するものです。

開発者は、すべての公開レポートを待たずにこの作業を始められます。機密性のないトラフィックの管理された一部を新モデルに振り分け、現在のシステムと結果を比較すべきです。

評価には、タスク成功率、人間による修正時間、ツール呼び出しの妥当性、レイテンシー、失敗の重大度を含めるべきです。各指標は、集計スコアでは見落とされるものを明らかにします。

チームは繰り返し実行もテストすべきです。1回成功して4回失敗するモデルは、一貫性が求められるワークフローには適していません。

ナレッジワークでは、評価者は事実的根拠、引用の正確性、文書検索、不確実性を明示する能力を比較できます。コーディングでは、通過したテスト、導入された回帰、レビュー工数を測定できます。

こうした非公開テストによって、DeepSeek Proが単にチャート上で近いだけなのか、それとも重要な場面で近いのかが決まります。

差が実在するかを決める三つのシグナル

次の段階は、リーダーボードを再び祝うことではなく、検証サイクルです。

最初のシグナルは、V4 Pro 0813に関する完全なDeepSeekのリリース記録です。DeepSeekは、リリース日、アーキテクチャの継続性、API挙動の変更、評価設定を文書化すべきです。

正式な変更履歴エントリーがあれば、8月13日が一般リリース、段階的ロールアウト、あるいは内部バージョン変更のいずれを示すのか確認できます。また、将来の更新後に開発者が挙動を再現する助けにもなります。

DeepSeekが完全な手法と安定したバージョンへのアクセスを公開すれば、このシグナルは同等性の主張を強めます。コミュニティテストが引き続き好意的でも、曖昧さが続けば信頼は弱まります。

二つ目のシグナルは、コーディング、推論、エージェントタスク全体にわたる独立した再現です。CAISI、学術グループ、ベンチマーク運営者、企業ユーザーは、それぞれ主張の異なる部分をテストできます。

最も価値の高い研究は、同一条件下でDeepSeek V4 Pro 0813とFable 5を比較するものです。同じプロンプト、ツール権限、時間制限、再試行ポリシーを使用すべきです。

結果はタスク別に分解したまま提示すべきです。単一の複合スコアは、アプリケーションにとって重要な弱点を隠す可能性があります。

DeepSeekが複数のスイートで近い性能を維持し、プレビュー版より重大な失敗が少なければ、独立した結果はその主張を強めます。非公開タスクや長期タスクで大きな差が出れば、主張は弱まります。

三つ目のシグナルは本番導入です。開発者には、新ビルドが継続的なトラフィックを処理し、構造化出力の契約に従い、デプロイ後も一貫性を保つという証拠が必要です。

利用量だけでは品質を証明できません。しかし、公開された移行レポートや詳細なポストモーテムは、モデルがどこで成功し、どこで失敗するかを明らかにできます。

コードレビュー、リポジトリ移行、リサーチ、サポートのワークロードを説明するエンジニアリングチームに注目すべきです。有用なレポートには、熱心な事例だけでなく、修正率と運用上の制約も含まれます。

組織が管理されたトライアルの後もモデルを使い続ければ、このシグナルはDeepSeekの主張を強めます。短い実験の後に静かに元へ戻す動きが続けば、反対の方向を示すでしょう。

Anthropicの対応も重要ですが、主なテストではなく補助的な文脈です。同社はFableを改善したり、周辺ツールを調整したり、別のモデルを導入したりできます。

より重要な問いは、DeepSeekが実用的な能力差を縮めたかどうかです。縮めているなら、ベンチマーク首位はより短命な優位性になります。

その変化はまず開発者に影響します。交渉力が増し、モデルルーティングの選択肢も広がります。

エンタープライズの購入者は、より複雑な判断に直面するでしょう。デプロイ管理とモデルアクセスは改善する可能性がある一方、ガバナンス、セキュリティレビュー、地政学的な懸念は依然として重要です。

ナレッジワーカーは、舞台裏でモデルプロバイダーを切り替える製品を通じて、間接的に変化を経験します。目に見えるインターフェース変更がなくても、出力は改善されるかもしれません。

その不可視性が、文書化を重要にします。組織は、重要な分析、コード、推奨をどのモデルが生成したか記録すべきです。

パーソナルナレッジシステムは、プロンプト、ソース資料、出力、その後の修正を保持するのに役立ちます。目的は、AI生成テキストをさらに集めることではなく、説明責任です。

独立テストが初期結果を確認すれば、DeepSeek Proは重要な閾値を超えたことになります。Fable 5に十分近く、購入者が自らの業務で両システムを評価しなければならない水準です。

現時点で証拠が支持するのは、確信ではなく注目です。APIビルドは実在し、競争圧力も実在し、広範な同等性の主張は依然として検証の途上にあります。

開発者は、正確な0813バージョンを取得し、最も難しい社内ケースを再実行して、人間による修正時間を測定すべきだ。ベンチマークが実運用のワークロードになったときも、DeepSeek Proは近い水準を維持できるのだろうか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page