top of page

DeepSeek V4 Pro、ベンチマークで強弱が分かれる結果

8月14日
読了時間: 20分

DeepSeekは更新版のV4 Proモデルをリリースしたが、初期のベンチマーク結果は明快な勝利とは言えない。Google Newsの見出しが捉えた緊張関係は、強力なコーディングエージェントのスコアが、弱めの独立評価や実運用での不確実な性能と並んでいる点にある。

8月13日の更新版「DeepSeek-V4-Pro-0813」は、DeepSeekのアプリ、Webサービス、APIで利用可能になった。DeepSeekによれば、このモデルはツール利用、ソフトウェアエンジニアリング、長時間稼働するエージェントタスクを改善している。これらの主張により、同社はAnthropic、OpenAI、Google、中国の競合Moonshot AIの主要モデルと直接競合することになる。

しかし、ベンチマークは異なる様相を示している。DeepSeek自身のテストでは、V4 Proはターミナル作業とソフトウェア開発で非常に競争力が高く見える。一方、より広範なV4ファミリーに関する独立評価では、推論、エージェントの信頼性、一部のセキュリティ関連タスクで継続的な差が示されている。

この食い違いは、単一のリーダーボード順位より重要だ。開発者はますます、リポジトリの編集、コマンドラインツールの操作、複数ステップのワークフロー完遂にモデルを使っている。統制されたテストで勝つモデルでも、ツール、プロバイダー、プロンプト、タスクの長さが変われば失敗し得る。

だからこそ、このリリースは単純な順位の話以上の検討に値する。DeepSeekは本格的なコーディングモデルを提供したが、現時点の証拠は一貫した優位性を立証していない。本当の競争は、ベンチマーク上の強さと、ベンチマーク環境の外での信頼できる性能との間にある。

DeepSeek V4 Pro 0813で変わったこと

DeepSeekは、4月のプレビュー版V4 Proを、コーディングエージェントとツール駆動型の作業に焦点を当てた、より広範な本番リリースへ移行した。

DeepSeekは一般提供開始の更新日を2026年8月13日としている。同社によると、モデルはアプリ、Webサイト、API全体に展開された。既存のAPIユーザーは、deepseek-v4-proというモデル名で利用できる。

この更新は、4月に導入されたV4ファミリーを基盤としている。このファミリーには、より大規模なフラッグシップモデルであるV4 Proと、より高速な動作向けに設計された小型のV4 Flashが含まれる。DeepSeekは両モデルをV3世代の後継として位置付けた。

公式のV4モデルカードによると、V4 ProはMixture-of-Expertsアーキテクチャを採用している。この設計では、各トークンに対してネットワーク全体の一部だけを活性化する。このモデルは総計1.6兆パラメータを持ち、推論時には490億パラメータがアクティブになる。

公開されているコンテキストウィンドウは100万トークンに達する。コンテキストウィンドウとは、モデルが1回のリクエストで考慮できる情報量のことだ。この容量は、大規模なリポジトリ、広範な文書コレクション、長いエージェント履歴を対象としている。

8月のビルドでは、low、high、maxの3つの推論努力設定が追加された。これらの制御により、アプリケーションはより速い応答と、より長い内部計算とのトレードオフを選べる。また、努力レベルの違いが結果に実質的な差を生み得るため、ベンチマーク比較も複雑になる。

DeepSeekは、エージェント向けインターフェースのサポートも拡大している。API変更ログでは、一般的なチャット補完パターンと、より新しいレスポンスワークフローを通じたアクセスが説明されている。これらのインターフェースは、モデルによるツール呼び出し、状態の保持、構造化された結果の返却を支援する。

最も目立つ主張はコーディングエージェントに関するものだ。DeepSeekは、Terminal-Bench 2.1で87.9、DeepSWEで62.7のスコアを報告している。Terminal-Benchは、AIエージェントがターミナル環境内で実務的なタスクを完了できるかを評価する。DeepSWEはソフトウェアエンジニアリング作業に焦点を当てる。

これらの結果が注目されるのは、エージェントのベンチマークがコード補完以上の能力を試すためだ。モデルは環境を調査し、行動を選び、ツールを使い、失敗を解釈し、タスクが成功するまで継続しなければならない。

ただし、これらの数値は依然として企業が報告した結果である。プロンプト設計、ツール設定、推論努力、再試行ルール、タスク選択によって、評価条件はスコアを変え得る。したがって公開数値は、優位性の最終証明ではなく、能力の証拠として読むべきだ。

当初のGoogle Newsの枠組みは、この結果を強弱が分かれるものとして説明している。今回の更新は、より広いV4評価記録に対する従来の疑問を解消せずに、DeepSeekのコーディング面での主張を強化しているため、この表現は正確だ。

DeepSeekは競争の基準線を変えた。大規模なオープンウェイトモデルが、信頼できるエージェント性能と幅広い展開選択肢を提供するようになった。一方で変わらないのは、独立した条件下でこれらの結果を再現する必要性である。

Google Newsのベンチマーク報道が重要な理由

このリリースは、DeepSeekが学術的な質問応答だけでなく、実用的なエージェント作業で競争しているため、フロンティアモデルの提供企業に圧力をかけている。

従来のモデル比較では、試験、数学、または個別のプログラミング問題がしばしば重視されてきた。コーディングエージェントは異なる基準に直面する。ファイルが衝突し、コマンドが失敗し、要件が不完全な、煩雑な環境を進まなければならない。

この変化により、Anthropic、OpenAI、Google、Moonshot AIなどのモデル開発企業にとって重要性が高まっている。各社の製品は、コーディングアシスタント、ターミナルエージェント、ワークフローツール、企業向け自動化システムの中で、ますます競合している。

DeepSeekが最も強いと報告する結果は、まさにこれらのワークロードを対象としている。Terminal-Benchはコマンドライン環境でのタスク完了を測定する。ソフトウェアエンジニアリング評価は、モデルがリポジトリを理解し、動作する変更を実装できるかを検証する。

こうした分野で信頼できる結果が出れば、開発者による採用に迅速な影響を与えられる。チームはアプリケーション全体を作り直さずに、エージェントの背後にあるモデルを置き換えられる。一般的なAPI形式との互換性は、テストに必要な労力を抑える。

したがって、モデル提供企業にとって圧力は即時的であり、企業の購入者にとってはより緩やかだ。提供企業は、より強力なモデル、より良いツール統合、またはより明確な信頼性の証拠で応える必要がある。購入者は本番業務を移行する前に、依然として社内評価を必要とする。

DeepSeekはオープンウェイト戦略を伴ってこの競争に加わっている。オープンウェイトにより、組織は適用されるライセンスに従ってモデルパラメータを検査し、ホストできる。この選択肢は、プライバシー、レイテンシー、カスタマイズ、インフラ要件を持つチームにとって重要だ。

4月のV4リリースはすでに、DeepSeekが特定のタスクでフロンティア付近に競争できることを示していた。新しいビルドでは、そのメッセージをエージェント実行へと絞り込んでいる。もはや問うべきなのは、V4が難しいプロンプトに答えられるかどうかだけではない。

より良い問いは、V4 Proが複数ステップの仕事を確実に完了できるかどうかだ。そこには、ツールの選択、エラーからの回復、制約の順守、検証可能な結果の生成が含まれる。

この違いは、なぜGoogle Newsの報道が開発者だけでなくナレッジワーカーにも重要なのかを説明する。エージェントモデルは、研究の要約、文書の操作、アプリケーション間での情報連携をますます担うようになっている。8番目のステップでの失敗は、それまでの正しい7ステップを無効にし得る。

AI workflowを構築する組織にとって、見出しのスコアは出発点にすぎない。モデルは、その組織の文書、指示、統合、レビュー要件と連携して機能しなければならない。

長いコンテキストも関心を集める理由を加える。100万トークンという上限は、コードベース全体や大規模な知識コレクションに適しているように聞こえる。しかし、容量がその範囲全体で正確な検索を保証するわけではない。

モデルは関連する詳細を見落としたり、直近の指示を過度に重視したり、依存関係を見失ったりすることがある。長文コンテキストのテストでは、システムが大きな入力を受け付けるかだけでなく、実用的な想起と推論を測定する必要がある。

DeepSeekは競合他社に二つの面で圧力をかけている。オープンウェイトに伴う展開の柔軟性を維持しつつ、強力なエージェント性能を主張している。この組み合わせは、検証に取り組むチームにとって現実的な代替案を生み出す。

それでも、主張の範囲が広がるほど立証責任も重くなる。コーディングベンチマークは、ある評価環境でのスキルを立証できる。しかしそれだけで、プロバイダー、リポジトリ、言語、企業ポリシーをまたぐ一貫した性能を立証することはできない。

DeepSeekの高スコアと独立評価の抵抗

中心的な逆転は単純だ。DeepSeekはリリースで最も強調する領域ではフロンティアに最も近く見える一方、評価者がテストセットを広げると支配的ではなくなる。

DeepSeekの公式結果は、ターミナルとソフトウェアエンジニアリングのタスクを重視している。これらは、8月モデルが選定されたエージェントのリーダーボードで最上位に近い競争力を持つことを示唆する。スコアは、V4 Proの実用性をめぐる評価も改善する。

独立した研究は、より慎重な見方を示している。5月、米国のCenter for AI Standards and Innovationは、4月のV4 Proリリースに関する評価を公表した。同機関は一般にCAISIとして知られ、National Institute of Standards and Technologyの内部で運営されている。

CAISIは、より広範な評価でV4 ProがGPT-5と同程度の性能を示したとした。当時、GPT-5のリリースからは約8か月が経過していた。この結果は、より新しいフロンティアシステムとのDeepSeekの強い比較を支持するものではなかった。

同機関は、DeepSeekの技術レポートに含まれていないテストで、より弱い結果も報告した。独立評価は、半非公開の推論、ホールドアウトされたソフトウェアエンジニアリング、サイバーセキュリティのタスクを対象とした。

これは8月の更新を直接否定するものではない。CAISIがテストしたのは、0813の本番ビルドではなく、以前のV4 Proリリースだった。しかし、この調査結果は、ベンダーの比較を受け入れる前に独立テストが重要である理由を示している。

モデルカード自体も、不均一な特性を示している。V4 Proのベースモデルは、複数の知識および長文コンテキストの指標でV3.2から大幅に改善した。HumanEval、GSM8K、MATHでも向上を記録している。

ただし、その傾向は普遍的ではない。公開されたベースモデルの結果では、V4 ProはMGSMとCMathでV4 Flashを下回っている。また、他の領域では前世代を上回るにもかかわらず、BigCodeBenchではV3.2を下回っている。

これらの違いは、V4 Proが弱いモデルであることを意味しない。モデルの進歩が多次元的であることを示している。パラメータ数の増加や平均結果の改善が、あらゆるワークロードで最良の答えを生むわけではない。

同じ注意は、集約インデックスにも当てはまる。Artificial Analysisは、4月のV4ファミリーを、より幅広い推論、コーディング、エージェントタスクで評価した。モデル評価では、V4 Proは主要なオープンウェイトシステムの一つに位置付けられたが、総合的には最強のクローズドモデルを下回った。

この組み合わせは、DeepSeekのリリース時の比較よりも限定的な結論を支持する。V4 Proは、特にオープンウェイトの分野で競争力がある。しかし、すべての主要なプロプライエタリモデルに対して一様な優位性を示したわけではない。

ベンチマーク手法が、差の一部を説明する。ベンダーは自社システムを熟知しており、有利な推論設定を選べる。カスタムプロンプト、大きな推論予算、タスク固有のエージェントフレームワークを使うこともある。

独立評価者は多くの場合、多数のモデルを公平に比較できるよう、標準化された設定を課す。こうした設定は一貫性を高める一方で、各モデルから最大限の性能を引き出せない可能性もある。

どちらの手法も自動的に誤りではない。ベンダーのテストは「このシステムは有利な構成の下でどれほど性能を発揮できるか」に答える。独立テストは「共通のルールの下で、他と比べてどうか」に答える。

ユーザーには両方の答えが必要だ。入念に設計されたデプロイでは、最大限の能力が重要になる。チームに特定プロバイダー向けにプロンプトやエージェントを最適化する時間がない場合は、標準化された性能が重要になる。

google newsの見出しが誤解を招くのは、読者が「mixed」を失敗という判定として受け取る場合に限られる。むしろ混在した結果は、明確な強み、不完全な検証、そしてタスク間での意味のある性能差を持つモデルを示している。

数値が示さないもの

ベンチマークは複雑なシステムを単一のスコアに圧縮し、エージェントを安全に信頼できるかを左右する失敗を隠してしまう。

端末上のスコアだけでは、モデルがどのように失敗したかは分からない。ある失敗した実行は軽微な書式エラーかもしれない。一方で、誤ったファイルを削除したり、要件を読み違えたり、誤ったコードを黙って生成したりする可能性もある。

本番環境では、この違いが重要になる。チームは不正な形式の応答なら低コストで復旧できる。しかし、エージェントがもっともらしいものの誤った変更を加え、成功したと報告する場合、リスクははるかに大きい。

エージェントの性能は、周囲のハーネスにも左右される。ハーネスはツールを提供し、コンテキストを管理し、コマンド出力を処理し、モデルに再試行を許可するかを決める。より優れたハーネスは、同じ基盤モデルのスコアを引き上げることがある。

プロバイダー間の違いも、別の変数を生む。オープンウェイトのモデルは、異なる量子化、ハードウェア、コンテキスト上限、サンプリング設定で提供される可能性がある。量子化はメモリ使用量を抑えるために数値精度を下げるもので、性能を変化させうる。

名目上は同一のDeepSeekエンドポイントでも、ホストによって挙動が同じとは限らない。スループット制限、ルーティング方針、非公開のシステム指示が結果に影響する場合がある。チームは評価時に正確なモデルバージョンとプロバイダーを記録すべきだ。

推論努力の設定も比較を複雑にする。最大努力の実行は、低努力の実行より多くの時間と生成トークンを消費しうる。こうした詳細なしにスコアを比較すると、運用上のトレードオフが見えにくくなる。

8月のリリースは、挙動の一貫性に欠けるというコミュニティ報告の中で登場した。一部の初期ユーザーは、推論が異例に短く見えた、あるいはローンチ後にサービスが変化したようだと主張した。これらの観察は独立して検証されていない。

こうした報告を、ロールバックやモデル欠陥の証拠として扱うべきではない。ただし、実務的な検証上の問題を示してはいる。APIエイリアスは、ユーザーに恒久的なバージョン識別子を提供しないまま、更新済みビルドを指すことがある。

この不確実性は再現性を弱める。後日テストを繰り返す開発者が、同じモデル挙動を得られるとは限らない。安定した識別子、リリースノート、評価ログがあれば、比較はより信頼しやすくなる。

安全性には別途注意を払う必要がある。4月モデルを評価した独立研究者は、攻撃的なプロンプトによって有害な応答率が急増しうることを発見した。これらの知見は、通常のコーディング品質ではなく、敵対的な挙動に関するものである。

それでも、エージェントのデプロイにとって重要だ。ツールを使うモデルは、テキストを生成するチャットボットよりもシステムへ影響を与える能力が高い。権限、サンドボックス、承認、監査ログは、モデルの制御外に置き続けなければならない。

CAISIの調査結果は、標準的なベンダーのチャートでは見落とされがちな能力差も浮き彫りにしている。半非公開のテストは、ベンチマーク問題が学習データに含まれていた可能性を下げる。ホールドアウトされたタスクは、未知の問題をより適切に近似する。

ベンチマーク汚染を証明または排除するのは難しい。公開テストセットは広く流通しており、モデル開発者は意図的にも間接的にもそれらに対して最適化できる。強い結果は、新しい非公開タスクに転移する場合、より説得力を持つ。

そのため企業は、単一の公開リーダーボードでモデルを選ぶべきではない。有用な社内評価には、代表的な文書、実際のリポジトリ、典型的なツール、既知の失敗事例が含まれる。

ソフトウェア作業では、チームはバグ発見、実装の正確性、回帰の回避、指示遵守を個別にテストすべきだ。あるモデルはより多くの欠陥を見つける一方、別のモデルはより安全な修正を書くかもしれない。

ナレッジワークにも同様の分解が必要だ。モデルは正確に要約できても、引用が不十分なことがある。正しい文書を取得できても、異なる日付の主張を混ぜ合わせる可能性がある。流暢な分析を生成しても、矛盾する証拠を見落とすことがある。

検索可能なナレッジベースは出典のコンテキスト保持に役立つが、検証の必要性をなくすものではない。モデルの出力は、元の資料まで追跡可能であるべきだ。

したがって、最も安全な解釈は条件付きとなる。DeepSeek V4 Pro 0813は、コーディングエージェント向けとして有望に見える。そのより広範な信頼性、セキュリティプロファイル、プロバイダー間の一貫性は、依然として未解決の問題である。

DeepSeek V4 Proとフロンティア市場の比較

DeepSeekの最も明確な利点は戦略的な柔軟性であり、一方で独自モデルの競合各社には、一貫したフロンティア性能を示すより強い証拠がある。

Anthropicは、コーディングと長時間稼働するエージェントタスクを軸にClaudeの評価を築いてきた。OpenAIは自社モデルをコーディングツールや構造化応答APIと密接に結び付けている。GoogleはGeminiモデルを幅広いクラウドおよび開発者向けプラットフォームと組み合わせている。

Moonshot AIとZhipu AIは、中国で急速に変化するモデル市場からも圧力を加えている。両社のシステムは、推論、コーディング、コンテキスト長、エージェント挙動で競合している。このため、DeepSeekの挑戦は単なる米中比較より広範なものとなる。

DeepSeekのオープンウェイト配布は、技術チームにとっての意思決定を変える。組織はモデルを研究し、デプロイ基盤を適応させ、データ移動に対するより大きな制御を維持できる。クローズドモデルは一般に、ウェイトや学習に対する可視性が低い。

この柔軟性には運用作業が伴う。総パラメータ数1.6兆のモデルをホストするには、各トークンでアクティブになるのが490億パラメータにとどまるとしても、相当なインフラが必要となる。効率的な提供は、エキスパートルーティング、メモリ管理、最適化されたカーネルに依存する。

クラウドAPIは、その負担の多くを取り除く。しかし同時に、プロバイダー依存とバージョンの不確実性を再び持ち込む。チームはワークロードごとに、制御性と利便性のどちらをより重視するか決めなければならない。

Anthropic、OpenAI、Googleは、モデルを中心に製品スタック全体を最適化することもできる。各社のコーディングエージェントは、独自ツール、非公開プロンプト、統合されたフィードバックシステムの恩恵を受ける可能性がある。基盤モデルの比較だけでは、製品レベルのあらゆる優位性を捉えられない。

DeepSeekの機会は移植性にある。開発者は一般的なインターフェースを通じてモデルを統合したり、管理された環境内でオープンウェイトを提供したりできる。これにより、エージェント開発者はプロンプト、ツール、ポリシーを調整する余地をより多く得られる。

4月のローンチは、より広い文脈を確立した。DeepSeekはOpenAIが別のフロンティア更新を発表した直後にV4をリリースし、中国と米国の開発者間の比較を激化させた。4月のリリース報道は、V4をR1が始めた競争の重要な継続と説明した。

R1の2025年の登場は、DeepSeekが強力な推論能力の主張を異なるコストと配布のストーリーと組み合わせたことで、期待を変えた。V4はこの挑戦を、汎用知能、長いコンテキスト、エージェント運用へと拡張する。

8月の更新は、競争をさらにソフトウェア作業へと絞り込む。DeepSeekは市場に影響を与えるため、すべてのベンチマークで首位に立つ必要はない。開発者が代替候補として真剣にテストするのに十分な性能を示せばよい。

その基準は、全面的な首位より低い。モデルは、大半のタスクで十分な性能を発揮し、いくつかの価値ある領域で卓越することで採用を勝ち取れる。デプロイの制御性は、総合スコアのわずかな差を補える場合がある。

逆に、高いベンチマーク結果が移行を保証するわけではない。チームは既存プロバイダーを中心に、プロンプト、監視システム、評価データを蓄積している。APIが互換に見えても、モデルの切り替えにはテストと保守のコストが発生する。

したがって主な競争は、ベンチマーク上の期待と運用上の現実との間にある。DeepSeekの数値は、同社を評価対象に加える根拠になる。顧客が安定した挙動、成熟したツール、大規模な独立検証を重視する場面では、競合各社が優位を保つ。

混在した結果は、性急に勝者を決めるのではなく、より良い比較を促すべきだ。各モデルは同じリポジトリ、ツール権限、再試行ポリシー、受け入れテストに直面すべきである。評価者はレイテンシ、トークン使用量、失敗の深刻度も記録すべきだ。

公正な試験には、タスクごとに複数回の実行を含めるべきである。エージェントシステムは生成が確率的であり、ツール出力も変化するため、試行ごとに結果が異なりうる。1回の成功デモは能力を示すが、繰り返しの成功は信頼性を示す。

購入者にとって、実務上の選択があらゆる用途で単一モデルになることはほとんどない。チームは定型的な分析をより高速なモデルに振り分け、難しい実装作業にはより強力なモデルを割り当てられる。影響の大きいアクションには人間の承認を求めることもできる。

DeepSeek V4 Proは、そのマルチモデルの未来に適している。エージェントのスコアは、要求の厳しい作業の候補であることを示す。その不均一な評価履歴は、自動的なデフォルトとして扱うべきではないことを示している。

DeepSeekのベンチマーク論争を決着させる3つのシグナル

次の結論は、別のローンチチャートではなく、再現可能な証拠、安定した本番挙動、実際の採用から導かれるべきだ。

最初のシグナルは、正確な0813ビルドに対する独立評価である。CAISIの取り組みは重要なベースラインを提供するが、対象は4月モデルである。評価者には現在、バージョンを固定したDeepSeek-V4-Pro-0813のテストが必要だ。

そのテストには、Terminal-Bench、ホールドアウトされたソフトウェアエンジニアリング、長文コンテキスト検索、敵対的安全性タスクを含めるべきである。ライセンスが許す範囲で、プロンプト、推論設定、ツール定義、再試行ポリシーを公開すべきだ。

独立スコアがDeepSeekの報告値に近づけば、同社のフロンティアコーディングに関する主張は大幅に強まる。大きな差があれば、ローンチ構成がモデルに有利だったという見方を補強するだろう。

2つ目のシグナルは、DeepSeekのアプリ、Webサービス、APIにおけるバージョン安定性である。開発者は、名前付きエンドポイントが一貫して同じビルドを提供するかを知る必要がある。ルーティングや推論設定が変わる際の通知も必要だ。

安定したバージョン識別子があれば、チームはインシデントを再現し、時間の経過に伴う結果を比較できる。これがなければ、挙動の改善や劣化をプロバイダー側の変更と切り分けるのは難しい場合がある。

一貫した本番挙動は、一部のベンチマークスコアが競合より低くてもDeepSeekの主張を強める。説明のない変動が頻発すれば、とりわけ自律ワークフローではその主張を弱めることになる。

3つ目のシグナルは、実際のリポジトリと企業パイロットにおける持続的な利用である。採用だけでモデル品質を証明することはできないが、繰り返しの利用は失敗パターンに関する証拠を生む。公開のポストモーテムや管理されたケーススタディは、特に有用となるだろう。

開発者は、V4 Proが回帰なしに複数ファイルの変更を完了できるかを注視すべきだ。また、リポジトリの慣例に従うか、ツールを正しく使うか、十分な情報がない状況を認識するかも測定すべきである。

企業の購入者は、タスク完了だけでなくレビュー時間も検討すべきだ。より多くの出力を生成しても、広範な確認を必要とするエージェントは、労力を削減しない可能性がある。最良のモデルは、多くの場合、高コストなミスをより少なくするモデルだ。

ナレッジワーカーも同じ基準を適用すべきである。最新の文書、相反する情報源、正確な引用を要する依頼でモデルをテストする。レビュー担当者が主張を証拠まで追跡できる頻度を測定する。

現時点では、google newsの物語はここで終えるべきだ。DeepSeekは、信頼できる強みを備えた重要なモデル更新を発表した。利用可能な証拠は依然として、決定的な順位付けではなく条件付きの判断を支持している。

このリリースは、信頼できるオープンウェイトの選択肢を拡大するため、Anthropic、OpenAI、Google、その他の開発者に圧力をかける。同時に、更新内容を文書化し、独立した再現を支援するようDeepSeekにも圧力をかける。

読者は、二つの安易な結論を避けるべきです。結果がまちまちだからといって、モデルが失敗したことにはなりません。ローンチ時のスコアが高いからといって、すでにすべての代替手段を上回っているわけでもありません。

自分にとって重要なワークロードを、そのまま実行してください。モデルのバージョン、プロバイダー、プロンプト、ツール、受け入れ基準は固定します。ばらつきが見えるよう、各タスクを十分な回数繰り返してください。

そのうえで、修正や人によるレビューも含め、最終的な成果全体を比較します。このプロセスによって、google news benchmarkの見出しを、実際に活用できる証拠へと変えられます。そうした結果が出るまでは、DeepSeek V4 Proは有力候補の一つであって、自動的に最上位に置くべき存在ではありません。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page