top of page

高度なAIエージェントを搭載して登場したDeepSeek V4 Pro、その主張には現実との乖離も

DeepSeekは8月13日、V4 Proの一般提供版を公開し、4カ月間のプレビューをAIエージェントに焦点を当てた本番向けモデルへと移行させた。この展開はすぐにGoogle Newsでも取り上げられたが、その主要な主張には文脈が必要だ。DeepSeekはコーディング、ツール利用、長時間にわたるワークフローで大幅な向上を報告している。一方、プレビュー版を対象にした独立評価では、それほど決定的な優位性は確認されなかった。

新モデルはDeepSeekのアプリ、Webインターフェース、APIを通じて利用できる。開発者はオープンウェイトをダウンロードし、自らが管理するインフラに展開することも可能だ。この組み合わせは、特に広範な作業履歴を処理するエージェントを必要とするチームにとって、Anthropic、Google、OpenAIのクローズドサービスに圧力をかける。

ただし、ベンチマークでの高い結果が、信頼できるエージェントを保証するわけではない。エージェントは、多数のステップにわたりツールを選択し、失敗を解釈し、状態を保持し、誤りから回復しなければならない。DeepSeek V4 Proには、こうしたワークフローを支える能力がある。それを一貫して実行できるかどうかが、依然として中心的な問いである。

DeepSeek V4 ProのGoogle News見出しが伝えていないこと

8月のリリースが重要なのは、DeepSeekがV4 Proを野心的なプレビューから、本番のエージェントワークロード向けとして明示的に提示されたモデルへ移行させたためだ。

DeepSeekは4月24日にV4プレビューを初公開した。これにはV4 Proと、より小型のV4 Flashモデルが含まれていた。両モデルは100万トークンのコンテキストウィンドウをサポートしており、各リクエストに最大100万個のエンコードされたテキスト断片を含めることができる。

8月13日のGAリリースは、まったく別のモデルファミリーを導入したものではない。代わりにDeepSeekはプレビュー期間後にV4 Proを更新し、本番性能を強調した。同社はコンシューマー向けインターフェースの「Expert Mode」を通じて提供し、同じAPIモデル名を維持した。

DeepSeekはまた、OpenAIのResponses API形式へのネイティブ対応を追加した。このインターフェースは、アプリケーションによるツール呼び出し、中間出力、複数ステップのやり取りの管理を支援する。Anthropic API形式のサポートは、すでにより広範なV4展開の一部となっていた。

こうした互換レイヤーは移行作業を減らす。開発者は、すべてのメッセージやツール定義を書き直すことなく、エンドポイントとモデル設定を変更できる。これは競合APIを同一のものにするわけではないが、既存のエージェントシステム内でDeepSeekを試す際の初期障壁を下げる。

同社は選択可能な推論強度も導入した。低い強度は単純なリクエストを対象とし、高い設定では難しいエージェントタスクにより多くの計算を割り当てる。この選択は、エージェントがしばしば不均一なワークロードに直面するため重要だ。ファイルの読み取りとリポジトリ全体に及ぶ変更の計画には、同じ推論予算は必要ない。

V4 Proは依然として、非常に大規模なMixture-of-Expertsモデルである。Mixture-of-Expertsアーキテクチャは、各トークンに対してネットワークの一部だけを活性化する。DeepSeekのモデルカードには、総パラメータ数1兆6000億、推論時に活性化されるパラメータ数490億と記載されている。

DeepSeekによれば、このモデルは32兆トークン超で訓練された。ポストトレーニングのプロセスでは、能力を統合する前に、領域ごとの専門家を個別に育成したという。同社は、この設計が単一モデル内の知識、推論、コーディング、エージェント挙動を強化するとしている。

こうした数値は、このリリースが単なる定例アップデート以上の評価に値する理由を示している。DeepSeekは、オープンウェイト、大きなコンテキストウィンドウ、エージェント重視のポストトレーニングを、展開可能な一つのパッケージに組み合わせている。クローズドモデルのベンダーは通常、ダウンロード可能なウェイトを提供せず、管理サービスとしてモデルを提供する。

ただし、「高度なAIエージェント」に関するGoogle Newsの見出しは、DeepSeekが完全な自律製品をリリースしたかのような印象を与えかねない。実際にはそうではない。V4 Proは主に、エージェントシステム内の推論モデルである。

周辺のエージェントには、ツール、権限、メモリー、実行を管理するソフトウェアであるハーネスがなお必要だ。アクセス制御と検証ルールも必要になる。モデルはコマンドを提案できるが、そのコマンドを実行するかどうかを決めるのはハーネスだ。

この違いは、今回の展開を評価するうえで中心的である。DeepSeekはより強力なエンジンと、より容易な統合経路を提供した。しかし、そのエンジンを中心に安全で信頼性の高いエージェントを構築するために必要なエンジニアリングをなくしたわけではない。

100万トークンのコンテキストがエージェントの構図を変える

DeepSeekにとって最も重要な優位性はチャットボット機能ではなく、長時間かつツールを多用する実行トレース向けに設計されたメモリー機構にある。

長時間稼働するエージェントは、情報を急速に蓄積する。コーディングエージェントは数百のファイルを調査し、テストを実行し、エラーログを読み、複数の計画を修正することがある。エージェントが情報を捨てるか要約しない限り、すべての結果が作業コンテキストの一部になる。

従来のアテンション機構では、これはコスト高になりやすい。モデルは別のトークンを生成するたび、拡大し続ける記録を繰り返し処理する。また、システムが以前のトークンのキー・バリューキャッシュ、一般にKVキャッシュと呼ばれるデータを保持するため、メモリー使用量も増える。

DeepSeekは、この問題に二つの補完的なアテンション機構で対処している。Compressed Sparse Attentionは、現在のクエリに最も関連するブロックを選択する前に、トークン群を圧縮する。Heavily Compressed Attentionは、すべてのクエリが参照できる、はるかに小さな表現を生成する。

同社は、V4 Proが100万トークン境界で、V3.2の単一トークン推論計算量の27%を使用すると報告している。また、従来モデルのKVキャッシュの10%を使用するとしている。これらはDeepSeekによるアーキテクチャ上の主張であり、あらゆる提供環境で普遍的に得られる結果ではない。

技術的なアーキテクチャ分析は、こうした削減がエージェントにとって重要な理由を説明している。ツールの結果を、アクセラレータメモリーを急速に埋めることなく、より長く利用可能な状態に保てる。その結果、長時間にわたるタスク中にエージェントが行う損失の大きい要約を減らせる。

能力だけでは理解力を証明できない。モデルは100万トークンを受け入れられても、途中にある重要な指示を見落とす可能性がある。長大なコンテキストのテストでは、検索、離れた証拠をまたぐ推論、無関係な詳細への耐性を測定しなければならない。

それでも、効率的なコンテキストは開発者が試みられることを変える。リサーチエージェントは、ソースの抜粋、棄却した仮説、これまでの検索経路を保持できる。コーディングエージェントは、インターフェース定義をテスト失敗や以前のパッチと並べて維持できる。

これはクローズドモデルに具体的な競争上の課題をもたらす。Anthropic、Google、OpenAIは、成熟したエージェントエコシステムと管理インフラを提供している。DeepSeekは、組織がホスト、検査、量子化し、自らのセキュリティ境界の内側に配置できるオープンウェイトモデルを提供する。

エージェントがプライベートリポジトリや社内文書にアクセスする場合、制御は重要になる。ローカル展開により、プロンプトとツール結果を組織のインフラ内にとどめることができる。また、カスタムの監視や保持ポリシーもサポートできる。

オープンウェイトであっても、展開が容易になるわけではない。V4 Proの総サイズは、大きなストレージとハードウェア要件を課す。トークンごとに活性化されるのが490億パラメータだけであっても、完全なチェックポイントは配布・提供しなければならない。

ホストによって実用的なコンテキスト上限も異なる場合がある。ハードウェア容量、量子化、提供ソフトウェアにより、実際のウィンドウは縮小しうる。モデルが公表する最大値を、すべてのプロバイダーで保証される上限と見なすべきではない。

したがって実際の仕組みは、複数の要素の組み合わせである。DeepSeekは長い履歴をより効率的に圧縮し、巨大なモデルの限られた部分を活性化し、アプリケーションに推論強度の調整を可能にする。これらの選択は合わせて、継続的なエージェント作業の経済性を狙っている。

この狙いは、別の対話ベンチマークより重要である。エージェントは、一つの結果を出す前に、多数の中間トークンと繰り返しのモデル呼び出しを生成する。小さな効率改善でも、ワークフロー全体では積み重なりうる。

開発者にとって、テストは孤立したプロンプトではなく、完全なタスクを含むべきだ。モデルにリポジトリ、失敗している課題、そして権限を限定したツールを与える。そのうえで、完了率、回帰率、ツールエラー、経過時間、必要な人間による修正を測定する。

この種の評価は、長いコンテキストが有用な連続性を提供するかどうかを明らかにする。また、実行トレースが長くなるにつれてモデルが混乱するかどうかも示す。宣伝されたウィンドウは可能性を示し、ワークフローが価値を決める。

DeepSeek AIエージェントがクローズドモデルに圧力をかける

DeepSeekはエージェント市場に対し、モデル能力とマネージドプラットフォームの利便性・ガバナンスを分けて考えるよう迫っている。

主な競争は、コーディングエージェントや職場向けエージェントで使われるDeepSeek V4 Proと、クローズドなフロンティアモデルの間で繰り広げられている。AnthropicのClaudeファミリー、GoogleのGeminiモデル、OpenAIのGPTモデルは、依然として重要な比較対象だ。これらには、プロバイダーが運用する安全システムと、確立されたアプリケーションエコシステムも備わっている。

DeepSeekの4月の発表は、V4 Proがエージェント型作業において主要なクローズドモデルに近づいたと主張した。エージェント能力とは、計画、ツール利用、観察、修正を通じて複数ステップのタスクを完了する能力を意味する。難しい一つの質問に正しく答えることとは異なる。

同社は、コーディングエージェントのベンチマークでV4 ProをClaudeモデルと比較した。また、推論・知識テストではGoogleとOpenAIのシステムとも比較した。これらの比較はDeepSeekの評価設定によるものだった。

独立報道は、初期結果をより慎重に扱った。4月のローンチ報道は、OmdiaのアナリストであるLian Jye SuがV4を米国の競合と競争可能だと評したと伝えた。同じ報道は、エージェント比較をDeepSeekの主張として明確に帰属させている。

この帰属が重要なのは、エージェントのベンチマークがスキャフォールディングに敏感だからだ。システムプロンプト、利用可能なツール、リトライ方針、推論予算によってスコアは変わりうる。あるハーネスで好成績を収めるモデルが、別のハーネスでは苦戦することもある。

8月の更新は、本番環境での改善に焦点を当てることで、この競争を鮮明にした。DeepSeekは単に抽象的な推論の向上を主張したのではない。モデルがツールを操作し、状態を維持し、より長いタスクを完了しなければならないワークフローを強調した。

互換性も、別の圧力源となる。使い慣れたリクエスト形式を受け付けるAPIは、開発者に並行評価を行う実用的な手段を与える。チームは、最初からアプリケーション全体を再設計することなく、選択したタスクをV4 Proに振り分けられる。

オープンウェイトは第二の道筋を生む。組織は自らのベンダーやインフラを通じてモデルをホストできる。この選択肢は単一のモデルプロバイダーへの依存を減らせるが、運用上の責任は展開するチームに移る。

クローズドモデルの道にも大きな強みは残る。プロバイダーは安全対策を中央で更新し、最適化された推論システムを運用し、統合監視を提供できる。顧客は1兆パラメータ規模のチェックポイントを管理したり、分散提供を調整したりする必要がない。

クローズドサービスは、ユーザーに新しいリリースをダウンロードさせることなく、基盤モデルを更新することもできる。これにより保守は簡素化されるが、挙動の変化を予測しにくくなる可能性がある。オープンな展開はバージョン管理を可能にする一方、各運用者がアップグレードを管理しなければならない。

選択は単純なオープン対クローズドではない。制御と運用委任の間の選択である。DeepSeekは、V4 Proが企業が真剣に評価できる能力帯に達したことで、制御を重視する側の選択肢をより現実的なものにしている。

NISTのCenter for AI Standards and Innovation(CAISI)は、4月のプレビュー版をサイバーセキュリティ、ソフトウェアエンジニアリング、科学、推論、数学の領域でテストした。同センターの独立評価では、V4 Proを同センターが評価した中国モデルの中で最も強力なモデルと位置づけた。

CAISIはまた、DeepSeekが報告した比較結果と独自の評価結果の間に、実質的な隔たりがあることも明らかにした。総合分析では、このプレビュー版は最先端の米国モデルよりおよそ8か月遅れているとされた。一方、DeepSeekのデータは、より新しいフロンティアシステムに近い性能を示唆していた。

詳細な結果は、一様に低調だったわけではなく、強弱が混在していた。V4 Proは、実際のソフトウェア問題に基づくベンチマークであるSWE-bench Verifiedで74%を記録した。GPQA Diamondでは90%、高度な数学評価では97%に達した。

非公開のホールドアウト課題では、より厳しい結果となった。V4 ProはCAISIの非公開ソフトウェアベンチマーク、PortBenchで44%を記録した。抽象的推論を評価する半非公開のARC-AGI-2では46%だった。

これらの結果が示すのは4月のプレビュー版であり、必ずしも8月のGAアップデートではない。DeepSeekは、新リリースによって、とりわけ本番環境でのエージェント性能が向上したとしている。今回の更新が従来の評価像をどの程度変えたかは、今後の独立テストで判断される必要がある。

その答えが出る前から、競合他社への圧力は現実のものとなっている。DeepSeekは購買判断に影響を与えるために、すべてのベンチマークで勝つ必要はない。チームが許容できない失敗率を招かず、適切なワークロードを同社モデルに振り分けられるだけの能力があればよい。

この構図は、勝者総取りのモデル競争というよりクラウド調達に近い。企業は、機密性の高いローカルタスクにはあるモデルを、複雑な計画には別のモデルを、定型的な抽出作業にはより小規模なモデルを使うかもしれない。エージェントプラットフォームは、こうした振り分けをますます可能にしている。

DeepSeek V4 Proは、このような混合スタックを支持する根拠を強める。オープンウェイトとAPI互換性により、代替は容易になる。その規模と長いコンテキストは、従来は小規模なオープンモデルでは十分に扱えなかったタスクにも適している。

その結果、プレミアムなクローズドモデルをデフォルトとする考え方への直接的な挑戦が生まれている。購入者には、試す価値のある新たな選択肢が加わった。クローズドモデルの提供者は、信頼性、安全性、統合品質、測定可能なタスク完了能力によって自らの立場を正当化しなければならない。

ベンチマークは依然として本番環境での信頼性を証明しない

最大の不確実性は、DeepSeekのより高いエージェントスコアが、未知のタスク、厳しい権限制約、敵対的な入力に対しても維持されるかどうかだ。

エージェントベンチマークは、多くの設計上の選択を単一の数値に圧縮する。その数値は、再試行、ツール設定、プロンプトエンジニアリング、タスク選定を覆い隠す可能性がある。また、途中で生じるリスクを測定せずに、タスクを完了したことだけを評価する場合もある。

本番環境のエージェントは、より混沌とした条件に直面する。ドキュメントが古くなっていたり、ツールがタイムアウトしたり、ユーザーが矛盾する指示を出したりすることがある。エージェントは、あらゆる曖昧さを行動に変換するのではなく、不確実性を検出しなければならない。

8月のリリースは、広範な独立再現試験を行うにはまだ新しすぎる。DeepSeekの発表によれば、V4 Proは本番向けエージェントワークロードで大幅に性能を伸ばしたという。しかし、その向上が外部のハーネス間でどのように移転するかを示すには、公開情報が十分ではない。

CAISIの先行評価は有用な警告を与えている。DeepSeekは自己報告のテストでは良好な成績を示した一方、複数のホールドアウト評価ではそれを下回った。これは同社のベンチマークを無効にするものではないが、その結果をどこまで一般化できるかには限界がある。

エージェント性能には、タスク精度以上の要素も含まれる。モデルはコーディング上の問題を解決しても、無関係な変更を加える可能性がある。不必要な外部サービスを呼び出したり、ツールリクエスト内で機密コンテンツを露出させたりすることもある。

オープンウェイトでは、セキュリティが特に重要になる。組織はV4 Proをローカルで実行し、独自の制御を適用できる。しかし、悪意ある運用者もまた、安全策を取り除いたり、改変版を配布したりできる。

FAR.AIは、複数のジェイルブレイク手法に対してV4 Proプレビュー版をテストした。ジェイルブレイクとは、モデルの安全ルールを回避するよう設計されたプロンプトである。同社のセキュリティストレステストでは、古い公開攻撃が修正なしでV4 Proに適用できることが判明した。

研究者らは、その公開攻撃がテスト対象の領域全体で完全に成功したと報告している。ほかの2手法は99.6%に達した。一部の攻撃には、通常のユーザープロンプトを超えるアクセス、すなわちシステムメッセージや応答プレフィックスの制御が必要だった。

これらの知見は、すべての導入環境が同じように失敗することを示すものではない。安全なハーネスは、入力をフィルタリングし、ツールを隔離し、権限を制限し、出力を検査できる。基盤モデルが悪意あるプロンプトへの耐性をあまり示せなくても、外部の安全策は有効であり続ける可能性がある。

ただし、モデルレベルの安全性を前提にしてはならない理由を示している。オープンなチェックポイントは、リリース後に回収できない。運用者は、レイヤー型セキュリティ設計における一部のコンポーネントとしてモデルを扱う必要がある。

エージェントシステムはプロンプトインジェクションのリスクも生み出す。Webページ、ドキュメント、リポジトリのコメントには、エージェントを別の方向へ誘導しようとするテキストが含まれることがある。モデルはタスクデータと指示を区別し、ハーネスは未承認の行動を阻止しなければならない。

100万トークンのコンテキストは、その攻撃面を広げる可能性がある。エージェントは、1回のセッション中により多くのドキュメント、ログ、Webコンテンツを取り込むかもしれない。コンテキストが増えれば有用な証拠も得られるが、矛盾した指示や敵対的な指示が潜む場所も増える。

そのため企業は、読み取り権限と実行権限を分離すべきだ。リポジトリを調査できるエージェントに、デプロイメント認証情報まで自動的に付与すべきではない。リサーチエージェントも、明確な承認プロセスなしに調査結果を公開してはならない。

影響の大きい行動には、人によるレビューが引き続き必要だ。適切な閾値はタスクによって異なるが、原則は一貫している。エージェントは、本番システムを変更したり、メッセージを送信したり、規制対象データを扱ったりする前に、監査可能な提案を作成すべきである。

組織は自社のワークフローに基づく行動評価も必要とする。公開コーディングベンチマークでは、企業の非公開アーキテクチャにおける性能を予測できない。ローカルのテストセットには、一般的なタスク、異常な失敗、意図的に誤解を招く入力を含めるべきだ。

評価では、成功だけでなく、それ以上の項目を追跡すべきである。チームは、未承認のツール試行、繰り返し実行されたコマンド、回帰、人間による修正時間を記録する必要がある。また、モデルが不確実性を正直に報告するかも検証すべきである。

知識集約型のエージェントにも同様の制御が必要となる。大きなコンテキストウィンドウには多くの社内情報源を保持できるが、矛盾を自動的に解消するわけではない。システムは引用を保持し、取得した事実とモデル生成の推論を区別すべきである。

構造化されたknowledge blendingワークフローは、モデル出力とその根拠となった資料を比較するのに役立つ。この追跡可能性は、エージェントがより長期的な調査や計画タスクを担うようになるほど、重要性を増す。

決定的な問いは、V4 Proが印象的な軌跡を生成できるかどうかではない。現実的な制約の下で、エージェントが正しい結果に繰り返し到達できるかどうかだ。この基準を満たすには、8月の更新後に独立したエンドツーエンドテストが必要となる。

Google News公開サイクル後に注目すべき点

DeepSeek V4 Proが持続的なエージェントプラットフォームになるのか、それとも印象的なベンチマークリリースにとどまるのかは、3つのシグナルで決まる。

第1のシグナルは、8月モデルのエージェントスコアが独立して再現されるかどうかだ。評価者は、正確なチェックポイント、推論設定、ハーネス、ツール設定を特定する必要がある。テストには、学習時に見えていなかった未知のタスクを含めるべきだ。

意味のある結果は、DeepSeekが好む設定だけでなく、複数のエージェントフレームワークで改善を示すものになる。非公開ソフトウェアタスクで安定した向上が確認されれば、同社の本番利用に関する主張は強まる。公開テストとホールドアウトテストの差が大きければ、その主張は弱まる。

4月のプレビュー版との比較は特に重要である。CAISIはGAアップデート前に詳細なベースラインを確立した。比較可能な評価を繰り返せば、DeepSeekが5月に特定された8か月の総合的な能力差を埋めたかどうかが分かる。

第2のシグナルは、DeepSeek自身のインターフェース外での導入時の挙動である。開発者は、ローカルサーバー、クラウドホスト、コーディングツール、カスタムエージェントを通じてV4 Proをテストするだろう。こうした環境では、プロンプト、コンテキスト制限、ツールポリシーが異なる。

タスク完了率とともに、運用上の摩擦にも注目すべきだ。遅い推論、メモリ負荷、一貫しないツール書式は、モデル単体ベンチマークで示された優位性を消し去る可能性がある。一般的なAPI形式との安定した互換性は、導入を容易にする。

長文コンテキストでの挙動には、独自の精査が必要である。評価者は、モデルが指示を見失わずに非常に大きな入力から証拠を取得できるかをテストすべきだ。また、短いタスクだけでなく、宣伝されているコンテキスト上限付近での性能も測定すべきである。

プロバイダーによる違いも重要になる。量子化されたデプロイメントは、元のチェックポイントとは異なる挙動を示す可能性がある。サードパーティのホストはコンテキスト制限を課したり、レイテンシや出力の一貫性を変えるサービング最適化を使用したりするかもしれない。

第3のシグナルは、DeepSeekと下流の運用者が安全性に関する知見へどう対応するかだ。GAリリースは、プレビュー版で特定された移植可能なジェイルブレイクに対してテストされなければならない。研究者は、現実的なツール利用セッション内でのプロンプトインジェクションも評価すべきである。

DeepSeekは、更新されたモデル挙動、評価手法、推奨される安全策を公開できる。ホスティングプロバイダーは、権限境界と監視を追加できる。エージェント開発者は、影響の大きい行動の前に承認ゲートを強制できる。

強力な対応に、完全な安全性を主張する必要はない。既知の攻撃を調査し、導入者に具体的な緩和策を示したことが分かればよい。移植可能な失敗に関する沈黙は、企業により大きな不確実性を負わせることになる。

競合他社の反応は補足的な文脈を与える。Anthropic、Google、OpenAIは、より優れたエージェント信頼性、より長く実用的なコンテキスト、より柔軟な導入形態で対抗できる。ほかのオープンウェイト開発者は、必要なインフラが少ない小規模モデルでDeepSeekに挑戦できる。

しかし、そうした反応によって主な競争から目をそらすべきではない。DeepSeek V4 Proは、オープンウェイトモデルが持続的なエージェント作業においてクローズドシステムへ挑戦できるかを試している。答えを左右するのは、Google Newsでの報道量ではなく実行力である。

モデルを検討する開発者は、限定的な評価から始めるべきだ。客観的な結果が得られ、権限が制限され、行動を元に戻せるタスクを選ぶ。同じハーネス内で、V4 Proを現在使用しているモデルと比較する。

意思決定には失敗も含めるべきである。わずかに高い頻度で成功しても、検出しにくいエラーを生むエージェントは、より悪い選択かもしれない。完了率、修正時間、セキュリティ上の挙動を総合して検討すべきだ。

エンタープライズの購入者は、ローカルデプロイメントとホスト型DeepSeekサービスも区別すべきである。オープンウェイトなら、データを選択したインフラ内に保持できる。リモートエンドポイントの利用は、データ取り扱い、管轄、ベンダー管理に関する別の問題を生じさせる。

ナレッジワーカーがこの変化を直接的に感じることは少ないだろう。V4 Proは、より大きなノート、ドキュメント、過去のツール結果の集合を保持するアシスタントを支援できる。その能力により、調査時の繰り返しの準備を減らせる可能性がある。

それでもユーザーには情報源の可視性が必要だ。より長いコンテキストウィンドウは回答をより情報豊かなものにできる一方、エラーの追跡を難しくする可能性もある。引用、来歴、明示的な承認ステップは引き続き必要である。

したがって、このリリースはモデル競争の決着をつけるものではないが、実際の変化を示している。DeepSeekは、大規模でエージェント重視のモデルを、インターフェース、API、オープンウェイトを通じて広く利用可能にした。そのアーキテクチャは、長い実行履歴にかかるコストへ直接対応している。

独立した検証では、評価は依然として割れている。プレビュー版は複数の公開タスクで好成績を収めた一方、非公開テストではフロンティアシステムとの差がより大きく浮き彫りになった。セキュリティ研究者は、既知の攻撃に対して機能しない安全対策も発見している。

8月のアップデートは、DeepSeekにより良い実運用の結果でこうした懸念に答える機会を与える。同時に、競合他社にとっても明確な目標となる。開発者が、より限定的なデプロイ管理や、より強いプラットフォーム依存を受け入れるべき理由を示さなければならない。

ひとまずGoogle News上の大げさな主張は脇に置き、実際のワークフローを試してみよう。V4 Proはあなたのタスクを完了し、設定された境界を守り、何を変更したのか説明できるだろうか。重要なのは、ローンチ時の見出しよりも、こうした結果がはるかに長く意味を持つということだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page