top of page

Gemini 3 Deep ThinkがHumanity's Last Examで48.4%を達成し、Codeforces Elo 3455を記録

更新日:6月17日

Gemini 3 Deep Think Achieves 48.4% on Humanity's Last Exam and 3455 Codeforces Elo

Googleは2026年2月12日にGemini 3 Deep Thinkをリリースしましたこれは、大規模言語モデルが複雑な推論を処理する方法における具体的な変化を示しています。このアップデートは、標準的なチャットボット機能を越えて、物理学、数学、ソフトウェアエンジニアリングにおける検証済みの問題解決を対象としています。

このリリースで最も重要なデータポイントは、「Humanity's Last Exam」におけるモデルのパフォーマンスです。Gemini 3 Deep Thinkは48.4%のスコアを記録しましたツールアシスタンスなしで。参考までに、OpenAIのDeep Researchツール(o3モデルベース)は約1年前に26.6%、DeepSeek R1は9.4%でした。このパフォーマンスの差は、「Deep Think」アーキテクチャが単純なパターンマッチングよりも連鎖的思考推論を優先することに成功したことを示唆しています。

この記事では、技術仕様、直接的なユーザーアクセス方法、およびGPT-5.2 Proのような現在の市場の代替品と比較したGemini 3 Deep Thinkの比較パフォーマンスデータを分析します。

Google AI UltraでGemini 3 Deep Thinkを有効にする方法

How to Enable Gemini 3 Deep Think in Google AI Ultra

Google AI Ultraサブスクリプションをお持ちのユーザーは、新しい推論機能にアクセスするために、特定のUIワークフローをナビゲートする必要があります。Googleは、ディープ推論モデルに関連する高い推論コストとレイテンシのため、「Deep Think」をデフォルト設定にはしていません。

モデルをアクティブ化するには:

  1. 標準のGeminiインターフェイスを開きます(gemini.google.com またはアプリ)。

  2. モデル選択メニュー(「+」またはモデルバージョンのドロップダウンで示されることが多い)に移動します。

  3. Thinking」モデルオプションを選択します。

  4. Deep Think」というラベルのセカンダリトグルを探してオンにします。

Redditからの初期ユーザーの報告によると、このインターフェースに関して混乱が見られます。「Thinking」モードはカテゴリであり、「Deep Think」は特定の高計算機能です。ベンチマークされたパフォーマンスを探しているユーザーは、セカンダリトグルがアクティブであることを確認する必要があります。それがなければ、システムは48.4%のベンチマーク主張に一致しない、より軽量な推論モデルにデフォルト設定されます。

開発者とエンタープライズリサーチャーは、モデルに異なる方法でアクセスします。直接のトグルではなく、アクセスは現在、Gemini APIの「Express Interest」フォームを通じてゲートされており、Googleが高ボリュームの商用利用のために計算リソースの割り当てを慎重に管理していることを示唆しています。

ベンチマーク分析:Humanity’s Last Exam および ARC-AGI-2

Benchmark Analysis: Humanity’s Last Exam and ARC-AGI-2

の技術的信頼性Gemini 3 Deep Thinkは、以前の世代のAIでは解けないように設計されたテストでのスコアにかかっています。

Humanity's Last Exam パフォーマンス

「Humanity's Last Exam」は、通常、解決するために深い専門知識を必要とする高度な学術的問題で構成されています。このテストは、「ベンチマックス」—標準化されたテストを専門に解くためにモデルを最適化する行為—を防ぐように設計されました。

  • Gemini 3 Deep Think: 48.4%

  • OpenAI Deep Research (o3): 26.6%

  • DeepSeek R1: 9.4%

48.4%というスコアは、外部ツールを使用せずに達成されたという点で注目に値します。モデルは内部的な推論チェーンのみに依存していました。AIコミュニティの批評家は、このようなニッチなデータセットでこれほど高いスコアを達成したことは、ある程度のトレーニングデータ汚染(記憶)を示唆する可能性があると主張していますが、他の指標における広範なパフォーマンスは、真の汎化能力を示唆しています。

科学およびコーディング指標

Googleは、内部バイアスの主張に対抗するため、第三者機関を通じてモデルを検証しました。

  • ARC-AGI-2: モデルは84.6%のスコアを達成し、ARC Prize Foundationによって検証されました。このテストは、記憶された知識を思い出すのではなく、その場で新しい論理規則を学習する能力を測定します。

  • Codeforces:Eloレーティングは3455で、競技プログラミングのトップティアに位置しています。

  • 国際オリンピック:このモデルは、2025年の国際数学オリンピック、物理オリンピック、化学オリンピックで金メダル基準を達成しました。

Gemini 3 Deep Think の実世界での応用

Real-World Applications for Gemini 3 Deep Think

高いベンチマークスコアは、必ずしもユーザビリティに直結するわけではありません。しかし、Google が提供し、大学パートナーによって検証された初期のケーススタディでは、学術ワークフローにおける特定の有用性が示されています。

ラトガース大学における物理学研究の修正

ラトガース大学との共同研究でGemini 3 Deep Think は、高エネルギー物理学に関するプレプリント論文を分析しました。この論文は初期の人間のレビューを通過していました。モデルは、人間のレビュー担当者が見逃していた数学的証明における論理的な矛盾を特定しました。これは、ユースケースを「テキスト生成」から「論理監査」へと移行させるもので、以前はシニア博士課程候補者にのみ reserved されていた機能です。

デューク大学における材料科学工学

デューク大学の研究者は、このモデルを使用して製造上の問題を解決しました。課題は、以前のレシピでは構造的完全性を維持できなかった >100 μm の厚さを目標とする特定のフィルムを成長させることでした。モデルは、所望の厚さを達成する新しい化学合成レシピを提案しました。

これらの例は、Gemini 3 Deep Think と remio GPT-5.2 Pro を区別します。GPT-5.2 は強力な汎用モデルであり続けていますが、Gemini のチューニングは、単一のエラーが結果全体を無効にするような、広く分岐する可能性に焦点を当てています。

ユーザーエクスペリエンスと市場比較

Gemini 3 Deep Think のテクノロジーに精通した一般層からの評価は賛否両論で、カジュアルユーザーと技術専門家の間には隔たりがあることが明らかになりました。

OpenAI および DeepSeek との比較

OpenAI のエコシステムに慣れているユーザーは、Gemini の以前の Pro バージョンから Deep Think への移行が、GPT-5.2 への最近のアップグレードよりも大きいと感じています。

  • GPT-5.2 Pro: ユーザーは、GPT-4 に対するわずかな改善であり、速度と会話の流暢さに焦点を当てていると説明しています。

  • Gemini 3 Deep Think:専門的なツールとして見られている。より遅く、より慎重である。

Redditユーザーは、一般的なクエリについては速度の点でClaudeやChatGPTを好むと指摘した。しかし、「調査や数学的証明」については、Geminiが好ましいエンジンになった。この二極化は、市場が「すべてを支配する一つのモデル」から、特定の認知タスクのための専門的なエンジンへと移行していることを示唆している。

コーディングとエージェントにおける弱点

高いCodeforces Eloにもかかわらず、実際のコーディング経験は様々である。ユーザーは、モデルがアルゴリズムパズル(LeetCodeスタイル)を解くことはできるが、Claude 3.7や最新のGPTイテレーションと比較して、大規模なソフトウェアエンジニアリングタスクには苦労すると報告している。「エージェント」機能、つまりモデルが自律的に複数ステップのタスクを実行する機能も、Anthropicの製品よりも信頼性が低いと報告されている。

「ロボトミー」の懸念

ユーザーフィードバックで繰り返しテーマとなっているのは、安全性の整合性がパフォーマンスを低下させることへの懸念である。コメントでは、モデルの「メンタルヘルス」に関する懸念が説明されており、積極的な人間のフィードバックからの強化学習(RLHF)が、モデルに複雑なクエリを拒否させたり、過度に無害化された回答を提供させたりしている。Gemini 3 Deep Thinkは現在、推論モードで制限されていないが、ユーザーは将来のアップデートで安全プロトコルに合わせるために、その創造的な問題解決能力が抑制されるのではないかと警戒している。

Gemini 3 Deep Thinkの価格設定とアクセス性

Gemini 3 Deep Think Pricing and Accessibility

Googleは、このモデルを既存のGoogle AI Ultraサブスクリプションこの積極的な価格戦略は、高推論モデルに対して従量課金制を採用しているエンタープライズ競合他社を切り崩そうとするものです。

開発者にとって、APIの利用可能性は依然として限定的です。「Express Interest」というゲートは、Googleがこれらのモデルが要求する大規模な推論コンピューティングをサポートするために必要なハードウェアインフラストラクチャをまだスケーリングしていることを示唆しています。一般的なAPIの利用可能性が開かれるまで、Gemini 3 Deep Thinkは主に個々のパワーユーザーおよび一部の学術パートナー向けのツールであり続けます。

Gemini 3 Deep Thinkのリリースは、推論重視のAIの新しい基準を確立します。「Humanity's Last Exam」のような検証済み試験におけるツール非依存のパフォーマンスに焦点を当てることで、Googleは目標をチャット機能から自律的な研究検証へとシフトしました。業界の焦点は、OpenAIがそのo3重視モデルの広く利用可能なバージョンでどれだけ早く対応するかへと移っています。

よくある質問

Q: Gemini 3 Deep Thinkモードをオンにするにはどうすればよいですか?

A: Geminiのウェブまたはモバイルインターフェースで、ドロップダウンメニューから「Thinking」モデルを選択します。選択したら、表示される特定の「Deep Think」スイッチをオンにします。この機能は現在、Google AI Ultraサブスクライバーに限定されています。

Q: Gemini 3 Deep ThinkはOpenAI o3よりも優れていますか?

A: 「Humanity's Last Exam」ベンチマークでは、Gemini 3 Deep Thinkは48.4%を記録したのに対し、o3ベースのDeep Researchツールは26.6%でした。これは、外部ツールなしで複雑で新しい学術的な問題を処理する上での優れたパフォーマンスを示しています。

Q: Gemini 3 Deep Thinkはコードを書くことができますか?

A: はい、このモデルはCodeforces Eloレーティングが3455であり、アルゴリズム問題に非常に高い能力を持っています。しかし、一部のユーザーは、大規模で複数のファイルを扱うソフトウェアエンジニアリングプロジェクトの管理においては、ClaudeやGPT-5.2よりも効果が低いと報告しています。

Q: Gemini ProとDeep Thinkの違いは何ですか?

A: Gemini Proは速度と一般的なタスクに最適化されているのに対し、Deep Thinkは回答前に一時停止して「考える」ように設計された推論モデルです。Deep Thinkは著しく遅いですが、数学、科学、論理パズルに適しています。

Q: Gemini 3 Deep Thinkは無料で使えますか?

A: いいえ、Deep Thinkモデルへのアクセスには有料のGoogle AI Ultraサブスクリプションが必要です。APIアクセスを希望する開発者や研究者は、現在、関心フォームを通じて申請する必要があります。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page