top of page

Google DeepMindがGemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyberを発表、速度と専門性を分離

Google DeepMindは7月21日に3つのGeminiモデルをリリースし、汎用エージェント、大規模自動化、アクセスが制限されたサイバーセキュリティ業務の区分をより明確にしました。Google DeepMindによるGemini 3.6 Flashの発表には、主力のFlashモデル、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyberが含まれています。これらは総じて、近接したバージョン番号から想像される以上に大きな戦略転換を示しています。

Gemini 3.6 Flashは、コーディング、マルチモーダル分析、長時間にわたるエージェントワークフローを対象としています。Flash-Liteは、低レイテンシーと高スループットを必要とする反復的な作業を処理します。Flash Cyberはソフトウェアの脆弱性を探索して修復しますが、当初は公開Gemini APIでは提供されません。

この分化は、本番環境のワークロードをめぐって競争するOpenAI、Anthropic、xAIなどのモデルプロバイダーに圧力をかけます。また、開発者はあらゆるタスクを1つの高性能モデルに割り当てるべきだという前提にも疑問を投げかけます。Googleが代わりに推進しているのは、調整役のモデルが、より限定的な作業を高速または専門特化したシステムに委任するポートフォリオです。

この戦略には、未解決の緊張関係があります。Googleは、より優れたベンチマーク結果と少ないトークン消費量を示していますが、多くの数値は同社独自のテストによるものです。Cyberモデルは、幅広い提供が必ずしも目標ではない理由も示しています。悪用可能な欠陥を発見するよう訓練されたシステムは、防御側に役立つ一方で、深刻な悪用リスクを生み出す可能性があります。

Google DeepMindによるGemini 3.6 Flashの発表がFlashのラインアップを変える

Googleは、Flashを単一のモデルカテゴリーから、さまざまな種類の作業に対応する階層型システムへと転換しています。

Gemini 3.6 Flashは現在、その中心的な位置を占めています。Googleはこれを、コーディングと知識労働に特に重点を置いた、複雑なエージェント型およびマルチモーダルタスク向けのモデルと説明しています。エージェント型タスクとは、ソフトウェアが行動を計画し、ツールを呼び出し、中間結果を評価する複数ステップのプロセスです。

このモデルは、テキスト、画像、動画、音声、PDFファイルを受け付けます。モデルドキュメントには、コンテキスト上限が1,048,576トークン、最大出力が65,536トークンと記載されています。このコンテキスト容量により、開発者は大規模なリポジトリ、文書群、長期間の対話履歴を1回のリクエストで送信できます。

Gemini 3.6 Flashは、関数呼び出し、コード実行、構造化出力、検索グラウンディング、ファイル検索、URLコンテキストにも対応しています。コンピューター操作は引き続きプレビュー機能です。このモデルは、ネイティブの画像生成、音声生成、GoogleのLive APIには対応していません。

2つ目にリリースされたGemini 3.5 Flash-Liteは、異なる本番環境上の制約に対応します。これは、すべてのステップで利用可能な最強のモデルを使用することよりも、応答速度とリクエスト量が重視される作業向けに設計されています。

Googleは、エージェント型検索、文書処理、構造化抽出、自律型サブエージェントの作業を想定用途として挙げています。サブエージェントとは、より大きなワークフローの一部を完了する、委任された小規模なプロセスです。例としては、レシートの翻訳、カタログ属性の抽出、複数のデザイン案の並列評価などがあります。

3つ目のリリースは、最も厳格に管理されています。Gemini 3.5 Flash CyberはGemini 3.5 Flashをベースとし、ソフトウェアの脆弱性を発見、検証、修正できるようファインチューニングされています。Googleは、無制限のAPIアクセスを提供するのではなく、同社のマネージドセキュリティエージェントであるCodeMenderを通じて提供する予定です。

したがって、この3つのリリースは単純な能力の序列を形成するものではありません。Flash-Liteは単に性能を抑えた3.6 Flashではなく、Flash Cyberも単なる別の汎用チャットボットではありません。各モデルは、ワークフロー内のどこでAI推論を実行すべきかという問いに対する異なる答えを示しています。

この違いが、本記事の中心的な緊張関係を生み出しています。Googleは開発者に対し、一度に1つのモデルから得られる個別の応答を比較するのではなく、エージェント型タスク全体のコストと完了率を評価するよう求めています。

効率性はシステム設計の問題になりつつある

Gemini 3.6 Flashの背景にある重要な主張は、個々の応答の高速化と同じくらい、ステップ数の削減が重要になり得るということです。

AIエージェントは、各リクエストが効率的に見える場合でも、リソースを消費する可能性があります。同じファイルを繰り返し調べたり、正しいコードを修正したり、回答を改善しないままツールを呼び出したりすることがあります。こうしたループはレイテンシーを増加させ、生成されるテキスト量を増やします。

Googleによると、Gemini 3.6 FlashはArtificial Analysis Intelligence Indexにおいて、Gemini 3.5 Flashより出力トークンの消費量が17パーセント少なかったといいます。また同社によれば、複数ステップのワークフローにおける推論ステップ数とツール呼び出し回数も少なかったとのことです。

エージェントのコストは実行経路全体で累積するため、これは有意義な設計目標です。生成するトークンが少ないモデルでも、不要な呼び出しを行えばパフォーマンスが低下する可能性があります。逆に、わずかに遅い応答であっても、追加のデバッグサイクルを防げるなら、より良い結果を生み出せます。

Googleの開発者向け移行ガイドによると、3.6 Flashは意図しないファイル変更が少なく、実行ループの暴走も抑えられています。また、診断作業中の指示追従性も向上したと報告されています。こうした挙動は、不要な編集がテスト、レビュー、さらなる修正を引き起こす可能性のあるコーディングエージェントにおいて重要です。

報告によると、このモデルはコードを変更する前に診断スクリプトを実行する傾向があります。エージェントが最初に証拠を収集するため、この挙動は複雑なタスクでの判断を改善できます。Googleは、同じ習慣が単純なフロントエンド作業では探索的なステップを増やす可能性があることも認めています。

この留保には注意を払う必要があります。エージェントの効率性は単一の指標ではなく、ベンチマークですべての本番環境を捉えることはできません。即時応答を優先するチームもあれば、より長いワークフロー全体での失敗の少なさを重視するチームもあります。

Gemini 3.5 Flash-Liteは、前者の要件により直接的に取り組んでいます。Googleは、Artificial Analysisによるテストで、1秒あたり350出力トークンを生成したと報告しています。同社はこれをGemini 3.5ファミリーで最速のモデルと位置付けています。

速度だけでは、有用な本番システムは保証されません。高速なモデルでも、その出力に繰り返し検証が必要なら、かえって作業を増やす可能性があります。そのためGoogleは、コーディング、長いコンテキストからの検索、コンピューター操作のベンチマークにおいて、従来のFlash-Liteバージョンから改善した点を強調しています。

同社は、Flash-LiteのTerminal-Bench 2.1スコアが54パーセントで、Gemini 3.1 Flash-Liteの31パーセントを上回ったと報告しています。Terminal-Benchは、ターミナル環境内でタスクを完了するエージェントの能力を測定します。

GDM-MRCR v2では、新旧のFlash-Liteモデルについて、それぞれ72.2パーセントと60.1パーセントのスコアをGoogleは報告しています。この評価では、複数の隠されたターゲットを含む長いコンテキストから、モデルが関連情報を取得できるかをテストします。

これらの結果はGoogleの効率性に関する主張を裏付けていますが、依然としてワークロードに依存します。請求書から固定フィールドを抽出するチームと、エージェントに分散システムの障害診断を求めるチームでは、ニーズが異なります。したがって、適切な比較は単純にモデル同士を比べることではありません。

開発者は、ワークフロー単位で完了率、総呼び出し回数、検証作業、レイテンシーを測定する必要があります。このアプローチには、より優れた可観測性も必要です。チームは、エージェントがなぜツールを選択し、ステップを繰り返し、別のモデルに作業をエスカレーションしたのかを理解する必要があります。

Googleは万能な単一モデルではなく、モデルルーティングに賭けている

現在の主要な競争軸は、1つの汎用モデルを使うか、ルーティングされた複数の専門モデルを使うかというシステム設計上の選択です。

Google DeepMindによるGemini 3.6 Flashの発表は、この選択を明確にしています。Gemini 3.6 Flashは調整役のモデルとして機能し、Flash-Liteは大量のサブタスクを実行できます。Flash Cyberは、防御的なセキュリティ業務のための専門的な経路を追加します。

これは、管理者と専門家の構造に似ています。管理者は目的を解釈して分解し、結果を確認します。専門家は、自身の速度、チューニング、アクセス制御が優位性をもたらす、範囲の限定されたタスクを処理します。

Googleは、複数のWebデザイン案を生成する際に、3.6 FlashがFlash-Liteを調整することで、このパターンを実演しました。Flash-Liteは、商品カタログの処理、レシートの翻訳、文書の要約も行えます。これらの例は、単一の会話のやり取りではなく、並列実行を示しています。

開発者にとって、ルーティングは新たな判断をもたらします。システムは、各タスクをどのモデルに割り当てるか、どのコンテキストをそのタスクに引き継ぐか、いつ結果をレビューする必要があるかを決定しなければなりません。ルーティングが不適切であれば、期待された効率性が失われる可能性があります。

軽量モデルは、コードベースの別の場所に隠れた依存関係を見落とすかもしれません。調整役のモデルは、委任によって節約した以上のリソースを回答の確認に費やす可能性があります。また、ルーティング層が情報を圧縮または再構成すると、コンテキストの転送時に詳細が失われることもあります。

製品構成は異なるものの、OpenAIとAnthropicも同じ広範な本番環境上の課題に直面しています。両社のモデルも、ツール利用、コーディングエージェント、長時間の推論に対応しています。競争上の焦点は、どのプロバイダーが開発者による実行プロセス全体の制御を最も効果的に支援できるかにあります。

純粋なベンチマークでの首位は依然として重要ですが、それだけでは不十分です。本番環境の購入者は、ツールの信頼性、レイテンシーの一貫性、コンテキスト処理、安全制御、監視、モデルのライフサイクルポリシーを考慮する必要があります。デモンストレーションで機能するエージェントでも、大規模に運用すると扱いが難しくなる可能性があります。

Googleの配信力は、その戦略にさらなる重みを与えています。Gemini 3.6 FlashとFlash-Liteは、Google AI StudioおよびAndroid StudioのGemini APIを通じて利用できます。Googleは、同社のエンタープライズ向けエージェントプラットフォームと一般消費者向けGeminiアプリケーションでも提供しています。

Flash-LiteはGoogle Searchへの導入が進められており、Gemini 3.6 FlashはGoogle Antigravityを通じて利用できます。この配信体制により、Googleは一般消費者、開発者、企業向けの各領域で同じファミリーをテストできます。

同社はまた、Gemini 3.6 FlashをAntigravityエージェントのデフォルトモデルにしました。この変更は、Googleの主張を検証する重要な社内テストになります。デフォルトのエージェントは、ベンチマークスイートよりも多様な利用を生み出し、長いツール実行シーケンスに関する問題を明らかにします。

モデルポートフォリオは、調達を複雑にする可能性もあります。企業は、モデルとルーティングの組み合わせごとに、個別の評価ポリシーを必要とするかもしれません。セキュリティチームは、エージェント間を移動するデータ、呼び出し可能なツール、各出力の記録方法を確認する必要があります。

知識労働者も、これに関連する問題に直面します。複数のエージェントが同じ資料を変換すると、出力の追跡が難しくなります。検索可能なAIナレッジベースはソースのコンテキストを保持できますが、モデル単位の監査記録が必要であることに変わりはありません。

ルーティングが、すべてのワークロードを1つのモデルに通すよりも容易になれば、Googleの戦略は成功します。開発者が節約分を評価、オーケストレーション、エラー回復に費やすことになれば、その戦略は弱まります。

Gemini 3.5 Flash Cyberがオープンアクセスの限界を試す

Flash Cyberは、専門特化によって能力が向上する一方で、それを提供すべき対象が限定される可能性を示しています。

サイバーセキュリティモデルは、デュアルユース領域で機能します。脆弱なコードパスを特定する同じ能力が、攻撃者による悪用可能な標的の発見にも役立つ可能性があります。有用な防御モデルは、攻撃目的の悪用を容易にすることなく、弱点について推論できなければなりません。

Gemini 3.5 Flash Cyberは、ソフトウェアの脆弱性を発見、検証、修復できるようファインチューニングされています。CodeMender内では、複数のFlash Cyberエージェントが問題を調査し、1つの統合レポートを作成します。このアプローチでは、1回の分析を信頼するのではなく、専門的な分析を繰り返し実施します。

Googleによると、このモデルは脆弱性調査エージェント向けベンチマークであるCyberGymにおいて、競争力のある性能を達成しています。しかし同社は、ベンチマーク性能を、未知のソフトウェアプロジェクト全般で信頼性の高い導入が可能である証拠と見なすのに十分な公開情報を提供していません。

提供計画にも、その不確実性が反映されています。Flash Cyberは当初、CodeMenderのパイロットプログラムを通じて、政府機関および信頼できるパートナーのみに限定されます。一般提供されるGemini APIモデルとして、3.6 FlashやFlash-Liteに加わるわけではありません。

Googleによると、この制限付きリリースは、広範な悪用を抑えながら、防御側に先行する機会を与えるものです。DeepMindのセキュリティ責任者らは、このアプローチを、技術のデュアルユース性に対する意図的な対応だと説明しています。

このサイバーセキュリティ関連のリリースは、Googleがこのモデルをレッドチーム業務や、より広範な企業防御へ拡張する意向であることも示しています。レッドチーミングとは、セキュリティ上の弱点を明らかにするため、許可された攻撃を試みてシステムをテストすることです。

この拡張は、有用性とリスクの両方を高めることになります。パッチを提案する防御用スキャナーは、組織が所有するリポジトリに限定できます。一方、レッドチームエージェントには、より広範な攻撃的推論能力が必要となるため、アクセス制御は一層困難になります。

CodeMenderは封じ込めレイヤーとして機能します。Googleは、アクセス権を付与する対象を決定し、サポートする活動を制限し、使用状況を監視し、マネージドサービスを通じて調査結果を統合できます。このアプローチは、モデルの重みや制限のないAPI認証情報を配布する場合よりも、強力な制御を実現します。

一方で、独立した検証も制限されます。アクセスが限定されている限り、外部の研究者は障害モードを十分にテストできません。パイロットプログラム外の企業も、実際のコードを用いて、現在使用しているセキュリティツールとモデルを比較することができません。

パッチの品質にも不確実性があります。疑わしいパターンを発見することと、安全な修正を作成することは異なります。パッチによって1つの脆弱性を除去できても、別の脆弱性が生じたり、動作が変わったり、パフォーマンスが低下したりする可能性があります。

したがって、特に重要インフラや広く利用されている依存関係については、人間によるレビューが引き続き必要です。セキュリティチームは各指摘事項を再現し、提案された変更をテストし、パッチが安全である理由を文書化しなければなりません。ベンチマークで高いスコアを獲得しても、このプロセスの代わりにはなりません。

誤検知も重要です。不確実な問題を過剰に報告するモデルは、メンテナーを圧倒する可能性があります。見逃しは、脆弱なままのコードに対して誤った安心感を生み出すため、さらに危険です。

そのため、Googleの制限付き展開は、安全策であると同時に証拠の不足でもあります。リスクを抑えられる一方、独立した観察者が実環境での信頼性について得られる情報は少なくなります。このパイロットプログラムの価値は、確認済みの指摘事項、採用されたパッチ、却下された提案に関する透明性の高い報告に左右されます。

ベンチマークの向上には、独立した実環境での証拠が必要

Googleの数値は本格的な性能上の主張を裏付けていますが、実際の組織内でこれらのモデルがどのように動作するかについて、結論を出すものではありません。

Googleが公開した複数の結果で、Gemini 3.6 FlashはGemini 3.5 Flashを上回っています。長時間にわたるソフトウェアエンジニアリング作業を測定するDeepSWEについて、同社は37パーセントに対して49パーセントと報告しています。機械学習エンジニアリング向けのMLE-Benchでは、49.7パーセントに対して63.9パーセントと報告しています。

コンピューター操作エージェントの評価であるOSWorld-Verifiedでは、GoogleはGemini 3.6 Flashを83パーセント、Gemini 3.5 Flashを78.4パーセントとしています。同社は、グラフ推論と長いコンテキストからの情報検索でも性能が向上したと報告しています。

より広範なGeminiの評価には、OpenAI、Anthropic、xAIのモデルとの比較が含まれています。掲載されたすべてのカテゴリーで首位となる単一のモデルはありません。このように結果が分かれていることは、全面的な優位性を主張するよりも有用です。

Gemini 3.6 Flashは、ソフトウェアエンジニアリングや知識労働に関する一部の指標で競合モデルに遅れを取っています。一方、コンピューター操作、マルチモーダル推論、Googleの長いコンテキスト評価では優れた性能を示しています。これらの違いは、テストを実際のワークロードに対応させる必要性を改めて示しています。

ベンチマークの手法によって結果は変わり得ます。ツール構成、プロンプト、再試行回数の上限、補助的な仕組み、制限時間は、すべてエージェントのスコアに影響します。評価用ハーネスのわずかな違いでも、モデルがエラーに気付くか、再試行の機会を得られるかが変わります。

データ汚染も懸念事項です。評価タスクが学習データに含まれる資料と類似している場合、モデルの性能が高くなる可能性があります。非公開のテストや最近更新されたテストは、そのリスクを軽減しますが、外部による再現も難しくなります。

Googleの効率性に関する主張も、同様に精査する必要があります。出力トークンが17パーセント減少したからといって、すべての顧客の総リソース使用量が同じ割合で減少するわけではありません。アプリケーションのプロンプト、ツール、検証ルール、ユーザーの行動が、最終結果を左右します。

Flash-Liteについて報告されている速度も変動する可能性があります。スループットは、リクエストサイズ、地域、サービスの負荷、バッチ処理、アカウント設定によって異なります。トークン毎秒という目を引く数値は、テストの指針にはなりますが、その代わりにはなりません。

ビジュアルデザインについては、品質上のトレードオフもあります。Googleの開発者向けドキュメントによると、一部のレイアウトやスタイリング作業では、人間の評価者が以前のモデルを好みました。ビジュアル上の好みが重要な場合、3.6 Flashに明確なデザイン指示を与えることを推奨しています。

この開示は価値があります。能力の向上が、あらゆる面で一様に進むことはほとんどないからです。モデルは、より信頼性の高い機能コードを作成しながら、初期設定では魅力に欠けるレイアウトを生成する場合があります。チームには、技術的判断と人間による判断の両方を含む、タスク固有の評価が必要です。

モデルの更新は、別の運用上のリスクも生みます。Googleは3.6 FlashとFlash-Liteを一般提供モデルとして位置付けているため、プレビュー版よりも高い安定性が期待できます。それでも、アプリケーションでモデル識別子やデフォルトのルーティングを変更する前には、回帰テストが必要です。

移行ガイドでは、新たに公開された両モデルについて、一部の非推奨サンプリングパラメーターと、あらかじめ入力されたモデルのターンを削除する必要があると記載されています。これらの変更は、以前のAPI動作を前提として構築されたアプリケーションに影響する可能性があります。

責任ある導入は、実際の作業を代表するタスクセットから始めるべきです。チームは、成功率、ツール呼び出しの総回数、出力の長さ、修正サイクル、人間によるレビュー時間を記録する必要があります。また、敵対的な指示や不完全なコンテキストについてもテストすべきです。

コーディングエージェントの場合、評価では意図しない編集や失敗したテストを数える必要があります。文書抽出では、フィールド単位の精度と根拠のない推論を測定すべきです。コンピューター操作では、誤ったクリック、復旧動作、権限の境界を追跡する必要があります。

独立した証拠は、開発者がこうした環境での結果を報告して初めて得られます。それまでは、Googleのベンチマークは方向性を示すものにとどまり、実環境での信頼性は未解決の実証的課題です。

3モデルのリリース後に注目すべき点

次の段階では、Googleのポートフォリオがワークフロー全体の労力を削減するのか、それとも単に複数のモデルへ再配分するだけなのかが明らかになります。

最初の注目点は、Gemini 3.6 FlashとFlash-Liteの実環境で継続的に示される動作です。開発者は、完了したタスク、モデル呼び出しの総回数、レイテンシー、人間による修正時間について、独立した測定結果に注目すべきです。出力トークン使用量の減少がGoogleの主張を補強するのは、ワークフロー全体も効率化された場合に限られます。

コーディングエージェントの導入事例からの報告は、特に有用です。3.6 Flashが一貫して意図しない編集を減らし、実行失敗のループから抜け出せるなら、Googleが主張する仕組みへの裏付けが強まります。チームが依然として大規模な再試行ロジックを必要とするなら、ベンチマークの向上が持つ運用上の意味は薄れます。

Flash-Liteには別の形の検証が必要です。最も有力な用途は、構造化データの抽出や文書分類など、自動的に確認できる反復作業です。大規模かつ多様な入力に対して精度が安定している場合、高いスループットが重要になります。

第2の注目点は、Flash Cyberのパイロットプログラムです。Googleは最終的に、確認された指摘事項の数、メンテナーが採用したパッチの数、人間のレビュアーが提案を却下した頻度を開示すべきです。集計された報告であれば、機密性の高い脆弱性を公開せずに証拠を提供できます。

政府機関や選ばれたパートナー以外にも提供範囲が拡大されれば、Googleがアクセス制御と監視によって、より広範な利用を支えられると判断したことを示します。制限が続く場合は、デュアルユースのリスク管理が依然として困難であることを示唆します。

観察者は、CodeMenderが重要なオープンソースプロジェクトで未知の脆弱性を発見するかどうかにも注目すべきです。確認済みの発見と採用された修正は、特化型防御エージェントの有用性を裏付けます。未検証の主張やノイズの多い報告は、その評価を弱めます。

第3の注目点は、競合各社の反応です。Anthropic、OpenAI、その他のプロバイダーは、より高速なモデル、より強力なルーティングシステム、特化型セキュリティツール、またはよりシンプルなエージェント運用によって対抗できます。その対応から、Googleが持続的な製品構造を見いだしたのかが分かります。

Google自身のロードマップも重要です。同社によると、Gemini 3.5 Proは引き続きパートナーによるテスト段階にあり、Gemini 4の開発はすでに始まっています。これらの将来のリリースによって、ポートフォリオが特化型のまま維持されるのか、別の主力モデルへ統合されるのかが明らかになります。

より強力なProモデルは、3.6 FlashとFlash-Liteの上位でプランナーとして機能する可能性があります。一方で、モデル間の役割の違いを理解しにくくする可能性もあります。開発者は能力を重視しますが、予測可能な移行経路と明確な製品境界も必要としています。

企業の購入担当者が今すぐ取るべき行動は、全面的な移行ではなく、制御された評価です。実際の業務から小規模なテストセットを作成し、元の文書を保存したうえで、完了までに必要な総労力を比較してください。すべてのエスカレーション、ツール呼び出し、手動修正を記録してください。

知識労働者にとって重要なのは、委任されたエージェントが、速度を向上させながら証拠を保持できるかどうかです。検索可能なワークフローが有用なのは、生成された主張を情報源までさかのぼって確認できる場合に限られます。

Google DeepMindによるGemini 3.6 Flashのリリースは、1つの戦略的主張を明確にしています。次の効率性をめぐる競争は、エージェントシステム全体で繰り広げられるということです。実際の導入でループの減少が確認されるか、Flash Cyberが採用される修正を生み出すか、競合他社が同じ階層型モデル戦略を採用するかに注目してください。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page