top of page

Gemini Enterprise for Legalはより安全なAIを約束するが、リスクを負うのは依然として弁護士だ

4 時間前
読了時間: 20分

裁判所がAI関連の誤りを数千件記録するなか、GoogleはGemini Enterprise for Legalを発表した。専門モデルが虚偽の提出書面を防げるのかを直接問う試金石となる。

この製品は、大手法律事務所4社とともにプレビュー提供を開始し、接続されたデータベースに根ざした法務リサーチを約束している。AnthropicもClaude Legal Solutionsで同様のアプローチを採り、xAIは法務業務向けにGrokを売り込んでいる。各社は、より優れたデータ接続とワークフロー管理により、生成AIを訴訟実務に適したものにできると見込んでいる。

しかし、その期待は不都合な実績と衝突する。弁護士は流暢なAIの回答を信頼した結果、架空の判例、捏造された引用、歪められた法原則を提出してきた。裁判所は罰金、戒告、照会、職業上の制限で対応している。したがって中心的な対立は、AIと従来型リサーチの間にあるのではない。ベンダーが管理する検証と、あらゆる法的根拠を確認する弁護士の委任不可能な義務との間にある。

Gemini Enterprise for Legal、AIを法律事務所のワークフローへ導入

Googleは法務AIを、法的言語を知るだけのチャットボットではなく、統制されたワークフローシステムとして提示している。

Googleは2026年8月25日、Gemini Enterprise for Legalを発表した。同社はこれを、法律事務所および企業法務部門向けに構成した、より広範なエンタープライズプラットフォームの専門版と説明している。

プレビューにはCleary Gottlieb、Freshfields、Weil、Williams & Connollyが参加する。これらの参加によりGoogleは高度な法務ワークフローに触れられるが、製品の正確性が独立して実証されるわけではない。

Gemini legal platformは、再利用可能なスキル、専門エージェント、ガバナンス制御、外部システムへのコネクターを組み合わせる。契約レビュー、レッドライン、規制モニタリング、法務リサーチ、訴訟支援などを対象とする。

コネクターは、タスク実行中にモデルが別のシステムから認可済みの情報を取得できるようにする。この設計により、既存のユーザー権限を維持したまま、GeminiをEverlawやNetDocumentsなどのプラットフォームに接続できる。

この違いは重要だ。一般的なモデルは、学習時に身につけたパターンに基づいて回答することが多い。引用した判決が存在しない場合でも、もっともらしい引用を生成し得る。

これに対し、接続された法務システムは、指定されたリポジトリから文書を取得できる。その回答は利用者を根拠資料へ導き、情報源まで遡れる追跡可能な経路を維持できる。

Googleは、アクセス制御、監査ログ、ポリシー適用が法務製品全体で機能するとしている。また、顧客のプロンプト、文書、出力は、他の顧客向けモデルの学習には利用しないとも述べている。

こうした保護策は、捏造判例以外にも複数の懸念に対応する。法律事務所は依頼人の秘密を維持し、秘匿特権の対象となる資料を保護し、案件間の倫理的障壁を徹底しなければならない。たとえ非常に正確なモデルであっても、ある依頼人の文書を別のチームに漏らすなら適切ではない。

このアーキテクチャは、法務業務が実際にどのように進むかも反映している。弁護士がリサーチを、孤立した一問一答として行うことはほとんどない。リサーチはメモに反映され、それが草案を形作り、さらにレビューと承認のプロセスへ入る。

Gemini Enterprise for Legalは、こうした段階を横断して機能することを目指す。モデルは接続済みの記録を検索し、草案を組み立て、統制されたシステムを通じて情報を移動できる。

これは、公開チャットボットに判例法を記憶させようとするより信頼性の高いアプローチだ。ただし、リスクをなくすのではなく、その所在を変えるだけでもある。

検索で支配的な判例を見落としたり、古い根拠を過度に高く順位付けしたり、限定的な文脈を欠いたまま一節を取り出したりすれば、誤りは生じ得る。モデルは実在する判決を正確に引用しつつ、裁判所の判断内容を誤って伝えることもある。

Google自身も、その位置付けのなかでこの問題の一部を認識している。同社は、ガバナンス、領域専門知識、権威あるシステムとの接続がなければ、基盤モデルの知能だけでは法務実務に不十分だとしている。

これこそが、この発表の真の意味だ。Googleは弁護士に、単に有能なモデルを売る段階を越えている。モデル、事務所の記録、弁護士の最終成果物の間に位置する制度的なレイヤーを提供しようとしている。

これによりGemini Enterprise for Legalは、既存のリーガルテクノロジー提供企業にとって本格的な競合となる。同時にGoogleには、その安全策が訴訟の圧力下でも機能することを示す責任が生じる。

法務AIツールは同じアーキテクチャへと競争を加速させている

主要製品は、裏付けのないモデルの記憶ではなく、接続された情報源、権限、専門ワークフローへの依存を強めている。

Anthropicは2026年5月、20を超えるコネクターと12の業務分野別プラグインを追加して、法務向け提供を拡充した。コネクターはClaudeを、法務リサーチ、文書管理、ディスカバリー、契約プラットフォームに接続する。

同社のClaude legal deploymentは、契約のレッドライン、M&Aレビュー、規制モニタリング、プライバシー評価、訴訟準備を対象とする。Anthropicによると、法務専門家は知識労働者ユーザーのなかで最も利用度の高いグループになったという。

プラグインは、特定の法分野に向けたタスク指示と反復可能な手順を提供する。コネクターは、それらの手順を実行するために必要な基礎文書とシステムアクセスを提供する。

これらの要素は合わせて、一般にRAGと呼ばれる検索拡張生成を構成する。この手法では、学習中に符号化された情報だけに頼るのではなく、リクエスト時にモデルへ選定済みの文書を与える。

RAGは、明白な失敗パターンの一つを減らせる。引用を提示する前に実際の判決文を取得する必要があるなら、記憶から判例名を捏造する機会は少なくなる。

この安全策には意味があるが、法的正確性の一部しかカバーしない。取得された判例は実在していても、その手続上の位置付け、管轄、先例性によっては無関係になり得る。

モデルは反対意見、当事者の主張、あるいは覆された基準の説明から文言を抽出することもある。引用文は存在していても、法的結論はなお誤っている。

したがってGoogleとAnthropicは、モデル品質だけで競争しているのではない。信頼できるデータベースとの接続、ワークフロー統合、ガバナンス、証拠の提示方法でも競争している。

既存の提供企業は、すでにこれらの利点の一部を持つ。Thomson ReutersはWestlawとCoCounselを管理し、LexisNexisは広範な法務リサーチコレクションとLexis+ AIを運営している。

これらの企業は、判例、制定法、解説、引用関係の整理に何十年も費やしてきた。また、根拠となる法的権威が否定的な扱いを受けた場合に弁護士へ警告するツールも維持している。

基盤モデル企業は異なる強みをもたらす。そのシステムは長大な記録を統合し、複雑な指示に従い、文書、通信、生産性ソフトウェアを横断して機能できる。

これにより、提携と競争圧力の両方が生まれる。AnthropicはClaudeをThomson Reutersのサービスに接続できるが、Claudeは弁護士がそれらのサービスへアクセスするインターフェースにもなり得る。

Googleも同じプラットフォーム論理に従う。すべての法務データベースを置き換えるのではなく、複数のシステムの上にGeminiを配置し、それらをまたぐ業務を調整できる。

xAIはGrokについて、より広範なビジョンを打ち出している。legal solutions pageでは、リサーチ、起案、契約分析、デューデリジェンス、コンプライアンス監視を掲げている。

しかし、この公開ページが示す引用検証や一次法源へのアクセスに関する詳細は限られている。その性能主張にも、比較可能な独立した法務監査はない。

これは重要である。Grokはすでに重大な制裁事案に登場している。オンタリオ州Law Society Tribunalは、弁護士Shahryar Mazaheriが申立て資料の準備にGrokを利用したと認定した。

その結果生じた文書には、存在しない法的根拠、裏付けのない命題、手続規則の誤った適用が含まれていた。この事案は、法務向けというラベルだけでは信頼性を確立できない理由を示している。

製品競争は、共通する命題へと向かっている。一般的なモデルは、権威あるデータ、限定的な指示、アクセス制御、人間によるレビューに囲まれることで、より安全になる。

未解決の問題は、こうした層が一貫して誤りを防ぐのか、それとも誤った回答をより専門的な情報源に基づくように見せるだけなのか、という点だ。

法務AIのハルシネーション問題は、架空の判例にとどまらない

実在する引用でも誤った回答を支え得るため、検証は判例の存在確認より難しい。

法務AIの失敗として最も目立つのは架空の判例である。引用された法的根拠が正当なデータベースのどこにも見つからないため、こうした事例は理解しやすい。

2025年7月、連邦判事はアラバマ州の刑務所当局を代理した弁護士3人に制裁を科した。ある弁護士がChatGPTを使ってリサーチし、その出力を検証しなかった後、2件の提出書面に捏造された判例引用が含まれていた。

判事は弁護士らを事件から外し、アラバマ州弁護士会へ照会した。資料の検証を怠った行為を、極めて無謀だと評した。

裁判所の制裁が注目を集めたのは、既存の法律事務所と重大な刑務所訴訟が関わっていたためだ。アラバマ州は2020年以降、この事務所に4,000万ドル超を支払っていた。

問題はこの事案にとどまらなかった。裁判官は、捏造された先例、不正確な引用、実在する判決を、その判決が一度も確立していない命題の根拠として引用する提出書面に直面してきた。

Mazaheriの事案は、そのようなパターンがどれほど高くつくかを示している。2026年6月、オンタリオ州の法廷は、2件の不成功に終わった申立てを受け、彼に31,150カナダドルの費用支払いを命じた。

法廷は、彼の過失によるAI利用を著しく不利な要素として扱った。提出書面では、架空の判決と、彼の主張を支えない実在の法的根拠が引用されていた。

ハルシネーションを含むAI資料に関するカナダの報道済み判決は、2024年の7件から2025年には86件へ増加した。2026年第1四半期にはさらに39件が現れた。

これらの数字は、CanLIIに掲載された報告済み事例に関する法廷の議論に基づく。法律事務所内で起きるAI業務上の不備のすべてではなく、公表された判決を追跡したものだ。

法廷は、LLMは判断を下すことも道徳的な指針を持つこともないと強調した。また、この種のシステムは不確実性を認めるより、回答を提示する傾向があるとも指摘した。

この傾向は、架空の引用以上の問題を生む。誤った規則を生成したり、例外を省いたり、期限を誤って述べたり、異なる管轄区域の基準を混ぜ合わせたりする可能性がある。

それぞれの要素は正当に見えるため、こうした誤りは発見が難しい。判例は存在し、引用された文言もどこかにはあり、回答は通常の法律メモのように見える。

したがって法務上のハルシネーションは、情報源の捏造だけを意味すべきではない。情報源がある主張を支持していると誤って主張することも含まれる。

このより広い定義は、Stanford RegLabが実施した商用法務リサーチシステムの評価を形作った。研究者らは、Lexis+ AI、Westlaw AI-Assisted Research、Ask Practical Law AIを、200を超える法的質問でテストした。

査読済みのlegal AI studyでは、専門システムは一般的なGPT-4システムよりハルシネーションの頻度が低いことが示された。しかし、誤解を招く回答や誤った回答はなお一般的だった。

Lexis+ AIとAsk Practical Law AIでは、6件に1件を超えるクエリで誤解を招く情報または虚偽の情報が示された。Westlaw AI-Assisted Researchでは、テスト対象となった回答のおよそ3分の1でハルシネーションが確認された。

Lexis+ AIは、質問の65%に対して正確かつ根拠に基づく回答を生成した。Westlawは約41%、Ask Practical Law AIは19%にとどまった。

研究者らは、回答拒否の挙動にも大きな差があることを明らかにした。Ask Practical Law AIは、テスト対象のクエリの62%に不完全な回答を返した。

ただし、これらの結果は慎重に解釈する必要がある。テストは複数の製品アップデート以前に行われたため、各システムの現行バージョンを測定したものではない。

また、Gemini Enterprise for LegalやAnthropicの2026年向け法務パッケージも評価対象ではない。それらのエラー率を示す、同等の独立した公開監査はまだ存在しない。

それでも、この研究は持続的な制約を浮き彫りにしている。モデルを信頼できるデータベースに接続しても、その統合結果が取得資料を忠実に表現するとは限らない。

法的な回答には複数の正確性の層がある。根拠となる権威が実在し、現在も有効で、関連する管轄に適用され、示された命題を裏付けていなければならない。

モデルは、拘束力のある判例と説得的な権威を区別する必要もある。規則の適用に影響する例外、手続き上の詳細、事実関係の違いも保持しなければならない。

リンクが証明するのは、情報源が存在することだけだ。モデルがその情報源を理解し、適切な箇所を選び、弁護可能な結論に至ったことまでは証明しない。

検証が依然として弁護士の仕事である理由

法務AIは検証のあり方を再編できるが、専門職としての責任を弁護士からベンダーへ移すことはできない。

裁判所は一般に、AIを利用したことだけを理由に弁護士を制裁するわけではない。専門職規則ですでに求められている審査を行わず、信頼性に欠ける成果物を提出した場合に責任を問う。

この違いは法務AI業界にとって重要だ。ベンダーは引用チェックや情報源へのリンクを追加できるが、書面に署名するのは依然として提出担当の弁護士である。

署名は単なる著者性以上の意味を持つ。それは、弁護士が合理的な調査を行い、法的内容に適切な根拠があると信じていることを裁判所に示すものだ。

製品ラベルでこの義務が変わることはない。モデルのベンチマークスコア、エンタープライズ向けセキュリティ認証、評価の高いリサーチプラットフォームとの接続も同様だ。

Gemini Enterprise for Legalは、生成テキストの横に裏付け文書を表示することで、検証を容易にできる。また、タスク中に参照したシステムを記録することも可能だ。

Claude Legal Solutionsは、接続された法務データベースや法律事務所の文書を参照できる。これにより、レビュー担当者は根拠のないチャットボット回答よりも良い出発点を得られる。

これらの機能は、証拠の所在を特定するための時間を短縮できる。また、書面が裁判所に届く前に、草案と引用元の矛盾を明らかにすることもできる。

しかし、同じ利便性が自動化バイアスのリスクを生む。ソフトウェアがすでに回答を根拠付きまたは検証済みと表示している場合、レビュー担当者は情報源を十分に確認しなくなるおそれがある。

洗練されたインターフェースは、その影響を増幅し得る。引用、信頼度指標、文書リンクは、法的推論が弱いままでも出力を完成されたものに見せる。

したがって法律事務所には、ワークフロー全体に対応する統制が必要だ。AIに実行させるタスク、アクセスを許可するデータ、各出力をレビューする担当者を決めなければならない。

有効な統制の一例として、提出手続きが進む前に弁護士が引用されたすべての権威を開くことを求める方法がある。また、引用文を原典と照合し、裏付けのない命題を警告する仕組みも考えられる。

法律事務所は、プロンプト、取得文書、モデルの回答、編集内容、最終承認の記録も保存できる。その記録は、監督者がエラーを調査し、将来の手続きを改善する助けとなる。

ただし、ログを残すだけで能力が身に付くわけではない。レビュー担当者は、モデルが誤った情報源を取得した場合や例外を見落とした場合に気付けるだけの関連法の理解を持たなければならない。

これは法律事務所にとって研修上の課題を生む。若手弁護士は従来、リサーチ、文書レビュー、起案を通じて判断力を養ってきた。

まさにそれらは、法務AI製品が迅速化を約束する業務でもある。ソフトウェアが基礎的な作業を過度に取り除けば、法律事務所は経験豊富なレビュー担当者を育てる基盤を弱める可能性がある。

Googleの法務顧問であるHalimah DeLaine Pradoは、AIを弁護士の代替ではなく補完と表現した。法務実務は依然として人間の判断に依存すると論じている。

この立場は各社の製品表現とも一致する。GoogleとAnthropicはいずれも、ますます複雑なワークフローを完了するエージェントを売り込みながらも、弁護士が主導権を維持することを強調している。

こうしたエージェントの自律性が高まるにつれ、この緊張関係はより鮮明になる。時間を節約するには、システムが常に人間の指示を受けずに、より多くの中間判断を下す必要がある。

判断が一つ増えるごとに、文脈が失われる箇所も増える。モデルは一連の流れの中で、文書を選択し、それを要約し、論拠を起案し、行動を推奨するかもしれない。

その結果、レビュー担当者は個々の推論手順ではなく、圧縮された最終成果物に向き合うことになる。システムが証拠を明確に示さなければ、迅速なワークフローは監査が難しくなり得る。

法務チームは、AIの出力を権威ではなく、リサーチの手がかりまたは草案として扱うべきだ。重要な命題はすべて、一次資料または信頼できる法務リサーチサービスに立ち返らなければならない。

同じ原則は訴訟以外にも当てはまる。契約の要約は契約書原文と照合し、規制アラートは公式ルールと比較すべきだ。

大量の証拠コレクションを管理する組織は、検索可能なAI knowledge baseからも恩恵を受けられる。価値は専門家によるレビューを置き換えることではなく、追跡可能性にある。

このアプローチは、法務AIの最も強い利点を維持する。モデルは、その意味を最終的に判断する存在になることなく、専門家による情報の発見、整理、比較を支援できる。

真のトレードオフは速度とレビュー能力の間にある

法務AIが時間を節約できるのは、その作業を確認するコストが手作業で行うコストを下回る場合に限られる。

ベンダーはしばしば、法務AIを数日分のリサーチを数分で完了する手段として位置付ける。この約束は、時間のかかる文書分析を基盤とする職業にとって魅力的に聞こえる。

しかし、すべての文を再構築して確認する必要があるなら、この計算は不利になる。複数の権威を含む長い回答は、経験豊富な弁護士による焦点を絞った検索よりも多くのレビュー作業を生む可能性がある。

Stanfordの研究では、回答が長いほど検証可能な主張が増えることが分かった。命題や引用が一つ増えるごとに、個別の評価が必要になった。

これは、回答の長さが単なる見せ方の選択ではないことを示唆する。長さはリスクと労力を左右する変数でもある。

短く、慎重に情報源を示した回答を返すシステムは、すぐに洗練されたメモランダムを生成するシステムより有用な場合がある。短い出力は、隠れたエラーが入り込む余地を限定する。

回答拒否の挙動にも価値がある。法務実務では、利用可能な情報源が回答を裏付けないという正直な表明は、もっともらしい統合回答よりも安全であることが多い。

これは製品設計における難しいトレードオフを生む。利用者は通常、完全に答えるアシスタントを好むが、法的な信頼性のためにはシステムが回答を止める必要がある場合もある。

したがってベンダーは、ベンチマーク精度以上の情報を報告すべきだ。購入者は、システムがどの程度の頻度で回答を拒否するのか、古い権威を取得するのか、判示内容を誤って述べるのか、誤解を招くプロンプトで失敗するのかを知る必要がある。

また、タスク別の評価も必要だ。契約抽出、判例リサーチ、秘匿特権レビュー、準備書面の起案では、異なるエラーパターンが生じる。

広範な法的推論で高得点を獲得しても、すべてのワークフローに対応できることは証明されない。厳しい管轄・時間的制約の下で、引用の忠実性についてほとんど示さない可能性もある。

法律事務所は、広範な導入前に自らの案件に照らして製品をテストすべきだ。現実的な評価では、終結済み案件、既知のリサーチ課題、意図的に誤解を招くプロンプトを利用できる。

レビュー担当者は、システムが支配的な権威を見つけ、引用文を維持し、アクセス権限を尊重するかを測定できる。また、各回答を検証するために必要な時間も記録すべきだ。

これにより、生の生成速度よりも有用な指標が得られる。重要なのは1分当たりの生成語数ではなく、1時間当たりに完了した検証済み業務量である。

専門特化型の法務AIは、それでもこの指標を改善できる。コネクターは文書探索を減らし、構造化された出力は弁護士による証拠比較や情報不足の特定を支援できる。

得られる効果はタスクごとに異なる。文書分類や条項抽出は、新規の法的主張よりも明確な基準点を提供する。

未解決の法領域に関するリサーチには、より大きな危険がある。モデルは、対立する権威、手続き上の差異、不完全な先例を解釈しなければならない。

訴訟では、敵対的な精査も求められる。相手方弁護士には、不正確な引用、引用文、法的性格付けをすべて暴く動機がある。

この環境は、法務AIを低リスクの文章作成アシスタントと区別する。小さな事実誤認でも、依頼者に損害を与え、信頼性を損ない、懲戒調査を招き得る。

したがって法律事務所は、ソフトウェア導入と並行してレビュー能力を予算化しなければならない。監督体制を拡充せずにAIを増やせば、未検証の資料がより大量に同じ弁護士へ流れ込む可能性がある。

このシナリオで、技術は作業をなくすわけではない。初期リサーチの作業を、より厳しい期限の下で行われることもある後段の検証へ移すだけだ。

成功するシステムは、不確実性を可視化し、情報源を容易に確認できるようにすべきだ。また、取得した証拠と生成された解釈の境界を保つ必要がある。

これを一貫して実現する最初の製品は、測定可能な性能によって信頼を得るだろう。マーケティング上の主張だけでは、この問題に決着はつかない。

Gemini Enterprise for Legalが機能するかを示すもの

次の段階は、独立したエラーテスト、実際の導入パターン、導入後の制裁記録によって評価されるべきだ。

第一の指標は、Gemini Enterprise for LegalとClaude Legal Solutionsに対する独立評価である。研究者は現行製品と現実的な法務タスクにアクセスする必要がある。

こうしたテストでは、架空の引用と、より微妙な失敗を区別すべきだ。不正確な判示内容、見落とされた権威、古い法律、裏付けのない引用文を検証する必要がある。

結果は、基盤モデルに起因する失敗と、検索またはワークフロー設定に起因する失敗も分けて示すべきだ。この区別により、どの安全策が実際にリスクを低減するのかが明らかになる。

強力な独立評価の結果は、コネクターとガバナンスが信頼性を高めるという各社の主張を支えるだろう。一般的なチャットボットを上回る性能であっても、エラー率が2桁台で続くなら、その主張は弱まる。

第二の指標は、プレビュー参加の法律事務所が製品をどのように利用するかだ。弁護士がAIの利用を要約、管理業務、低リスクの社内草案に限定するなら、広範なアクセスはほとんど意味を持たない。

実際の導入には、複数の実務グループにまたがる、監督下でのリサーチ、ディスカバリー分析、契約レビュー、訴訟準備が含まれるだろう。法律事務所は、購入者が報告された成果を解釈できるだけの方法論を開示すべきだ。

レビュー負担は、利用状況と同じくらい重要である。弁護士が生成時間を節約しても、出力の検証に同程度の時間を費やすなら、経済的な根拠は狭まる。

第三の指標は、専門特化型ツールが一般化した後の裁判所制裁のパターンである。重要なのは、AI関連のエラーがすべて消えるかどうかではない。

むしろ観察者は、統制された法務システムを通じて作成された提出書面に、一般的なチャットボットで作成された書面よりも、捏造または誤った性格付けをされた権威が少ないかを問うべきだ。

エラー率の低下は、特定用途向けプラットフォームの必要性を裏付ける材料となるだろう。制裁が続くなら、製品上の制御では不十分な監督や拙速なレビューを補えないことを示唆する。

裁判所が近いうちに責任をベンダーへ移す可能性は低い。命令は一貫して、弁護士に既存の能力、誠実さ、合理的な調査義務を求めている。

このことは、Gemini Enterprise for Legalに厳しい役割を課す。生成された推論を検証済みの法とみなすよう利用者を促すことなく、法務業務を加速させなければならない。

Google、Anthropic、Thomson Reuters、LexisNexis、xAIはいずれも、この市場の一部を狙っている。製品は異なるが、各社は同じ制度上の現実に向き合わなければならない。

弁護士は、検索、整理、比較、起案を委任できる。しかし、裁判官に提出される内容に対する説明責任は委任できない。

最も安全な導入経路は、追跡可能な業務と測定可能なレビュー手順から始めることだ。チームは、エージェントの権限を拡大する前に、情報源レベルでの検証を必須とすべきである。

法務AIツールを評価する読者にとって、決定的な問いは、モデルが弁護士らしく聞こえるかどうかではない。重要な主張のすべてを、弁護士が追跡し、確認し、擁護できるかを問うべきだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page