AI証拠の不正利用疑惑で捜査対象となったダービーシャー警察の上級刑事
Google Newsが、英国警察の中核にある憂慮すべき問題を改めて浮き彫りにした。ダービーシャー警察の上級刑事が、複数の事件でAIを使用した疑いをめぐり刑事捜査の対象となっている。
Derbyshire Policeによると、警察官が人工知能システムを使って証拠資料を作成した疑いがある。同警察は氏名を公表していない当該警察官を現場業務から外し、司法妨害の可能性について捜査を開始した。
問題は、警察官が未承認の生産性向上ツールを使ったというだけではない。報道によれば、このシステムは起訴、量刑、その他の法的判断に影響を与えることを意図した文書の作成に使われた可能性がある。
この違いにより、内部の技術利用規則違反は適正手続きへの潜在的な脅威へと変わる。また、この問題は英国政府が警察活動全体で人工知能の活用を拡大する国家的なPoliceAIプログラムを推進するなかで起きた。
したがって、中心的な対立は明白だ。警察指導部はAIによる事務作業の削減を望む一方、裁判所は重大な結果をもたらすすべての記述が正確で、追跡可能であり、人に帰属することを求めている。
過去の論争はすでにその危険性を示していた。West Midlands Policeは、注目度の高いサッカーの試合を評価する際にMicrosoft Copilotが生成した誤情報に依拠していた。ダービーシャーの疑惑は、この懸念を情報収集から個別の訴追に関わる文書へと移している。
ダービーシャー警察のAI捜査が実際に対象とするもの
この捜査は、単なる自動文法チェックや書式設定の無害な実験ではなく、事件資料の操作疑惑に関するものだ。
Derbyshire Policeは2026年6月、司法妨害の疑いを受けて刑事捜査を開始したと発表した。同警察によると、警察官が複数の事件でAIシステムを使い、証拠資料を作成した疑いがある。
当該警察官の氏名は公表されていない。捜査が公になった時点で、逮捕や刑事訴追は発表されていなかった。主張はあくまで疑惑であり、捜査も刑事責任を確定していないため、これらの点は重要である。
同警察は当該警察官を現場業務から外した。また、一般にCPSと呼ばれるCrown Prosecution Serviceと連携しており、新設された国家組織PoliceAIにも通知したとしている。
CPSも別途、この調査期間中にDerbyshire Policeと連携していることを確認した。その関与は、捜査当局が当該警察官の行為だけでなく、進行中または終了した訴追への影響の可能性も検証しなければならないことを示している。
その後の報道では、さらに具体的な疑惑が加わった。この刑事は、生成AIチャットボットを使って検察官向けの書類や被害者影響陳述書の草案を作成したとされる。
被害者影響陳述書は、犯罪が被害者に与えた影響を説明するもので、量刑判断に影響する場合がある。捜査官やソフトウェアシステムが、被害者自身の説明を超えて被害を誇張する機会となるべきものではない。
法律ニュースの報道が要約した情報によると、当該警察官はこうした陳述書の影響を最大化するようチャットボットに指示した疑いがある。また、望ましい起訴結果を支持する事件資料の作成も依頼したとされる。
影響を受けたファイルの一部にはレイプ事件の捜査が含まれていた。複数の有罪判決が見直し対象となったと報じられているが、当局は事件を公表せず、正確な件数も明らかにしていない。
「証拠資料を作成する」という表現には、複数の行為が含まれ得る。AIシステムは、確認済みのメモを再構成したり、要約を下書きしたり、陳述を脚色したり、相反する詳細を省いたり、情報を捏造したりする可能性がある。
こうした行為がもたらす法的・倫理的な結果は、大きく異なる。公表された報道では、どの文書に不正確な文言が含まれていたのか、その文言がどのように事件ファイルへ入ったのか、裁判所がそれに依拠したのかについて、正確には明らかにされていない。
証拠と事件書類の区別にも注意が必要だ。検察官向けの説明資料は、物的証拠や証人の当初の供述と同一ではない。しかし、偏った要約であっても、起訴判断、開示、司法取引、裁判準備に影響を及ぼし得る。
AIによる証拠は、洗練された文章が不確かな出所を覆い隠すとき、特に危険になる。流暢な文書は、その表現が証人、捜査官、確認済みの記録ではなく、プロンプトを反映したものであっても、権威あるものに見える可能性がある。
したがって、この捜査では完全な文書の経路を再構築しなければならない。これには、元のメモ、プロンプト、チャットボットの出力、編集、承認、開示記録、そして最終的に検察官または裁判所へ送られた版が含まれる。
これが今回の出来事における中心的な緊張関係だ。疑われる行為は、単に事実誤認を持ち込んだだけではない。刑事事件で重大な結果をもたらす記述を誰が作成し、なぜ特定の表現が現れたのかを曖昧にした可能性がある。
Google Newsの報道がPoliceAIに圧力をかける理由
この事件は、自動草案作成が日常化する前に、国家規模での導入が証拠の完全性を守れることをPoliceAIに証明するよう迫っている。
このタイミングは政府にとってこれ以上ないほど厄介だ。Home Officeは、ダービーシャーの疑惑が全国的な注目を集める数日前の2026年6月にPoliceAIを立ち上げた。
PoliceAIは、技術の試験、基準の策定、イングランドとウェールズの警察組織への支援を目的とする専門的な国家センターだ。政府は、これにより警察官がデータを分析し、証拠上の手掛かりを得て、事務作業を減らせるようにしたい考えだ。
政府によると、初期の活用事例では大幅な時間短縮が示されている。ある誘拐事件では、当局が800時間分の映像を3時間以内に確認し、早期の有罪答弁につながったとされる。
政府によると、別の事例では50万冊分の電子書籍データの翻訳が行われた。当局者は、この作業が組織犯罪の容疑者逮捕に貢献したとしている。
これらの事例は、既存資料の大規模な集まりを処理するものだ。チャットボットに物語を強めるよう求めたり、望ましい結果を狙った陳述書を作成させたりすることとは、本質的に異なる。
Home Officeは、2026年と2027年に最大10の警察組織で試験運用を行う計画だ。試験運用が業務上および保証上の要件を満たせば、2027年にはより広範な展開が見込まれている。
政府は、PoliceAIが最終的に年間600万時間の警察官の業務時間を節約できると予測している。これは約3,000人の警察官を追加配置するのに相当する能力だとしている。
こうした目標は、文書作成が多い業務を自動化する誘因となる。デジタル証拠の確認、開示、翻訳、文字起こし、要約は、警察の多くの時間を消費する。
しかし、効率だけが成功の尺度になってはならない。弁護士が文書の主張が証人によるものか言語モデルによるものかを判断するために数か月を費やさなければならないなら、数分で完成した文書に公共的な利益はない。
政府の警察AIファクトシートは、Home Office、個々の警察組織、全国警察組織、既存の規制機関に責任を分散している。この分散型モデルは、ツールが実験段階から日常の事件業務へ移行する際に不確実性を生む可能性がある。
PoliceAIの責任者Alex Murrayは、保護策が整備されるまで、裁判所提出用の陳述書作成を含む一部のAI利用を停止するよう、複数の警察組織に求めたと報じられている。この介入は、情報の分析と司法制度に提出される資料の作成との間にある重要な境界を認めるものだ。
ダービーシャー警察のAI事件は今、任意の停止措置や策定途上の指針が、行動を十分迅速に抑制できるかを試している。地方の警察組織はすでに、市販のチャットボットやその他の生成ツールを利用できる。
警察官は、メモを汎用モデルに貼り付けるために国家プラットフォームへのアクセスを必要としない。このような影の利用は、承認済みの調達、ログ記録、セキュリティ審査、保存管理を回避し得る。
シャドーAIとは、職員が業務のために未承認の人工知能サービスを使用することを意味する。よく知られたプライバシー問題を生むが、刑事司法ではさらにリスクがある。隠れた自動化は、その出所を後に裁判で説明しなければならない資料を汚染する可能性がある。
そのためPoliceAIは、二つの方向から圧力を受けている。閣僚は測定可能な時間短縮を期待する一方、弁護人と裁判所は信頼できる作成者情報、開示、監査記録を必要としている。
成功する国家プログラムは、導入後に追加される障害としてこれらの要件を扱うことはできない。情報がモデルに入力された瞬間から、出所の追跡可能性をワークフローの一部にしなければならない。
つまり、承認済みシステムには改ざん不能なログ、明確に定義された権限、保存されたプロンプト、出力のラベル付け、明確な人による承認が必要となる。警察組織には、生成ソフトウェアに決して委ねるべきではない業務を特定する規則も必要だ。
Google Newsによる注目が重要なのは、このガバナンス上の空白を広い層に示すからだ。市民は、警察がAIを利用すべきかどうかだけを問われているのではない。AIが個人の事件にどこで影響を与えたのかを、警察が正確に示せるのかを問われている。
本当の対立は、迅速な書類作成と検証可能な証拠の間にある
生成AIは事務作業を圧縮できるが、刑事司法は作成者、出所、目的が不明な文章を受け入れることはできない。
大規模言語モデルは、学習時に得たパターンから、ありそうな語の連なりを予測して文章を生成する。記述が正確、公正、完全、または法的に許容されるかを独立して判断するわけではない。
この仕組みにより、日常的な草案作成には役立つ。一方で、枠組みの設定にも反応する。中立的な要約を求めるプロンプトと、起訴のための最も強い主張を求めるプロンプトでは、異なる文書が生成される可能性がある。
モデルが不完全なメモを受け取る場合、プロンプトの表現は特に重大な意味を持つ。出力は、裏付けとなる事実を強調し、矛盾を軽視し、原資料が正当化しないほど確信をもって詳細を結び付ける場合がある。
人間の作成者も偏った要約を作ることはある。違いは、自動化が初めて偏りを生んだわけではないという点だ。
違いは、規模、不透明性、そして誤った確信にある。チャットボットは多数のファイルを迅速に変換でき、流暢な出力は、急いで確認するなかで根拠のない表現を見つけにくくする。
刑事事件は、それぞれ異なる役割に依存している。証人は自らが経験したことを説明し、捜査官は情報を収集・検証し、検察官は起訴基準を評価し、裁判所は資料にどの程度の重みを与えるべきかを判断する。
生成AIによる草案作成は、こうした境界を曖昧にし得る。警察官がソフトウェアに被害者の陳述を強化するよう求めれば、出来上がった文章は、被害者自身の表現よりも警察官の目的やモデルの言い回しを反映する可能性がある。
同じ懸念は検察官向けの要約にも当てはまる。起訴を支持するよう指示されたモデルは、中立的な事件整理を装った主張を作り出す可能性がある。
だからこそ、人による確認だけでは不十分な保護策となる。確認者は、出力を各情報源と照合し、その出力を形作ったプロンプトを理解しなければ、すべての合成的な推論を確実に見抜くことはできない。
効果的な確認には、自動化によって節約されるはずだった時間がかかる可能性がある。職員が情報源レベルで比較せずに洗練された文章を承認するだけなら、人による監督は形式的なチェックボックスに過ぎなくなる。
リスクは、もっともらしいが裏付けのない情報を生成するハルシネーションにとどまらない。モデルは事実に基づいていても、選択的な強調によって誤解を招く文書を作成し得る。
不確実性を省いたり、無関係な事実の横に疑惑を配置したり、慎重な情報源の表現を断定的な文章に置き換えたりすることがある。こうした失敗のいずれにも、架空の人物名や出来事は必要ない。
したがって、ダービーシャーで疑われているAI証拠の利用は、効率性と検証可能性のトレードオフを示している。警察は一部の変換作業を自動化できるが、重要な主張のすべてと原典との信頼できるつながりを維持しなければならない。
擁護可能なアプローチの一つは、モデルの利用を明確に限定された作業に制限することだ。面談録音の文字起こし、文書の翻訳、重複の特定は、証人の供述を最大限の印象を与えるよう書き換えることとは異なるリスクを伴う。
限定された用途であっても検証は必要である。音声認識は言葉を聞き違える可能性があり、翻訳は法的な意味を変えてしまう可能性があり、分類システムは関連する証拠を見落とす可能性がある。
しかし、これらの作業は固定された原典と照合できる。自由形式の文章作成は、新たな言葉遣い、構成、強調を生み出すため、変換過程の監査をより困難にする。
政府によるPoliceAIの開始は、トリアージ、開示、要約を重視している。それぞれのカテゴリーには、なお正確な運用上の定義が必要だ。
トリアージは、確認対象のファイルを優先順位付けすることを意味する場合もあれば、一部のファイルを無関係と判断することを意味する場合もある。要約は内部向けのナビゲーション支援を作成する場合もあれば、検察に直接送付される文章を作成する場合もある。
こうした違いによって、AIの出力が事件に影響を与え得るかどうかが決まるべきだ。また、ログ記録、レビュー、開示、異議申立てに関する要件も、それによって決めるべきである。
承認されたあらゆるワークフローには、どのモデルを実行したか、どのバージョンを使用したか、どのソースデータを受け取ったか、どのプロンプトが出力を制御したかを示す、可視化された記録が必要である。人間による編集もすべて記録しなければならない。
その連鎖がなければ、弁護側はシステムの寄与に意味のある形で異議を唱えられない。検察は受領したものを確信を持って証明できず、裁判所も、見かけ上の供述が本人の真正な説明を表すものかどうかを判断できない。
人間が責任を負うと宣言するだけでは、この対立は解消しない。追跡可能性のない責任は、失敗後に誰を責めるかを捜査官に示すが、失敗そのものを防ぐものではない。
以前のCopilotの失敗が示す監査証跡の重要性
英国の警察にはすでに、AIが生成した主張が内部レビューをすり抜け、重大な公的判断に影響を与え得るという警告があった。
West Midlands Policeは、Maccabi Tel AvivとのAston VillaのEuropa League戦に関連する情報評価に虚偽情報が記載された後、厳しい検証にさらされた。
この評価では、実際には開催されていないMaccabi Tel Aviv対West Hamの試合に言及していた。その存在しない出来事は、Aston Villa戦を高リスクと分類する根拠を支える資料の中で用いられた。
当局は最終的に、遠征サポーターが2025年11月の試合を観戦することを禁止した。AIの問題が完全に知られる前から、この判断は政治的・世論上の批判を集めていた。
警察幹部は当初、この虚偽の主張はインターネットまたはソーシャルメディアの調査に由来すると説明した。その後、同警察はMicrosoft Copilotがこの情報を生成したことを認めた。
元Chief ConstableのCraig Guildfordは、システムの役割を知った後、議会委員会に謝罪した。彼はそれ以前、当該作業にAIを使用していないと議員らに説明していた。
後の独立調査では、この虚偽資料がどのように作成されたかについて、上級指導部が当初正確な情報を受け取っていなかったことが判明した。この事例は、当局者が直接質問を受けていても、組織がAI利用の実態を見失う可能性を示した。
Guildfordはその後、この論争のさなかに退任した。この事例は、モデルの信頼性と組織的説明責任の双方に関する警鐘となった。
失敗は、Copilotがサッカーの試合をでっち上げたことだけではない。職員はその主張を公式分析に取り込み、内部レビューはそれを除去できず、幹部は出所について誤った説明を行った。
この一連の流れは、ダービーシャーにおける中心的なリスクと似ている。AIが生成した、あるいはAIによって形作られた資料は、明示的なラベルや保持された監査記録なしに公式文書へ入り込むと、封じ込めが難しくなる。
両事例は同一ではない。West Midlandsの事案は公共安全上の判断を支える情報に関するものだった一方、ダービーシャーでの疑惑は個別の刑事事件に関連する資料に関するものだ。
ダービーシャーの調査では、法的な重大性がより高い可能性がある。文書は、容疑者が起訴されるか、被告人が答弁取引を受け入れるか、量刑時に裁判官が被害をどのように理解するかに影響を与え得る。
それでも、この歴史的比較は同じ統治上の弱点を明らかにする。組織は、自らの記録内で確実に特定できない技術を監督することはできない。
以前の失敗はまた、上級レベルのレビューが明白な誤りを見つけるという安心感のある前提に疑問を投げかける。基本的な試合記録だけで反証できた参照を含む文書を、複数の専門家が扱っていた。
刑事事件のファイルは、サッカーの日程よりはるかに複雑であることが多い。そこには面談記録、医療記録、端末からの抽出データ、メッセージ、専門家証拠、食い違う記憶が含まれる場合がある。
裏付けのない一文は、その膨大な量の中でより容易に隠れ得る。その後、要約、起訴文書、裁判所への申立書、通信文書にわたって繰り返され、反復によって見かけ上の信頼性を得る可能性がある。
だからこそ、来歴情報はコピー後も維持されなければならない。元のチャットボット出力にだけ付けられたラベルは、職員が文章を別のシステムへ貼り付ければ役に立たなくなる。
ラベルは、すべての下流文書を通じて内容に追随する必要がある。レビュアーはまた、生成された記述から、それを裏付ける正確な原典の箇所へ戻れるべきだ。
West Midlandsの事例はさらに、当局が「AI assisted」のような曖昧な表現を避けなければならない理由を示している。この言葉は、スペル修正、検索、翻訳、要約、リスクスコアリング、文書全体の生成まで含み得る。
それぞれの利用は、正確性と説明責任に異なる影響を与える。監督機関には、人間が関与し続けているという大まかな保証ではなく、作業レベルの記録が必要である。
ダービーシャーの調査は、警察官が現地の指針を受けていたか、そのツールが承認されていたか、監督者がAIが文書を形作ったことを認識していたかを明らかにすべきである。また、疑われる行為がどのように発見されたかも確定すべきだ。
公的報道は、これらの疑問に答えていない。使用されたチャットボットを特定しておらず、プロンプトも明らかにしておらず、機微な事件情報が外部サービスに入力されたかどうかも確定していない。
この検証上の空白は、警察官の意図について早まった結論を避ける理由となるべきだ。しかし、影響を受けたファイルをレビューする緊急性を低下させるべきではない。
疑わしい表現が有罪判決に影響したのであれば、司法制度はその誤りが重大だったかどうかを判断しなければならない。結果に影響していなかったとしても、捜査当局は著者が不明確なままになることを許した記録管理の失敗に対処しなければならない。
調査がなお確定しなければならないこと
最も重要な未解決の問題は、AIが事件業務に登場したかどうかではなく、その出力が判断を変えたり、被告人の権利を損なったりしたかどうかである。
司法の運営を妨害したとの疑いは重大である。これは司法の運営に干渉し得る行為を意味するが、疑いは認定ではない。
捜査官はまず、警察官がシステムに何をさせようとしたのかを確定しなければならない。より明確な文法を求めることと、望ましい法的結果を確保するために設計された表現を求めることには、重大な違いがある。
次に、生成されたすべての文章を基礎記録と比較しなければならない。このレビューでは、捏造された事実、変更された引用、裏付けのない推論、省略、語調の変化を特定すべきである。
次の問題は配布に関するものだ。捜査官は、どの出力が個人の下書きにとどまり、どれが警察システムに入り、どれが検察、弁護側、証人、裁判所に届いたのかを判断する必要がある。
また、各文書を誰が承認したのかも特定しなければならない。生成された一文は、判断に影響する前に、監督者、事件レビュー担当官、検察官、その他の専門家を経由していた可能性がある。
開示もまた重要な問題である。England and Walesでは、捜査官と検察官は、訴追を弱めたり弁護側を助けたりする可能性のある情報を含め、未使用資料を公正に取り扱わなければならない。
すべての原ファイルが利用可能なままであっても、偏った要約はそのプロセスを歪め得る。人間の読者は大規模な事件を読み解くために要約に依存しており、初期の枠付けが次に何を調べるかを形作る可能性がある。
CPSは、影響を受けた被告人がAIの関与について十分な情報を受け取ったかを評価しなければならない。弁護人は、開示されていないプロンプト、下書き、モデル出力が事件記録の一部を構成すべきだったと主張する可能性がある。
その後、裁判所は不備が有罪判決を不安全なものにしたかどうかを判断する必要があるかもしれない。手続上の失敗が影響を受けたすべての事件を自動的に無効にするわけではなく、各結果はその事実関係に左右される。
レビュー対象となった有罪判決の公表件数は依然として不明確である。報道では複数のレイプ有罪判決に言及しているが、当局は完全な事件件数を公表していない。
この不確実性のため、広範な主張は不適切である。AI生成テキストが冤罪を引き起こした、量刑を変えた、あるいは裁判で捏造された事実を持ち込んだことは、まだ確定していない。
調査ではデータ保護についても検討すべきだ。警察の事件ファイルには、医療上の詳細、住所、犯罪歴、証人の身元、その他の極めて機微な情報が含まれ得る。
これらの記録が未承認の外部チャットボットに入力されていた場合、警察は情報がどこで処理され、保持され、または使用されたのかを判断する必要がある。この懸念は、生成された文章の正確性とは別個のものである。
ツールの識別も同じ理由で重要だ。厳格な保持管理を備えた内部ホスト型システムは、個人アカウントを通じてアクセスされる消費者向けチャットボットとは異なるセキュリティプロファイルを示す。
どちらの導入モデルも、証拠上の問題を解決するものではない。安全なソフトウェアでも偏った、あるいは裏付けのない表現を生成し得るが、そのログは再構成を容易にする可能性がある。
最初に注目すべき兆候は、事件レビューの範囲である。影響を受けた捜査、訴追、有罪判決、文書の件数を透明性をもって示せば、この事案が孤立したものか、組織的なものかが分かる。
完全な記録を伴う限定的なレビューであれば、警察活動が広範な文書化危機に直面しているという主張は弱まる。事件数の増加やログの欠落があれば、その主張は強まるだろう。
二つ目の兆候は、PoliceAI、Home Office、またはCollege of Policingによる正式な指針である。最も有用な規則は、分析支援と、証人・証拠・裁判所向け文書の著者となることを区別するものだろう。
出力を確認するよう求める一般的な注意喚起では、ほとんど効果がない。作業別の禁止事項、必須の開示、保持されたプロンプト、監査可能な原典引用は、当局者が失敗の仕組みを理解していることを示すだろう。
三つ目の兆候は法的対応である。検察、第一審裁判所、控訴裁判所による判断は、既存の開示・証拠規則が生成AIによる汚染を扱えるかどうかを明らかにする。
既存の手続きを通じて問題を特定・是正することに成功したレビューは、管理された導入を支持することになる。被告人がAIによって形作られた資料を追跡または争えなかったという認定は、より深い法的な空白を露呈する。
警察組織は、こうした結果を待ってから管理を厳格化すべきではない。承認済みツールの棚卸し、未承認サービスの遮断、ログの保存、生成テキストへの明示的なラベル表示を直ちに実施できる。
また、保護対象とする文書カテゴリーを定義することもできる。証人供述書、被害者影響陳述書、起訴に関する勧告、開示スケジュール、裁判所提出書類には、社内会議メモよりも強い制限が必要だ。
研修では、技術的な限界だけでなくインセンティブも扱わなければならない。大量の案件を抱える警察官は、流暢な自動化を実用的な近道と見なしかねない。とりわけ、評価指標が処理速度や完了した案件ファイルに報いる場合はそうだ。
そのため管理職は、削減された時間だけでなく、修正負担、開示の質、証拠の信頼性も測定する必要がある。さもなければ、効率化目標がよりリスクの高い利用を静かに促すことになる。
警察以外のナレッジワーカーにとっても、教訓は同様に明確だ。生成された要約は、誰もそれを最終的な証拠として扱っていなくても、重大な意思決定を導き得る。
AIが規制対象または高リスクの業務を支援する場合、チームはソース、プロンプト、改訂履歴を保存すべきである。検索可能なAI knowledge baseは追跡可能性を支えられるが、説明責任を伴うレビューの代わりにはならない。
Google Newsの報道は、すべての警察自動化が安全でないことの証明ではなく、ガバナンスの試金石として読むべきだ。一部のシステムは、検証のための固定された情報源を維持しながら、反復的な作業を減らせる可能性がある。
決定的な境界は、自動化が専門家による証拠の検証を助けるのか、それとも他者が証拠として受け入れる物語をひそかに作成するのか、という点にある。
公表される事案数、裁判所向け文書に関する全国的な規則、影響を受けた訴追に関わる最初の法的判断に注目したい。これらのシグナルは、英国の警察が検証可能なAI支援を構築しているのか、それとも脆弱なプロセスに速い言葉を加えているだけなのかを示すだろう。
PoliceAIは大幅な事務コスト削減を約束するが、ダービーシャーの調査がまず示したのは、より重要な基準である。重大な影響を及ぼすすべての文は、そのソース、作成者、プロンプト、レビュー担当者まで追跡できるのか。
当局がこの問いに一貫して答えられるようになるまでは、Google Newsでこの事案を追う読者は、効率化に関する主張を慎重に受け止めるべきだ。警察におけるAI導入の次の段階には、広範な保証を減らし、検証可能な記録を増やすことが求められる。



