德比郡高级侦探因涉嫌使用 AI 证据面临调查
Google News 再次将英国警务体系核心的一场令人不安的冲突带入公众视野。一名德比郡高级侦探因涉嫌在多起案件中使用 AI 而面临刑事调查。
德比郡警方表示,一名警员涉嫌使用人工智能系统制作证据材料。该警队已将这名身份未公开的警员调离一线岗位,并开始调查其是否涉嫌妨碍司法公正。
指控并不只是称该警员使用了未经授权的效率工具。报道显示,该系统可能协助准备了意在影响起诉、量刑或其他法律决定的文件。
这一差异使内部技术违规问题演变为对正当程序的潜在威胁。与此同时,英国政府正推动全国性的 PoliceAI 计划,以扩大人工智能在警务工作中的应用。
因此,核心冲突十分明确:警务领导者希望 AI 减少行政工作,而法院则要求每一项具有实质影响的表述都必须准确、可追溯,并可归责于具体个人。
此前的一场争议已经显示出其中的风险。西米德兰兹警方在评估一场备受关注的足球比赛时,曾依赖由 Microsoft Copilot 生成的错误信息。德比郡的指控则将担忧从情报收集推进到与个别刑事起诉相关的文件。
德比郡警方 AI 调查实际涵盖什么
此次调查涉及的是涉嫌操纵案件材料,而非无害地试用自动化语法或排版功能。
德比郡警方于 2026 年 6 月宣布,在接到涉嫌妨碍司法公正的指控后,已启动刑事调查。警方称,一名警员涉嫌在多起案件中使用 AI 系统制作证据材料。
该警员的姓名尚未公开。调查公开时,尚未宣布逮捕或提出刑事指控。这些细节很重要,因为相关说法仍属指控,调查尚未确定刑事责任。
警方还将该警员调离一线岗位。警方表示,正与英国皇家检察署(Crown Prosecution Service,通常简称 CPS)合作,并已通知新成立的全国性 PoliceAI 机构。
CPS 也另行确认,正在调查期间与德比郡警方合作。其参与表明,调查人员必须审查该警员的行为,以及此事对正在进行或已经完成的起诉可能产生的影响。
后续报道补充了更具体的指控。据报道,这名侦探使用生成式 AI 聊天机器人为检察官起草文件,并撰写受害者影响陈述。
受害者影响陈述说明犯罪行为如何影响受害者,并可能为量刑提供参考。它不应成为调查人员或软件系统在受害者本人陈述之外夸大伤害的机会。
根据法律新闻报道汇总的消息,该警员涉嫌提示聊天机器人最大化此类陈述的影响。该系统据称还被要求制作支持预期起诉结果的案件材料。
部分受影响文件涉及强奸案调查。据报道,一些定罪结果正接受审查,但官员未公开相关案件,也未披露确切数量。
“制作证据材料”这一表述涵盖多种可能行为。AI 系统可能重新整理已核实的笔记、起草摘要、润色陈述、省略相互矛盾的细节,或编造信息。
这些行为将带来截然不同的法律与伦理后果。公开报道尚未确认哪些文件包含不准确文本、这些文本如何进入案件档案,或法院是否依赖了它们。
证据与案件文书之间的区别同样需要谨慎对待。向检察官提供的简报并不等同于物证或证人的原始证词。然而,带有倾向性的摘要仍可能影响起诉决定、信息披露、认罪谈判和庭审准备。
当流畅的语言掩盖了不确定的来源时,AI 证据尤为危险。即使一份文件的措辞源于提示词,而非证人、调查人员或经核实的记录,它也可能显得权威可信。
因此,调查必须重建完整的文件链路。这包括原始笔记、提示词、聊天机器人的输出、编辑记录、审批记录、披露记录,以及最终发送给检察官或法院的版本。
这正是事件的核心张力。被指控的行为不只是引入了事实错误,还可能模糊了关键陈述由谁撰写,以及特定措辞为何会出现在刑事案件中。
为什么 Google News 的报道令 PoliceAI 承压
该案迫使 PoliceAI 证明,在自动化起草成为常规工作之前,全国推广能够维护证据完整性。
这一时机对政府而言几乎再尴尬不过。英国内政部于 2026 年 6 月启动 PoliceAI,而德比郡相关指控在数日后便受到全国关注。
PoliceAI 是一个专业的国家级中心,旨在测试技术、制定标准,并为英格兰和威尔士各警队提供支持。政府希望它帮助警员分析数据、形成证据线索并减少行政工作。
政府表示,早期应用已显示出显著的时间节省效果。据称,在一起绑架案调查中,相关部门在三小时内审阅了 800 小时的视频素材,促成嫌疑人较早认罪。
政府称,另一个案例涉及翻译 50 万本电子书规模的数据。官员表示,该工作促成了一起有组织犯罪案件的逮捕。
这些案例涉及处理大量既有材料。它们与要求聊天机器人强化某种叙事,或制作旨在达成预设结果的陈述有着根本区别。
内政部计划在 2026 年和 2027 年期间,最多在 10 个警队开展试点。如果试点满足业务和保障要求,预计将在 2027 年更广泛推广。
政府预测,PoliceAI 最终每年可节省 600 万警员工时,并将这一能力描述为相当于新增约 3,000 名警员。
这些目标会促使机构自动化处理文书密集型任务。数字证据审查、信息披露、翻译、转录和摘要工作都会占用警方大量时间。
但效率不能成为唯一的成功衡量标准。如果律师必须花数月时间确认文件中的说法究竟来自证人还是语言模型,那么几分钟内完成的文件并不会带来任何公共利益。
政府的警方 AI 情况说明书将责任分配给内政部、各个警队、国家级警务组织及现有监管机构。当工具从试验阶段进入日常案件工作时,这种分散模式可能造成不确定性。
据报道,PoliceAI 负责人 Alex Murray 曾要求部分警队暂停某些 AI 用途,包括准备法庭陈述,直至相关保障措施制定完成。这一干预承认了一个关键界限:分析信息与撰写提交司法系统的材料之间存在根本差异。
德比郡警方 AI 案如今考验的是,自愿暂停与仍在形成中的指导方针能否足够迅速地约束行为。地方警队已可获得商业化聊天机器人和其他生成式工具。
警员无需接入国家级平台,就能将笔记粘贴到通用模型中。这类影子使用可能绕过获批采购、日志记录、安全审查和数据保留控制。
影子 AI 指员工在工作中使用未经批准的人工智能服务。它会带来常见的隐私问题,但刑事司法还增加了一项额外风险:隐藏的自动化可能污染日后必须在法庭上解释来源的材料。
因此,PoliceAI 面临双重压力。部长们期待看到可量化的时间节省,而辩护律师和法院则需要可靠的作者归属、信息披露和审计记录。
一个成功的国家级计划不能将这些要求视为部署之后才补上的障碍。它必须从信息进入模型的那一刻起,就将来源可追溯性纳入工作流程。
这意味着获批系统需要不可篡改的日志、明确的权限、保留的提示词、输出标识以及清晰的人工签核。各警队还需要规定哪些任务绝不应交由生成式软件完成。
Google News 的关注之所以重要,是因为它将这一治理缺口带给了更广泛的受众。公众面对的问题不只是警方是否应使用 AI,而是警方能否准确说明 AI 在何处影响了一个人的案件。
真正的冲突是更快的文书处理与可验证的证据之间的较量
生成式 AI 可以压缩行政工作,但刑事司法不能接受作者、来源和目的均不明确的文字。
大型语言模型通过预测基于训练中学习到的模式而可能出现的词序列来生成文本。它们无法独立判断一项陈述是否准确、公平、完整或具有法律可采性。
这种机制使其适合常规起草工作,也使其容易受表述框架影响。要求生成中立摘要的提示词,可能与寻求支持起诉的最强论点的提示词产生不同文件。
当模型接收的信息笔记并不完整时,提示词措辞的影响尤其重大。输出可能突出支持性事实、淡化矛盾,或比源材料所能支持的程度更有把握地串联细节。
人类作者同样可能写出带有偏见的摘要。区别并不在于自动化首次创造了偏见。
区别在于规模、不透明性以及错置的信心。聊天机器人能够迅速处理大量文件,而流畅的输出会使未经支持的表述在匆忙审查中难以发现。
刑事案件依赖不同角色的分工。证人描述自身经历,调查人员收集并检验信息,检察官评估起诉标准,法院决定材料应获得何种证明力。
生成式起草可能模糊这些边界。如果警员要求软件强化受害者陈述,最终文本反映的可能更多是警员的目标和模型的措辞,而非受害者本人的表达。
同样的担忧也适用于检察官摘要。被要求支持某项指控的模型,可能生成伪装成中立案件整理的辩护性表述。
这就是为什么仅靠人工审查并非完整保障措施。审查者若不逐一将输出与每项来源进行比对,并理解塑造文本的提示词,就无法可靠发现所有合成推断。
有效审查可能消耗掉自动化本应节省的时间。如果工作人员只是批准润色后的文本,而不进行源材料层面的比对,人工监督就会沦为形式化的勾选项。
风险并不止于幻觉,即生成看似合理却缺乏支持的信息。模型即使在事实上有所依据,也可能通过选择性强调制造误导性文件。
它可能省略不确定性,将指控与无关事实并列,或用肯定的表述取代来源中谨慎的措辞。这些失误都不需要凭空捏造姓名或事件。
因此,德比郡涉嫌使用 AI 证据一事,体现了效率与可验证性之间的权衡。警方可以将部分转换工作自动化,但必须保留每一项重要陈述与其原始来源之间可靠的关联。
一种可辩护的方法,是将模型的使用限制在边界清晰的任务中。转录访谈录音、翻译文件或识别重复内容,所涉及的风险不同于为了最大化影响力而重写证人陈述。
即使是有边界的使用也需要验证。语音识别可能听错词语,翻译可能改变法律含义,分类系统也可能遗漏相关证据。
不过,这些任务可以依据固定来源进行核查。开放式起草会产生新的语言、结构和侧重点,使这一转换过程更难审计。
政府的 PoliceAI launch 强调分流、证据披露和摘要。每一类别仍需要精确的操作性定义。
分流可能是指为文件审查排序,也可能是判定某些文件不相关。摘要可能生成内部导航辅助材料,也可能直接形成发送给检察官的文本。
这些差异应决定 AI 输出是否可以影响案件。它们也应决定日志记录、审查、披露和申诉要求。
任何获批的工作流程都需要有一份清晰可见的记录,说明运行的是哪个模型、使用了哪个版本、接收了哪些源数据,以及哪个提示词控制了输出。记录还必须涵盖每一项人工编辑。
没有这条链路,辩方团队就无法有意义地质疑系统所作的贡献。检察官无法有把握地认证其收到的内容,法院也无法评估表面上的陈述是否代表某个人的真实说法。
仅仅宣称仍由人类负责,无法解决这一冲突。没有可追溯性的责任,只能告诉调查人员在失败后该责怪谁,却无法防止失败发生。
一次更早的 Copilot 失误说明审计轨迹为何重要
英国警务部门此前已经得到警示:一项由 AI 生成的主张,可能通过内部审查并影响具有重大后果的公共决策。
西米德兰兹警察局在一份情报评估中出现虚假信息后,面临严密审查;该评估与阿斯顿维拉对阵特拉维夫马卡比的欧联杯比赛有关。
评估提到了一场从未举行过的特拉维夫马卡比对阵西汉姆联的比赛。这一不存在的赛事,被用于支持将阿斯顿维拉这场比赛定性为高风险的材料中。
当局最终禁止客队球迷参加 2025 年 11 月的比赛。在 AI 问题被完全披露前,这一决定已招致政治和公众批评。
警方领导层最初将这一虚假主张归因于互联网或社交媒体研究。该警队后来承认,相关信息由 Microsoft Copilot 生成。
前警察总长 Craig Guildford 在得知系统所起作用后,向议会委员会致歉。他此前曾告诉议员,警队并未将 AI 用于这项工作。
后续的一项独立审查发现,高级领导层最初并未获得关于虚假材料如何生成的准确信息。这一事件表明,即使官员面对直接提问,一个组织仍可能失去对 AI 使用情况的掌握。
Guildford 此后在争议中退休。这一事件成为有关模型可靠性和机构问责的警示。
这次失败并不只是 Copilot 虚构了一场足球比赛。工作人员将该主张纳入官方分析,内部审查未能将其剔除,而领导层则对其来源作出了错误解释。
这一连串情况与德比郡的核心风险相似。由 AI 生成或经 AI 塑造的材料,一旦在没有清晰标签和保留审计记录的情况下进入官方文件,就更难控制。
两起事件并不完全相同。西米德兰兹事件涉及支持公共安全决策的情报,而德比郡的指控则涉及与个别刑事案件相关的材料。
德比郡调查中的法律利害关系可能更高。一份文件可能影响嫌疑人是否被起诉、被告是否接受认罪协议,或法官在量刑时如何理解伤害后果。
尽管如此,历史比较暴露了同样的治理弱点。机构无法监督那些无法在自身记录中可靠识别的技术。
这次更早的失败也挑战了一种令人安心的假设:高级审查会发现明显错误。多名专业人士处理过一份文件,其中包含一项只要查阅基本赛程记录即可证伪的提及。
刑事案件卷宗通常比足球赛程复杂得多。它们可能包含访谈、医疗记录、设备提取数据、信息记录、专家证据以及相互矛盾的回忆。
一句缺乏支持的话更容易隐藏在这样的信息量之中。随后,它可能在摘要、起诉文件、法院申请或通信中被反复引用,直到重复本身赋予其表面上的可信度。
这就是为什么溯源信息必须在复制过程中得以保留。如果工作人员将文本粘贴到另一个系统,仅附在原始聊天机器人输出上的标签就会失去作用。
标签需要伴随内容进入每一份下游文件。审查者还应能够从生成的陈述追溯到支持它的确切原始段落。
西米德兰兹事件还表明,机构必须避免使用“AI assisted”这类含糊描述。这一说法可能涵盖拼写纠正、搜索、翻译、摘要、风险评分或完整文件生成。
每种使用方式对准确性和问责的影响都不同。监督机构需要任务层面的记录,而不是笼统保证人类仍然参与其中。
德比郡调查应澄清,警员是否收到本地指导意见、该工具是否获批,以及主管是否知晓 AI 塑造了这些文件。调查还应确定所谓行为是如何被发现的。
公开报道尚未回答这些问题。它们没有说明所涉聊天机器人,没有披露提示词,也没有确定敏感案件信息是否进入外部服务。
这一验证缺口应防止人们过早就该警员的意图下结论。但它不应降低审查受影响文件的紧迫性。
如果存在问题的措辞影响了定罪,司法系统必须确定该错误是否具有实质性影响。如果它没有影响结果,调查人员仍必须处理导致作者身份不确定的记录保存失误。
调查仍须查明什么
最重要的未决问题并非 AI 是否出现在案件工作中,而是其输出是否改变了决定,或损害了被告人的权利。
妨碍司法公正的指控十分严重。它意味着可能干扰司法运行的行为,但指控并不等于认定。
调查人员首先必须确定该警员要求系统执行什么任务。要求更清晰的语法,与要求设计旨在确保某一偏好法律结果的措辞,两者存在实质差异。
随后,他们必须将每一处生成段落与基础记录进行比对。这项审查应识别虚构事实、被改动的引述、缺乏支持的推论、遗漏以及语气变化。
下一个问题涉及传播范围。调查人员需要确定哪些输出仅留在个人草稿中,哪些进入警方系统,以及哪些送达检察官、辩方团队、证人或法院。
他们还必须识别每一份文件由谁批准。一句生成的文字在影响决定前,可能已经经过主管、案件审查警员、检察官或其他专业人士之手。
证据披露是另一个关键问题。在英格兰和威尔士,调查人员和检察官必须公平处理未使用材料,包括可能削弱控方指控或有助于辩方的信息。
即使每份原始文件仍可获取,一份倾向性的摘要也可能扭曲这一过程。人类读者依靠摘要浏览大型案件,早期的框架可能塑造他们接下来审查什么。
CPS 必须评估,受影响被告是否获得了关于 AI 参与的充分信息。辩护律师可能主张,未披露的提示词、草稿或模型输出本应构成案件记录的一部分。
法院随后可能需要决定,任何程序瑕疵是否使定罪不安全。程序性失误不会自动使每起受影响案件失效,每项结果都取决于其具体事实。
接受审查的定罪案件公开数量仍不清楚。报道提到数起强奸罪定罪,但官员尚未提供完整案件数量。
这种不确定性使宽泛主张并不恰当。目前尚未确定 AI 生成的文本是否导致错误定罪、改变刑期,或在审判中引入虚构事实。
调查还应审查数据保护问题。警方案件卷宗可能包含医疗细节、地址、犯罪记录、证人身份及其他高度敏感的信息。
如果这些记录进入未经批准的外部聊天机器人,警队将需要确定信息在哪里被处理、保留或使用。这一担忧与生成文本的准确性是相互独立的。
出于同样的原因,工具身份很重要。采用严格留存控制的内部托管系统,与通过个人账户访问的消费者聊天机器人相比,具有不同的安全状况。
这两种部署模式都无法解决证据问题。安全的软件仍可能生成有偏见或缺乏支持的措辞,但其日志可能使重建过程更容易。
第一个观察信号是案件审查的范围。受影响调查、起诉、定罪和文件的透明统计,将显示该事件是孤立的还是系统性的。
范围狭窄且记录完整的审查,会削弱有关警务面临广泛文件危机的论点。不断增加的案件或缺失的日志,则会加强这一论点。
第二个信号是来自 PoliceAI、内政部或警务学院的正式指导。最有用的规则应区分分析辅助,与证人文件、证据文件和面向法院文件的作者身份。
泛泛提醒核查输出作用不大。任务特定的禁令、强制披露、保留提示词以及可审计的来源引文,将表明官员理解了失败的机制。
第三个信号是法律回应。检察官、审判法院或上诉法院的决定,将揭示现有的披露和证据规则能否处理生成式 AI 污染。
若成功审查能通过现有程序识别并纠正问题,将支持受控采用。若调查发现被告无法追溯或质疑经 AI 塑造的材料,则会暴露更深层的法律缺口。
警队不应等到这些结果出现后才收紧控制措施。它们可以立即盘点获批工具、阻止未经授权的服务、保存日志,并要求对生成文本加注明确标签。
他们还可以定义受保护文件类别。证人陈述、受害者影响陈述、起诉建议、披露清单和法院提交材料,应当比内部会议记录受到更严格的限制。
培训不仅要涵盖技术局限,也必须关注激励机制。在案件负荷沉重的情况下,办案人员可能会把流畅的自动化视为实用捷径,尤其是在绩效指标奖励速度和结案数量时。
因此,管理者需要在节省时间之外,同时衡量更正负担、披露质量和证据可靠性。否则,效率目标会在不知不觉中鼓励风险更高的使用方式。
对于警务系统以外的知识工作者而言,这一教训同样直接。即使没有人将生成的摘要视为最终证据,它们也可能为具有重大影响的决策提供指引。
只要 AI 协助了受监管或高风险工作,团队就应保留来源、提示词和修订历史。可搜索的 AI knowledge base 可以支持可追溯性,但无法取代可问责的审查。
这则 Google News 报道应被视为一次治理测试,而非所有警务自动化都不安全的证据。一些系统能够减少重复性工作,同时保留可供核验的固定来源。
决定性的界限在于:自动化是帮助专业人员审查证据,还是悄然撰写他人将其当作证据接受的叙事。
应关注已公布的案件数量、面向法院文件的国家级规则,以及首批涉及受影响起诉案件的法律裁决。这些信号将显示,英国警务系统是在构建可验证的 AI 辅助,还是仅仅为脆弱的流程加入更快的语言生成。
PoliceAI 承诺可大幅节省行政成本,但德比郡调查确立了首先应关注的标准:每一句具有重大影响的表述,能否追溯到其来源、作者、提示词和审查者?
在官员能够持续一致地回答这个问题之前,通过 Google News 关注此案的读者都应谨慎看待效率方面的说法。警务 AI 采用的下一阶段,需要更少笼统的保证,以及更多可供检查的记录。



