Gemini Enterprise for Legal 承诺更安全的 AI,但律师仍需承担风险
在法院记录了数千起与 AI 相关的错误后,Google 推出了 Gemini Enterprise for Legal,直接检验专业模型能否防止错误诉讼文件的提交。
该产品与四家大型律师事务所一同进入预览阶段,并承诺提供基于已连接数据库的法律研究。Anthropic 通过 Claude Legal Solutions 采取了类似路径,而 xAI 则在为法律工作推广 Grok。这些公司押注于,更好的数据连接和工作流控制能够让生成式 AI 适用于诉讼业务。
但这一押注与令人不安的记录相冲突。律师在信任流畅的 AI 回答后,曾提交虚构案件、捏造引文并歪曲法律原则。法院则以罚款、谴责、转介和职业限制作为回应。因此,核心冲突并非 AI 与传统研究之间的对立,而是供应商控制的验证机制与律师不可委托的逐一核查义务之间的冲突。
Gemini Enterprise for Legal 将 AI 引入律所工作流
Google 将法律 AI 定位为受治理的工作流系统,而非一个恰好懂法律语言的聊天机器人。
Google 于 2026 年 8 月 25 日发布 Gemini Enterprise for Legal。该公司将其描述为面向律师事务所和企业法务部门的、更广泛企业平台的专业配置。
此次预览涉及 Cleary Gottlieb、Freshfields、Weil 和 Williams & Connolly。这些律所的参与让 Google 得以接触复杂的法律工作流,但并不能独立证明产品的准确性。
Gemini 法律平台结合了可复用技能、专业代理、治理控制以及与外部系统的连接器。其任务包括合同审阅、修订标记、监管监测、法律研究和诉讼支持。
连接器让模型能够在任务执行期间从另一个系统检索获授权的信息。这种设计可将 Gemini 与 Everlaw 和 NetDocuments 等平台连接,同时保留现有用户权限。
这一差别很重要,因为通用模型通常依据训练期间学习的模式作答。即使所引用的裁决根本不存在,它也可能生成看似可信的引文。
相比之下,已连接的法律系统可以从指定资料库中检索文件。其回答能够将用户引向底层材料,并保留可追溯至来源的路径。
Google 表示,访问控制、审计日志和政策执行机制贯穿该法律产品。该公司还称,客户提示、文件和输出不会被用于训练面向其他客户的模型。
这些保护措施解决了虚构案件以外的多项担忧。律师事务所必须维护客户机密性、保护享有特权的材料,并在不同事项之间执行伦理隔离。即便模型准确性极高,若会将一名客户的文件暴露给另一团队,它仍不适合使用。
这一架构也反映了法律工作的实际开展方式。律师很少把研究当作孤立的问答练习。研究结果会进入备忘录,备忘录又影响草案,随后进入审阅和审批流程。
Gemini Enterprise for Legal 旨在贯穿这些阶段。该模型可以搜索已连接的记录、生成草案,并通过受治理的系统传递信息。
这比要求公共聊天机器人记住判例法更可信。不过,它改变了风险所在的位置,而非消除了风险。
当检索遗漏具有约束力的案件、将过时权威排得过高,或抽取脱离限制性背景的段落时,都可能出现错误。模型也可能准确引用真实裁决,却错误描述法院的裁定内容。
Google 在自身表述中承认了这一问题的一部分。该公司称,如果缺少治理、领域专业知识和与权威系统的连接,基础模型智能不足以支持法律实践。
这正是此次发布的真正意义。Google 不再只向律师销售一个能力强大的模型,而是在销售一个置于模型、律所记录和律师最终工作成果之间的机构层。
这使 Gemini Enterprise for Legal 成为既有法律科技提供商的严肃竞争者,也让 Google 有责任证明其防护措施能在诉讼压力下发挥作用。
法律 AI 工具正向相同架构竞速
领先产品日益依赖已连接的信息源、权限和专业工作流,而不是缺乏依据的模型记忆。
Anthropic 于 2026 年 5 月扩展了其法律产品,新增超过 20 个连接器和 12 个执业领域插件。这些连接器将 Claude 与法律研究、文档管理、证据开示和合同平台连接起来。
该公司的 Claude 法律部署涵盖合同修订标记、并购审查、监管监测、隐私评估和诉讼准备。Anthropic 表示,法律专业人士已成为其知识工作用户中参与度最高的群体。
插件为特定法律领域提供任务指令和可重复执行的程序。连接器则提供执行这些程序所需的底层文件和系统访问权限。
这些组件共同构成检索增强生成,通常称为 RAG。该方法会在请求期间向模型提供精选文件,而不是只依赖训练期间编码的信息。
RAG 可以减少一种明显的失效模式。如果系统在给出引文前必须检索真实判决书,它从记忆中编造案件名称的机会就更少。
这一防护措施很有意义,但它只覆盖法律准确性的一部分。检索到的案件可能真实存在,但其程序阶段、管辖权或先例地位可能使其不具相关性。
模型还可能从异议意见、一方当事人的论点,或对已被推翻标准的描述中提取文字。引文确实存在,但法律结论仍然错误。
因此,Google 和 Anthropic 的竞争不只是模型质量之争,更是它们与可信数据库的连接、工作流整合、治理和证据呈现能力之争。
既有提供商已经拥有其中一些优势。Thomson Reuters 控制着 Westlaw 和 CoCounsel,LexisNexis 则运营广泛的法律研究资料库和 Lexis+ AI。
这些公司花费数十年整理案件、法规、评论和引文关系。它们还维护工具,在某项权威依据受到负面处理时提醒律师。
基础模型公司则具备不同优势。它们的系统可以综合长篇记录、遵循复杂指令,并跨文件、通信工具和生产力软件开展工作。
这既带来合作,也带来竞争压力。Anthropic 可以将 Claude 连接至 Thomson Reuters 服务,但 Claude 也可能成为律师访问这些服务的界面。
Google 遵循同样的平台逻辑。它无需替代每一个法律数据库,而是可以将 Gemini 置于多个系统之上,并协调跨系统工作。
xAI 正在为 Grok 推广更广泛的愿景。其 法律解决方案页面宣传研究、起草、合同分析、尽职调查和合规监测。
不过,该公开页面对引文验证或获取第一手法律资料的细节披露有限,其性能主张也缺乏可比的独立法律审计。
这一点很重要,因为 Grok 已出现在一宗重要制裁案件中。安大略省律师协会审裁处认定,律师 Shahryar Mazaheri 在准备动议材料时依赖了 Grok。
由此产生的文件包含不存在的权威依据、缺乏支持的命题,以及对程序规则的错误运用。这一事件表明,仅有“法律”标签并不能证明可靠性。
产品竞赛正朝着一个共同命题发展:通用模型在权威数据、严格指令、访问控制和人工审查的环绕下会变得更安全。
尚未解决的问题是,这些层级能否持续防止错误,还是仅仅让错误答案看起来拥有更专业的来源。
法律 AI 幻觉问题不止于虚构案件
真实引文仍可能支撑错误答案,因此核查远不只是确认案件是否存在。
最引人注目的法律 AI 失败案例涉及虚构案件。这些事件容易理解,因为所引用的权威依据无法在任何合法数据库中找到。
2025 年 7 月,一名联邦法官制裁了代表阿拉巴马州监狱官员的三名律师。其中两份提交文件在一名律师使用 ChatGPT 进行研究且未核实输出后,包含了伪造的案件引文。
法官将这些律师从案件中移除,并将此事转介至阿拉巴马州律师协会。她称,未核实材料的行为构成极端鲁莽。
法院制裁之所以受到关注,是因为案件涉及一家知名律所和高风险的监狱诉讼。自 2020 年以来,阿拉巴马州已向该律所支付超过 4,000 万美元。
问题并未止于该案。法官们还面对过虚构先例、不准确引文,以及援引真实裁决来支持这些裁决从未确立过的命题的提交文件。
Mazaheri 的案件说明了这种模式的代价可能有多高。2026 年 6 月,安大略省审裁处在两项未获成功的动议之后,命令他支付 31,150 加元的费用。
审裁处将其疏忽使用 AI 视为显著的加重因素。他的陈述援引了虚构裁决,以及并不支持其论点的真实权威依据。
涉及 AI 幻觉材料的加拿大已报道裁决数量,从 2024 年的 7 起上升至 2025 年的 86 起。2026 年第一季度又出现了 39 起。
这些数字来自审裁处对 CanLII 已报道案件的讨论。它们追踪的是公开裁决,而非律所内部每一起存在缺陷的 AI 工作。
审裁处强调,大语言模型不会行使判断,也不具备道德指南针。它还指出,这类系统倾向于给出答案,而不是承认不确定性。
这种倾向带来的不只是虚构引文。它还可能生成错误规则、遗漏例外、错误陈述期限,或混合不同管辖区的标准。
这些错误更难发现,因为每个组成部分看起来都可能合理。案件确实存在,被引用的文字似乎也出现在某处,回答还很像一份常规法律备忘录。
因此,法律幻觉不应仅指编造来源,也包括错误声称某一来源支持某项陈述。
这一更广泛的定义塑造了 Stanford RegLab 对商业法律研究系统的评估。研究人员使用超过 200 个法律问题测试了 Lexis+ AI、Westlaw AI-Assisted Research 和 Ask Practical Law AI。
经同行评审的 法律 AI 研究发现,这些专业系统的幻觉发生率低于通用 GPT-4 系统。然而,误导性或错误答案仍然常见。
超过六分之一的查询导致 Lexis+ AI 和 Ask Practical Law AI 提供误导性或错误信息。Westlaw AI-Assisted Research 在约三分之一的测试回答中出现幻觉。
Lexis+ AI 对 65% 的问题给出了准确且有依据的答案。Westlaw 的这一比例约为 41%,Ask Practical Law AI 则为 19%。
研究人员还发现,系统在拒答行为上存在显著差异。Ask Practical Law AI 对 62% 的测试查询提供了不完整的答案。
这些结果需要谨慎解读。测试发生在多次后续产品更新之前,因此并未衡量每个系统当前版本的表现。
该研究也未评估 Gemini Enterprise for Legal 或 Anthropic 的 2026 年法律产品套件。目前尚无可比的独立公开审计确定它们的错误率。
不过,这项研究揭示了一个持久存在的局限性:将模型连接到可信数据库,并不能保证其综合分析会忠实呈现检索到的材料。
一份法律回答涉及多个层面的正确性。相关权威依据必须真实存在、仍然有效、适用于相关司法辖区,并且能够支持所陈述的主张。
模型还必须区分具有约束力的先例与具有说服力的权威依据。它必须保留会影响规则适用方式的例外、程序细节和事实差异。
链接只能证明某个来源存在。它无法证明模型理解了该来源、选取了正确段落,或得出了站得住脚的结论。
为什么核查仍是律师的职责
法律 AI 可以重新组织核查流程,但无法将职业责任从律师转移给供应商。
法院通常不会仅因律师使用 AI 而对其实施制裁。只有当律师未完成职业规则本已要求的审查,却提交了不可靠的工作成果时,才会承担后果。
这一区别对法律 AI 行业至关重要。供应商可以增加引文检查和来源链接,但提交文件的律师仍要在文件上签字。
签名所代表的不只是作者身份。它向法院表明,律师已经进行了合理调查,并相信法律内容具有适当依据。
没有任何产品标签能够改变这项义务。模型的基准测试分数、企业安全认证,或与知名研究平台的连接也同样不能改变它。
Gemini Enterprise for Legal 可以通过在生成文本旁展示支持文件,使核查更加容易。它还可以记录任务过程中查阅过的系统。
Claude Legal Solutions 可以利用已连接的法律数据库和律所文件。这让审查人员拥有比缺乏依据的聊天机器人回答更好的起点。
这些功能可以减少定位证据所需的时间。它们还可以在文件提交至法院前,暴露草稿与所引来源之间的矛盾。
但同样的便利也会带来自动化偏见风险。当软件已经将答案标记为“有依据”或“已验证”时,审查人员可能会降低核查来源的严谨程度。
精致的界面可能会放大这种效应。引文、置信度指标和文档链接会让输出看似完整,即使其法律推理仍然薄弱。
因此,律所需要覆盖整个工作流的控制措施。它们必须决定 AI 可以执行哪些任务、可以访问哪些数据,以及由谁审查每项输出。
一项有效的控制措施可以要求律师在文件进入下一流程前打开每一项引用的权威依据。另一项措施则可以将引文与原文进行比对,并标记缺乏依据的主张。
律所还可以保留提示词、检索文件、模型回答、修改记录和最终批准的记录。这些记录有助于主管调查错误,并改进未来流程。
然而,记录日志本身并不能带来胜任能力。审查人员必须充分理解相关法律,才能识别模型何时检索了错误来源或遗漏了例外情况。
这为律所带来了培训问题。初级律师传统上通过法律研究、文件审查和起草工作培养判断力。
而这些正是法律 AI 产品承诺加速完成的任务。如果软件消除了过多基础性工作,律所可能会削弱培养有经验审查人员的人才管道。
Google 总法律顾问 Halimah DeLaine Prado 将 AI 描述为律师的补充,而非替代者。她认为,法律实践仍然依赖人类判断。
这一立场与这些公司的产品表述一致。Google 和 Anthropic 都强调律师应保持控制权,同时又在推广能够完成日益复杂工作流的智能体。
随着这些智能体获得更多自主性,这种矛盾将愈发尖锐。节省时间意味着系统必须在没有持续人工指导的情况下作出更多中间决策。
每增加一个决策,就增加一个可能丢失上下文的环节。模型可能在同一条链路中选择文件、总结文件、起草论点并建议行动。
审查人员面对的将是被压缩后的最终产品,而不是各个独立的推理步骤。除非系统清晰展示其证据,否则更快的工作流反而会更难审计。
法律团队应将 AI 输出视为研究线索或草稿,而非权威依据。每一项重要主张都必须回溯至一手来源或可信的法律研究服务。
这一原则同样适用于诉讼之外。合同摘要应与协议原文核对,监管提醒则应与正式规则进行比对。
管理大量证据集合的组织也可以从可搜索的 AI knowledge base 中获益。其价值在于可追溯性,而不是取代专家审查。
这种做法保留了法律 AI 最强的优势。模型可以帮助专业人士查找、组织和比较信息,而无需成为信息含义的最终裁判者。
真正的权衡是速度与审查能力
法律 AI 只有在核查其工作成果的成本低于手动完成工作的成本时,才能真正节省时间。
供应商常将法律 AI 描述为能在几分钟内完成数天研究工作的工具。对于一个建立在耗时文件分析之上的行业而言,这一承诺颇具吸引力。
但当每一句话都需要重新核实,这笔账就不那么划算了。一份包含多项权威依据的长篇回答,可能比经验丰富的律师进行一次聚焦检索带来更多审查工作。
斯坦福研究发现,更长的回答会产生更多可被证伪的主张。每增加一项主张和引文,都需要单独评估。
这表明,回答长度不仅仅是呈现方式的选择。它也是风险和劳动量变量。
与立即生成一份优雅的备忘录相比,能够返回简短、审慎且来源明确回答的系统可能更有用。较短的输出缩小了隐藏错误的暴露面。
拒答行为同样可能具有价值。在法律实践中,坦诚说明现有来源不足以支持某一答案,往往比看似合理的综合分析更安全。
这带来了艰难的产品设计权衡。用户通常偏好能够完整作答的助手,但法律可靠性有时要求系统停止回答。
因此,供应商应披露的不应只是基准准确率。买方还需要知道系统拒答的频率、检索过时权威依据的频率、错误陈述判决要旨的频率,以及在误导性提示下失效的情况。
他们还需要针对具体任务的评估。合同提取、案例研究、特权审查和诉状起草会呈现不同的错误模式。
在广泛法律推理上的高分,并不能证明系统已准备好用于每一种工作流。对于严格司法辖区和时间限制下的引文保真度,它可能几乎说明不了什么。
律所在大规模部署前,应以自身案件测试产品。现实的评估可以使用已结案件、已知研究问题和刻意设计的误导性提示。
审查人员可以衡量系统是否找到了具有控制力的权威依据、是否保留了引文原文,以及是否遵守访问权限。他们还应记录核实每份回答所需的时间。
这会产生比原始生成速度更有用的指标。真正相关的衡量标准是每小时完成的经核实工作量,而不是每分钟生成的字数。
专业法律 AI 仍然可以改善这一指标。连接器可以减少查找文件的工作,结构化输出则可帮助律师比较证据并识别缺失信息。
不同任务的收益会有所不同。文件分类和条款提取比新颖的法律论证拥有更清晰的参照标准。
对尚未确定法律问题的研究风险更大。模型必须解读相互冲突的权威依据、程序差异和不完整的先例。
诉讼还会因对抗性审查而提高要求。对方律师有动机揭露每一处不准确的引文、引述和表述。
这种环境使法律 AI 不同于风险较低的写作助手。一个微小的事实错误就可能损害客户利益、削弱可信度,并触发纪律调查。
因此,律所在采用软件的同时,必须为审查能力预留资源。在不扩大监督范围的情况下部署更多 AI,可能会将更大规模的未经核实材料推向同一批律师。
在这种情形下,技术并未消除工作。它只是将工作从初始研究转移到后续验证,有时还要在更紧迫的截止日期下完成。
成功的系统应当让其不确定性可见,并让其来源易于检查。它还应保留检索证据与生成式解释之间的边界。
最先持续做到这些的产品,将通过经过衡量的表现赢得信任。仅凭营销主张无法解决这一问题。
什么将证明 Gemini Enterprise for Legal 是否有效
下一阶段应依据独立错误测试、真实采用模式,以及部署后的制裁记录来评判。
第一个信号是对 Gemini Enterprise for Legal 和 Claude Legal Solutions 的独立评估。研究人员需要获得当前产品和真实法律任务的访问权限。
此类测试应区分虚构引文与更隐蔽的失败情况。它应审查错误的判决要旨、遗漏的权威依据、过时法律以及缺乏依据的引述。
结果还应区分由底层模型造成的失败,与由检索或工作流配置造成的失败。这一区别将显示哪些保障措施真正降低了风险。
强有力的独立结果将支持这些公司关于连接器和治理机制提升可靠性的主张。即使表现优于通用聊天机器人,持续两位数的错误率仍会削弱这一主张。
第二个信号是试用律所如何使用这些产品。如果律师仅将 AI 限制用于摘要、行政任务或低风险内部草稿,广泛访问的意义就不大。
真正的采用应涵盖多个业务组中受到监督的研究、证据开示分析、合同审查和诉讼准备。律所应披露足够的方法信息,以便买方解读所报告的收益。
审查负担与使用情况同样重要。如果律师节省了生成时间,却花费相近时长验证输出,其经济合理性就会变得更有限。
第三个信号是专业工具普及后法院制裁的模式。重要的问题并不是所有与 AI 相关的错误是否都会消失。
相反,观察者应关注:通过受治理的法律系统生成的提交文件,是否比通过通用聊天机器人生成的文件包含更少虚构或错误表述的权威依据。
错误率下降将进一步证明专用平台的价值。若制裁持续出现,则说明产品控制措施无法弥补监督薄弱或审查仓促的问题。
法院短期内不太可能将责任转移给供应商。其裁定始终聚焦于律师既有的胜任能力、坦诚义务和合理核查义务。
这让 Gemini Enterprise for Legal 承担起一项严苛职责:它必须加速法律工作,同时又不能鼓励用户将生成的推理视为已经核实的法律结论。
Google、Anthropic、Thomson Reuters、LexisNexis 和 xAI 都在争夺这一市场的不同部分。它们的产品各不相同,但都必须面对同样的机构现实。
律师可以委托检索、整理、比较和起草工作,但不能委托对提交给法官内容所承担的责任。
最稳妥的采用路径,应从可追溯的任务和可衡量的审查程序开始。团队应在扩大代理权限之前,要求对源级证据进行核实。
对于正在评估法律 AI 工具的读者,决定性问题并不是模型是否听起来像律师。应当问的是:每一项重要主张,是否都能由律师追溯、核查并加以辩护。



