top of page

Stephen Aarons 的 ChatGPT 诉状虚构证人,法院处以 5,000 美元罚款

52分钟前
讀畢需時 15 分鐘

Stephen Aarons 提交了一份由 ChatGPT 协助撰写的谋杀案上诉文件,其中包含虚构证人;新墨西哥州最高法院随后以藐视法庭为由对其处以 5,000 美元罚款。法院还将 Aarons 从该上诉案中撤下,移交纪律审查,并撤销了本案中提交的全部书面文件。

Stephen Aarons 的 ChatGPT 诉状并不只是又一次令人尴尬的引用失误。据法院称,该文件将证词归于从未在庭审中出庭的人士;它还篡改真实证人的陈述,并歪曲现有法律判例。

这一差别显著提高了事件的严重性。早期的法律 AI 失误往往涉及不存在的案例,律师通过常规引文核查本可发现问题。而据报道,这份文件篡改了一项谋杀罪定罪所依据的事实记录,当事人当时正服无期徒刑。

此案如今将法律 AI 应用中的一组明确矛盾置于核心:自动化起草的速度,与律师亲自核实案卷的责任。法院并未将软件输出视为独立参与者,而是要求在文件上签字的律师为每一句话负责。

法院在一宗谋杀案上诉中发现虚构证人

该项处罚源于当事人承认存在事实虚构,而非律师如何解读证据的分歧。

新墨西哥州最高法院于 2026 年 9 月 9 日在 State v. Sandoval 案中作出终局命令。该案涉及 Oscar Renee Sandoval 对谋杀罪定罪提出的上诉,案号为 S-1-SC-40845。

Aarons 承认在准备上诉开篇书状时使用了 ChatGPT。他还承认,在签署并提交文件前,未核实其中的事实主张或法律依据。

法院确认了四名完全虚构的证人:Officer Michelle Amarillo、Officer Sanchez、Manal Al-Jibury 和 Teresa Marquez。这并非轻微的拼写错误或身份认定不确定;命令称,证人本身就是虚假的。

该文件还将虚构证词归于真实证人。它声称 Danny Stanton 收到 Sandoval 的威胁并对此十分重视,还包含关于 Linda Stanton 的丈夫所受威胁的虚假陈述。

据称,其他段落歪曲了关于枪手服装和外貌的证词。该命令将这些陈述与 Mariah Chavez 及虚构的 Teresa Marquez 联系起来。

错误还延伸至法律研究。法院表示,该文件歪曲了 State v. Lopez 和 State v. Manus 案中的权威内容。这两个案件确实存在,因此问题不同于仅仅引用一项虚构判决。

通过检索引文,有时可以发现虚构案例。被歪曲的真实判决则要求更仔细地比对所主张的命题与原始来源。篡改后的证词还需要通过庭审记录和证物进行另一轮核实。

这份藐视法庭命令记录了 Aarons 承认自己未进行任何一种审查。命令还称,他没有告知当事人该文件中存在的事实与法律歪曲。

法院此前已命令 Aarons 于 8 月 21 日出庭,说明为何不应对其作出藐视法庭处罚并移交纪律审查。他提交了书面答复,并在五名大法官面前进行了口头陈述。

听证结束后,大法官们认定 Aarons 对自己的行为缺乏悔意,也缺乏对当事人的关切。最终命令认定其构成直接藐视法庭,并将案件移交新墨西哥州纪律委员会。

Aarons 必须在 30 天内向新墨西哥州律师协会客户保护基金支付 5,000 美元。他还必须在付款后通知法院。

实际后果不止于罚款。在纪律程序尚未结束期间,Aarons 不得在州最高法院出庭。法院保留在该程序结束后作出进一步决定的权利。

法院指定公设辩护律师事务所为 Sandoval 提供新的代理律师。此前提交的全部书状均被撤销,后续将公布新的书面陈述时间表。

法院计划在 2026—2027 审判期审理重新启动的上诉。因此,由于其原律师提交了未经核实的 AI 输出,当事人将面临新一轮书面陈述程序。

这一程序性重置构成了本文的核心张力。ChatGPT 原本承诺可以更快审阅冗长案卷,但未经核实的输出反而增加了所有相关人员的工作量。

Stephen Aarons 的 ChatGPT 诉状使当事人面临风险

当一项幻觉式回答进入带有律师签名的法院案卷时,其性质便发生了实质变化。

生成式 AI 通过预测看似合理的词序来生成文本。它不会独立保证一项陈述与庭审记录、所引判决或证据案卷相符。

这种限制通常被称为“幻觉”。在此语境下,AI 幻觉是指一项看似自信、却缺乏现有法律来源支持的陈述。

这个术语听上去或许无害,因为它最初只是技术速记说法。但在刑事上诉中,其结果可能会虚假描述哪些人作证,以及他们向陪审团说了什么。

谋杀案上诉依赖封闭案卷。上诉法官审查的是审判法院发生过的事项,而非重新审理案件或听取替代证人的证词。

律师可以质疑证据裁定、陪审团指示、宪法问题或证据是否充分。但律师不能向案卷中添加额外人物,也不能重写证词来强化论点。

据称,Stephen Aarons 的 ChatGPT 诉状多次越过了这条界限。其错误影响了上诉法官用于评估法律主张的原始材料。

与围绕聊天机器人引发的争议相比,当事人所承受的后果更为重要。Sandoval 并未因这份藐视法庭命令而在上诉中收到不利裁决,但该文件延误并复杂化了其获得审查的路径。

法院称,Aarons 未向 Sandoval 告知这些不准确之处。法院还认定,他没有向当事人说明责令说明理由程序,也未提供相关提交文件。

这些遗漏使当事人无法了解其代理关系遭受的严重扰乱。在问题被发现后,法院也不得不安排替代律师。

公设辩护律师现在必须重新审阅庭审案卷、评估可行争点并准备新的书面陈述。检察官和法院工作人员也必须重新处理原本已经开始办理的上诉。

这正是看似提升效率的工具如何转移而非消除工作量:一名用户起初节省了时间,但其他数名参与者承担了发现和修复无依据输出的成本。

Reuters 报道,这份文件似乎超出了此前以虚构判例为核心的事件范围。它将虚构证词写入了一宗刑事上诉。

这种升级解释了法院回应的严厉程度。虚假判例可能误导法官对法律的理解;虚假证人则可能误导法官对案件事实本身的理解。

两种失误都违反了律师应当核查提交文件的预期。然而,事实虚构可能更难发现,因为庭审案卷篇幅冗长、因案而异,且通常无法通过普通网络搜索获得。

对方当事人或许能很快发现已公开判决中不正确的引文。要发现虚构证词,可能需要检索数千页庭审记录,并比对多名证人的说法。

这种负担使可追溯性至关重要。起草系统应保留每一项事实主张背后的来源,并显示支持性文字出现的位置。

即使如此,来源链接也无法取代法律判断。人工审查者必须确认所引用段落属于正确证人,并能够支持其周围的主张。

同样的纪律也适用于法律领域之外。使用 AI 总结技术文档的团队,需要一个可搜索的知识库,以确保结论始终与原始材料相连。

法院提交文件使这一责任格外显眼,因为法官可以施加处罚。其背后的教训同样适用于合规报告、医疗摘要、审计以及其他证据敏感型工作。

更快起草与个人问责发生冲突

法院将 ChatGPT 视为受监督的工具,而责任仍完全由提交其输出的律师承担。

据报道,Aarons 使用 ChatGPT 协助总结庭审记录并准备上诉书状。这一用途看似颇具吸引力,因为刑事案卷可能包含大量证词、证物、动议和程序历史。

摘要工具可以帮助律师定位主题并整理笔记。但它也可能过度压缩语言,导致限定条件、矛盾之处和发言者身份消失。

通用聊天机器人还带来另一种风险。如果它无法检索到所请求的事实,它可能会生成一个看似合理的替代内容,而不是明确指出信息缺口。

当输出符合法律文书惯例时,风险会进一步上升。虚构的姓名、引语和引文可以以经过润色、看似可直接提交的散文形式出现。

专业格式并不等于事实可靠性。流畅性只说明输出读起来多么自然,并不代表每一项主张都得到案卷支持。

在书面命令公布前,据报道 Aarons 的解释聚焦于过度依赖。他表示,自己没想到该工具会以连贯形式生成虚构证人、证词、引语和法律依据。

这一解释暴露了确切的失效模式。期待获得抽取式摘要的用户,可能不会意识到生成式模型能够产出来源中不存在的材料。

然而,职业规则将核实责任置于律师身上。该模型没有执照、客户关系、诚实义务,也不会面临职业纪律处分。

美国律师协会在 Formal Opinion 512 中讨论了这一责任划分。其AI 伦理指引称,现有职责规范使用生成式系统的律师。

这些职责包括胜任能力、保密、沟通、监督、诚实义务和合理收费。律师必须充分了解工具的能力与局限,才能负责任地使用它。

在这份文件提交前,新墨西哥州律师协会也已发布具体指引。其伦理意见允许律师使用生成式 AI,但前提是仍须履行既有职业义务。

该意见强调对法庭的诚实义务和真实性,也涵盖保密、利益冲突、监督以及费用和成本的处理。

因此,问题并非缺少一项点名禁止 ChatGPT 的全州性规则。既有职责本就要求准确陈述事实,并如实引用法律依据。

法院在其命令中依据了这些熟悉的责任。它援引了授权制裁(包括藐视法庭)的诉讼文书规则,适用于律师未能遵守规定的情形。

它还援引了司法机关规范诉讼程序和惩戒律师的权力。其明确目的包括保护公众、维护行业声誉,以及确保司法公正有序地运行。

这种做法避免让法院依赖某一特定模型或软件版本。无论错误源于 ChatGPT、其他助手、搜索平台,还是漫不经心的人工起草,律师仍须承担责任。

这一原则同时对律师事务所和法律科技供应商施加压力。律所需要与每项任务风险相匹配的审查程序。供应商则需要设计能够防止未经支持的内容被直接复制进最终成果的界面。

低风险的头脑风暴不需要与谋杀案上诉中的事实陈述同等严格的保障措施。错误后果越严重,工作流程就应越严格。

对于庭审记录工作而言,这意味着每一项事实主张都需要精确到页码的来源。每一处引文都需要与原始记录比对。每一位被点名的人都需要通过证人名单或庭审记录确认。

对于法律依据,审查者必须打开裁决并阅读相关段落。当 AI 错误陈述判决要旨时,仅确认该案件真实存在并不足够。

这些检查会削减生成式 AI 所承诺的一部分时间节省。这并不意味着该技术没有价值,而是说明可靠采用需要将核验工作纳入成本考量。

因此,核心取舍是可衡量的。自动化可以加快初稿生成,但专业人士仍须承担证明该初稿准确的成本。

法律 AI 工具尚未消除幻觉问题

面向法律领域的专用系统可以减少缺乏依据的回答,但没有任何界面能够免除审查者检验结果的责任。

Stephen Aarons 的 ChatGPT 诉讼文书涉及一项通用 AI 服务。这并不能证明每一种法律 AI 产品的行为都相同,或承担相同的风险。

一些法律研究平台采用检索增强生成。RAG 是一种将生成式回答连接至选定源文件集合的方法。

理论上,检索会缩小模型可依据的证据范围,并为审查提供引文。由于用户可以在生成回答旁打开被引用的法律依据,它能使核验更容易。

然而,检索并不能保证回答如实反映其来源。模型可能引用一份真实文件,但该文件并不支持其旁边所列的主张。

Stanford 的研究人员评估了 LexisNexis 和 Thomson Reuters 的 AI 辅助法律研究产品。他们的研究还将这些系统与一款通用 GPT 模型进行了比较。

研究人员报告称,他们测试的专用产品幻觉率介于 17% 至 33% 之间。这些系统的表现优于通用模型,但缺乏依据或依据错误的回答仍然存在。

这项法律 AI 研究认为,幻觉问题尚未解决。研究呼吁开展公开基准测试和更严格的评估。

这些发现并不能预测每一款当前产品或每一项法律任务的准确性。模型、检索系统、提示词和底层数据库仍在不断变化。

该基准测试也聚焦于研究问题,而非某一特定刑事案件中的庭审记录摘要。一款产品在公开判决上的表现,并不能证明其处理上传证据时可靠。

在评估 ChatGPT 的法律错误时,这一区别至关重要。法律研究数据库通常包含结构化的法律依据和易于识别的引文。庭审记录则往往包含不完整的笔录、缩写、同名人物及碎片化证词。

一个系统可能准确找到某个案件,却在记录中混淆两名证人。它也可能正确引用庭审记录,却省略改变含义的相邻表述。

正确的怀疑态度应当双向适用。一次法院失败并不意味着律师必须放弃 AI。供应商的保证同样不能成为将生成文本视为已核验内容的理由。

相关问题在于,工作流程是否能让缺乏依据的主张在提交前被轻易发现。一个有用的系统应当展示不确定性、保留引文,并使来源比对变得简单。

它还应防止模型悄无声息地填补空白。当记录中没有答案时,“未找到”比润色过的重构内容更安全。

律所可以通过任务设计强化这些控制措施。它们可以将头脑风暴与事实提取分开,并将敏感文件限制在获批系统中处理。

它们还可以要求律师维护一份主张台账。每一项事实陈述都应指向庭审记录页、证物、案件卷宗条目或已公开的法律依据。

主管人员随后可以审计高风险主张,而无需脱离语境地重读每一句生成文本。该流程能够形成已进行核验的证据,尽管仅靠文档记录无法证明审查足够认真。

培训必须聚焦于行为,而非泛泛警告。仅仅告诉律师 AI 有时会产生幻觉,在实际提交截止日期临近时几乎无法提供指导。

一个实用标准是:另一位审查者能否根据所引来源复现每一项主张。若答案是否定的,该段内容就尚未准备好提交法院。

除准确性之外,还存在保密问题。将庭审记录上传至第三方服务,可能会暴露受保护的客户信息,具体取决于产品条款和控制措施。

新墨西哥州的命令并未解决这一问题。它聚焦于事实和法律上的失实陈述、与客户的沟通,以及 Aarons 在法院前的行为。

读者不应推断大法官作出了他们并未作出的独立保密性认定。该命令也没有确定 ChatGPT 在未经用户修改的情况下生成了每一段虚假内容。

它所确立的范围更窄,但仍然严重。Aarons 承认使用了该工具、提交了未经核验的输出内容,并且未向客户告知由此产生的问题。

法院中的 AI 幻觉如今会带来可预见的后果

新墨西哥州案件属于既有制裁模式的一部分,但其虚构庭审事实使这种模式进入了更危险的领域。

2023 年,Mata v. Avianca 案中的律师提交了由 ChatGPT 生成、实际上并不存在的司法判决。一名联邦法官审查其行为及后续回应后,对他们处以 5,000 美元制裁。

该案成为法院中 AI 幻觉问题的早期警示。它表明,当无人打开底层判决时,一个看似可信的引文可以一路通过起草、内部审查和提交环节。

新墨西哥州事件发生时,这一警示已经广为人知。此前,全国和州级的伦理指引也已开始讨论律师使用生成式 AI 的问题。

因此,法院可以期待律师理解这种基本风险。当公开制裁、律师协会意见和专业培训都已说明该问题时,声称自己感到意外就不再那么有说服力。

事实范围也发生了变化。Mata 案涉及民用航空纠纷中的虚构先例。报道称,Stephen Aarons 的 ChatGPT 诉讼文书在一宗谋杀案记录中虚构了参与者和证词。

2025 年,澳大利亚一宗谋杀案诉讼也发出了另一则警示。辩方提交的材料包含虚构引文和不存在的案件,导致法院在调查期间延误审理。

当地律师道歉并承担责任。法官表示,律师使用 AI 生成材料前,必须进行独立且彻底的核验。

这份澳大利亚提交材料表明,风险并不限于某一家美国法院或某一个执业领域。只要流畅的输出超越了来源核查,类似失误就会出现。

不过,只要提交材料中存在错误,制裁并不会自动发生。法院会考量律师的行为、回应、坦诚程度、纠正措施以及适用的程序规则。

排版错误不同于把虚构证词作为案卷记录的一部分提交。及时纠正不同于隐瞒问题或让客户始终不知情。

新墨西哥州最高法院强调了 Aarons 的承认及其对程序的回应。法院关于其悔意和对客户关切的认定,有助于将此事与迅速修正的意外错误区分开来。

该命令不具有先例效力,这意味着法院并未将其作为规范后续案件的正式意见发布。这一地位限制了律师应如何将其作为法律依据引用。

但其实际影响依然真实。Aarons 面临藐视法庭、金钱制裁、被移出上诉案件、禁止在该法院出庭,以及纪律审查。

公开记录还会带来可能比付款持续更久的声誉后果。搜索该律师的名字,将会把他与谋杀案上诉中虚构证人的事件联系起来。

对于律师事务所而言,这一后果改变了采用相关技术时的风险计算。一场不充分的审查可能带来的代价包括更换律师、重复工作、纪律风险,以及对客户信任的损害。

对于法院而言,反复发生的事件会形成要求认证或披露的压力。一些法官已要求提交声明,确认 AI 生成的文本和引文已接受人工审查。

这类规则可以提醒律师履行义务,但无法检验核验是否具有实质意义。一个勾选框并不能说明是否有人打开过庭审记录。

技术控制也面临同样的局限。一个系统可能为每句话附上引文,却仍将主张关联至无关或相互矛盾的段落。

最有力的保护措施是将产品约束与专业审查相结合。软件应让证据清晰可见,而律师必须将证据与拟提交的主张进行比对。

这种组合保留了有用的自动化能力,同时不会将判断力交给概率模型。它也为主管人员提供了可以检查的具体流程。

因此,该案不应被简化为“ChatGPT 编造了内容”。生成式系统已知会产生缺乏依据的文本,尤其是在被要求补全缺失细节时。

真正造成后果的决定发生在未经核验的输出进入署名法院提交材料之时。法院制裁了对这一转换负责的人类专业人士。

法院、律所和 AI 供应商接下来应关注什么

三项进展将显示,此案是否会带来持久的保障措施,还是沦为法律工作流程未能吸取的又一次警示。

第一个信号是新墨西哥州的纪律程序。最高法院已将 Aarons 移交纪律委员会,但 9 月命令尚未宣布最终的职业制裁。

调查人员可以审查藐视法庭程序之外的问题,并根据纪律规则建议适当回应。法院表示,如有程序启动,将在该程序结束后作出进一步决定。

一项重大的额外制裁将强化这样一个信息:未经核验的 AI 内容构成职业行为失范。有限的回应则表明,藐视法庭和撤换代理人被认为已足以应对该次提交行为本身。

第二个信号是重新启动的 Sandoval 上诉。新律师必须提交出庭代理通知、重建诉讼文书,并识别由真实庭审记录支持的论点。

这一过程将揭示虚假提交造成的实际损害。法院计划将该上诉排入 2026—2027 年度日程,但尚未提供具体听证日期。

一次有序、迅速的重新启动将减少对当事人的伤害。进一步拖延,或围绕案卷记录的争议,将表明一份存在缺陷的 AI 辅助提交材料能对刑事案件产生多么长期的影响。

第三个信号来自法院和法律科技供应商的回应。法院可以采用核验认证机制,而供应商则可以为庭审记录和引证工作增加源头级控制。

最有意义的产品改进,不会是又一项笼统的准确性承诺,而是一套拒绝补全缺乏支持的事实、并展示每个答案背后证据的工作流。

独立测试仍将十分重要。任何供应商都能展示一个有利的案例,但用户需要的是能够衡量产品在陌生案卷和对抗性问题中表现的评估。

律所还应监测自身的审查程序在截止期限压力下是否依然有效。若律师缺乏时间、培训或获取来源材料的渠道,再要求核验的政策也没有多大意义。

眼前的教训很直接。AI 可以协助整理案卷、勾勒论点,或定位可能的问题;但它不能代替律师承担如实陈述义务。

法庭提交材料中的每一项事实陈述,都必须能够追溯至可采纳的材料。每一项法律命题,都必须得到明确表达该提交材料所主张内容的权威依据支持。

这一标准要求严格,因为上诉工作向来要求严格。生成式 AI 改变了起草界面,却没有降低准确性的责任。

Stephen Aarons 的 ChatGPT 辩护状将原本承诺的捷径,变成了藐视法庭、替换代理律师以及一次全新的书面陈述周期。法律专业人士如今又有了一则有据可查的警示:这次涉及的不是仅仅虚构的判例,而是虚构的证人。

下一个问题是,在又一名当事人承担后果之前,机构是否会重新设计其工作流程。使用 AI 的律师在提交前应测试一件事:每一句重要表述,是否都能从原始案卷中得到证明?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page