top of page

Stephen Aarons ChatGPT 制裁案将虚假证人演变为一场法律危机

9月14日
讀畢需時 14 分鐘

Stephen Aarons 因其由 ChatGPT 辅助撰写的上诉状提交了虚假证词,以及从未在庭审中出庭的证人信息,被处以 5,000 美元制裁。新墨西哥州最高法院还以直接藐视法庭罪认定这名资深辩护律师有责。Stephen Aarons ChatGPT 制裁案揭示的问题,远比又一次虚构法律引文严重得多。

Aarons 代理 Oscar Renee Sandoval,后者因谋杀罪被判无期徒刑。法院称,上诉状歪曲了庭审记录和法律依据。其中一些段落描述了虚构证人的证词,包括据称关于枪手衣着和外貌的观察。

这一区别改变了事件的严重性。此前的 AI 制裁案通常涉及不存在的判例或引文。而这份文件据称改写了一场刑事审判中的事实叙事,当事人的自由取决于准确的记录。它将一份不可靠的摘要包装成所谓证据,并将其带入该州最高法院。

Stephen Aarons ChatGPT 制裁案不止于罚款

法院将这份文件视为对上诉本身的威胁,而不只是一次尴尬的研究失误。

新墨西哥州最高法院于 2026 年 9 月 9 日作出制裁决定。大法官认定 Aarons 构成直接藐视法庭,并命令其向新墨西哥州律师协会客户保护基金支付 5,000 美元。

法院还将此事移交进行律师纪律处分。在该程序处理期间,Aarons 不得出庭参加州最高法院的诉讼。这项限制使该案区别于仅以警告或继续教育结案的事件。

现有上诉状已被撤销。Sandoval 的上诉经由新墨西哥州公设辩护人体系,重新指派给律师 Kim Chavez Cook。根据 Reuters 发布的案件报道,基础上诉程序仍在进行中。

这些补救措施承认了两种不同的损害。第一种涉及法院:法院收到了一份内容与记录不符的文件。第二种涉及 Sandoval:他的直接上诉被延误,并被迫由新律师重新启动。

Sandoval 曾对谋杀其子女母亲的指控作无罪答辩。他于 2025 年被定罪,并被判处终身监禁。他的死刑案件上诉提出了涉及证据、证人披露、专家证词、对质权以及一审辩护律师有效性的问题。

新墨西哥州司法机构的审期案件清单证实了这些上诉争点。它们需要在庭审记录、已保留的异议和具有约束力的法律之间进行细致比对。

但法院表示,提交的上诉状包含虚假的警察证词,以及归属于实际上未曾作出相关陈述之人的说法。文件还包含对法律依据的不准确描述。

证据与论证之间的区别至关重要。虚构先例可能扭曲支配案件的法律规则。虚构证词则可能改写陪审员听到了什么、有哪些证人存在,以及为何应撤销裁决。

虚假的事实摘要还可能污染建立在其上的每一项论点。举例而言,无效辩护主张取决于律师做了什么,以及记录实际包含什么内容。一个虚构证人可能制造出从未发生过的失误。

因此,法院的回应触及了文件、律师和代理关系。撤销上诉状清除了受污染的工作成果。指定新律师为被告提供了重新前行的清晰路径。纪律处分移交则将职业责任问题带出了上诉程序本身。

这种结构解释了为何 Stephen Aarons ChatGPT 制裁案值得新墨西哥州以外的人关注。法院并未宣布律师必须避免使用生成式 AI。它执行的是一项更古老的规则:律师仍须对每一项提交的陈述负责。

该事件也考验了针对 AI 失误的一种常见辩解。Aarons 称这是一次无心之失,并表示自己不了解 ChatGPT 可以在多大程度上虚构事实。法院则聚焦于那份带有其签名、却未经核实的文件。

一份签署的上诉状不是头脑风暴笔记。它是向法官、对方律师和当事人作出的正式陈述。一旦生成的文本进入该文件,其来源并不会减轻律师的责任。

一份 AI 摘要成为庭审的虚假版本

核心失误发生在:生成的文字未经逐行核验,就被视为忠实反映记录的内容。

在 8 月 21 日的一场听证会上,Aarons 表示,他向 ChatGPT 提供了一份计算机生成的庭审记录和其他案件材料。他期待该系统生成他所谓的“无懈可击的摘要”。

这种期待颠倒了应有的举证责任。生成式模型根据模式和上下文生成看似合理的文字。它并不保证每句话都出现在上传的庭审记录中。

AI 幻觉是指缺乏相关证据或来源支持、却表现得信心十足的输出。这个词听起来或许无害,但后果取决于输出流向何处。私人笔记中的错误摘要只会造成混乱;同一份摘要出现在上诉状中,就成为对法院作出的陈述。

据报道,该上诉状将一些虚假陈述归于 Danny Stanton 和 Linda Stanton。文件还在关于枪手衣着和外貌的描述中提及 Mariah Chavez 和 Teresa Marquez。法院认定 Marquez 是一名虚构证人。

其中一段显然称,枪手穿着深色裤子和白色衬衫。这一说法听起来像是普通的事实细节,因此很容易被纳入整体叙事。然而,法院认定该说法没有任何有效的记录支持。

这比识别一个明显荒谬的答案更棘手。生成的法律文本往往采用恰当的语气、预期的词汇和熟悉的论证结构。这些特质会让缺乏支持的细节看似已成定论。

律师在快速阅读时,可能辨认出整体故事,却忽略其中虚构的衔接内容。姓名、衣着描述、威胁和证人观察都可能看起来与周边材料一致。流畅的表达掩盖了来源链条的缺失。

这一工作流程还混淆了两种不同的文件。庭审记录记载证词和法庭事件。模型生成的摘要则是根据该来源创建的新文本。在每项重要主张都被追溯验证前,它必须被视为一种解读。

上传源材料并不能消除幻觉。冗长的记录可能超出系统的有效注意力范围,包含转录错误,或诱发缺乏支持的综合推断。模型也可能将相近的细节组合成任何证人都未曾说过的陈述。

当指令要求给出确定性叙事时,这种风险会增加。“完整”“无懈可击”或“全面”等措辞,可能奖励表面的完整性,而非明确的不确定性。输出可能会填补空白,而不是标记这些空白。

可靠的法律工作流程需要主张级别的来源追溯。每个事实性句子都应指向庭审记录页码、证物、案卷条目或司法认定。每一处引文都应与来源完全一致。每个引用的判例都应真实存在,并支持所述命题。

这一流程不能止于询问同一个聊天机器人其摘要是否准确。生成器可能会用更多虚构的解释来为自身缺乏支持的输出辩护。核验必须回到独立的源材料。

这一教训不仅适用于法律领域。研究人员、分析师、顾问和高管正越来越多地使用 AI 压缩冗长记录。当摘要成为后续审阅者唯一看到的版本时,风险就会上升。

团队需要在生成的综合内容旁保留原始证据。一套结构化的知识融合工作流程可以帮助将笔记与源文件连接起来。然而,仅靠检索并不能证明每项生成的主张都正确。

决定性的保障仍是依据权威记录进行人工审查。AI 可以帮助定位段落、梳理问题和起草工作笔记。它不应将未经核实的推断转化为事实性陈述。

承担责任的是律师的签名,而非 ChatGPT

核心冲突在于:起草可以委托,职业责任却不可转移。

Aarons 向 Reuters 表示,他从事刑事辩护已超过 40 年。他称,自己在 2025 年接受 Sandoval 的上诉委托时,并不熟悉 AI 幻觉会在何种程度上发生。

“我深感悔意,但希望纪律委员会能考虑到这是一次无心之失,”他说。他将该事件描述为使用不稳定技术的专业人士应吸取的一课。

法院作出了更严厉的评价。其命令称,Aarons 承认在签署和提交上诉状前,未核实其中的事实主张或法律依据。命令还称,他未将这些缺陷告知当事人。

大法官认定,他对 Sandoval 表现出的悔意和关切不足。法官 C. Shannon Bacon 质疑,一名律师如何能对被广泛报道的 AI 失误始终毫不知情。她的提问强调,幻觉式法律材料早已成为反复出现的公共议题。

这种张力并不意味着应将 ChatGPT 视为没有责任。根据 Aarons 和法院的说法,该系统生成的文字包含缺乏支持的材料。OpenAI 未立即就制裁向 Reuters 作出回应。

然而,聊天机器人不能代理出庭、签署上诉状、向当事人提供建议,或回应藐视法庭命令。这些职责属于持牌律师。法律体系将问责责任赋予获授权行事的人。

美国律师协会在本案之前已得出同样的基本结论。其 AI 伦理意见指出,律师必须理解生成式工具的益处与风险。

第 512 号正式意见将 AI 的使用与既有职责联系起来,包括胜任能力、保密义务、与客户沟通、监督、坦诚义务、具备实质依据的主张以及合理收费。它并未为这些职责创造 AI 例外。

该指引还将生成式文本系统描述为预测工具。它们根据数据模式生成具有统计概率的输出。这种设计不同于返回经认证法院文件的数据库。

律师可以将研究或起草工作委托给助理律师、律师助理、承包商和软件。委托改变的是谁完成初步工作,而不会改变谁必须监督工作或核验提交文件。

本案表明,仅作披露无法解决问题。一句“由 AI 协助”的标签或许能提醒法院,但不会让虚构证词变得准确。法官不能成为每份由软件生成文件的事实核查员。

工具禁令也面临类似局限。律师可能通过错误记忆、草率口述、未经培训的员工或普通复制粘贴错误引入虚假信息。无论采用何种制作方式,法院关心的是签署文件的准确性。

更好的分界线在于核验。只要每一项重要主张都能对照案卷核查,AI 辅助仍然可以发挥作用;当流畅的表达取代了这一核查时,它就会变得危险。

与客户的沟通又增加了一层要求。刑事上诉人应当了解,有缺陷的书面陈述何时已使上诉面临风险。据法院称,Aarons 未向 Sandoval 说明该书面陈述中存在的事实和法律失实表述。

这一遗漏至关重要,因为客户承担着实际后果。律师可能面临制裁和纪律处分,但上诉人承受的是延误、不确定性,以及律师关系的破裂。

因此,职业问责必须覆盖整个工作流程:从选择合适工具、保护机密信息开始,贯穿来源核验、实质审查、客户沟通以及最终确认。

ChatGPT 虚构证人,越过了更危险的界线

虚构证词使 AI 幻觉从错误研究问题,走向污染证据记录。

最广为人知的早期制裁案件是 Mata v. Avianca。在一宗联邦人身伤害纠纷中,律师提交了由 ChatGPT 生成、实际上并不存在的司法判例。法官于 2023 年处以 5,000 美元罚款。

该案确立了一项长期有效的警示:聊天机器人可能虚构案件名称、引文、案号和法律推理。法院要求律师通过公认的法律研究系统核实这些权威资料。

新墨西哥州事件扩大了这一问题。据报道,Aarons 的提交文件包含虚构证人和对证词的虚假描述。这些错误不仅是错误陈述了另一家法院的裁决,还在客户自己的案件中制造了事实。

上诉法院通常审查既有案卷,不会重新审理案件,也不会将律师新增的事实当作证据接受。书面陈述必须以庭审记录、证物、裁定和已保留的异议为依据。

一项虚构的事实细节可能影响法官对损害的理解。它可能让被排除的证据显得更为重要,强化身份识别论点,或改变交叉询问表面上的价值。即使事后得到纠正,这些影响也可能持续存在。

这一问题同样会给对方律师带来负担。检察官必须将书面陈述与案卷比对,并找出不一致之处。法官和书记员则必须判断,一段异常陈述究竟反映了真实的庭审记录内容,还是生成式虚构。

这种核验成本会扩散至整个系统。一名律师或许节省了起草时间,却将审查工作转移给法院、对方当事人、替任律师和客户。制裁旨在将这项成本重新归于应负责任的专业人士。

2026 年佐治亚州的一起谋杀案上诉展示了另一种污染路径。在 Payne v. State 中,检方提交文件和由一审法院签署的拟议裁定中出现了虚构或错误归属的引文。

Payne 判决撤销了一审法院的裁定,并将案件发回要求重新作出裁定。该事件表明,生成式错误可能从代理人的草稿迁移至司法文件中。

这种迁移风险使溯源变得至关重要。法律文件经常在动议、拟议裁定、内部备忘录和上诉书面陈述之间重复使用。一旦无依据的段落进入链条,后续作者可能会认为已经有人核验过它。

新墨西哥州的提交文件似乎也遵循了类似的信任捷径。Aarons 使用 ChatGPT 制作了对诉讼程序的压缩性表述,随后在未充分回查庭审记录的情况下依赖了该表述。

最终文件具有上诉代理的表面形式:它列出证人、描述证词、援引先例,并将事实与法律主张联系起来。这种形式使内容看起来仿佛经过了专业审查。

这也是为什么仅仅强调“人类参与其中”几乎无法提供保障。人可以快速浏览草稿、修改语法,却仍然漏掉事实虚构。只有当审查者拥有时间、专业能力和直接获取来源的条件时,这句话才有意义。

有效审查还需要在源文本和生成文本之间划出清晰界限。引用的庭审记录段落应保留页码标注;摘要应标明其支持内容所在的范围;未经支持的模型评论应置于事实陈述之外。

对于高风险事项,第二位审查者应独立检验文件。该审查者应根据风险抽查来源,并在发现任何不一致时扩大核查范围。虚构姓名应触发对每一项事实陈述的审查。

同样的原则适用于法律权威资料。审查者必须打开每一份被引用的判决,并确认引文语言、裁判要旨、司法辖区和相关性。引用真实案件来支持虚假命题,仍然是严重错误。

Stephen Aarons 因 ChatGPT 受到制裁一事表明,法院正不再纠结于究竟是哪种工具造成了错误。关键的操作性问题在于,律师是否建立了足够严密的控制措施,以防生成式虚构变成已提交的事实。

这些制裁并不证明 AI 在法律工作中没有位置

最有力的批评针对的是失控的依赖,而非律师对生成式 AI 的每一种使用。

很容易将此案视为法律专业人士永远不应使用 ChatGPT 的证据。但这一结论超出了法院认定的范围,也忽视了被归入“AI 使用”之下的各种任务。

模型可以帮助列出争点清单、重组由律师撰写的笔记、比较文件结构,或建议搜索词。这些用途仍需要判断力,但它们并不都像概述一份谋杀案庭审记录那样具有相同风险。

风险取决于输出的用途和去向。私人提纲只是暂定性的;客户信函需要仔细审查;刑事上诉中的事实陈述则必须对照官方案卷核验。

工具之间也存在差异。通用聊天机器人生成开放式文本,而某些法律系统则从受限数据库中检索,并展示支持性权威资料。即便带有引文的系统,也可能误引、误读或选择无关材料。

新墨西哥州法院并未对 ChatGPT 的可靠性进行科学评估。它审查的是一名律师的行为和一份存在缺陷的提交文件。读者不应将这一认定转换为普遍适用的错误率。

该案也不能证明 AI 独立造成了每一项缺陷。Aarons 选择了材料、向系统输入提示、使用其输出,并在结果上签字。公开报道并未提供完整的提示历史或每一版中间草稿。

这种不确定性很重要。缺少完整互动记录,观察者无法重建哪些主张由模型生成、哪些段落由 Aarons 编辑,或庭审记录缺陷是否也构成影响。法院命令确立的是责任,而不是完整的技术复盘。

不过,这些空白并不能为已提交文件中的不准确内容开脱。它们说明产品和流程层面仍有哪些问题有待解答。更完善的日志记录可以帮助律所判断,一项无依据的陈述是如何进入文件的。

法律 AI 供应商可以通过为每一句事实陈述附上来源引用来降低风险。他们可以在回答缺少证据时发出警告,将引文与摘要分开,并阻止导出仍含未解决引文问题的文件。

这些控制措施会有帮助,但无法取代实质审查。来源链接可能指向一份真实文件,却并不支持生成的主张。自动化可以让核验更容易,但不能让它变成可选项。

律所还需要制定基于任务敏感度的政策。概述公开背景材料,与解读享有特权保护的证据,后果并不相同。起草常规核对清单,也不同于描述存在争议的证词。

一项务实的政策应明确禁止输入的内容、获准使用的系统、留存规则、审查标准和升级处理节点。它还应规定由谁核查引文、由谁对照案卷确认事实主张。

培训不能止于教律师如何撰写提示词。使用者需要了解自信但错误的输出、上下文限制、检索不完整、数据暴露以及自动化偏见。自动化偏见是指人们因内容由系统生成而对其过度信任。

时间压力也值得关注。AI 承诺加快起草速度,但核验可能抵消部分收益。律所必须如实预留审查时间,而非假定第一版流畅草稿已经接近完成。

主管人员也应避免只以速度衡量成功。这种激励会促使员工掩盖不确定性并跳过来源核查。高风险 AI 工作需要与证据挂钩的准确性指标。

因此,审慎的结论更狭窄,也更有力。生成式 AI 可以协助法律工作,但前提是律所将其输出视为未经核验的草稿。提交文件的人仍必须亲自确认每一项重要主张。

法院和法律团队接下来应关注什么

下一项检验是,制裁能否在法律实践中促成可核验的工作流程变革。

第一个信号将来自涉及 Aarons 的纪律程序。新墨西哥州委员会可以审查其专业能力、坦诚义务、客户沟通以及提交文件相关情形。

公开的纪律处分决定将有助于厘清,法院是将该事件视为孤立的疏忽,还是更广泛的职业不当行为。更严厉的处罚将强化直接藐视法庭命令;有限的救济则会强调补救和主观意图。

该程序还可能披露新闻报道中缺失的信息。调查人员可以审查起草过程、与 Sandoval 的沟通、庭审记录处理情况,以及 Aarons 发现问题的时间。这些事实将界定本案作为先例的价值。

第二个信号将是 Sandoval 的替代上诉。此前的书面陈述被撤销后,新律师必须根据真实案卷重建论点。这一过程将显示虚构材料造成了多大程度的实质损害。

如果修正后的书面陈述基于真实证据提出类似法律主张,那么该事件将更像是一次严重但可挽回上诉的工作流程失败;如果主张发生重大变化,AI 摘要很可能扭曲了案件的理论基础。

法院最终如何对待 Sandoval 同样重要。制裁律师有助于维护制度完整性,但司法系统必须避免因律师提交文件存在缺陷而惩罚客户。新的代理关系可以应对这一风险,但无法消除所有延误。

第三个信号将是采用与证据关联的起草控制措施。法院可以要求作出证明,律所可以要求每一项事实陈述均附庭审记录引文,供应商则可以展示每一段生成内容背后的来源。

最有用的控制措施将是可审计的。仅勾选“有人审查过草稿”的复选框,保护作用有限;将每项主张关联至庭审记录页码的主张映射表,则能证明实际进行了核验。

法院还将决定现有职业规则是否已提供足够的约束力。ABA 框架已经涵盖专业能力、坦诚、监督和保密义务。新墨西哥州的命令表明,法官无需创设 AI 专属义务也能采取行动。

新规则在界定程序时仍可能具有价值。它们可以要求披露特定用途、保留生成草稿,或对引文和引用作出个人确认。不过,披露应当服务于核验,而不是取代核验。

更广泛的行业应关注刑事案件中是否反复出现事实虚构。虚假先例如今已并不陌生;虚构证词则对上诉案卷的完整性构成了更直接的挑战。

对知识工作者而言,眼下的行动很简单,却也要求严苛:识别每一项由 AI 生成的事实主张,重新查阅具有控制力的来源,并记录支持依据所在的位置。任何不一致之处,都应在文本送达客户、监管机构、高管或法院之前上报。

Stephen Aarons 因 ChatGPT 受到制裁一事,并非是在警示不够完美的文笔。它揭示的是:当 AI 生成的摘要在没有文档支持的情况下取代证据,会发生什么。

在依赖任何生成内容之前,先问一个问题:另一位审阅者能否将每一句具有实质影响的表述追溯至权威来源?如果答案是否定的,这份草稿就尚未完成。现在就建立核验链路,保留原始记录,并留给审阅者足够的时间来质疑那些流畅的语言。下一次严重的 AI 失误,很可能会先显得可信,之后才暴露为虚假。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page