top of page

OpenAI Project Lily 将人工审核置于 ChatGPT 看似私密的对话背后

9月16日
讀畢需時 16 分鐘

据报道,OpenAI Project Lily 雇用了数百名承包商审核真实的 ChatGPT 对话,尽管一对一聊天机器人的界面营造出私密氛围。审核员协助评估模型回复,但据称部分对话包含自动过滤未能清除的个人信息。

该项目的存在在 9 月 14 日的一项调查中被披露,调查依据包括内部指南、工作场所讨论、评分材料和真实提示词。根据原始调查,审核员可能会收到完整对话,而非脱离上下文、彼此孤立的问题。

核心冲突并不在于人类是否参与人工智能。多年来,人类反馈一直塑造着领先的语言模型。更尖锐的问题是,面向消费者的披露是否充分让人们意识到,承包商可能会阅读一段让人感觉保密的交流。

Google 已表示,受训服务提供商会审核部分 Gemini 对话。根据 Project Lily 的报道,Anthropic 也确认会对符合条件的对话进行人工审核。这种做法似乎并非单一公司所独有,但 OpenAI 现在正面临有关告知、数据最小化,以及其隐私过滤器是否提供足够保护的直接质询。

据报道 OpenAI Project Lily 审核员能看到什么

Project Lily 将部分消费者对话转化为供人工审核员完成的结构化评估任务。

据报道,这一工作流程始于一条真实的 ChatGPT 提示词。承包商会阅读用户请求,总结其表面意图,并评估多个由模型生成的回答。据称,审核员会收到四个候选回复,并按一到七分的量表进行评分。

这一过程远不只是点击“赞”图标。审核员必须识别回答中的优点与不足,解释其推理过程,并判断回复是否符合 OpenAI 所偏好的行为准则。

据报道,评分指引同时涉及内容与语气。审核员会关注准确性、相关性、恰当的格式,以及是否遵循用户请求。他们也会惩罚那些可能让生成文本显得机械或带有操纵性的习惯。

据称,这些习惯包括不必要的勾选符号、杂乱的格式,以及主要为了延长互动而设计的结尾。审核员还被要求标记声称拥有个人经历的内容,例如聊天机器人将自己表述为拥有个人历史的人。

另一个目标是谄媚,即模型过度认同用户或强化用户框架的倾向。谄媚的助手听起来可能很支持用户,却没有质疑不理性、错误或危险的前提。

人工判断在这里十分重要,因为这些问题高度依赖语境。僵化的自动化指标并不总能区分有益的共情与不负责任的认同。它也难以判断何时友好的回答变成了逢迎或误导。

这解释了为何模型开发者即使在计算基础设施和自动化评估上投入巨资,仍然需要人类参与。一则回复可以语法正确、事实看似合理,却依然显得闪烁其词、居高临下,或令人不安地过度附和。

然而,帮助审核员判断回复的同一份上下文,也提高了隐私风险。一条孤立的提示词或许泄露的信息有限;完整交流则可能暴露人际关系、健康担忧、职场纠纷、财务问题或其他可识别细节。

据报道,部分审核任务会在对话上方显示用户记忆摘要。ChatGPT 记忆可保留此前互动中的有用细节,让后续回复显得更具个性化。这类摘要也可能提供关于个人职业、所在地、兴趣或处境的额外线索。

据称,审核员不会收到 ChatGPT 用户名。OpenAI 还表示,对话在送达审核员前会经过一个名为 Privacy Filter 的系统。该自动化模型旨在识别并移除个人信息。

但移除账户名称并不必然使详细对话匿名化。独特的工作、罕见的病史、具名的社区和具体的家庭事件,可能共同识别出某个人。单独审视时,每个片段都可能看似无害。

因此,据报道的 ChatGPT 人工审核流程依赖两道并不完美的保障。第一道是自动脱敏;第二道是对承包商的组织性管控,而他们仍需获得足够上下文才能进行有意义的评估。

二次报道称,数百名承包商参与了该项目。报道还将这项工作与 Mercor 和 Crossing Hurdles 联系起来,不过 OpenAI 尚未发布完整的运营说明。

这项调查并未确定总共有多少对话进入 Project Lily、它们如何被抽样,或审核员能够访问它们多久。调查也未指出哪些具体模型版本会获得由此产生的反馈。

这些信息缺口很重要。“人类会阅读 ChatGPT 聊天记录”暗示全面监控,而现有证据并不支持这种说法。“匿名样本能改进模型”听起来令人安心,但它弱化了据报道完整对话及记忆上下文的可见性。

可辩护的结论介于这两种说法之间。据报道,部分对话会进入人工评估流程,OpenAI 会在审核前采取隐私保护措施。这些保护并不能保证每一项敏感细节都会消失。

为什么 ChatGPT 人工审核会引发同意问题

最强烈的隐私担忧,在于正式数据控制措施与对话式产品所营造预期之间的落差。

大多数人明白,公开发布的内容可能被陌生人阅读。聊天机器人则呈现出不同的心理情境:它提供空白文本框、即时回复,以及看不见的人类受众。

这种界面鼓励披露。人们会用 ChatGPT 修改机密邮件、解读医疗术语、讨论人际关系、调试专有代码,以及梳理职场问题。还有人将它当作日记或情绪倾诉对象。

因此,用户或许理解数据有助于改进服务,却未必会想到承包商可能检查其中的文本。模型训练听起来像是计算过程;人工评估则听起来更具人际属性。

OpenAI 确实披露,消费者内容可用于帮助改进其模型。其公开说明称,公司会保留部分交互数据,同时在训练前采取措施减少个人信息。该公司还在其模型改进政策中区分了消费者产品和商业产品。

Project Lily 改变了读者对这些披露的理解。“改进我们的模型”据报道包括由人阅读、总结、批评和评分部分对话。由于这一机制影响知情同意的含义,它值得获得更清晰的关注。

OpenAI 告诉进行调查的媒体,敏感细节可能会穿过其过滤器。自动脱敏系统面临棘手的语言问题,尤其是在身份识别信息以间接方式出现时。

过滤器识别电子邮件地址,通常比识别“罕见职业加小城镇”的组合更容易。它可以移除常规电话号码,却可能漏掉以非常规格式写出的标识符。模糊指代则更难处理。

上下文也带来了基本的技术权衡。更严格的脱敏能保护隐私,却可能损害审核员所需的材料;较弱的脱敏保留了评估价值,却增加了暴露风险。

假设用户要求 ChatGPT 在职场纠纷后起草给经理的回复。移除姓名或许能保留基本任务;移除行业、角色、指控和此前交流,则可能使该回复无法被恰当评估。

同样的张力也适用于健康和关系类对话。审核员需要上下文,才能判断一则回答是适当谨慎还是危险地认同。这些上下文可能恰恰包含交流中最敏感的部分。

记忆会加剧这一问题,因为信息可以跨会话累积。单个细节未必能识别某人,但反复出现的细节所构成的结构化摘要会缩小可能范围。

这正是隐私不能完全依赖传统个人身份信息的原因。有效的去识别化必须考虑信息组合、推断和可关联性。没有姓名的对话仍可能极其私密。

报道还引用了一名承包商的话,他怀疑用户并不会想到有人正在分析他们的交流。这一观察并非衡量用户认知的科学指标,但它确实捕捉到了产品设计层面的问题。

OpenAI 可以指出一个有效设置和一份准确的隐私政策。用户仍可能从界面中形成实质不同的预期。这两种说法可以同时成立。

这个问题对于弱势用户尤为重要。向聊天机器人寻求保密的人,可能会将其对话式回复理解为保密承诺。模型无法通过自身回答改变 OpenAI 后端的数据处理方式。

聊天机器人不是治疗师、律师、医生或享有保密特权的专业顾问。然而,它们的界面正日益模仿耐心、个性化的对话。这种相似性提高了隐私说明不充分或不显著时的代价。

美国联邦贸易委员会已警告 AI 提供商应履行其隐私与保密承诺。其AI 隐私指南特别强调了提交给模型服务的敏感信息,以及清晰告知的重要性。

Project Lily 报道并未证明 OpenAI 违反了任何法律。但它确实构成了一项检验:现有披露是否已足够清楚地说明人类访问和承包商审核。

一份被深埋的政策可以准确描述数据处理方式,却无法纠正产品所建立的预期。因此,OpenAI 面临的压力远大于一个泄露的项目名称。

该公司必须协调两种信息:ChatGPT 正变得更加个性化、更具上下文感知能力,而对话也可能成为由人审核的训练材料。

更好的回复依赖上下文,而上下文会提高风险

Project Lily 揭示了一项艰难的权衡:用于改进 ChatGPT 的最有价值材料,也可能是最难匿名化的材料。

模型开发者需要接近真实使用情况的示例。合成提示词可以覆盖已知场景,但它们很少能再现数百万真实对话中的混乱、模糊性和情感质感。

真实用户会改变方向、省略上下文、自相矛盾,并混合多个任务。他们也会回应模型此前的措辞。审核完整交流有助于评估者发现 ChatGPT 是否造成混淆,或强化了不良前提。

这些反馈能够解决基准测试分数遗漏的问题。模型可能在事实测试中答对,却因反复添加免责声明而令用户感到沮丧。另一个模型或许听起来富有同情心,却在认同有害的观点。

人工审核员能够识别这些差异。他们的评分可以支持后训练,即在预训练模型学会广泛语言模式后,用于塑造其行为的过程。

据报道,Project Lily 的指引部分聚焦于让 ChatGPT 减少讨好倾向,并降低拟人化自我呈现的倾向。这些目标直接关系到安全性和用户信任,而不只是写作风格。

在审核前移除所有个人线索,可能削弱这种评估。评估员在判断敏感建议时,需要了解用户披露了什么信息,以及对话如何发展。

这造成了一种令人不安的反转。个人上下文能够提升审核员识别不安全行为的能力,但同样的上下文也让人工接触带来更严重的影响。

随着 AI 助手获得记忆能力,这种矛盾愈发尖锐。记忆系统可帮助 ChatGPT 避免重复提问,并针对后续回复进行个性化调整。但它也会将零散披露的信息转化为持续存在的用户画像。

这份画像可能同时包含普通偏好和高度敏感的内容。即使没有直接出现身份标识,多种信息的组合也可能暴露用户的大致位置、职业、家庭结构或持续面临的问题。

这并不是说记忆功能或人工评估必须消失,而是主张应当从设计之初就将上下文数据视为敏感数据。

最安全的模型改进流程应尽量减少每位审核员所见的信息,将身份与内容分离,限制访问权限,记录每一次交互,并执行较短的数据保留期限。它还应测试脱敏处理在不同语言和非常规标识符中的一致性表现。

OpenAI 尚未公开足够的 Project Lily 细节,因而无法评估这些控制措施。报道称,用户名会被隐藏,且对话会经过 Privacy Filter 处理。但报道未提供独立安全审计或可量化的失败率。

缺少这些细节不应被视作失败的证据,而应被视为尚未解决的验证缺口。

由于承包商安排扩大了涉及的组织和工作人员数量,因此尤其值得审视。每增加一个访问点,都会带来有关培训、监督、设备安全、复制、保留和事件响应的运营问题。

承包商即使遵守严格规则,仍可能看到完成任务所必需的敏感材料。隐私风险并不一定源于不当行为。获授权的访问本身,就可能与用户的预期相冲突。

这种区别经常在消费者隐私讨论中被忽略。安全关注的是未经授权的人是否获取了数据;隐私还关注获授权的使用是否适度、是否易于理解,以及是否符合数据收集时的语境。

OpenAI Project Lily 似乎旨在通过正当的评估工作提升模型质量。争议在于,数据流程是否匹配产品体验所带来的亲密感。

对个人而言,这也是一个知识管理问题。草稿、研究笔记和工作场所细节在组合后,可能比单独存储时泄露更多信息。私有的 AI 知识库需要对其源材料流向何处设定明确边界。

用户不应以为删除姓名就能让提示词变得安全。专有代码可能暴露一家公司。合同摘录可通过日期和义务识别相关方。医疗叙述则可能因罕见情况暴露某人的身份。

更好的规则是在提交前进行数据最小化。只提供完成任务所需的细节,在本地替换标识符,并避免在缺乏适当控制措施的情况下将机密信息粘贴到面向消费者的工具中。

这种做法并不能为平台披露不清开脱。它承认,没有任何自动化隐私过滤器能够完全替代周密的产品设计和用户判断。

OpenAI 的隐私控制很重要,但也存在边界

用户可以阻止新的消费者对话被用于模型改进,但这一选择并不会消除所有形式的审核或保留。

OpenAI 当前的 ChatGPT 隐私控制提供了直接的退出选项。已登录用户可以打开“设置”,选择“数据控制”,并关闭“为所有人改进模型”。

根据官方的数据控制指南,关闭该设置后,对话仍会显示在聊天记录中。新的对话不会被用于训练 ChatGPT。

该设置会在同一账户的所有设备上生效。OpenAI 还表示,此前通过支持渠道或隐私表单提交的退出请求仍将得到遵守。

新旧数据之间的这种区别很重要。关闭模型改进会改变未来对话的处理方式。用户不应认为这一开关会追溯性地删除已经处理过或已纳入训练流程的材料。

Temporary Chat 提供了另一层边界。OpenAI 表示,未保存的临时对话不会出现在历史记录中,不会创建新的记忆,也不会用于模型改进。

公司可能会出于安全目的保留副本长达 30 天。OpenAI 还表示,临时对话可能会被审核,以监测滥用行为。

这意味着“临时”不等于不可见、立即删除,或免于所有人工访问路径。它意味着该对话遵循更严格的产品改进和记忆政策。

在个性化功能仍启用时,临时对话也可以使用现有记忆。如果用户不希望应用此前的记忆或自定义指令,可以选择非个性化的临时会话。

如果用户保存 Temporary Chat,它将成为普通对话,随后会遵循账户的模型改进和个性化偏好设置。

这些细节使 ChatGPT 隐私控制颇具实用性,但也容易被误解。其中涉及三个彼此独立的概念:

  • 模型改进决定符合条件的内容是否会支持训练和评估。

  • 记忆决定信息是否可以用于个性化后续对话。

  • 安全监测允许为检测滥用而进行有限的数据保留或审核。

修改其中一项不一定会关闭其他项。关闭记忆功能的用户,并不会自动关闭模型改进;选择 Temporary Chat 的用户,也不会获得绝对免于安全审核的保证。

商业产品遵循不同的默认规则。OpenAI 表示,除非组织明确选择加入,否则不会使用 ChatGPT Business、Enterprise、Edu、医疗服务、面向教师的产品或其 API 平台的输入和输出进行训练。

对于正在决定员工能否将内部文件放入 AI 系统的企业而言,这一区别很重要。消费者账户与获批准的企业工作区并不承担完全相同的数据承诺。

即使是商业保护措施,也不能消除治理需求。组织仍必须控制访问权限、关联应用、数据保留,以及员工对客户信息的处理方式。

个人用户也应将便利性与保密性区分开来。聊天机器人可以协助改写一条敏感信息,而无需接收原始姓名、雇主、地址或账户号码。

开发者可以在调试时使用虚构值。研究人员可以先概述一个案例,再请求结构性反馈。员工可以遵循获批准的工作工具,并避免将受限材料转移到个人账户中。

对于经常性的私密工作,本地优先的第二大脑可以减少在系统之间不必要的复制。关键问题不只是信息存储在哪里,还包括哪些服务会在处理过程中接收它。

Project Lily 也揭示了界面级警示为何重要。用户不应仅从一句关于模型改进的宽泛表述中,推断出人工访问的存在。

清晰的披露可以说明:在经过自动化隐私处理后,被选中的对话可能由受过培训的人员或服务提供商审核。此类说明应出现在模型改进开关附近,而不应只隐藏在政策文件中。

界面还可以在用户启用记忆或上传敏感文件前提醒他们。在运营上可行的情况下,更细粒度的控制可以将自动训练、人工评估和安全审核区分开来。

这些控制措施都无法让云端聊天机器人等同于受法律特权保护的通信,但能让边界更清晰、更容易理解。

人工审核是行业惯例,并非 OpenAI 的例外

OpenAI 目前受到聚光灯照射,但人工评估已嵌入整个消费级 AI 的开发过程。

Google 的 Gemini 文档提供了最清晰的公开对照。Google 表示,受过培训的服务提供商会审核一部分聊天记录,以识别低质量、不准确或有害的回复。

Google 还表示,经过审核的聊天在送达服务提供商前,会与用户账户解除关联。其 Gemini 隐私中心警告用户,不要输入不希望审核员看到的机密信息。

这一警告以罕见的明确方式说明了人工的角色。Google 表示,即使用户删除了相关活动,经过审核的对话及相关信息仍可能保留长达三年。

用户可以关闭“保留活动”设置,以阻止未来聊天被用于改进 Google 的服务。临时聊天同样不会用于模型改进,尽管有限的安全处理仍可能继续。

Anthropic 向 404 Media 表示,它也会对通过其改进设置而符合条件的对话进行人工审核。据报道,Anthropic 会在审核前移除包括电子邮件地址在内的账户标识符。

这些对比并不能证明每家公司都收集相同的材料,或使用完全相同的控制措施。它们表明,人工评估并非 OpenAI 独有的临时权宜之计。

语言模型依赖自动化系统无法完全提供的判断。人们会评估回答是否有帮助、准确、安全、是否保持恰当谨慎,以及是否符合复杂指令。

竞争压力显而易见。公司希望助手表现得自然,却不假装自己是人类;希望拥有情感智能,却不一味附和;希望提供个性化体验,却不带来不可接受的隐私暴露。

每个目标都会与另一个目标产生张力。更多上下文可以提升相关性,更多保留的上下文会增加敏感性,更多人工判断可以提升细致的安全性,更多人工访问则可能削弱用户信心。

行业偏好的答案一直是去标识化、访问控制、承包商协议和退出设置。随着助手变得更加亲密,Project Lily 正在检验这些措施是否仍具说服力。

竞争压力还可能带来另一个问题。模型质量部分依赖于多样化、及时反映真实使用情况的样本。大幅限制审核数据的提供商,可能失去有关新兴失效模式的宝贵证据。

这并不意味着隐私与性能必然互相排斥,而是意味着保护隐私的替代方案需要严肃投入和可量化的验证。

公司可以改进合成评估,使用设备端分类,将审核员可见内容限制为狭窄的摘录,或针对最敏感的任务采用受控的内部团队。它们还可以发布有关抽样和脱敏表现的汇总信息。

独立审计将有助于区分真正有力的保护措施与令人安心的表述。有效的披露可包括审核人员所在地点、访问时长、脱敏测试、事件发生率,以及每项任务是否确有必要提供记忆摘要。

OpenAI 还可以说明,对话是随机抽样、由自动化系统筛选,还是因为用户提交了反馈而被选中。每种机制都会带来不同的预期与潜在偏差。

抽样设计也会影响模型质量。由用户反馈选出的对话,可能会过度代表失败案例和参与度异常高的用户。随机样本或许能捕捉到普通行为,却也可能暴露从未主动提交反馈的用户的内容。

有关 Project Lily 的报道并未解答这些问题。它揭示了此前大多仅被称作“模型改进”的一类工作背后涉及的人员和机制。

即使人工审核仍有必要,这种可见性也很有价值。当 AI 服务背后的劳动不再被技术性语言掩盖时,消费者就能作出更明智的选择。

承包商的工作条件也是如此。评估人员可能接触令人不安、涉及性内容、暴力或高度私密的材料。负责任的项目需要心理健康保障、清晰的升级处理程序,以及现实可行的生产力预期。

这些劳动议题应当补充隐私分析,而非取而代之。核心矛盾仍然是 OpenAI 对可控模型改进的承诺,与人类可接触具体上下文这一现实之间的落差。

Project Lily 仍需证明什么

下一阶段应通过信息披露、可验证的隐私表现以及审核人员界面的变化来评判。

第一个信号是 OpenAI 是否会发布对 Project Lily 的直接说明。一份有实质意义的声明应描述哪些对话符合条件、同意设置如何适用,以及承包商可以看到什么。

如果确认报道所述的工作流程,将强化这样一个结论:人工审核是面向消费者的模型改进中的常规组成部分。若作出狭义否认或重大更正,则会削弱当前说法的部分内容。

沉默则会使证据仍主要依赖泄露材料和匿名工人的证词。这些材料意义重大,但无法回答所有运营层面的问题。

第二个信号是 OpenAI 是否提供有关 Privacy Filter 的可量化信息。用户需要的不只是“个人信息会在训练或审核前被减少”的声明。

有价值的证据应包括针对不同语言、罕见标识符、间接指代以及长对话的错误测试。独立评估的分量将高于公司给出的笼统描述。

较低且得到证明的失败率,将支持 OpenAI 关于其确实限制审核人员接触范围的主张。脱敏不一致的证据,则会强化对缩小抽样范围和加强控制措施的要求。

第三个信号是审核人员界面是否会改变。记忆摘要尤其值得关注,因为它们可能整合跨对话的细节,从而使重新识别更容易。

OpenAI 可以将这些摘要限制在确实需要个性化上下文的任务中。它也可以仅向审核人员提供最低限度的相关记忆,或用抽象类别替代个人细节。

在 ChatGPT 的模型改进设置附近提供醒目提示也很重要。提示应明确说明,入选的对话在经过隐私处理后可能会接受人工审核。

监管机构将关注这些披露与实际做法之间的关系。FTC 已明确表示,AI 公司必须履行隐私承诺,避免隐瞒数据的二次用途。

对用户而言,眼下的应对方式更简单:检查 ChatGPT 隐私控制,在适当情况下关闭模型改进,并在清楚了解其安全例外的前提下使用 Temporary Chat。

不要提交密码、金融凭证、私钥、未经脱敏的医疗记录或雇主机密数据。在请求协助前,请替换姓名和可识别身份的细节。

组织应核实员工使用的是获批准的商业产品,而非个人消费者账户。它们还应记录哪些信息类别可以进入 AI 系统,哪些必须始终排除在外。

OpenAI Project Lily 并不能证明每一段 ChatGPT 对话都会被承包商接触。但它说明了,外观私密的界面绝不应被误认为是一间私密房间。

人工审核可以提升准确性、语气与安全性。它也可能暴露使这些判断成为可能的个人上下文。行业必须以普通用户能够理解的语言说明这种交换。

在下一次敏感对话前检查你当前的设置。然后再问一个更棘手的问题:如果一名受过培训的审核人员在看不到你用户名的情况下读到这段提示,它是否仍然可以接受?如果答案是否定的,请移除可识别身份的上下文、选择数据承诺更强的产品,或将相关材料留在聊天机器人之外。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page