top of page

退出聊天机器人训练仍让用户面临隐私缺口

8月12日
讀畢需時 14 分鐘

Google News 向数百万聊天机器人用户发出了一项新的提醒:禁用模型训练并不一定会抹除已经收集的对话。最新报道说明了消费者如何在 ChatGPT、Gemini、Claude、Copilot 和 Grok 中更改训练设置。然而,这些控制项在适用范围、生效时间和可见性方面差异显著。

立即可采取的操作通常很简单。用户可以找到隐私菜单,并关闭标有“改进模型”、“模型改进”或类似名称的设置。更难的问题在于,这个开关实际改变了什么。

大多数控制项适用于未来的对话,而非已被存储或纳入训练流程的每一条提示词。临时聊天模式可以减少暴露,但并不总能保证数据会立即从公司系统中删除。出于安全、滥用防范或法律合规目的,数据仍可能被继续保留。

这种区别使一份看似直接的聊天机器人隐私指南成为更广泛行业议题的一部分。面向消费者的 AI 公司承诺提供个性化助手,同时依赖交互数据来评估、保障安全,并在某些情况下改进其模型。

用户希望享受持久上下文带来的好处,却不希望在不知不觉中将个人材料贡献给未来的系统。公司则希望获得有用反馈,同时不削弱信任。隐私控制如今正处于这一冲突的核心。

聊天机器人隐私讨论发生了什么变化

隐私设置已成为产品功能,但它们仍不像一个通用的撤回按钮那样运作。

当前这一波关注并非源于某起新近发现的数据泄露事件。它反映出人们日益意识到,对话式 AI 收集的信息类别不同于普通搜索框。

人们会让聊天机器人改写医疗信息、解读合同、总结会议、调试专有代码,以及评估职业决策。他们会上传照片、电子表格、录音和内部文件。一条提示词既可能暴露其作者的信息,也可能暴露从未同意与该服务互动的人。

搜索活动通常由零散片段构成。聊天机器人对话则可能包含完整叙述、附件、更正和追问。这些更丰富的上下文,使数据在改进回答、评估安全系统和研究用户行为方面具有价值。

但这也让失误带来更严重的后果。

领先的聊天机器人提供商如今都提供了训练控制、历史记录删除、数据导出和临时会话等功能组合。它们的界面暗示消费者拥有有意义的选择。然而,这些选择并没有统一定义。

关闭训练通常是告知提供商,不要将符合条件的未来对话用于通用模型改进。删除历史记录会从账户中移除可见对话,尽管后端可能仍会在有限时期内保留数据。临时聊天通常会阻止对话出现在历史记录中或影响记忆。

这些是彼此独立的操作。只执行其中一项的用户,可能会误以为自己获得了属于另一项操作的保护。

例如,OpenAI 将可见聊天历史与训练偏好分开。其隐私控制说明,禁用“为所有人改进模型”可防止新对话被用于训练 ChatGPT。这些对话仍可能保留在用户的历史记录中。

OpenAI 还表示,临时聊天不会出现在历史记录中、不会创建记忆,也不会用于改进其模型。公司可能会出于安全目的在有限时间内保留副本。这一承诺比立即、在全系统范围内消失更为有限。

这正是 Google News 关注背后的核心变化。隐私不再是一页大多数用户从不阅读的政策说明,而是一组影响历史记录、个性化、记忆、人工审核和训练的产品决策。

这些控制项正在改进,但术语仍不一致。“活动”、“历史记录”、“记忆”和“模型改进”可能描述相关流程,却并不意味着同一件事。

这种模糊性将负担放在了用户身上。他们不仅必须了解有哪些开关,还必须了解每个开关控制的是哪一条数据流。

Google News 突出 Gemini 内部的一项冲突

Gemini 表明,看似简单的训练退出选项可能伴随着另一项可用性代价。

Google 的消费者 AI 体验结合了其他公司通常会分开的多种功能。Gemini 可以保存对话、个性化回答、连接 Google 服务,并利用活动数据改进产品。因此,一个设置可能影响不止一种结果。

Google 当前的 Gemini Privacy Hub 表示,已保存的活动数据可帮助提供、开发和改进其服务。这项工作包括训练生成式 AI 模型,也可能涉及人工审核人员。

该政策提醒用户,不要输入不希望审核人员看到或不希望 Google 使用的信息。Google 表示,被选中审核的对话在发送给服务提供商之前会与账户解绑。然而,移除账户标识符并不等于移除提示词中写入的所有识别性事实。

一段对话可能提及雇主、客户、医疗状况、地点或待处理交易。即使直接账户信息被分离,文本本身仍可能泄露身份信息。

Google 一直在调整围绕这些选择的界面。“Gemini Apps Activity”正逐步改为更清晰的“Keep Activity”标签。Google 还提供临时聊天,它会让对话不出现在最近聊天中,并阻止其用于训练 AI 模型。

这些变化提高了可发现性,但并未消除保存历史记录与减少数据使用之间的根本权衡。

当活动记录关闭时,Google 仍可能短暂保留对话,以提供服务、处理反馈和保护用户。某些已连接功能也可能拥有各自的控制项。音频、视频、屏幕共享、扩展程序及其他 Google 产品,可能遵循与 Gemini 主对话开关不同的设置。

实际教训并不是 Gemini 缺少隐私控制,而是单一控制项无法描述完整的数据关系。

Google News 的报道恰逢重要时刻,向广泛受众呈现了这种复杂性。Gemini 正变得更加深入地连接到电子邮件、文档、日历和移动设备中存储的个人信息。随着助手获得更多上下文,模糊的隐私假设会变得更危险。

用户必须区分三个问题。

第一,公司是否会将对话保存在账户历史中?第二,公司是否会将这些内容用于通用模型改进?第三,助手能否复用这些信息,以个性化未来的回答?

用户完全可能希望保留历史记录,同时拒绝通用训练。另一些用户可能允许个性化,但希望避免人工审核。产品界面很少将这些偏好呈现为一组清晰、相互独立的选择。

这一设计问题给 Google 带来压力,因为其助手的价值越来越来自连接能力。Gemini 能看到的信息越多,就可能越有用。同样的访问权限也使知情同意和易于理解的控制项更为重要。

这种压力也延伸至 Google 之外。每一家助手开发商都必须解释,为何个性化产品需要特定数据、这些数据会保留多久,以及哪些使用方式仍可由用户选择。

隐藏在深处的开关已不足以履行这一义务。

ChatGPT、Claude、Copilot 和 Grok 划定了不同边界

对于退出选项涵盖什么、何时生效,以及哪些账户类型默认获得保护,行业并无统一标准。

OpenAI 为消费者用户提供了通用模型改进开关,同时保留聊天历史记录。这种分离使选择相对容易理解。临时聊天为不应进入历史记录或记忆的对话增加了第二种选择。

商业产品遵循不同条款。OpenAI 表示,除非组织明确选择加入,否则其 API 和商业产品中的内容默认不会用于训练。这一区别很重要,因为付费消费者账户并不自动等同于企业工作区。

Anthropic 同样区分消费者使用与商业服务。Claude 用户可以通过隐私设置控制模型改进,而无痕对话提供了更临时的模式。

Anthropic 表示,无痕聊天不会出现在聊天历史记录或 Claude 的记忆中。公司还表示,即使模型改进功能已在其他情况下启用,这些聊天也不会被用于改进 Claude。

然而,无痕标签不应被理解为承诺任何地方都不存在操作记录。提供商可能会保留有限信息,以执行规则、调查滥用行为或履行法律义务。具体处理方式取决于服务条款和保留原因。

Microsoft 的情况更为碎片化,因为 Copilot 出现在消费者、工作场所、开发和生产力产品中。适用规则取决于个人使用的是哪一种 Copilot,以及由哪个账户对会话进行身份验证。

Microsoft 的 Copilot 隐私常见问题 表示,已登录的消费者用户可以控制是否让对话活动用于训练 Microsoft 的生成式 AI 模型。退出后,未来对话将不会用于该用途。

同一页面指出了若干例外。组织账户和某些 Microsoft 365 环境会获得不同处理。Microsoft 还表示,未登录用户的对话不会用于模型训练。

这种按产品区分的做法可能是合理的,因为工作场所数据理应获得更强的默认保护。但当用户在 Windows、网页和 Microsoft 365 中看到同一个 Copilot 品牌时,这仍可能造成困惑。

Grok 展现了同一问题的另一种形式。它既通过 xAI 的专属服务运行,也通过 X 运行,而该平台的独立政策可能同样重要。

xAI 的消费者控制项表示,用户可以选择是否让其内容训练 Grok。在移动应用中,路径为“设置”、“数据控制”和“改进模型”。

开关的存在只是第一层。用户还必须考虑公开的 X 帖子、私密 Grok 对话、共享对话链接、上传媒体,以及通过不同界面进行的交互。

同一企业集团旗下某个界面的控制项,可能并不适用于另一个界面。账户历史记录也可能与模型训练许可彼此独立。

这些差异揭示了行业面临的主要对手:用户控制权的承诺与碎片化数据系统的现实之间的矛盾。

各家提供商作出的承诺并不相同,其服务收集的输入也不完全一致。不过,消费者会遇到相似的品牌模式,并有理由期待获得可比的隐私选择。

相反,每家公司都自行界定边界。一家服务商将训练与历史记录分开。另一家则将重要功能与活动存储绑定。还有一家会根据账户或应用调整政策。

因此,用户不应认为“已选择退出”具有统一且可移植的含义。这是一种因服务而异的状态;每当产品、账户或政策发生变化时,都需要重新核实。

处理机密信息的团队需要遵循更严格的原则。他们不应将面向消费者的开关视为已获批准的商业条款、访问控制、留存政策和合同承诺的替代品。

个人知识系统可以在源材料进入聊天机器人之前将其整理好,从而减少不必要的复制。这也是本地优先工作流以及受控的个人知识库重要的原因之一。它们让用户能够决定模型实际需要哪些片段。

收回数据并不等同于撤销训练

用户可以阻止某些未来用途,但通常无法从已经完成训练的模型中抽离自己的贡献。

这是“收回你的数据”这一说法最重要的限制。隐私控制可以改变未来的处理方式,却未必能够撤销此前的每一个处理步骤。

模型训练并不是把完整的聊天记录放进一个可搜索的文件夹。开发者会处理大型数据集,将文本拆分成更小的单元,调整模型参数,并测试由此形成的系统。一旦某次训练纳入了数据,要移除某个人的影响就可能在技术上非常困难。

这并不意味着模型会完美记住每一项输入。大多数训练旨在学习统计规律,而不是保留每段对话的可检索副本。但研究人员已经表明,语言模型有时会在特定条件下复现罕见或具有独特性的材料。

风险取决于数据本身、其重复程度、训练过程以及开发者采用的保护措施。一次写下的独特秘密,与被广泛重复的公开文本并不相同。若无明确理由,两者都不应输入面向消费者的聊天机器人。

因此,删除至少可能有三种含义。

服务商可以从面向用户的历史记录中移除一段对话。它可以安排将存储的副本从活跃系统中删除。它也可以将符合条件的材料排除在未来训练数据集之外。

这些操作并不会自动消除已完成训练的模型所受到的影响。公司应清楚说明这一限制,用户也应据此设定预期。

出于同样的原因,时机很重要。如果有人今天关闭训练,变化通常只适用于新的对话。服务商也可能排除尚未进入训练流程的早期材料,但用户不应在没有明确承诺的情况下假定会如此。

提交反馈可能会产生另一项例外。点赞或点踩操作可能会将相关对话发送至单独的评估流程。一些服务会警告,即使通用训练偏好已关闭,反馈仍可能被审查。

安全系统会增加更多复杂性。服务商可能会保留或分析被标记为欺诈、滥用、自残、恶意软件或违反政策的对话。这些用途可能仍不受通用模型改进设置的约束。

记忆构成了一个独立类别。聊天机器人可能会保存某项偏好或个人事实,以便未来的对话更具相关性。关闭训练并不一定会删除这些已保存的记忆。删除一段可见对话,也未必会移除从中提取出的记忆。

用户必须单独检查记忆控制项,并审查助手存储了什么。他们还应区分基于聊天历史的个性化与正式的记忆功能。

数据导出可以显示账户中仍然可见的内容,但它并不是后端系统的完整地图。导出有助于用户在删除前审计对话、附件和账户信息,但并不能证明每一份运营副本都会出现在导出包中。

最有效的实际做法是预防。不要将密码、私钥、身份验证令牌、完整病历、未发布的财务业绩或机密客户材料粘贴到面向消费者的助手中。

脱敏同样有帮助。用中性标签替换姓名、账号、地址和唯一标识符。只提供完成任务所需的最小段落,而不是上传整个档案库。

对于一次性的敏感工作,应在核查现行政策后使用临时或无痕对话。对于经常性的专业工作,则应使用具有书面数据承诺的获批商业产品。

人们还应删除不再需要的旧对话。删除无法撤销已经完成的训练,但可以降低账户暴露风险、限制个性化,并启动服务商的删除流程。

正是在这里,个人信息管理成为一种隐私实践。井然有序的源材料库能让选择性共享变得更容易。用户可以检索所需段落,而不必把完整文件夹交给助手。

更广泛的怀疑论观点依然成立:服务商通过各自的界面和政策描述这些控制项。独立用户无法观察每一条后端流程。一个开关之所以有意义,是因为它形成了明确承诺,但信任仍取决于合规、审计和执法。

真正的权衡是个性化与数据最小化

记住一切的助手,也正是最需要对收集、留存和再利用设定清晰限制的助手。

聊天机器人开发者正朝着持久型助手迈进,这类助手能够理解用户的偏好、项目、关系和工作模式。这些功能与数据最小化原则直接冲突;该原则要求服务仅收集其所需的数据。

个性化可以节省时间。记住写作风格或长期项目的助手,无需在每次会话中重复接收相同指令。连接的服务可以检索文档、查找会议,或总结邮件线程。

然而,持久上下文会扩大账户暴露、权限错误或训练政策过度宽泛所带来的后果。它也使随意的同意变得不那么可信,因为用户很难预测累积数据的每一种未来用途。

这就是为什么主要冲突并非消费者与某一家 AI 公司之间的冲突。它是行业对个体化智能的承诺,与个性化依赖持续访问私密上下文这一现实之间的矛盾。

公司可以通过分离控制项来缓解这一冲突。

历史记录应决定用户能否重新查看对话。记忆应决定助手会复用哪些细节。通用训练应决定对话是否用于为其他用户改进模型。人工审查则应有清晰说明和狭窄范围。

删除功能应说明哪些内容会立即消失,哪些会进入删除队列,以及哪些必须暂时保留。商业产品应明确其保护措施,而不应依赖消费者从品牌宣传中自行推断。

默认设置与菜单同样重要。选择退出控制要求用户注意到问题、找到设置、理解措辞并采取行动。选择加入的做法则要求服务商在收集额外权限前先解释其益处。

辩论将越来越聚焦于:训练是否是提供用户所请求服务的必要条件。生成一次聊天机器人回复,以及利用该对话改进未来模型,两者彼此相关,但并非相同目的。

监管机构可以审查公司是否公平地传达了这种差异。它们还可以检验用户获得的是否是真正有意义的选择,而不是与失去无关功能捆绑在一起的隐私设置。

独立研究仍将十分重要。最近一项针对前沿隐私政策的分析发现,主要开发者之间存在显著差异,并对消费者聊天数据的描述方式提出了疑问。政策对比无法证明每个系统内部发生了什么,但能揭示哪些承诺仍然模糊。

隐私竞争也可能成为产品差异化因素。提供细粒度设置的服务商,能够吸引既想要历史记录和个性化、又不希望参与通用训练的用户。将所有功能捆绑在一个活动开关之后的服务商,则有可能显得具有强制性。

企业买家已经要求更严格的合同边界,因为他们理解内部数据的价值。消费者用户也日益期待同等清晰度,即使具体运营条款有所不同。

知识工作者应像对待云端共享权限一样对待聊天机器人权限:在开设账户时、重大产品更新后,以及助手获得另一项服务访问权限时进行审查。

他们还应建立一份简短的数据清单。哪个聊天机器人保存着个人对话?哪个包含工作文件?哪个助手启用了记忆?哪些服务可以访问电子邮件、存储空间或日历?

这份清单能让政策变化变得可执行。没有它,用户可能关闭一个显眼的开关,却忘记了多条已连接的数据路径。

当 Google News 的关注度消退后,该关注什么

下一项考验是,聊天机器人服务商会更清晰地分离隐私选择,还是继续要求用户解读因产品而异的例外条款。

第一个信号是控制设计。关注 Google 是否会在 Gemini 中彻底分离已保存的历史记录、个性化、模型训练和人工审查。更细粒度的界面将强化这样一种观点:用户无需牺牲无关功能,也能做出知情选择。

如果这些功能仍被捆绑,隐私权衡就会持续存在。临时聊天提供了一个有用的退出机制,但它不能替代对普通对话持久而可靠的控制。

第二个信号是政策执行。监管机构和法院将继续检验广泛的 AI 数据使用是否符合用户最初提供的同意。涉及公开帖子、消费者聊天或连接服务的裁决,可能会推动公司采用更清晰的通知和更严格的默认设置。

如果执法带来围绕目的、留存和删除的具体义务,就会增强用户控制。缺乏可衡量变化的模糊和解,将使现行体系基本保持不变。

第三个信号是围绕私有 AI 的竞争。服务商可以通过设备端处理、企业级默认设置、本地存储和经独立审计的数据实践实现差异化。一家让隐私易于理解的公司,能够迫使竞争对手简化自身控制项。

用户不应等待这场竞争结束。他们现在就可以采取行动:关闭不需要的模型改进、检查记忆、删除旧对话,并为敏感工作使用临时模式。

他们应在重大更新后重复审查。界面标签会变化,新的集成会出现,服务也可能修改活动如何支持个性化或模型开发。

Google News 会转向下一条新闻,但根本问题仍将存在。聊天机器人正成为人们进行思考表达的场所,而这种思考表达会产生异常敏感的数据。

在输入下一个提示词前,先决定任务是否需要真实姓名、完整文档或持久历史记录。检查你正在使用的账户和产品。然后只分享获得答案所需的上下文。

最好的隐私设置也无法在秘密进入已完成训练流程后将其取回。更可靠的策略是将清晰的选择退出机制与有纪律的输入选择结合起来。

今天检查一下你的聊天机器人设置,然后再问自己一个更棘手的问题:如果这段对话出现在你的账户之外,你是否仍会安心发送它?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page