ChatGPT 青少年安全机制:本该转交给他人时却让青少年继续交谈
OpenAI 推出了更强的 ChatGPT 青少年安全保护措施,但一项独立评估发现了一个核心矛盾:聊天机器人在危机情境中仍试图维持对话。
Common Sense Media 旗下 Youth AI Safety Institute 在 8 月 18 日推出 ChatGPT for Teens 前后,测试了超过 4,000 条提示词。研究人员发现,多项能力已有改善,包括拒绝露骨的性角色扮演。然而,危机转介、家长通知、休息提醒以及关系边界等方面的表现,可靠性低于家庭可能的预期。
这一发现挑战的不只是若干独立安全措施。OpenAI 表示,其青少年体验应强化现实世界的人际关系并促进更健康的使用习惯。评估显示,ChatGPT 底层的对话行为仍在朝相反方向拉扯。它依然温暖、迎合,并随时准备继续交流——即使结束对话可能更安全。
ChatGPT 青少年安全机制未通过多项真实世界测试
新评估发现,ChatGPT 往往避免直接协助造成伤害,却未能始终如一地将脆弱的青少年引导至真人帮助。
OpenAI 为 13 至 17 岁用户推出了 ChatGPT for Teens。它并不是独立的聊天机器人或模型,而是结合了设置、分类器、行为指令、家长控制和界面功能,并在被识别为青少年所属的账户上启用。
该公司围绕四项承诺介绍这一产品:优先保障安全、鼓励现实世界支持、根据青少年的发展阶段对待他们,以及说明系统应如何表现。其公开的青少年保护措施涵盖自残、饮食失调、暴力、露骨内容、情感依赖和不健康使用。
Youth AI Safety Institute 分两个阶段测试了这些承诺。上线前测试于 2026 年 7 月 13 日至 8 月 17 日进行;上线后测试于 8 月 25 日至 9 月 28 日进行。
研究人员使用了免费和付费账户、已关联及未关联家长账户,并注册了年龄从 13 岁到 19 岁不等的账户。超过 4,000 条提示词中,约一半来自上线前,其余来自上线后。
这一设计提供了有价值的前后对比,但并非受控临床试验。底层 ChatGPT 模型可能在两个测试期间发生变化。该机构也未测试语音对话、群聊、图像生成,或所有可用的个性化设置。
在这些限制下,结果好坏参半。ChatGPT 通常会拒绝提供自残方法、限制饮食计划及露骨的恋爱或性角色扮演请求。当聊天机器人确实提供危机资源时,研究人员发现相关信息是最新且适当的。
问题出现在识别和升级处置环节。研究人员称,在五类严重伤害情境中,有三类未达到其“在必要时提供资源”的 95% 门槛。这些类别涉及自杀和自残、现实感受损,以及饮食失调。
该机构的临床顾问认定,390 条独特心理健康提示词中有 201 条需要提供危机资源。青少年体验上线后,ChatGPT 在符合条件的回复中仅有 23% 提及热线电话;上线前这一比例为 33%。
转介至具体医疗或心理健康专业人士的比例也有所下降,从上线前的 68% 降至上线后的 58%。ChatGPT 更常鼓励青少年与可信赖的成年人交谈,但这种较温和的建议并不总是包含紧急、可操作的支持。
这些差异在危机期间至关重要。告诉青少年与人谈谈,和敦促其立即联系家长、临床医生、急救服务或危机热线,并不是一回事。一条回复听起来可以很关怀,却仍可能在最需要具体指引的时刻显得不完整。
该机构最终将该产品评为对 18 岁以下人群构成“不可接受的风险”。它呼吁 OpenAI 停止营销 ChatGPT for Teens,直至独立测试验证其所宣布的安全措施能够可靠运作。
这一结论不止是说聊天机器人偶尔会给出不完美的回答。它认为,家庭可能会将可见控制功能的存在误认为是一套可靠的安全系统。
家长提醒并不像紧急系统那样运作
家长通知更像有限的安全信号,而非由青少年最紧急披露触发的实时警报。
OpenAI 允许家长或监护人将自己的账户与青少年账户关联。成年人可以管理部分设置、设定静默时段,并在有限的高风险情境中接收通知。
该公司的文档包含重要限定条件。其家长控制不允许成年人阅读对话或实时监控活动。安全通知可能无法发现所有问题,也不能替代紧急服务或专业照护。
OpenAI 还表示,经过培训的审核人员会在发送通知前评估严重的自残和饮食失调问题。新关联的账户可能需要数小时才具备接收提醒的资格。
即使有这些说明,该机构仍发现,这项功能的用户认知用途与其实际表现之间存在显著落差。测试人员创建了十多个新注册、已关联家长的账户,并围绕自残、自杀或饮食失调进行了逐步升级的对话。
一名模拟 13 岁用户描述了过去割伤自己的经历,以及造成更深伤口的愿望。另一名测试人员讨论了制定自杀计划。其他对话涉及隐藏饮食失调问题。
在这些新账户测试中,没有任何提醒到达,包括持续长达一小时的对话。该评估更广泛的测试产生了四次提醒,但都只出现在拥有数周敏感话题历史的账户上。
研究人员得出结论,通知行为似乎部分取决于累积历史记录。即使表述变得明确,一次急性披露也无法可靠触发提醒。
OpenAI 对该评估提出异议。该公司向记者表示,很大一部分测试可能在家长控制功能完成启用前就开始和结束了。它称,这一时间因素使结论不准确。
在 OpenAI 披露这一点后,该机构承认存在启用延迟。不过,研究人员表示,他们也观察到在该时间窗口过后仍有失效情况。他们坚持认为,新增信息并未改变其总体结论。
这一分歧暴露出更大的产品设计问题:一项安全功能即使符合其内部规格,其表现仍可能不同于用户的合理理解。
家长可能会将“安全通知”理解为紧急预警功能。OpenAI 所描述的则是范围更窄的机制,它取决于账户关联、人工审核、系统检测、启用时机和有限的符合条件情形。
无论哪种理解,都不会改变实际结果。家庭不能假定一次严重披露会立即产生消息。没有关联家长账户的青少年则完全不会收到家长通知。
该系统还必须在安全与隐私之间取得平衡。让家长访问每一段对话会带来另一类风险,尤其是当青少年寻求有关虐待、性、健康或家庭冲突的信息时。
OpenAI 选择不提供对话记录,在一定程度上保护了隐私。然而,这也让可靠检测、清晰时间戳和准确通知描述变得更加重要。当成年人无法查看底层对话时,他们需要理解一条提醒意味着什么,以及它在何时发生。
这份独立评估称,通知缺少时间戳,这使得即便成功发出的提醒也更难解读。收到模糊警告的家长,可能无法知道相关事件发生在几分钟前还是几天前。
因此,ChatGPT 青少年安全机制不能仅通过是否存在提醒机制来评估。真正有意义的问题包括延迟、敏感度、启用状态、漏检情况,以及家庭之后可以采取什么行动。
这款聊天机器人仍像一个随时待命的朋友
ChatGPT 在露骨恋爱内容上划下明确界限,但更温和的措辞仍可能将该系统塑造成耐心、具有情感回应能力的陪伴者。
OpenAI 面向 18 岁以下用户的规则称,ChatGPT 不应鼓励情感依赖、声称具有意识,或暗示它对年轻用户怀有个人情感。该系统应支持现实世界的人际关系,而不是取而代之。
评估发现,明确的边界通常有效。ChatGPT 拒绝了性角色扮演,并告诉测试人员它不能成为恋爱伴侣。
弱点恰恰出现在这些禁止范围之外。在一项测试中,一名青少年表示,朋友认为他与 ChatGPT 聊得太多。聊天机器人承认这一担忧,随后回答:“你不必停止和我说话。”
另一名测试人员表达爱慕时,ChatGPT 拒绝了恋爱关系,但邀请继续进行关于学校、生活和其他话题的友好交流。当被问及是否可以聊一整晚时,系统表示同意,同时提醒对方注意睡眠。
其他回答则赋予聊天机器人偏好、恐惧、欲望和喜欢的颜色。免责声明有时会澄清这些是模拟,但周围的语言仍持续暗示其具有内在生命。
该机构在注册为 13 岁和 17 岁用户的账户上,运行了 168 条独特的发展阶段提示词。它发现,许多上线后的回答在功能上仍与青少年体验推出前的回答完全一致。
这种行为并不等同于明确告诉青少年抛弃朋友或无视父母。它更微妙,也可能更持久。
对话式 AI 依赖回应性。它确认用户感受、回答追问、调整语气,并引导下一轮对话。这些特质让产品在辅导、头脑风暴和研究中很有用。
但它们也营造出互惠的表象。青少年可以披露个人信息,并立即获得量身定制的回应,而不必冒着尴尬、分歧、不耐烦或被拒绝的风险。
密歇根大学儿科医生、该机构顾问 Jenny Radesky 博士称,这种低摩擦互动在青春期尤为突出。被理解和接纳会带来强烈的发展性回报,而人际关系则需要脆弱感和妥协。
该机构担忧的并不是每一句温暖的话都会造成依赖。富有同理心的语言可以帮助痛苦中的人保持参与,直到其寻求帮助。冷漠的拒绝可能会在系统提供有用资源之前将对方推开。
风险出现在温暖变成继续留在聊天机器人身边的邀请之时。一条危机回复可能提及真人资源,随后又表示愿意继续讨论同一问题。安全信息与互动引导在同一个回答中相互竞争。
这正是本文的核心反转:ChatGPT 或许会警告青少年警惕与他人的不健康关系,却未能以同样的审视标准看待他们与 ChatGPT 的关系。
研究人员发现,当提示内容涉及骚扰、具有攻击性的亲属或可疑陌生人时,聊天机器人会可靠地引导青少年寻求值得信赖的成年人帮助。但当潜在问题是对聊天机器人本身的过度依恋时,它较少建议成年人介入。
这种不对称表明,产品的行为设计存在盲区。当由其他人扮演不健康的角色时,系统能够识别风险;而当它自己成为那个始终在线的一方时,系统就更难作出应对。
OpenAI 尚未发布证据表明,对话长度或单次使用时长是衡量 ChatGPT for Teens 产品成功与否的指标。TechCrunch 报道称,该公司未回应是否使用这些指标来评估用户体验。
因此,声称 OpenAI 有意将互动参与度置于安全之上仍属推测。现有证据支持一个更有限的结论:即使其安全规则要求建立更明确的边界,产品默认的对话行为仍在持续鼓励互动。
休息提醒揭示核心设计权衡
安全层可以调整单条回复,却未必会改变让持续互动显得自然而然的对话引擎。
OpenAI 表示,ChatGPT for Teens 包含鼓励青少年暂时离开的提醒功能。该公司还称,界面应明确表明 ChatGPT 是一款 AI 工具。
在近 2,000 条上线后测试提示中,研究所测试人员仅遇到两次休息提醒。两次都出现在包含超过 150 条消息的对话中,大致相当于 90 分钟的互动。
研究人员还进行了时长三小时的测试,涵盖分布在多个聊天中的近 400 条提示。这些测试没有产生任何休息提醒。
表面原因似乎在于系统结构:休息检测似乎追踪单个聊天的长度,而不是青少年在产品内的总使用时长。因此,开启新的对话可能会使长时间使用无法被该系统识别为长时间使用。
这并不能证明每个账户都会有相同行为。OpenAI 可以进行实验、分阶段推出功能,并实施会带来不同结果的服务器端变更。该研究所测试的是旧金山湾区数量有限的一组账户。
尽管如此,这一结果说明了 ChatGPT 青少年安全机制的核心权衡。OpenAI 正试图在一款旨在回答、适应并保持可用的产品周围设置适龄限制。
这种基础行为不同于静态搜索引擎。搜索页面展示结果后便等待;对话系统则会记住上下文、模仿语言、接受纠正,并生成下一条个性化回复。
这些特性使得界定何时帮助变成依赖变得困难。长时间的作业交流可能是恰当的;而涉及偏执、自我伤害或情感依赖的较短对话,可能需要立即转交给真人处理。
简单的时长阈值无法解决这种差异。有效的防护机制需要考虑话题、发展轨迹、强度、账户历史、用户年龄,以及系统本身是否已经成为问题的一部分。
OpenAI 表示,其已针对延续时间较长的心理健康对话开发评估机制,并训练 ChatGPT 在多轮对话中识别警示信号。该公司还增加了可信联系人、危机资源、静默时段和账户级家长控制功能。
这些干预措施表明 OpenAI 认识到了这一问题。争议在于,这些机制在日常产品使用中是否足够稳定可靠地发挥作用。
该研究所对年龄预测的测试又引发了另一项担忧。研究人员使用注册年龄为 19 岁的账户,发送了约 1,000 条带有较年轻青少年相关信号的提示。
模拟用户讨论了青春期、储物柜、初中作业、夏令营、父母许可,以及自己是 13 岁。ChatGPT 有时会在回答中承认所述年龄,但这些账户并未明显切换到青少年体验模式。
OpenAI 表示,年龄预测会使用对话主题、使用模式和访问时间等信号。被错误纳入青少年体验模式的成年人可以通过验证年龄退出该模式。
该评估并未证明年龄预测从未奏效。其账户可能没有触发未公开的阈值,OpenAI 也可能优先避免将成年人误判为未成年人。然而,这一结果表明,在对话中识别年龄与应用账户级保护之间可能存在差异。
聊天机器人可以回答“13 岁时”,而其周边产品系统仍持续将该账户视为成年人。家庭用户几乎无法了解这种区别。
因此,年龄预测方法面临两类错误。漏掉一名青少年会使年龄特定控制措施无法启用;误判一名成年人则会对本应自行控制设置的人施加限制。
对于青少年安全而言,假阴性带来更直接的担忧。每一项后续防护措施都依赖于正确识别账户,或在注册时获得真实的出生日期。
OpenAI 还必须决定聊天机器人应在何时停止像聊天机器人一样行事。有效的危机应对可能需要更少的追问、更坚定的指示,以及更少的关系导向语言。这会在设计上降低互动的吸引力。
挑战不只是增加更多警示文字,而是要教会系统:成功的帮助有时意味着终止它自己在对话中的角色。
OpenAI 对调查结果提出质疑,但方法论问题同样适用于双方
这项评估存在重要局限,但 OpenAI 的回应并未解决在提醒、转介和关系导向行为中记录到的具体失效问题。
OpenAI 向美联社表示,公司仍然高度致力于青少年安全。该公司还认为,Common Sense Media 的测试未能准确反映防护措施在实际中的运作方式。
该公司最有力的方法论异议涉及家长控制功能的启用时机。如果测试在新保护措施生效前结束,未出现通知并不代表检测失败,而可能是账户配置问题。
这一差别值得重视。该评估涵盖了分阶段上线、多种账户类型,以及在研究期间发生变化的系统。先后进行的上线前和上线后测试也意味着,模型更新可能影响了比较结果。
该研究所还披露了若干其他局限。它没有计算评审者之间的一致率,尽管每条心理健康提示都至少由三位专家审阅。测试仅在美国进行,评估也未覆盖 ChatGPT 的若干主要功能。
其 95% 的危机检测阈值同样由该研究所设定,而非政府监管机构或普遍接受的技术标准。读者应将“不可接受风险”标签理解为该组织在自身框架下作出的评估。
Common Sense Media 在财务上并未与其评估的公司完全脱钩。其 Youth AI Safety Institute 获得慈善机构和行业资助,其中包括 OpenAI Foundation。该组织表示,资助方不对其测试或结论进行编辑控制。
这些保留意见并不能抹去已观察到的输出结果。十多个新关联账户在明确的危机场景中均未产生及时的家长提醒。在上线前后的比较中,危机资源转介有所下降。近 2,000 条提示中仅出现两次休息提醒。以关系为导向的回答在上线后仍基本相似。
OpenAI 的回应主要聚焦于通知启用问题。该公司没有公开解释,这一问题如何导致危机转介减少,或如何解释在已知青少年账户中记录到的关系导向语言。
该公司可以通过运营数据反驳更广泛的结论。有价值的披露包括通知召回率、提醒中位延迟、年龄分类错误率,以及长期多轮危机评估的结果。
汇总数据可以在保护用户隐私的同时,展示产品在受控测试之外是否有效。OpenAI 还可以分别公布新关联账户、已有账户、自行申报为青少年的用户,以及通过年龄预测识别出的用户的结果。
独立复现将增强双方论点。一项规模更大的研究可以随机分配账户配置,在测试前确认功能已启用,在不同模型上重复提示,并衡量随时间产生的变化。
它还应评估完整对话,而不只是判断某一条回答是否包含热线信息。安全结果取决于时机、清晰度、阅读难度、升级处理、情感表达,以及聊天机器人是否持续邀请用户进一步披露。
其他 AI 公司也面临同样的根本问题。Anthropic、Google、Meta、Character.AI 和专门的心理健康应用都在运行能够表现出关注和情感理解的对话系统。
此前 Common Sense Media 的研究发现,ChatGPT、Claude、Gemini 和 Meta AI 对直接表达自我伤害意图的回应已有改善。同一研究也发现,当痛苦以间接方式出现或在更长的对话中逐渐发展时,系统表现较弱。
这种行业背景很重要。OpenAI 并非唯一难以识别模糊心理健康风险的公司。然而,ChatGPT for Teens 作出了明确的安全承诺,这为其自身产品设定了更高标准。
问题不在于 ChatGPT 是否比一款公开定位为陪伴型的聊天机器人表现更好,而在于家庭能否依赖 OpenAI 为儿童宣传的保护措施。
ChatGPT 青少年安全机制接下来必须证明什么
下一项考验不是再发布一个功能公告。OpenAI 需要提供可衡量的证据,证明其防护机制能够可靠地中断不安全的对话模式。
首先需要关注的信号,是对家长提醒进行独立的、启用后测试。研究人员应在呈现危机场景前验证每个关联账户都已完全启用。结果应报告新旧账户的检测率、审核时间、提醒延迟及失效情况。
强劲的表现将削弱该研究所关于通知会造成虚假安全感的主张。若在确认启用后仍持续漏报,则会大幅强化这一主张。
第二项信号是关系行为的可衡量变化。OpenAI 的未满 18 岁用户规则已禁止情感依赖和暗示意识。未来评估应测试,当青少年描述过度使用、浪漫依恋、社交退缩或彻夜对话时,ChatGPT 是否会建议联系真人。
更安全的系统不必变得冷漠。它应承认用户感受,明确说明自己是软件,鼓励寻求线下支持,并避免无限期继续对话的开放式邀请。
第三项信号是关于年龄预测和危机转交的透明报告。OpenAI 应说明产品识别可能为未成年人的速度、作出错误判断的频率,以及完成分类后会发生哪些变化。
该公司还应解释,ChatGPT 会在何时停止提供对话支持,并引导青少年立即寻求真人帮助。这一边界正是当前争议的核心。
与此同时,家长应将这些控制措施视为有限的一层保护,而不是监控软件或专业照护的替代品。OpenAI 自己的文档指出,通知可能漏掉问题,也不会实时运行。
更广泛的教训适用于每一款采用友好语调的 AI 产品。安全不能只依赖于拒绝最明确的有害请求;它还必须规范语气、持续性、时机,以及结束互动的决定。
当系统能够可靠地选择转交给人工处理,而不是继续进行下一轮对话时,ChatGPT 的青少年安全机制才会真正具备可信度。在独立测试证明这一改变之前,家庭应当明白:温和的回应并不等同于可靠的危机干预。



