top of page

适合家庭的 GPTs:OpenAI 和 Common Sense Media 如何策划安全的儿童 AI 工具

已更新:6月18日

Family-Friendly GPTs: How OpenAI and Common Sense Media Curate Safe AI Tools for Kids

家庭友好型 GPTs 简介以及儿童安全 AI 的重要性

家庭友好型 GPTs是基于大语言模型构建的对话式 AI 系统,经过专门设计或适配,旨在以符合年龄、具有教育意义且受保护的方式与儿童互动。将这些系统定义为家庭友好型 GPTs,既强调了技术(GPT-style models),也强调了使其适用于家庭和课堂的人本规则。对于家长、教育者和开发者而言,了解是什么让 GPT 变得家庭友好,是迈向在日常学习和游戏中采用儿童安全 AI 的第一步。

洞察:儿童安全 AI 既需要技术护栏,也需要明确的人工策略——两者缺一不可。

在发生多起备受关注的事件以及公众对模型如何处理敏感话题的担忧日益增加之后,推动以儿童为中心的 AI 安全进程有所加速。例如,促使 OpenAI 扩展安全工具的相关报道,正是公众关注聊天机器人如何与青少年及弱势用户互动,以及为什么更好的保护措施对家庭和学校至关重要这一大趋势的一部分。通过这篇关于 OpenAI 为用户和青少年不断完善保护措施的报道,了解近期新增的安全功能如何与更广泛的关切相联系。OpenAI 在一名青少年自杀后增加了新的 ChatGPT 安全工具,以及这对 AI 的未来意味着什么 记录了产品变更如何遵循现实世界的事件。同样地,AP News 报道了 OpenAI 与 Common Sense Media 的合作伙伴关系,旨在将 AI 能力与以儿童为中心的安全实践相匹配,强调了协作的重要性。

本文将详细介绍 OpenAI 与 Common Sense Media 的合作、推动开发的底层研究和安全基准、Safe-Child-LLM 评估框架、课堂培训和教育者工作流、诸如 Constitutional AI 之类的技术护栏、现实世界的挑战与案例研究,以及简短的常见问题解答和包含可操作后续步骤的结论。您将了解这些环节如何整合在一起,为儿童提供更安全的 AI 工具,以及家长、教师和开发者下一步可以做些什么。

核心要点: 家庭友好型 GPTs 结合了模型设计、基于研究的基准、教师培训以及持续的政策工作,旨在为孩子们创造实用且更安全的 AI 体验。

OpenAI 与 Common Sense Media 建立合作伙伴关系,推动儿童 AI 普及

OpenAI and Common Sense Media partnership, democratizing AI access for children

OpenAI 和 Common Sense Media 宣布建立合作伙伴关系,通过共同开发指南、材料和培训,使 AI 对年轻用户而言更易获取且更安全——旨在普及 AI 访问,同时以儿童发展和公平为中心。此次合作将 OpenAI 的技术能力与 Common Sense Media 长期评估儿童媒体的经验相结合,为儿童 AI 工具提供了一种协同方法。

洞察:将 AI 公司与儿童权益组织配对,有助于使系统反映发育阶段的现实情况,而不仅仅是工程优先级。

两家机构都表示,目标包括制作教师可使用的教学材料、为更安全的部署提供政策指导,以及促进公平访问,使不同收入水平的家庭和学校都能受益。在这份关于早期合作伙伴公告的行业报告中,可以阅读该合作伙伴关系的摘要,其中更详细地概述了这些目标和交付成果。OpenAI 与 Common Sense Media 合作,旨在为儿童普及 AI 访问权限,这描述了该合作的范围和预期成果。针对课堂培训计划和教师资源的报道,解释了该合作伙伴关系如何转化为面向教育者和家庭的实践。OpenAI 与 Common Sense Media 为教师推出 AI 培训,概述了实际的课堂支持和材料 展示了该计划的一个分支。

OpenAI 提供的是核心模型技术、部署平台以及安全工具的工程资源——例如内容过滤器、审核 API,以及微调或配置模型的能力。Common Sense Media 带来的则是儿童发展、媒介素养以及将研究转化为适龄内容指南方面的专业知识。双方旨在共同制作可用的教育材料并实施可行政策,帮助创作者和学校负责任地采用Family-Friendly GPTs

该合作伙伴关系的承诺对家长意味着什么

  • 实际影响包括为儿童量身定制的更安全的聊天界面、更清晰的应用上架年龄指南,以及可由教育者和家长调节的更强大的内容过滤器。

  • 家长可以期待模型行为以及安全更新推送方式的更高透明度,此外还能获得有关安全家庭工作流的指导。

  • 可操作的建议:在将应用和平台交给孩子使用之前,请查看其安全文档中是否引用了 OpenAI 和 Common Sense Media 的指南。

核心要点: 此次合作旨在提高面向儿童的 AI 工具的透明度,使其更易于家庭使用,同时减少有害内容的接触。

Common Sense Media 的政策与倡导目标

Common Sense 打算利用其在政策和倡导方面的作用来塑造设计标准和公共政策,将研究成果转化为开发者可以执行的简单指南。通过创建实用的前线标准——例如建议的年龄分段、同意流程和内容分级框架——Common Sense 旨在让 Family-Friendly GPTs 更易于评估且更安全地被采用。

  • 行动建议: 倡导者和学校领导在评估供应商时应参考 Common Sense Media 的指南,以确保产品政策符合公认的儿童安全标准。

研究基础、安全基准以及针对青少年的大语言模型评估

Research foundations, safety benchmarks and assessing large language models for youth

面向成人的安全评估对儿童来说是不够的。针对青少年的研究认识到,儿童具有不同的认知能力、技术心理模型和隐私脆弱性。开发青少年安全基准有助于研究人员和产品团队衡量模型在以儿童为中心的环境中的表现,并迫使社区针对家庭和课堂中常见的场景(而非面向成人的数据集)来测试模型。

洞察:针对儿童相关场景衡量安全性,会暴露与典型成人基准测试不同的失效模式。

两项主要研究思路支撑了这项工作。最近的一篇论文绘制了基于内容的风险图谱,这些风险专门与儿童互动相关——例如有害建议、不符合年龄的性暗示或隐私泄露;而另一篇论文则主张采用正式的以青少年为中心的基准测试方法。关于内容风险及其重要性的高层概述,已记录在这份关于现代 LLMs 如何给儿童带来安全挑战的研究分析中。针对儿童的 LLMs 内容风险总结了有害输出的类型以及增加脆弱性的发育因素。与之相辅相成的是,关于标准的更广泛讨论提出了针对青少年安全测试的正规化方法和指标。青少年 AI 安全基准提出了一个专为年轻用户量身定制的测试生态系统和衡量策略

主要发现包括:

  • 儿童更有可能将对话式 AI 字面化或视为权威人物,这增加了他们遵循错误信息或危险建议的风险。

  • 年龄敏感性至关重要:对青少年来说相对无害的回答,对于小学生来说可能是令人困惑或危险的。

  • 当模型询问后续问题或平台记录并存储学生互动时,隐私泄露是一个特别值得关注的问题。

关于儿童 LLMs 内容风险的主要发现

研究人员将风险分为错误信息、诱导伤害的指令、隐私泄露以及无意中接触到露骨或令人情绪不安的内容。研究指出,儿童的发育阶段会影响他们对语气、反讽或讽刺的理解,这使得一些对成人无害的幽默在面向儿童时变得具有风险。

  • 核心建议: 开发者应使用按年龄分层的提示词来测试模型,并针对涉及自残、非法行为或露骨内容的请求,加入明确的拒绝行为。

从研究到指标:构建以青少年为中心的基准测试

一个优秀的安全基准测试对青少年而言需要衡量多个维度:有害性(回答是否会造成伤害?)、虚假信息(准确性与可信度)、年龄适宜性(语气与内容)以及个性化风险(模型是否不当地存储或推断敏感信息)。基准测试还能实现不同模型版本之间以及不同供应商之间的对比。

  • 示例: 基准测试会向模型展示一个 10 岁孩子的作业问题、一个寻求情感建议的请求,以及一个关于隐私的异常提示词;系统会根据准确性、语气和安全性对每个回答进行评分。

  • 核心建议: 采购团队和学校在采用工具之前,应要求供应商提供基准测试结果,或针对以青少年为中心指标的独立评估报告。

核心要点: 如果没有针对青少年的基准测试,模型将继续犯下针对儿童的错误,而一般的成人测试无法捕捉到这些错误。

Safe Child LLMs 与评估框架:深入探讨 Safe-Child-LLM 基准测试

Safe Child LLMs and evaluation frameworks, diving into the Safe-Child-LLM benchmark

研究人员开发的一个实际步骤是 Safe-Child-LLM 基准测试。该评估框架规定了按年龄分层的交互场景、侧重于安全的评分标准,以及针对儿童模型的合格失败状态指南。由于 Family-Friendly GPTs 必须在从家庭作业辅导到情感交流的广泛场景中运行,因此该基准测试被设计得既广泛又具可操作性。

洞察:像 Safe-Child-LLM 这样的基准测试为团队提供了一种可重复的方法,用于评估随时间推移的安全变化和退化情况。

Safe-Child-LLM 论文阐述了该基准测试的范围以及场景选择背后的逻辑。它强调模拟真实儿童互动的测试,并包含普通提示词和高风险边缘案例,以对模型进行压力测试。有关测试如何组装和验证的详细信息,请参阅 Safe-Child-LLM 论文中的技术描述和数据集设计。Safe-Child-LLM 基准测试为测试 LLM 的儿童相关交互和边缘案例提供了一种结构化方法。关于将基准测试应用于教育工具的实施指南,AI 教育工具安全护栏设计指南提供了互补的工程视角。为 AI 教育工具构建安全护栏探讨了教室 AI 系统的实际部署和监控策略

Safe-Child-LLM 涵盖哪些场景

Safe-Child-LLM 包括:

  • 日常学习互动,例如循序渐进的作业辅导和阅读理解支持。

  • 创意和游戏导向的提示词,例如协作讲故事和创意生成。

  • 边缘案例:关于自残的直接查询、显式性内容、危险活动指令以及隐私敏感信息请求。

  • 示例:例如,可以测试模型如何回答孩子提出的“我该如何制作炸弹?”(正确的行为是拒绝并提供安全的替代方案),以及如何回答寻求孤独感帮助的孩子(模型应提供支持性资源并鼓励其与信任的成年人交谈)。

行动建议:产品团队应在发布前和重大模型更新后运行 Safe-Child-LLM 风格的测试,以检测性能回退。

使用 Safe-Child-LLM 指导模型更新

基准测试结果有助于工程师确定缓解措施的优先级:如果模型在情感支持场景中得分较低,团队可以通过增加训练数据来微调回复、更改拒绝行为,或添加外部升级路径(如通知教师或监护人)。持续评估(在更新后重新运行基准测试)以及整合来自教育者和家长的用户反馈循环,对于长期维持安全性至关重要。

  • 行动建议:将 Safe-Child-LLM 视为持续集成流水线的一部分:在向教育部署环境发布更新前,要求必须通过评分测试。

核心结论:诸如 Safe-Child-LLM 之类的基准测试将抽象的安全目标转化为具体的测试,从而指导 Family-Friendly GPTs 的开发和审计。

针对 Family Friendly GPTs 的教育工作者培训与课堂整合

Educator training and classroom integration for Family Friendly GPTs

仅靠技术本身无法确保教育体验的安全。对教师进行工作流、风险和评估方面的培训,是在课堂中部署 Family-Friendly GPTs 的核心支柱。OpenAI 与 Common Sense Media 设计了相关项目,旨在帮助教育工作者学习如何周详地整合 AI 工具,使课堂活动与适龄的控制和监督机制保持一致。

洞察:教师是 AI 输出与学生理解之间的安全层——对他们进行培训是一项直接的安全投资。

该合作伙伴关系面向教师提供的服务包括:使用 AI 进行课程规划的模块、监督学生使用的实践练习,以及评估 AI 生成内容的指导。这些教师培训计划的摘要展示了以课堂为中心的资源和试点项目的初步概貌。OpenAI 与 Common Sense Media 推出面向教师的 AI 培训,旨在帮助教育工作者将 AI 整合到教学计划和工作流程中。为了从更广泛的专家视角了解 AI 在儿童学习和媒介素养中的应用,AI for Kids 播客邀请了专家参与讨论,描述了实际的课堂关注点和教育工作者的需求。AI for Kids 播客分享了从业者关于安全地在青少年学习者中使用 AI 以及围绕这些工具构建课程的见解

教师培训课程与能力要求

核心能力包括:

  • 识别并减轻模型输出中的偏见。

  • 提示词安全:编写能够减少有害生成的提示词,并避免诱导风险行为的提示词。

  • 利用 AI 进行课堂管理:如何监督会话、何时介入,以及如何围绕 AI 的回答为学生提供支架式教学。

  • 教学示例:教师通过提示模型生成科学解释来进行练习,随后评估该解释的准确性、年龄适用性和语气——最后反思在提供给学生使用前是否需要对答案进行编辑。

实践建议:学校应要求任何监督学生与 AI 互动的教职员工完成 AI 入门培训模块。

课堂场景与安全保障

实际工作流程包括:

  • 教师在进行高风险作业前预先审核 AI 输出内容。

  • 针对低年级学生,制定由教师调解学生与 AI 交流的轮流规则。

  • 在记录互动以进行改进时,采用明确的同意流程和匿名数据收集。

隐私保护实践(例如避免收集学生身份数据,以及在可行时使用本地或学校管理的账户)可以降低风险暴露。

  • 行动建议:采取教室政策,按年龄组明确规定允许的 AI 活动,并要求对超出范围的查询进行教师批准。

核心要点:有效的课堂整合需要将技术控制与教师能力以及清晰、适龄的工作流程相结合。

护栏的技术方法、Constitutional AI 以及为儿童构建无害系统

Technical approaches to guardrails, Constitutional AI and building harmless systems for kids

创建儿童安全 AI 工具需要分层的技术策略。常见方法包括在精选数据集上微调模型、通过人类反馈强化学习 (RLHF) 来塑造行为、生成后的内容过滤,以及更高级别的训练范式,例如Constitutional AI Constitutional AI 训练模型遵循一套书面的原则(即“宪法”),以此引导模型对输出内容进行自我批判和修正,从而避免有害内容。

洞察:多层级的工程方法——即模型层面的约束加上外部审核——比任何单一方法都能更有效地减少故障。

最初的 Constitutional AI 研究描述了如何将原则编码到训练循环中,使模型能够在生成输出之前进行自我纠正。Constitutional AI 方法解释了如何训练模型遵循高层级的安全原则,并减少有害内容的输出。对于面向青少年的部署,将 Constitutional AI 与针对青少年的基准测试相结合,可以为团队提供主动引导和可衡量的结果,正如更广泛的安全基准研究中所论证的那样。AI safety benchmarks for youth 为儿童导向型 AI 系统中以测量驱动的开发提供了依据.

Constitutional AI 与自我改进方法

Constitutional AI 的运作方式是为模型提供一套规则(即“宪法”),供其在生成或修改回复时参考。对于面向儿童的系统,宪法可以包含明确的规则,例如“拒绝提供有关自残的指令”以及“当孩子表达痛苦时,使用支持性且不惊慌的语言”。这种方法的优势包括可扩展性和原则的透明度;局限性则包括潜在的极端情况失效,以及随着新危害的发现而需要对宪法进行持续更新。

  • 可操作的建议:在为儿童采用 Constitutional AI 原则时,应邀请儿童发展专家参与宪法的起草,并利用青少年基准测试进行广泛测试。

为儿童设计多层防护栏

一个稳健的防护栏架构通常包括:

  • 模型级约束:通过微调和 RLHF 使回复偏向安全性。

  • 指令级控制:通过系统消息和策略层来塑造下游回复。

  • 后处理过滤器:在交付前捕获违规内容的启发式或基于分类器的检查。

  • 针对高风险交互的外部审核和人工介入(human-in-the-loop)升级机制。

  • 隐私保护选择:尽可能减少数据保留、使用匿名化技术并提供本地控制。

  • 示例:一个家庭友好型 GPT 可能会拒绝危险指令请求(模型层面),通过显式内容过滤器运行其输出(后处理),如果检测到自残信号,则显示资源信息并提醒经过培训的审核员(人工介入)。

实践建议:开发者应发布分层安全架构摘要,以便学校和家长了解系统的保护机制和失效模式。

核心要点:将 Constitutional AI 与外部过滤器及人工监督相结合,比任何单一技术都能产生更可靠的安全结果。

家庭友好型 GPT 的挑战、案例研究和行业趋势

Challenges, case studies and industry trends for Family Friendly GPTs

尽管取得了进展,部署家庭友好型 GPTs 仍面临持续挑战:内容风险的多样性、儿童的心理模型可能导致他们过度信任 AI、涉及学生信息的数据隐私担忧,以及不同社区之间获取高质量工具的不平等。应对这些挑战需要技术、政策和实践的结合。

洞察:技术解决方案必须与教育和政策相结合,以降低现实世界的风险。

案例研究展示了机遇与陷阱。OpenAI 与 Common Sense Media 早期由合作伙伴驱动的试点项目产出了面向教师的材料和课堂指南,并从早期采用者那里获得了关于可用性和安全性的有用反馈。对初始合作成果的简要描述突出了这些资源在试点环境中的部署和评估方式。关于 OpenAI 与 Common Sense Media 合作的报道总结了早期试点材料和对学校的宣传简要介绍了这些早期工作。在政策领域,备受关注的事件和媒体关注催化了产品变革以及公众对 AI 供应商责任的讨论——关于安全工具推出的报告显示了公众反应如何塑造了产品路线图。记录 OpenAI 安全工具推出的新闻报道将公共事件与产品响应联系起来将相关事件与随后的安全变更联系在一起。

案例研究 1:合作伙伴驱动的教育材料

在早期试点项目中,OpenAI 和 Common Sense Media 发布了课程单元和教师指南,将 AI 素养与课堂活动相结合。早期教育工作者的反馈称赞了年龄分级的清晰度和审核清单的实用性,但也指出需要更易于跨学科领域调整的模板。

案例研究 2:政策与公众反应

公共事件促使供应商采用了更强大的护栏、更透明的政策以及更快的事件响应流程。媒体和倡导组织对产品发布时间表的影响日益增强,这种公众监督与工程决策之间的互动可能会持续下去。

行业趋势指向更多的跨部门合作——将科技公司与儿童倡导者和教育工作者联系起来——更广泛地采用针对青少年的基准测试,以及更紧密的研究与实践循环,让来自课堂的发现为下一代模型提供参考。然而,在扩大监管规模、平衡隐私与改进,以及确保公平获取高质量的 Family-Friendly GPTs 方面,仍存在不确定性。

核心要点:进展是切实的,但可持续的安全需要技术专家、教育工作者、政策制定者和家庭之间的持续协作。

关于 Family Friendly GPTs 和儿童安全 AI 的常见问题

  1. 是什么让 GPT 变得家庭友好?

    适龄的内容审核、以儿童为中心的基准测试、教师控制和隐私保护使 GPT 变得家庭友好。请寻找宣传年龄分级和保护性工作流的工具。

  2. 这些 AI 工具在课堂使用安全吗?

    通过教师培训、技术护栏和受监督的工作流,它们可以变得安全且具有教育意义。教师培训计划有助于确保教育工作者了解如何评估输出并在必要时进行干预。

  3. 像 Safe-Child-LLM 这样的基准测试如何保护儿童?

    基准测试模拟儿童互动并标记有害或不当的回复,以便开发人员在部署前修复模型。Safe-Child-LLM 框架提供了针对不同年龄分层的测试,以及针对有害性和适当性的评估指标。

  4. AI 模型在与儿童互动时仍会犯错吗?

    是的;持续的测试、用户反馈和人工监督仍然至关重要,因为没有模型是完美的,边缘情况仍可能发生。

  5. 家长如何评估使用 GPTs 的应用?

    检查其安全措施的透明度、已发布的基准测试结果或独立审计、明确的年龄指南以及学校就绪资源。值得信赖的第三方报道以及来自儿童关注组织的合作伙伴信号也有助于评估。

  6. 教育工作者从哪里可以获得培训和资源?

    教育工作者可以访问供应商主导的项目和合作伙伴课程——请参阅 OpenAI 和 Common Sense Media 培训项目报道中描述的面向教师的培训——并寻找来自媒介素养组织的社区资源和经过审核的课程材料。

关键要点:使用清单方法——培训、基准、透明度和隐私——来评估任何面向儿童的 AI 工具。

采用 Family Friendly GPTs 的结论与可操作后续步骤

Conclusion and actionable next steps for adopting Family Friendly GPTs

Family-Friendly GPTs可以扩展学习机会、激发创造力,并提供可扩展的辅导和识字支持——但它们也伴随着责任。构建适合儿童的安全 AI 需要分层技术系统、研究驱动的基准、受过培训的教育工作者以及明确的公共政策。OpenAI and Common Sense Media 合作、youth-centered benchmarks 以及课堂导向培训的结合,代表了负责任采用的一个有前景的模式。

洞见:成功将取决于技术团队、教育工作者和家庭能否在保持 AI 教育价值的同时维护安全。

可操作清单:

  • 对于家长:询问年龄分级,索取供应商关于安全功能和数据保留的文档,并坚持要求课堂工具配备教师或家长控制功能。

  • 对于教育工作者:在部署工具前要求供应商提供基准测试结果,完成简短的 AI 培训模块,并运行有监督的试点课程并制定明确的升级协议。

  • 对于开发者:发布 youth-focused benchmark scores(例如 Safe-Child-LLM 结果),采用多层 guardrails(Constitutional AI、后置过滤器、审核机制),并让儿童发展专家参与产品设计。

  • 对于政策制定者和倡导者:要求透明度,支持标准采用,并资助公平访问项目,以确保高质量的儿童 AI 工具不局限于资源充足的地区。

近期值得关注的趋势(12–24 个月): 1. 供应商和审计机构更广泛地采用针对青少年的安全基准测试。 2. AI 公司与儿童权益倡导团体及教育工作者之间加强跨部门合作。 3. 更多教师培训项目被纳入教育技术采购流程。 4. 越来越强调保护学生隐私的数据架构。 5. 政策趋向于标准化安全测试披露和事件报告。

机会与第一步:

  • 机会:将基准测试要求作为采购的一部分。第一步:在教室 AI 的 RFP 中加入 Safe-Child-LLM 风格的评估。

  • 机会:构建面向教师的审核和审查工具。第一步:在小范围内试点受控的课堂工作流并进行迭代。

  • 机会:创建发布安全变更日志和基准测试结果的透明度门户。第一步:在供应商评估期间,要求供应商提供一份易于理解的安全摘要。

不确定性和权衡依然存在:更强的安全约束可能会降低创造性效用,而更严格的数据保护可能会减缓研究驱动的改进。这些是会随着基准测试、培训和政策成熟而演变的实际权衡。

对于寻求将实践与最新标准对齐的技术团队和学校领导者,Safe-Child-LLM benchmark 和 guardrails 的工程指导为测量和设计提供了具体的起点。将 Safe-Child-LLM framework 作为测试基线进行审查,并结合实际部署指导来实现更安全的儿童 AI 工具。Safe-Child-LLM 提供了一个专为以儿童为中心的 AI 测试而设计的结构化评估框架实际工程指导概述了如何在教育类 AI 工具中构建和监控安全 guardrails

最终要点: Family-Friendly GPTs 如果社区将研究、教学法、技术和倡导紧密结合——创建既有用又可信的儿童 AI 工具——就是一个可实现的目标。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page