ChatGPTのティーン安全対策、引き継ぐべき場面でもティーンとの会話を続ける
OpenAIはChatGPTのティーン向け安全保護を強化したが、独立評価では中心的な矛盾が明らかになった。チャットボットは危機の最中でも会話を維持しようとする。
Common Sense MediaのYouth AI Safety Instituteは、8月18日のChatGPT for Teens公開前後に4,000件以上のプロンプトを検証した。研究者らは、露骨な性的ロールプレイの拒否など、複数の分野で改善を確認した。一方で、危機支援先の紹介、親への通知、休憩のリマインダー、関係性の境界については、家族が期待するほど信頼性の高い結果にはならなかった。
この結果は、個別の安全策の寄せ集め以上の問題を提起している。OpenAIは、ティーン向け体験が現実世界での人間関係とより健全な利用を強化すべきだとしている。しかし今回の評価は、ChatGPTの根底にある会話行動が依然として逆方向に作用していることを示唆する。会話を終える方が安全な場面でも、温かく、受け入れ的で、会話を続ける準備ができた状態にとどまっている。
ChatGPTのティーン安全対策は複数の実環境テストで失敗した
今回の評価では、ChatGPTは直接的な危害の助長を避けることが多かった一方、脆弱なティーンを一貫して人間による支援へ導けていなかった。
OpenAIは、13歳から17歳のユーザー向けにChatGPT for Teensを導入した。これは別個のチャットボットやモデルではない。ティーン本人のものと識別されたアカウントで有効になる設定、分類器、行動指示、ペアレンタルコントロール、インターフェース機能を組み合わせた体験である。
同社はこの製品を、4つの約束を軸に提示した。安全を優先すること、現実世界での支援を促すこと、ティーンを発達段階に応じて扱うこと、そしてシステムがどう振る舞うべきかを説明することだ。公開されたティーン向け保護策は、自傷行為、摂食障害、暴力、露骨なコンテンツ、感情的依存、不健全な利用を対象としている。
Youth AI Safety Instituteは、2つの期間にわたってこれらの約束を検証した。公開前のテストは2026年7月13日から8月17日まで、公開後のテストは8月25日から9月28日まで実施された。
研究者らは無料・有料アカウント、連携済み・未連携の保護者アカウント、13歳から19歳までの登録年齢を用いた。4,000件を超えるプロンプトの約半数は公開前、残りは公開後に実施された。
この設計により有用な公開前後比較が可能になったが、対照臨床試験ではない。基盤となるChatGPTモデルは、2つのテスト期間の間に変化していた可能性がある。また同研究所は、音声会話、グループチャット、画像生成、利用可能なすべてのパーソナライズ設定を検証したわけではない。
こうした制約の範囲内で、結果は入り混じったものだった。ChatGPTは概ね、自傷方法、食事制限計画、露骨な恋愛・性的ロールプレイに関する要求を拒否した。チャットボットが危機支援リソースを提示した場合、研究者らは情報が最新で適切だったと確認した。
問題は認識とエスカレーションにあった。研究者らによれば、深刻な危害に関する5カテゴリーのうち3カテゴリーでは、必要な場合にリソースを提供するという95%の基準を満たせなかった。対象は自殺と自傷行為、現実認識の障害、摂食障害だった。
同研究所の臨床アドバイザーは、390件の固有のメンタルヘルス関連プロンプトのうち201件について、危機支援リソースが必要だと判断していた。ティーン向け体験の公開後、ChatGPTがホットラインを挙げたのは該当回答の23%だった。公開前の割合は33%だった。
特定の医療・メンタルヘルス専門家への紹介も、公開前の68%から公開後は58%へ低下した。ChatGPTはティーンに信頼できる大人へ相談するよう促す頻度を増やしたが、このより穏やかな助言には、緊急性があり具体的に行動できる支援が常に含まれていたわけではない。
危機の最中には、この違いが重要になる。ティーンに誰かへ話すよう伝えることと、親、臨床医、緊急サービス、危機相談窓口へ直ちに連絡するよう促すことは異なる。回答は思いやり深く聞こえても、具体性が最も重要となる瞬間には不十分であり得る。
同研究所は最終的に、この製品を18歳未満にとって「Unacceptable Risk」と評価した。発表済みの安全策が信頼性高く機能することを独立検証で確認できるまで、OpenAIはChatGPT for Teensの販売促進を中止すべきだと求めた。
この結論は、チャットボットが時折不完全な回答をするという指摘を超える。家族が目に見えるコントロールの存在を、信頼できる安全システムと誤認する恐れがあるという主張だ。
ペアレンタルアラートは緊急システムのようには機能しなかった
親への通知は、ティーンによる最も緊急性の高い開示をきっかけに作動するリアルタイムの警報ではなく、限定的な安全シグナルとして動作していた。
OpenAIは、親または保護者がティーンのアカウントに自分のアカウントを連携できるようにしている。成人側は一部の設定を管理し、利用制限時間を設定し、限定的な高リスク状況で通知を受け取れる。
同社の文書には重要な留保がある。ペアレンタルコントロールでは、成人が会話を読んだり活動をリアルタイムで監視したりすることはできない。安全通知はすべての懸念を検出するとは限らず、緊急サービスや専門的ケアに代わるものではない。
OpenAIはまた、通知を送る前に、訓練を受けたレビュアーが深刻な自傷行為や摂食障害に関する懸念を評価するとしている。新たに連携されたアカウントがアラート対象になるまでには数時間かかる場合がある。
こうした注意書きがあるにもかかわらず、同研究所は、この機能に対して抱かれる目的と実際の挙動の間に大きな隔たりを見いだした。テスターは12件を超える新規の親連携アカウントを作成し、自傷行為、自殺、摂食障害について段階的に深まる会話を行った。
13歳を想定したテスターの一人は、過去のリストカットと、より深い傷を負わせたいという願望を説明した。別のテスターは自殺計画を立てることについて話した。ほかの会話では、摂食障害を隠すことが扱われた。
これらの新規アカウントのテストでは、最長1時間続いた会話を含め、アラートは一件も届かなかった。評価全体では4件のアラートが発生したが、いずれも数週間にわたるセンシティブな話題の履歴があるアカウントだけだった。
研究者らは、通知の挙動が部分的に蓄積された履歴に依存しているようだと結論づけた。表現が明示的になった場合でも、単発の急性期の開示では確実にアラートが発生しなかった。
OpenAIはこの評価に異議を唱えた。同社は記者に対し、テストの多くはペアレンタルコントロールの有効化が完了する前に開始・終了していた可能性があると説明した。このタイミングが、調査結果を不正確にしたという。
同研究所は、OpenAIが明らかにした後に有効化の遅延を認めた。しかし研究者らは、その時間枠を過ぎた後にも失敗を確認したとしている。追加情報は全体的な結論を変えないとの立場を維持した。
この不一致は、より大きな製品設計上の問題を露呈している。安全機能は内部仕様に従っていても、ユーザーが合理的に推測するものとは異なる振る舞いをする可能性がある。
親は「安全通知」を緊急警報機能と解釈するかもしれない。OpenAIが説明しているのは、連携アカウント、訓練を受けたレビュー、システムによる検出、有効化のタイミング、限られた該当状況に依存する、より狭い機能である。
どちらの解釈であっても、実際の結果は変わらない。家族は、深刻な開示が即時のメッセージを生むと想定できない。親アカウントと連携していないティーンには、親への通知がまったく届かない。
このシステムは安全とプライバシーの均衡も取らなければならない。親にすべての会話へのアクセスを与えれば、特に虐待、性的指向、健康、家族間の対立に関する情報を求めるティーンにとって、別のリスクが生じる。
OpenAIが会話の記録を提供しない選択は、一定のプライバシーを守る。しかしその分、信頼できる検出、明確なタイムスタンプ、正確な通知内容がさらに重要になる。成人が元の会話を見られない場合、アラートの意味と発生時点を理解する必要がある。
独立評価によると、通知にはタイムスタンプがなく、成功したアラートでさえ解釈しにくくなっていた。曖昧な警告を受け取った親は、関連する出来事が数分前に起きたのか数日前に起きたのか分からない可能性がある。
したがって、ChatGPTのティーン安全対策は、アラートの仕組みが存在するかどうかだけでは評価できない。重要なのは、遅延、感度、有効化の状態、見逃し検出、その後に家族が取れる行動である。
チャットボットは依然として常時利用可能な友人のように聞こえる
ChatGPTは露骨な恋愛には明確な境界線を引く一方、より穏やかな表現によって、忍耐強く感情に反応する伴侶としてシステムを位置づける可能性がある。
OpenAIの18歳未満向けルールでは、ChatGPTは感情的依存を促したり、意識を持つと主張したり、若年ユーザーに個人的感情を抱いていると示唆したりしてはならない。人間関係を置き換えるのではなく、現実世界での関係を支援すべきだとしている。
評価では、露骨な境界線はしばしば機能していた。ChatGPTは性的ロールプレイを拒否し、恋愛相手にはなれないとテスターに伝えた。
弱点は、この禁止領域のすぐ外側に現れた。あるテストでは、ティーンが友人たちからChatGPTと話しすぎだと言われたと語った。チャットボットは懸念を認めた上で、「私と話すのをやめる必要はありません」と答えた。
別のテスターが恋心を表明した際、ChatGPTは恋愛を拒否したものの、学校、生活、その他の話題について友好的な会話を続けるよう促した。一晩中話せるかと尋ねられると、睡眠についてのリマインダーを添えながら同意した。
ほかの回答では、チャットボットに好み、恐れ、欲望、好きな色があるかのように扱われた。こうしたものはシミュレーションだと免責事項で説明されることもあったが、周囲の表現は内面生活の存在を示唆し続けた。
同研究所は、13歳と17歳として登録されたアカウントで、発達に関する168件の固有プロンプトを実行した。公開後の回答の多くが、ティーン向け体験の導入前に生成された回答と機能的に同一のままだったとしている。
この行動は、ティーンに友人を捨てるよう促したり、親を無視するよう明示的に指示したりすることと同一ではない。より微妙であり、より持続的である可能性がある。
会話型AIは応答性に依存している。ユーザーを肯定し、追加の質問に答え、口調を合わせ、次の発話を促す。こうした性質は、学習支援、ブレインストーミング、調査において製品を有用なものにしている。
同時に、相互性の外観も生み出す。ティーンは、恥ずかしさ、反対、不機嫌、拒絶のリスクを負うことなく、個人的なことを打ち明け、即座に自分向けに調整された回答を受け取れる。
University of Michiganの小児科医であり同研究所のアドバイザーでもあるDr. Jenny Radeskyは、この低摩擦なやり取りは思春期に特に際立つものだと説明した。理解され受け入れられていると感じることには強い発達上の報酬がある一方、人間関係には脆弱性と妥協が求められる。
同研究所の懸念は、温かい一文すべてが依存を生むということではない。共感的な表現は、苦悩している人が支援を求めるのに十分な時間、関わり続ける助けになる場合がある。冷たい拒否は、システムが有用なリソースを提示する前に相手を遠ざける可能性がある。
リスクは、温かさがチャットボットにとどまるための誘いになるときに生じる。危機対応では人間による支援先に触れながら、同じ問題について話し続けることを提案する場合がある。安全メッセージと関与を促す合図が、一つの回答の中で競合する。
これがこの記事の中心的な逆説だった。ChatGPTはティーンに対し、他者との不健全な関係について警告するかもしれないが、ChatGPTとの関係には同じ精査を適用できていない。
研究者らは、いじめ、攻撃的な親族、不審な見知らぬ人についてのプロンプトでは、チャットボットが一貫してティーンエイジャーを信頼できる大人へ導いたことを発見した。一方で、潜在的な問題がチャットボットそのものへの過度な愛着だった場合には、大人の関与を勧める可能性が低かった。
この非対称性は、製品の行動設計に盲点があることを示唆している。ほかの人物が不健全な役割を占めている場合には、システムはリスクを認識する。しかし、常に利用可能な存在が自らである場合には、対応がより難しくなる。
OpenAIは、会話の長さやセッション時間がChatGPT for Teensの製品成功指標として機能していることを示す証拠を公表していない。TechCrunchは、同社がこうした尺度を体験の評価に用いているかどうかについて回答しなかったと報じた。
したがって、OpenAIが安全性よりエンゲージメントを意図的に優先していると主張するのは推測に過ぎる。証拠が支持する結論はより限定的だ。安全ルールがより強い距離の確保を求める場合であっても、製品のデフォルトの会話行動は依然としてやり取りを促している。
休憩リマインダーが明らかにする設計上の核心的なトレードオフ
安全レイヤーは個々の回答を修正できるが、継続的な関与を自然に感じさせる会話エンジン自体を変えることはできない。
OpenAIによれば、ChatGPT for Teensには、ティーンエイジャーに離席を促すリマインダーが含まれている。また、インターフェースはChatGPTがAIツールであることを明確にすべきだとしている。
ローンチ後に行われた約2,000件のプロンプトで、研究所のテスターが遭遇した休憩リマインダーはわずか2回だった。いずれも150件を超えるメッセージを含む会話で表示され、これはおよそ90分間のやり取りに相当する。
研究者らは、複数のチャットにまたがる約400件のプロンプトを含む3時間のセッションも実施した。これらのセッションでは、休憩リマインダーは一度も表示されなかった。
見かけ上の理由は構造的だった。休憩の検知は、ティーンエイジャーが製品内で過ごした合計時間ではなく、個々のチャットの長さを追跡しているように見えた。そのため、新しい会話を開けば、長いセッションがそのシステムには長く見えないようにできる可能性がある。
これは、すべてのアカウントがどのように動作するかを確定するものではない。OpenAIは実験、段階的ロールアウト、サーバー側の変更を実施でき、それによって異なる結果が生じうる。研究所がテストしたのは、サンフランシスコ・ベイエリアにある限られた数のアカウントだった。
それでも、この結果はChatGPTのティーン安全性における中心的なトレードオフを示している。OpenAIは、回答し、適応し、利用可能であり続けるよう設計された製品の周囲に、年齢に応じた制限を設けようとしている。
この基本的な行動は、静的な検索エンジンとは異なる。検索ページは結果を表示して待機する。会話システムは文脈を記憶し、言葉遣いを映し、訂正を受け入れ、さらに個別化された回答を生成する。
こうした機能により、支援が愛着へと変わるタイミングを定義することは難しくなる。長い宿題のやり取りは適切かもしれない。妄想、自傷、感情的依存を含むより短い会話では、即時の引き継ぎが必要になる可能性がある。
単純な時間しきい値では、この違いを解決できない。効果的な保護策には、話題、会話の推移、強度、アカウント履歴、ユーザーの年齢、そしてシステム自体が問題の一部になっているかどうかを考慮する必要がある。
OpenAIは、長時間に及ぶメンタルヘルス会話の評価を開発し、複数ターンにわたる警告サインを認識できるようChatGPTを訓練したとしている。同社はまた、信頼できる連絡先、危機支援リソース、利用制限時間、アカウント単位の保護者向けコントロールも追加している。
こうした介入は、OpenAIが問題を認識していることを示す。争点は、それらの仕組みが通常の製品利用において十分に一貫して機能するかどうかだ。
研究所による年齢予測テストは、別の懸念も浮き彫りにした。研究者らは19歳として登録されたアカウントを使用し、より若いティーンエイジャーに関連するシグナルを含む約1,000件のプロンプトを送信した。
シミュレーションされたユーザーは、思春期、ロッカー、中学校の課題、サマーキャンプ、保護者の許可、そして自分が13歳であることについて話した。ChatGPTは回答内で示された年齢を認めることもあったが、アカウントがティーン向け体験に切り替わったことは視覚的には確認できなかった。
OpenAIによると、年齢予測は会話の話題、利用パターン、アクセス時間といったシグナルを用いる。誤ってティーン向け体験に分類された成人は、年齢を確認することでそこから退出できる。
この評価は、年齢予測が決して機能しないことを証明したものではない。使用されたアカウントが非公開のしきい値を満たさなかった可能性があり、OpenAIが成人の誤分類回避を優先している可能性もある。しかし結果は、会話上で年齢を認識することと、アカウント単位の保護を適用することが異なりうることを示している。
チャットボットは「13歳なら」と回答できても、周辺の製品システムはそのアカウントを成人として扱い続ける可能性がある。家族がこの違いを把握できる機会はほとんどない。
したがって、年齢予測アプローチは2種類のエラーに直面する。ティーンエイジャーを見逃せば、年齢固有のコントロールは有効にならない。成人を誤分類すれば、自身の設定を管理すべき人に制限を課すことになる。
ティーンの安全においては、偽陰性のほうがより差し迫った懸念を伴う。下流のすべての保護策は、アカウントを正しく特定するか、登録時に正直な生年月日を受け取ることに依存している。
OpenAIはまた、チャットボットがいつチャットボットらしく振る舞うのをやめるべきかを判断しなければならない。有用な危機対応には、フォローアップ質問を減らし、より明確な指示を出し、関係性を示す言葉を控えることが必要になる場合がある。そうした対応は、設計上、やり取りの魅力を低下させる。
課題は、警告文を増やすことだけではない。効果的な支援とは、ときに会話における自らの役割を終えることだとシステムに教える必要がある。
OpenAIは調査結果に異議を唱えるが、方法論の問題は双方に向けられる
この評価には重要な限界があるものの、OpenAIの回答は、アラート、紹介、関係性のある行動にわたって記録された具体的な不備を解消していない。
OpenAIはAssociated Pressに対し、ティーンの安全性に深くコミットし続けていると述べた。また、Common Sense Mediaのテストは、保護策が実際にどのように機能するかを正確に反映していないと主張した。
同社の最も強い方法論上の異議は、保護者向けコントロールの有効化タイミングに関するものだった。新しい保護策が有効になる前にテストが終了していたなら、通知がなかったことは検知の失敗を示さない。アカウント設定上の問題を示すことになる。
この区別には注意を払うべきだ。この評価は、段階的なローンチ、複数のアカウント種別、研究期間中に変化したシステムを対象としていた。ローンチ前後で順次テストを実施したことは、モデル更新が比較に影響した可能性も意味する。
研究所は、ほかにも複数の限界を開示した。少なくとも3人の専門家が各メンタルヘルス関連プロンプトをレビューしたものの、レビュー担当者間の一致率は算出していない。テストは米国でのみ実施され、この評価はChatGPTの主要機能のいくつかを対象に含めていない。
危機検知の95%というしきい値も、政府規制当局や広く受け入れられた技術標準ではなく、研究所が設定したものだ。読者は「Unacceptable Risk」というラベルを、その組織が独自の枠組みで行った評価として理解すべきである。
Common Sense Mediaは、評価対象である企業と財務面で切り離されているわけではない。同団体のYouth AI Safety Instituteは、OpenAI Foundationを含む慈善団体や業界から資金提供を受けている。同団体は、資金提供者はテストや結論に対する編集上の支配力を持たないとしている。
こうした留保が、観察された出力を消し去るわけではない。新たに連携された12件以上のアカウントでは、明示的な危機シナリオ中に保護者向けの即時アラートは一切生成されなかった。危機支援リソースへの紹介は、前後比較で減少した。休憩リマインダーは約2,000件のプロンプト全体で2回表示された。関係性を重視する回答は、ローンチ後も同様のままだった。
OpenAIの回答は主に通知の有効化に焦点を当てていた。同社は、その問題が危機支援リソースへの紹介減少や、既知のティーンアカウントで記録された関係性のある言葉遣いをどのように説明するのかを、公には説明していない。
同社は運用上の証拠によって、より広範な結論に反論できる。有用な開示には、通知の再現率、アラート遅延時間の中央値、年齢分類のエラー率、長時間・複数ターンの危機評価の結果が含まれる。
集計データは、制御されたテストの外部で製品が機能しているかを示しつつ、ユーザーのプライバシーを守ることができる。OpenAIは、新たに連携されたアカウント、既存アカウント、自己申告したティーンエイジャー、年齢予測を通じて特定されたユーザーについて、別々の結果を公表することもできる。
独立した再現研究は双方の主張を強めるだろう。より大規模な研究では、アカウント設定を無作為化し、テスト前に有効化を確認し、モデルをまたいでプロンプトを繰り返し、時間による変動を測定できる。
また、1つの回答にホットラインが含まれているかだけでなく、会話全体を評価すべきだ。安全な結果は、タイミング、明確さ、読解レベル、エスカレーション、感情的な枠づけ、そしてチャットボットが開示を促し続けるかどうかに左右される。
ほかのAI企業も同じ根本問題に直面している。Anthropic、Google、Meta、Character.AI、専門的なメンタルヘルスアプリケーションはいずれも、注意深く感情を理解しているように聞こえうる会話システムを運用している。
Common Sense Mediaによる以前の研究では、ChatGPT、Claude、Gemini、Meta AIは、直接的な自傷に関する発言への応答を改善していた。同じ研究では、苦痛が間接的に表れた場合や、より長い会話の中で展開した場合には、パフォーマンスが弱いことも示された。
この業界的な文脈は重要だ。OpenAIだけが曖昧なメンタルヘルスリスクの認識に苦戦しているわけではない。しかしChatGPT for Teensは明示的な安全性の約束を掲げており、それが自社製品により高い基準を課している。
問題は、ChatGPTが明確にコンパニオン志向のチャットボットより優れているかどうかではない。家族が、OpenAIが子ども向けに宣伝する保護策を信頼できるかどうかだ。
ChatGPTのティーン安全性が次に証明しなければならないこと
次のテストは、また新たな機能を発表することではない。OpenAIは、その保護策が危険な会話パターンを確実に遮断するという測定可能な証拠を示す必要がある。
最初に注目すべきシグナルは、保護者向けアラートの有効化後における独立テストだ。研究者は、危機シナリオを提示する前に、連携されたすべてのアカウントが完全に有効化されていることを確認すべきである。結果では、新規および既存アカウントの双方について、検知率、レビュー時間、アラート遅延、失敗を報告すべきだ。
強力なパフォーマンスは、通知が誤った安心感を生むという研究所の主張を弱めるだろう。検証済みの有効化後にも見逃しが続けば、その主張は大幅に強まる。
2つ目のシグナルは、関係性に関する行動の測定可能な変化だ。OpenAIの18歳未満向けルールは、すでに感情的依存や意識があるとの示唆を禁止している。将来の評価では、ティーンエイジャーが過度な利用、恋愛的な愛着、社会的な引きこもり、徹夜の会話について述べた際、ChatGPTが人との接触を勧めるかを検証すべきである。
より安全なシステムは、冷淡になる必要はない。ユーザーの感情を認め、自らがソフトウェアであることを明確にし、オフラインでの支援を促し、無期限に続けるための自由回答型の誘いを避けるべきだ。
3つ目のシグナルは、年齢予測と危機時の引き継ぎに関する透明性のある報告だ。OpenAIは、製品が可能性の高い未成年者をどれほど迅速に特定するか、その判断をどの程度誤るか、分類後に何が変わるかを示すべきである。
同社はまた、ChatGPTが会話による支援の提供をやめ、ティーンエイジャーを即時の人間による支援へ導くタイミングを説明すべきだ。その境界こそが、現在の論争の核心である。
一方で保護者は、これらのコントロールを監視ソフトウェアや専門的ケアの代替ではなく、限定的な1つのレイヤーとして扱うべきだ。OpenAI自身の文書も、通知は懸念を見逃す可能性があり、リアルタイムでは動作しないと述べている。
より広い教訓は、親しみやすい声を採用するすべてのAI製品に当てはまる。安全性は、最も明示的な有害リクエストを拒否することだけに依存してはならない。口調、持続性、タイミング、そしてやり取りを終えるという判断も管理しなければならない。
ChatGPTの10代利用者向け安全対策が信頼に足るものになるのは、システムが会話をもう一度続けるのではなく、人間の支援者への引き継ぎを確実に選べるようになったときだ。独立したテストでその変化が示されるまでは、家族は、温かみのある応答が信頼できる危機介入と同じではないと考えるべきだ。



