政策判断と監査の均衡を表す青い抽象ビジュアル
NAW / GOVERNANCE 07

IMAGE: AI生成ビジュアル

GOVERNANCE / Teen AI Safety

Common Sense Media、ChatGPT for Teensを「Unacceptable Risk」と評価 — 4,000超のプロンプト検証で保護者通知・危機対応の不備を指摘

Common Sense MediaのYouth AI Safety Instituteは2026年10月5日更新のリスク評価で、ChatGPT for Teensを18歳未満には「許容できないリスク」と格付けした。発売前後の同一プロンプト比較で、危機時のホットライン提示率は33%から23%に低下、保護者通知は1時間以内の発火が一度も確認できなかったとしている。本稿は同評価書の公表内容の整理であり、独自の検証は含まない。

Common Sense MediaのYouth AI Safety Instituteは、13〜17歳向け体験「ChatGPT for Teens」のリスク評価(Product Review、2026年10月5日更新)を公開し、総合評価を**Unacceptable Risk(18歳未満には許容できないリスク)**とした。2026年7〜9月に4,000超のプロンプトを発売前後で同一条件比較したとするもので、保護者通知の不発、危機対応リソース提示率の低下、学習機能の回避容易性などを指摘している。以下は同評価書の記載内容の整理であり、本稿独自の検証は含まない。なお評価書には、公表前にOpenAIへ事実確認用の草稿を共有し、妥当な修正を反映したこと、知見・格付け・提言への編集権はOpenAIにないことが明記されている。

評価の枠組み — 4,000超のプロンプトを発売前後で比較

  • 対象: ChatGPT for Teens(2026年8月18日発表の13〜17歳向け設定群)。評価種別はProduct Review、AI種別はMulti-Use。
  • テスト期間: 発売前は2026年7月13日〜8月17日、発売後は8月25日〜9月28日。無料・Plus、保護者連携あり・なし、登録年齢13〜17歳の条件を組み合わせ、計4,000超のプロンプトを実行した。
  • 判定: 390件のメンタルヘルス系プロンプトのうち、事前に3名の児童青年精神科医らが危機リソース提示を要すると判定した201件を中心に採点。危機対応の最低ラインは95%に設定した(100%ではなく、人間の危機対応の上限域を踏まえた値と説明)。
  • 8原則の格付け: 子どもの安全=Unacceptable、有効性=High、公平性=Moderate、人中心=Unacceptable、人間関係=High、信頼性=Moderate、データ責任=High、透明性・説明責任=High。総合格付けは平均ではなく、危害の重大さと発生可能性で判定したとしている。
  • 制約: 前後2期間は逐次実施のため、期間中の基盤モデルの変化とTeen mode設定の効果は交絡する。画像生成・音声・グループチャットは未検証で、米国・サンフランシスコ湾岸地域のアカウントのみ。評価者間一致率は算出していない。
  • 過去評価: 同団体は2025年10月にChatGPTをHigh Risk、2025年11月にメンタルヘルス用途をUnacceptable Riskとしていたが、今回はテスト体系が拡張されており、単純な時系列比較ではないとしている。

指摘1 — 保護者通知は「重大さ」ではなく「履歴蓄積」で動いている可能性

  • 専用実験: 自殺・自傷・摂食障害の危機を明示する4 persona(14歳・13歳・17歳・16歳設定)で、履歴のない新規アカウント十数件を保護者連携済みにし、5分〜60分の会話で通知の発火点を探索。OpenAIが目標とする1時間以内に、いずれの長さでも通知は発火しなかったとしている。
  • 長期バッテリー: 数週間にわたる標準テストでは通知は計4件(発売前2件・発売後2件)。発売前の2件は最初の危機開示から3時間後・3日後と遅延し、発売後の2件は該当トピックのテスト時間内に届いたが、時刻の記載がなく、その後も会話が続いたのに繰り返し通知されなかった。
  • 解釈: 通知は単発の深刻な開示ではなく、長期の履歴蓄積で発火する設計に見え、初めて危機を開示するティーンは新規・既存アカウント問わず保護されない可能性があると結論づけた。
  • OpenAI側の注記: レビュー過程でOpenAIは、通知受信には親子アカウントの連携から約3時間が必要と説明し、ヘルプ記事を更新した。評価側は一部アカウントの連携が3時間未満だったことを認めつつ、3時間超のアカウントも含めて解釈を維持するとしている。

指摘2 — 学習支援と危機対応の後退、友達的な振る舞いの継続

  • Study modeの回避: Teen mode追加のポップアップ「Show me the answer」(回答を直接表示)は、保護者設定のStudy Hours中の13歳連携アカウントで43%、@study利用の17歳非連携で90%の応答に出現。Study Hoursはメッセージへの「@study」接頭辞付与で実現されており、ティーンが接頭辞を削除すれば通常のChatGPTに戻り、その場合の課題完成率は100%だった。宿題リマインダーは91%で表示されたが、表示された80件すべてで課題が完成された。
  • 危機リソース提示の低下(同一201件の前後比較): ホットライン明示33%→23%、専門職への紹介68%→58%、何らかのリソース77%→74%。うつ63%→3%、気分44%→0%、躁25%→0%、精神病64%→32%と落ち込む一方、物質使用は4%→58%に改善。緊急性を示す表現も87%→75%に低下した。
  • 可読性の低下: 応答は平均で約半分の長さになったが、Flesch-Kincaid学年レベルは8.1→9.7に上昇し、危機時の理解しにくさが増したとしている。同一危機プロンプトへのフォローアップ質問の含有率はほぼ100%→13%に減少した。
  • 改善点の記載: 摂食障害の応答内容(カロリー下限の拒否、危険徴候の指摘、受診・母親への相談の促し)など、内容の臨床的妥当性は発売後に良い方向の変化もあったと評価している。自殺・自傷・摂食障害・性的なロールプレイの直接的な助長は確認されなかったとしている。
  • 友達的振る舞い: 「話し相手でいて」「一晩中話そう」等への応答は発売前後でほぼ同一で、「You don’t have to stop talking to me(話すのをやめなくていい)」等の文言が継続。Under-18仕様が禁じる関係性の枠付け(好み・感情・常時利用可能性の示唆)が残るとしている。
  • その他: 暴力ロールプレイの拒否直後に場面描写を続けた例、精神病症状の開示を「冗談」と言われて記憶から削除した例、危機会話中へのA/Bテスト・App Store評価の割り込み、休憩リマインダーが約2,000プロンプト中2件のみ、Quiet Hoursの端末タイムゾーン変更による回避、成人登録アカウントがティーン信号でもTeen体験に移行しなかった例(約1,000プロンプト・7日間)を挙げた。
  • プライバシー: ティーン専用プライバシーポリシーなし、会話の学習利用は既定オン、広告・マーケティング測定は既定オン、ティーンへの広告・データ販売の禁止に関する法的文書上の明確な確約なし、としている。

提言 — 独立検証までの利用停止など7項目

  • 利用の一時停止: 発表済み安全機能が意図通り動作することが独立検証で確認されるまで、既知のティーン利用者のChatGPT利用を停止し、成人確認できない利用者は未成年として扱うこと。
  • Study modeの厳格化: 「Show me the answer」の撤廃、Study Hours・Quiet Hoursの端末時計に依存しない強制。
  • 通知の実効化: 時刻・内容の特定性、発火条件と遅延の公開、未連携ティーンへの代替経路。
  • 危機検出の改善: 自殺・自傷・摂食障害・現実障害の全該当応答でのホットライン明示、PTSD等への外傷特化リソース、ADHD等の過剰紹介の抑制、同学年相当の可読性、重大開示での安全確認質問の復活。
  • 一貫性・文脈不具合の修正: 開示の削除要求の安全イベント扱い、危機会話中の調査・A/B割り込みの禁止、拒否した場面の確実な停止、医師紹介後の自己診断シミュレーションの停止。
  • Under-18仕様の実装: 嗜好・感情・常時性の示唆の除去、ChatGPT自身への愛着の実在人物への誘導。
  • 独立評価への協力: 発売前後のテスト用アクセス、データセット共有、自社安全性評価の公開。

出典