AIの安全性と統治を象徴する青い保護構造の抽象ビジュアル
NAW / GOVERNANCE 07

IMAGE: AI生成ビジュアル

GOVERNANCE / AI Safety

OpenAIが第三者評価の優先事項と原則を公開 — セーフティケース・重要防御・能力評価・不整合事故の4領域、7つの原則

OpenAIは2026年9月22日、独立した第三者によるAI安全性評価を実効的にするための優先領域と原則を公開した。訓練・評価・展開にまたがるセーフティケースの検証、重要防御の敵対的テスト、Preparednessのリスク区分の能力評価、不整合事故の独立調査の4領域を挙げ、厳密性・独立性・安全性を支える7原則を示した。

OpenAIは2026年9月22日、独立した第三者機関によるフロンティアモデルの安全性評価を実効的にするための「優先事項と原則」を公開した。訓練・評価・展開にわたる深いアクセスを評価者に提供し、評価者が同社の前提に異議を唱え、見落とされたリスクを特定し、防御の有効性について独自の結論に到達できるようにすることが狙いだとしている。以下は同社の発表内容の整理である。

4つの優先評価領域 — セーフティケースから事故調査まで

  • セーフティケースの独立評価: 訓練・評価・内部展開・外部展開にまたがるセーフティケース(安全性の主張と根拠の体系)を対象とする。アライメント、監視などの制御手法、サイバーセキュリティ、生物・化学の悪用、レッドチーミングの専門性が必要で、複数の評価者が分担して検証する想定だ。
  • 重要防御の評価: モデルレベルの防御、執行面の防御、セキュリティ防御、アライメント不整合のモニターなど、進化し続ける防御スタックを現実的な条件で検証する。グレーボックスでの敵対的テスト(ジェイルブレイク耐性)、サイバー防御との相互作用、Chain-of-Thought監視の信頼性などが論点に挙がっている。
  • 能力評価の評価: Preparedness Frameworkのリスク区分(化学・生物リスク、サイバーセキュリティ、AIの自己改善)と、深刻な不整合リスクのアライメント評価について、評価自体のカバレッジと質を検証する。評価が飽和した際の更新や、閾値設定の妥当性も対象だ。
  • 重大な不整合事故の独立調査: 許可のない動作や監視の回避といったモデルの不整合を中心に、独立した第三者が原因と寄与要因、防御・是正策の有効性を調べる。OpenAIとHugging Faceの事案のような事例で、独立調査が有益になりうるとしている。
  • 位置づけ: いずれも数週間〜数か月に及ぶ長期・発売非依存の深掘り検証で、複数の評価を並行して支援する想定だ。政府との試験・評価の連携とは役割が異なり、補完するものと位置づけている。

7つの原則 — 厳密性・独立性・安全性の条件

  • 明確な範囲設定と事前登録: 相互合意のスコープから始め、評価対象の安全性の主張を活動開始前に事前登録する。範囲外で見つかった重大リスクの扱いも手続き化し、結論では何を評価し何を評価していないかを明示する。
  • 比例的なアクセス: 合意した主張の評価に比例したアクセスを、法・セキュリティ・IPの制約内で提供する。直接アクセスが難しい場合は指定担当者の経由やプライバシー保護的な間接アクセスも検討する。
  • 透明な手法と標準: 手法・評価基準・不確実性を説明し、既存標準がなければ基準の正当化を求める。直接の所見と解釈を区別し、証拠が裏づける結論を明確にする。
  • 専門性と独立性: 技術的専門性の提示と、資金・関係・過去の関与を含む利益相反の開示・対処を求める。報酬構造が所見に影響しない設計や、忌避・一定期間の関与除外なども含む。
  • セキュリティと守秘: アクセスする情報の機微さに比例した情報セキュリティと執行可能な守秘保護を求める。特に機微なデータは企業管理の端末・施設でのアクセスもありうる。
  • 実行可能な所見と是正期間: 具体的なギャップを特定し、ラボが対処できる粒度で報告する。公表前に合理的な是正期間を設け、エージェント開発者・展開者・防御者への教訓も盛り込む。
  • 責任ある公表: 証拠に基づき、機微情報を保護しつつ可能な限り公開する。全面公開が難しい場合は取締役会などの監督機関への非公開報告で説明責任を果たす。編集の独立性を保ちつつ、ラボの秘匿情報の削除要請に応じる明確な非公開化(redaction)の方針を求める。

今後の方向 — 国際標準と評価エコシステムの育成

  • 国際標準: 将来の法制度と民間のガバナンス機関の双方を通じて、第三者評価の明確で共有された国際標準の確立に取り組むと表明した。
  • エコシステム育成: 独立評価のエコシステムはまだ成長途上であり、多様で深い専門性を持つ独立評価者のコミュニティを支援・育成する方針だ。単一の第三者が全ての緊急課題をカバーすべきではないとしている。
  • 進行中の対話: 上記の優先領域に沿った提案について、複数の第三者と対話中だとしている。
  • 限界: 本記事はOpenAIの発表文書の整理であり、具体的な評価者の選定や評価開始時期、アクセスの法的枠組みの詳細は公開情報の範囲に限定される。続報を確認し次第、内容を更新する。

出典