AIの安全性と統治を象徴する青い保護構造の抽象ビジュアル
NAW / GOVERNANCE 07

IMAGE: AI生成ビジュアル

GOVERNANCE / Governance

OpenAI、フロンティアAI訓練向け「セーフティケース」指針の初期版を公開 — 訓練継続の前に構造化された安全文書を要求

OpenAIは2026年9月28日、フロンティア強化学習の訓練実行を継続する前に構造化された安全文書を求める考え方と、その初期ガイドライン「Towards safety cases for frontier AI training」を公開した。技術的セーフガード(アライメント訓練・封じ込め・監視)、運用ガイドライン(第三者による反証・幹部の拒否権・監査・段階的エスカレーション)、ミスアライメント事案の調査手順の3本柱で構成される。航空・原子力のような厳密さには未達と認めつつ、枠組みの成文化を進めるとしている。

OpenAIは2026年9月28日(米国時間)、フロンティアAIの強化学習(RL)訓練を対象とする「セーフティケース(安全論証)」に向けた初期ガイドライン「Towards safety cases for frontier AI training」を公開した。新たなフロンティアRL訓練の実行を継続する前に、リスクに関する包括的・構造的・証拠ベースの文書を求めるべきだという考え方が柱で、航空や原子力といった安全重視産業の実務を参照している。以下は同社公開ページの記載内容の整理であり、提案の有効性に関する独立した評価ではない。

問題設定 — 訓練の前に安全文書を要求する新時代へ

  • 主張: 構造化された安全文書なしにフロンティアRL訓練の実行を継続すべきではないとし、理想的には他産業の「セーフティケース」水準の文書を求めるべきとしている
  • 位置づけ: セーフティケースは目指すべき北極星としつつ、能力段階ごとに創発的な複雑さが生じるため、航空・原子力並みの厳密さの実現は課題であると認めている
  • 範囲: 本書はフロンティアRL訓練に焦点を当てたもので、内部・外部デプロイにはさらに広範なアライメント特性の検討が必要としている
  • 状態: 現時点の学びを反映した初期のベストプラクティスで、社内プロセスの反復とともに進化する見込みとし、コミュニティからのフィードバックを求めている。運用面の推奨は同社で導入途上で、今後数週間で進化を続けるとしている

技術的セーフガード — アライメント訓練・封じ込め・監視の3層

  • 全体像: (1)モデルをミスアラインさせないアライメント訓練、(2)仮にミスアラインしても有害行動を防ぐ封じ込め、(3)ミスアライン行動を捉える監視の3層で構成する
  • 訓練環境とグレーディング: 報酬ハックへの正の強化を防ぐため、壊れたRL環境をエージェントで発見・修正する自動データセットレビュー、手動レビュー、環境の搾取を罰するグレーダー調整、過去実験の軌跡への分類器適用などを挙げている
  • アライメント測定: 訓練中のオフライン評価での後退調査、過去事案へのバックテストによる検出力確認、評価認識・メタゲーミングの監視と阻止閾値、最悪ケースのストレステストを挙げている
  • CoTの扱い: 自動グレーダーに思考過程(chain-of-thought)を見せないことで、CoT監視を回避する方向への進化を防ぐとしている
  • 封じ込め: サンドボックスと研究基盤の多層防御、フロンティア訓練のチェックポイントを用いた封じ込めのレッドチーミング、承認経路以外の高帯域なサンプル間通信の制限、RL訓練・評価・内部デプロイの記録の長期保存(例: 書き換え不可のライトワンスストレージ)を挙げている
  • 監視: 監視可能性と監視回避の評価と閾値、過去事案への高い再現率、新規実行ごとの新鮮な評価データ、定義されたSLA内の優先アラート対応(例: 日中はセキュリティ当番と実行責任者へページング、夜間の無応答アラートでは自動停止)を挙げている

運用ガイドラインと事案調査 — 拒否権・監査・CEOへのエスカレーション

  • 反証レビュー(プレモーテム): セーフティケース起案後、別チームのメンバーが欠陥を探す反証文書を書き、訓練チームが対応することで文書を強化するとしている
  • 承認と拒否権: 上級リーダー(研究組織責任者・VP、安全責任者、チーフサイエンティストなど)が審査し、各員が実行への拒否権を持つことで多重の社内チェックを確保するとしている
  • 説明責任: 訓練実行の責任者(研究組織責任者・研究VPなど)がセーフティケースと事案対応に責任を負い、人事評価にも含めることで安全側への動機づけを図るとしている
  • 停止と技術統制: セーフティケースを無効化する問題(新たなセキュリティ問題など)が見つかった場合の停止手順・技術統制・SLAを整備し、監視や自動停止などの安全機能がフェイルクローズド(無効な実行を開始できない設計)になるようにするとしている
  • 透明性と監査: セーフティケースを社内の監督組織(安全・セキュリティ委員会など)に開示し、監査人が主張の妥当性を検証できる十分なアクセスを与えるとしている
  • エスカレーション: ミスアライメントの重大度レベル表と当番体制を定義し、一定の重大度で経営層(CEOを含む)へページングできる経路を設けるとしている
  • 残余リスクと巻き戻し: 現行緩和策でカバーされない残余リスクを可能な限り列挙して受容判断に供し、ミスアラインしたモデルの下流利用(データ生成・グレーディングなど)を特定して影響を取り消せるようにするとしている
  • 事案調査: 調査中の定期的社内更新(例: 日次)、根本原因の特定(標的化したアブレーションや再サンプリング実験)、運用・文化面のポストモーテム、事案情報に直接最適化しない形での検出評価の開発と回帰テスト化、調査完了後の公表と影響を受けた第三者への速やかな通知を挙げている

出典