政策判断と監査の均衡を表す青い抽象ビジュアル
NAW / GOVERNANCE 07

IMAGE: AI生成ビジュアル

GOVERNANCE / OpenAI

OpenAI、保護された推論の抽出を狙った組織的蒸留キャンペーンを阻止 — Moonshot AI関係者に帰属と発表

7月1日に始まり7月24〜25日に1万6000件のリクエストへ急増、4千超のアカウントと1万5千超の関連クラスタを7月28日までに全面阻止。暗号化推論の別会話へのコピー&復号という新手口、外部研究者の責任ある開示が対策を加速させたとしている。

OpenAIは2026年9月30日、モデルから「保護された推論(protected reasoning)」を抽出しようとする組織的なキャンペーンを特定・阻止したと発表した。敵対的蒸留(adversarial distillation)と位置づけ、暗号化された推論を別会話に持ち込んで復号させる新手口の観測、7月中の活動規模、緩和策、業界・政府との情報共有を説明している。以下は同発表の内容整理であり、帰属に関する記述はOpenAIによる評価として伝える。

何が起きたか — 7月の時系列と規模

  • 定義: adversarial distillationとは、あるモデルの出力や推論を系統的・無断で利用し、別モデルの学習・再現・改良に役立てる行為を指す。保護された推論はタスク解決過程の内部記録であり、最終回答では伏せられる情報を含み、抽出されると他者が能力を再現する助けになるとしている。
  • 時系列: 最初の観測は7月の第1週で、活動自体は7月1日に低量で開始。7月24日と25日に大量のスパイクが発生し、抽出パターンに該当する1万6000件のリクエストが4000超のユーザーから送られた。さらなる調査で関連するプロンプトパターンの活動が1万5000超のユーザーのクラスタにまたがることを特定し、7月28日までに全面阻止したという。
  • 被害の否定範囲: 攻撃者が暗号化を破った、データベースを侵害した、保存されたユーザー会話へ直接アクセスした事実はないとしている。利用規約に違反する規模と連携性で、リクエスタに見える形に推論を再現させていたという。

手口 — 暗号化推論のコピー&復号と外部研究者の開示

  • 新手口: ある会話の暗号化された推論をコピーし、別の会話でモデルに「復号・書き起こし」を求める試みなど、新しい方法での抽出が観測されたとしている。
  • 外部研究者の貢献: 独立したセキュリティ研究者が、モデル横断や会話圧縮(conversation-compaction)に関する脆弱性を責任ある開示で報告し、OpenAIは攻撃経路が実在することを確認した。研究者の成果が攻撃クラス全体の理解と緩和の加速に役立ったとしている(関連論文としてarXiv:2608.09867を挙げている)。
  • 一般性の指摘: この種の操作はOpenAIのモデル固有の脆弱性ではなく、他の先端AIシステムにも影響し得る共通のセキュリティ課題だとしている。

帰属の評価 — Moonshot AI関係者への言及と留保

  • OpenAIの評価: 関連期間に観測した行為者のすべてが単一主体に由来するかは不明としつつ、中核クラスタについてはMoonshot AI(Kimiの開発元)に関係する個人によるものと判断したと発表している。
  • 留保の明記: これはOpenAIによる調査・評価の表明であり、確定した事実認定としてではなく伝える。OpenAIの発表文には相手側の見解の記載は確認できなかった。
  • 問題意識: 抽出された推論は元のモデルの安全対策を継承せずに別モデルの学習に使われ得ること、大規模な蒸留は安全投資なしに先端能力の移転を加速させ得ること、デュアルユース領域で懸念が高まることを理由に挙げ、安全保障上のリスクと位置づけている。

対応 — アカウント措置、技術対策、業界・政府連携

  • 執行と監視: 不正アカウントの停止・制限、サインアップやインフラ側の統制強化、関連ネットワークの監視拡大を実施した。第三者サービスを経由した活動については当該事業者と連携して関係アカウントを特定・阻止したとしている。
  • 技術的緩和: 他者の暗号化推論を持ち込んで再生・復元する経路を閉鎖し、推論を露出させ得るストリーミング出力を検知・保留するチェックを追加した。ユーザー・ワークスペース・組織・モデル系列をまたぐ隠れた推論の保護を強化したという。
  • 情報共有: Frontier Model Forumを通じて業界パートナーと情報を共有し、適切な政府の情報共有チャネルにも提供した。再利用・再生可能な推論成果物を扱うシステムには同様のリスクがあり得ると注意を促している。
  • 今後: フロンティアモデルが高度化し模倣の動機が強まる中で敵対的蒸留は巧妙化すると見込み、抽出への技術的防御、組織的キャンペーンの検知・執行、業界・政府をまたぐ脅威情報共有の3領域に注力するとしている。パートナー提供のデプロイにも同等の保護が必要であり、ツール出力経由の攻撃への防御や分類器・拒否応答の改善を続けるとしている。

出典