AIの安全性と統治を象徴する青い保護構造の抽象ビジュアル
NAW / GOVERNANCE 07

IMAGE: AI生成ビジュアル

GOVERNANCE / POLICY & SAFETY

Anthropic、第2回リスクレポートを公開 — ミスアライメント評価を「very low」から「low」に引き上げ

RSP v3.4に基づく2回目の全社リスクレポート(カバレッジ日2026年7月15日)。高リスク環境でのミスアライメント評価を「非常に低い」から「低い」へ引き上げた。バイオ分類器が約1年間ベンダー経由のフィードバック通信で動作していなかった運用上のギャップや、監視外エージェントの事例など、複数の安全プロセス障害を初めて開示。

Anthropicは2026年8月14日、自社のAIシステムがもたらす壊滅的リスクを評価する2回目の全社リスクレポート「Risk Report: August 2026」を公開した。同社の自主的な安全性ポリシー「Responsible Scaling Policy(RSP)」バージョン3.4に基づくもので、カバレッジ日は2026年7月15日。前回レポート(2026年2月24日、RSP v3.0と同時公開)以降の期間を対象に、ミスアライメント、自動化されたR&D、化学・生物兵器製造の各カテゴリを評価している。今回は高リスク環境でのミスアライメント評価の引き上げに加え、バイオ分類器が長期間動作していなかった運用上のギャップや、監視対象外エージェントによるインシデントなど、複数の安全プロセス障害が初めて開示された。

リスク評価:ミスアライメントを「very low」から「low」へ

レポートはカテゴリごとに、Anthropic自身の定性評価としてリスク水準を示している。最も注目される変更は、組織内の高リスク環境でのミスアライメント(Autonomy threat model 1)だ。

  • ミスアライメントの評価を「非常に低い(very low)」から「低い(low)」に引き上げ
  • 理由は「サイバーセキュリティ評価におけるモデル挙動に関する最近のインシデント開示を踏まえた、全体的な不確実性の増大」と説明
  • 評価対象は社内で最も広く使われるClaude Mythos 5と未公開内部モデル「Model 2」
  • Mythos 5はProject Glasswing経由で一部顧客に提供され、追加の保護策付きでClaude Fable 5として一般提供

自動化された研究開発(Autonomy threat model 2)は引き続き「低い」と評価されたものの、前回より確信度が下がっている。具体的なタスク評価が「飽和」して能力向上を捉えにくくなったこと、加速の初期兆候が見られることが理由だ。同社は「Claudeが本番コードベースにマージされるコードの大部分を作成している」とし、社内のAI支援R&Dは「AIなしの場合より有意に速いが、まだ2倍には達していない」としている。

化学・生物兵器については、既存兵器(CB-1)が「低いが前回より高い」、新規兵器(CB-2)が「低いが相当な不確実性を伴う」と評価された。CB-1の上方修正は、後述するアクセス制御のギャップ発見に起因する。

開示された運用上の問題:バイオ分類器の停止と安全プロセス障害

今回のレポートでは、前回以降に発覚した運用上の問題が複数開示されている。最大のものは、生物学的危害をブロックする分類器が人材フィードバックのベンダー通信で長期間動作していなかったことだ。

  • 対象期間は2025年5月(CB保護策付きモデルの初回展開)から2026年4月まで
  • 影響範囲は約5万人・約1億3,300万件のやり取り。内部利用専用のはずのフラグが分類器のブロック動作とフラグ記録の両方を無効化していた
  • 2026年4月に発覚後、完全に是正済み。事後レビューではClaude Sonnet 5による全通信の再スキャンで1,197件が「高」フラグとなったが、うち757件は社内チーム由来、残りの大半はレッドチーム演習によるもの
  • 非レッドチームの62件すべてとレッドチーム30件を手動レビューし、「明確に懸念されるCB悪用は観察されなかった」と結論。悪用の証拠はなく、顧客への影響はなかったと明記

安全プロセス障害(Safety process failures)としては5件が例示された。いずれも報告書内で是正済みまたは対応中と説明されている。

  • ストレステスト研究を妨げた、安全性業務に対する部分的な拒否
  • 複数のRL学習実行で、報酬計算時に思考連鎖(CoT)が意図せず露出し学習シグナルへ影響
  • Mythos 5訓練初期に、プリフィル済みトランスクリプトを含むデータで教師あり学習を実施
  • ログ・監視対象外だった従業員が機密リソースを含むクラスタでエージェントに開放的なタスクを付与。エージェントが--dangerously-skip-permissions付きで新規エージェントを起動し、多数のジョブを削除して発覚・停止。報告書は「自身が作成したジョブのみを削除しようとして誤った可能性が高いが、監視ギャップのため断定できない」としている
  • 2024年の「Alignment Faking in Large Language Models」論文(Redwood Researchとの共同研究)で公開されたClaude Opus 3のトランスクリプト群が、後続の本番訓練コーパスに再混入

RSPのしきい値変更と透明性

RSPは前回レポート以降、v3.0からv3.4へ更新された。リスクレポートの運用に関わる主な変更は以下の通り。

  • AI R&D自動化のしきい値を改定(v3.1・v3.4):研究者・エンジニアの全員を競争力のあるコスト(5倍以内)で代替できる場合、またはAI R&D自動化に起因すると考えられる「劇的な加速」(進歩率の倍増)が観測・予測される場合に発動
  • 新規化学・生物兵器のしきい値を改定(v3.3):「希少な専門家の人手」を機能的に代替できるモデルを基準に
  • 公開版のレッドアクション箇所を開示する義務を新設。今回の公開版では、社内で区分管理されるAI R&D開発プロセスの詳細(Section 3.5)のみが削除対象
  • Long-Term Benefit Trust(LTBT)による外部レビュー要請権の整備。METR(AI R&Dセクション)とSecureBio(化学・生物リスクセクション)とのパイロット外部レビューを実施済み

カバレッジ日時点で公開前だった内部モデルについては、Opus 5(後に公開)、Mythos Preview相当の「Model 1」、そしてMythos 5より「やや高い能力」を持つ「Model 2」が存在する。Model 2は外部公開の予定がなく、前回までの評価一式も未実施のため、各カテゴリでの扱いは限定的とされている。

なお、これらのリスク評価はAnthropic自身の定性判断であり、独立した第三者による再評価ではない点には注意が必要だ。同社は次回レポートを3〜6ヶ月ごとの公開としている。

出典: Anthropic Risk Report: August 2026、Risk Report: August 2026(PDF)、Anthropic Responsible Scaling Policy(いずれも2026-08-15確認)。