政策判断と監査の均衡を表す青い抽象ビジュアル
NAW / GOVERNANCE 07

IMAGE: AI生成ビジュアル

GOVERNANCE / POLICY & SAFETY

Anthropic、Claude Fable 5のバイオセーフティを改善 — 生物学関連フォールバックを約85%削減

セーフティ分類器のconstitutionを見直し、良性の健康・教育クエリをFable 5で回答できるように。全フォールバックはClaude.aiで約67%減。ウイルス学・毒物学・分子設計などデュアルユース要求は引き続きOpus 5へフォールバックされ、専門研究者向けのトラステッドアクセス経路を開発中。

Anthropicは2026年8月7日、公式記事「Improving Fable 5’s biology safeguards」を公開し(8月14日更新)、フロンティアモデル「Claude Fable 5」のバイオセーフティガードレールを大幅に改善したと発表した。セーフティ分類器のルール(constitution)を見直して再学習し、生物学関連クエリで発生していた「フォールバック」(より性能の低いモデルへの切り替え)を約85%削減。日常的な健康・教育の質問では、ユーザーがFable 5の回答を受け取れる範囲が広がる。

セーフティ分類器の再調整で偽陽性を削減

Fable 5は一部の複雑な生物学タスクで専門家を上回る能力を持つ一方、悪用されれば生物兵器開発の支援にもなり得る「デュアルユース」の懸念から、発表当初はほぼ全ての生物学クエリをブロックしていた。このため良性の質問でも分類器が発火し、Opus 5へのフォールバックが頻発していた。

  • 分類器が発火すると、リクエストは生物学能力の低いOpus 5へルーティングされる(フォールバック)
  • 今回、分類器のconstitution(保護対象と許可対象を判別するルール群)を丁寧に書き直し、良性の用途を詳細に定義
  • 社内外の多様な専門家からフィードバックを収集し、更新した学習データで分類器を再学習・検証
  • 有害・デュアルユースの研究生物学コンテンツでは引き続き発火する一方、良性・有益な用途を広く許可するようになった

フォールバック削減の効果

Anthropicのテストでは、生物学関連のフォールバックが製品横断で約85%減少した。全フォールバック(生物学以外も含む)の減少率は製品ごとに公表されている。

  • Claude.aiで約67%減、Coworkで約55%減、Claude Codeで約17%減、Claude Platformで約7%減(脚注による補足)
  • 検査結果の解釈、症状の理解、教育目的の生物学学習など、日常的な健康・教育クエリでフォールバックが大幅に減少
  • 医療従事者は臨床タスクでFable 5のサポートをより多く受けられる

Fable 5のバイオセーフティ分類器の概念図。発売時(A)は安全マージンを含めて広くブロックしていたが、更新後(B)は良性リクエストの多くが許可される 出典: Improving Fable 5’s biology safeguards - Anthropic(Anthropic公式記事より引用)

デュアルユース領域は引き続き厳格に

良性クエリの開放と引き換えに、悪用リスクの高い領域は従来どおり保護される。Anthropicはデュアルユースの研究生物学・創薬クエリを今後もブロックすると明言している。

  • ウイルス学・毒物学・分子設計などの要求は、引き続きOpus 5へフォールバック
  • Fable 5は現時点で専門の生物学研究や創薬には未対応とし、「フロンティア生物学能力」へのギャップを認める
  • このギャップは「トラステッドアクセス経路(trusted access pathways)」の整備で埋める方針。信頼できる研究者に安全な形で最上位モデルへのアクセスを提供する計画
  • 分類器の安全マージンは残るため、低リスクでも発火する偽陽性は一定数避けられないと説明

Anthropicは「AIが世界に良い影響を与えられる最大の機会は生物学と医学にある」とし、責任ある形でフロンティア能力へのアクセスを広げる方針を示している。今回の更新は、モデル能力の解放とデュアルユースリスク管理のバランスをどう取るかという業界全体の課題に対する一つの事例としても注目される。

出典