TAG / TOPIC

AI Safety

「AI Safety」に関するAIニュースと解説記事の一覧です。

03 STORIES

LATEST STORIES

AI Safetyの新着記事

タグ一覧

GOVERNANCE / 07

Anthropicが2026年9月の脅威レポート公開 — 中国7研究所による大規模蒸留攻撃を詳細化、Alibabaは1.5億超の対話を観測

Anthropicが2026年9月に脅威レポートを公開。2025年12月〜2026年8月の悪用阻止事例をサイバー・影響工作・監視・詐欺・生物・通常兵器・不正蒸留の7分野で報告。不正蒸留ではAlibaba(1.51億超)、Moonshot(2300万超)、DeepSeek(14日で1210万超)、Zhipuの活動を帰属つきで記載。

GOVERNANCE / 07

OpenAI、カリフォルニア州の青少年AI安全法案 SB1119を支持 — コンパニオンAIの子ども保護を強化

OpenAIは2026年8月31日、カリフォルニア州のコンパニオンチャットボットの子ども安全を定める法案 SB1119 への支持を表明した。法案は2027年7月1日までに事業者へリスク評価、子ども安全ポリシーの整備、第三者監査の実施などを求め、違反時には司法長官や被害児童による民事救済を可能にする。

RESEARCH / 04

Anthropic、自動化されたアライメント研究で10種の失敗を修復 — Claudeが自律的に安全性ギャップを解消、能力低下なし

Anthropicは2026年8月28日、Claudeが自律的にモデルを訓練して10カテゴリのアライメント失敗を改善したとする研究を公開。全カテゴリで能力低下なしに安全性ギャップを大幅に解消し、非公開評価や大規模モデルへの転移、生産版Opus 4.8への適用でも有効性を示した。