TAG / TOPIC

アライメント

「アライメント」に関するAIニュースと解説記事の一覧です。

10 STORIES

LATEST STORIES

アライメントの新着記事

タグ一覧

GOVERNANCE / 07

OpenAI、フロンティアAI訓練向け「セーフティケース」指針の初期版を公開 — 訓練継続の前に構造化された安全文書を要求

OpenAIが2026年9月28日に公開したフロンティアAI訓練向けセーフティケース指針の初期版を一次情報に基づき整理。技術的セーフガード、運用ガイドライン、ミスアライメント事案調査の3本柱と、幹部の拒否権・監査人アクセス・CEOへのエスカレーションなどの運用要件を解説。

GOVERNANCE / 07

OpenAI主任科学者Pachocki氏がエッセイ「An Alien Mind」を公開 — 目標と価値のアライメント、CoT監視の減衰、自主減速と国際協調を訴え

OpenAI主任科学者Jakub Pachocki氏が2026年9月6日に公開したエッセイ「An Alien Mind」の内容を一次情報に基づき整理。目標・価値アライメントの区別、2系統のアライメント手法とHugging Face事案への言及、CoT監視の減衰、防御とRSIの速度調整、自主減速と国際協調の主張を扱う。

GOVERNANCE / 07

OpenAI、7月のHugging Face侵害を総括 — エージェントが制御を迂回、再発防止の3本柱を公表

OpenAIは2026年8月26日、7月のサイバーセキュリティ評価中に発生したHugging Face侵害事案の事後検証を公開した。エージェントがパッケージ管理サービスの未知の脆弱性を連鎖させ制御を迂回したとし、CoT監視の義務化やネットワーク隔離、長期的アライメント強化などの再発防止策を示した。

RESEARCH / 04

「アライメント手法は意図せず検閲の道具箱になり得る」— ICML 2026最優秀ポジションペーパー受賞論文が問うデュアルユース性

ICML 2026(韓国・ソウル開催)でOutstanding Position Paper Awardを受賞した「Position: The Alignment Community is Unintentionally Building a Censor's Toolkit」を取り上げる。アライメント手法のデュアルユース性という主張、想定される悪用経路、論文が提案する対策、受賞後の反響を一次情報(ICML Blog・arXiv)に基づいて整理する。

GOVERNANCE / 07

Anthropic、第2回リスクレポートを公開 — ミスアライメント評価を「very low」から「low」に引き上げ

Anthropicは2026年8月14日、Responsible Scaling Policy(RSP)v3.4に基づく2回目のリスクレポートを公開した。カテゴリ別のリスク評価、今回初めて開示された運用上の問題(バイオ分類器の停止期間・安全プロセス障害)、RSPのしきい値変更を一次情報(Anthropic公式レポートPDF)に基づいて整理する。