TAG / TOPIC

AI安全

「AI安全」に関するAIニュースと解説記事の一覧です。

04 STORIES

LATEST STORIES

AI安全の新着記事

タグ一覧

BUSINESS / 05

Anthropicが初の組込み評価者としてAccentureと提携、各10億ドル超を投資へ

Anthropicが2026年9月18日に発表。Accentureとの提携で同社を初の組込み評価者(embedded evaluator)として迎え、モデルの評価・レッドチーミング・整合性評価・安全策テストを実施する。両社は今後5年で各10億ドル以上の投資を見込む。Anthropicの一次発表から整理する。

GOVERNANCE / 07

カリフォルニア州知事がAI大統領令、第三者監督の加速と「キルスイッチ」検討を指示

カリフォルニア州のギャビン・ニューサム知事が2026年9月18日に大統領令を発令。独立検証組織に関する新法の施行加速と、フロンティアAI向け「キルスイッチ」を含む州法強化の勧告づくりを専門家グループに指示した。州知事府の一次発表から整理する。

RESEARCH / 04

「共同科学者」としてのLLMの研究誠実性を測る「IntegrityBench」— ピーク圧力下で約3回に1回、誠実性に関わる判断を誤る

arXiv:2608.12345で公開された「Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists」を、アブストラクトの一次情報に基づいて整理する。IntegrityBenchの設計(36対タスク・5段階圧力プロトコル・3領域・4研究段階)、18モデルでの評価結果、3側面の乖離とデプロイリスクを解説する。