GOVERNANCE / 07
Anthropic、評価中のClaudeの意図しない動作を報告 — 内部評価のライブ接続を全面停止
Anthropicが2026年10月9日に公表した評価・内部利用時の意図しないモデル動作レポートを一次情報に基づき整理。4類型の内容、7月開始のレビュー、実害の評価、全内部評価のライブ接続停止と修復策を扱う。
TAG / TOPIC
「評価」に関するAIニュースと解説記事の一覧です。
17 STORIES
LATEST STORIES
GOVERNANCE / 07
Anthropicが2026年10月9日に公表した評価・内部利用時の意図しないモデル動作レポートを一次情報に基づき整理。4類型の内容、7月開始のレビュー、実害の評価、全内部評価のライブ接続停止と修復策を扱う。
RESEARCH / 04
Aleph Alphaが2026年9月28日に公開した研究記事「Training on the Party Line」を一次情報に基づき整理。中国モデル6件の967プロンプト評価(17〜41%がバランス回答)、Nemotron Cascade 2の17%フラグとSFTデータ約930万行中の約3,500行の問題指摘、3つの対策提言を扱う。自社ベンチマークという留保付きの解説である。
RESEARCH / 04
Epoch AIが2026年9月23日に公開したFurniture Assembly Benchmark(FAB)の結果を一次情報に基づき整理。3種のIKEA家具・60枚の写真による評価設計、GPT-6 Astraの80%という結果、Claude各モデルとの比較、オープンモデルの遅れ、実時間利用の制約を扱う。
RESEARCH / 04
Forecasting Research Instituteが2026年9月22日に公開したAI進歩予測の精度検証レポートを一次情報に基づき整理。IMO・FrontierMath・収益予測などの具体値、過大評価の例、手法の限界を扱う。
RESEARCH / 04
OpenAIが2026年9月23日に公開したメンタルヘルス会話評価ベンチマークMentalHealthBenchを一次情報に基づき整理。22カ国80人超の専門家によるルーブリック、重み付き採点、10の行動次元、44人の利用者調査、オープン公開の方針を扱う。
BUSINESS / 05
Snorkel AIが2026年9月22日に発表した3.5億ドルのシリーズE調達(評価額35億ドル)を一次情報中心に整理。data-as-a-serviceの成長、 frontier labsや米政府機関との連携、「Data 2.0」とデータ開発のRSIループ構想を扱う。
RESEARCH / 04
UK AISIとEvalEval Coalitionの連携による再現可能な評価報告の取り組みを一次情報中心に整理。Every Eval Everスキーマ、5ベンチマークと6モデルの公開データ、推論計算量と評価プロトコルの論文を扱う。
GOVERNANCE / 07
OpenAIが2026年9月21日に数学の独立諮問グループとの連携を発表。IAS拠点・9名構成・無報酬・勧告公開・決定権なしの原則と、当面の課題である内部モデル由来とされる数学成果の公表調整について一次情報から整理。
RESEARCH / 04
IBM Researchがエージェントの一貫性ギャップ(Mean@kとPass^kの差)を診断・改善するALTK-Evolveの拡張「consistency guidelines」を公開。AppWorld test_normalでPass⁵が53.0%→69.0%、ギャップが24.4pp→12.0ppに縮小したと報告。一次情報に基づき手法と数値を整理する。
GOVERNANCE / 07
AnthropicのCEO Dario Amodei氏が2026年9月12日にエッセイ「We Must Pace the Frontier」を公開し、AIモデルの能力向上ペースの減速を提唱。埋め込み型外部評価者の受け入れ、民主国家間の協調、国際協調の3段階計画と、得た時間の使い道(運用・ alignment・解釈可能性・評価)を一次情報に基づき整理する。
GOVERNANCE / 07
Google DeepMindは2026年8月27日、世界初のプロプライエタリ・フロンティアモデルに対する二重盲検評価のパイロットを発表した。Google CloudのConfidential Computing(Confidential Space)によりモデル重みと評価プロンプトを互いに秘匿したままGemini Flash Liteをテスト。パートナーにSingapore AI Safety Institute、OpenMined、AVERI、MLCommonsを迎え、暗号的検証による評価の信頼性向上を目指す。
RESEARCH / 04
独立ベンチマーク機関のArtificial Analysisは2026年8月19日、AIエージェントの検索APIを比較する新ベンチマーク「Search Index」を公開した。12の検索APIプロダクト(7プロバイダ)を対象に、GPT-5.6 Luna(medium)を候補モデル、Stirrupハーネス(web_search・web_fetch・finish、最大25ターン)を固定して、検索プロバイダだけを変える同一条件で評価する。品質指標はDeepSearchQA(F1)・BrowseComp(正解率)・AA-Omniscience(正解率)の等加重平均。検索なしのモデル単体ベースライン(33点)に対し、上位はParallel Search(advanced)75点、Exa Search(auto)74点、Firecrawl Search 73点など。コスト(タスクあたり)と速度(タスクごとの所要時間)も併せて比較する。数値は全てArtificial Analysisの公開データに基づく。
RESEARCH / 04
IBM Researchは2026年8月18日、Hugging Faceブログでエージェントメモリの「適正用量」を検証する研究を公開した。過去の実行軌跡から行動ガイドラインを蒸留し推論時に注入する「ALTK-Evolve」を、30B級の小型モデルからフロンティアのプロプライエタリモデルまで8モデルを対象にAppWorld(585タスク)で評価。強力なモデルは全ガイドラインを注入するのが最適(DeepSeek-V3.2はタスク達成率+9.5pp)、弱いモデルはコンパクトなコア+タスク別検索が最適(gpt-oss-120bは+16.1ppを+5%トークンで達成)、飽和モデルは改善なし(GLM-5)という3パターンを報告。費用面では、選択型検索が精度とコストの両面で最良になり得ることを示した。内容はIBM Researchの一次情報(Hugging Faceブログ)に基づく。
RESEARCH / 04
arXiv:2608.11242。ペンシルベニア州立大学のZhiqi Wang氏らが、LLMシステムがコンテキストを圧縮(コンパクション)する際に「セッション制約(Session Constraints, SC)」が消失する問題を定量化した研究。3つの長期コンテキストシナリオ(マルチターンチャット・エージェント軌跡・長時間研究)で12種のコンパクタを評価した結果、注入したSCの平均保持率は17%で、多くのケースで圧縮なしより悪化した。SC認識抽出器(Qwen3.5-9Bベース)をコンパクタと並置するだけで全シナリオで90%超の保持率を記録した。評価スイートと実装はGitHubで公開。
RESEARCH / 04
Alibaba InternationalのAccioチーム(电商AI AgentプラットフォームAccio Workを開発)が、実サービスを再現するローカルレプリカ上でエージェントのタスク完遂能力を評価するRealReplicaBenchをGitHubで公開(v1.3.1)。107タスクは53 CLI・28ブラウザ・16ファイル・10 API/MCPで構成され、65がテキストのみ、20がブラウザ+テキスト、22が視覚情報必須。各タスクはフレッシュなコンテナで実行され、決定論的またはLLM支援の検証器が採点する。12モデルファミリーをOpenClaw/Accioの2ハーネスで評価した結果、最上位はClaude Opus 5の60/107(56.1%, OpenClaw)と66/107(61.7%, Accio)、次いでClaude Opus 4.8(51.4%/55.1%)、GPT-5.6 Sol(49.5%/51.4%)。Qwen 3.8 MaxはAccioハーネスでOpus 4.7と並ぶ56/107(52.3%)。採点ジャッジはgemini-3.1-pro-previewで、スコアはAccio管理の評価エンドポイントによる。ハーネス・コードはApache 2.0、タスクセットはCC BY 4.0で公開され、ライブリーダーボードも運用中。
RESEARCH / 04
arXiv 2607.27191。AIエージェントによるオープンエンドなAI研究の遂行能力を測る「シャドウ評価」を提案。未発表論文の中核研究課題をエージェントに与え、原著者が採点する。NeurIPS 2026投稿2件での実験では、エージェントはエンジニアリングを全て完了したが研究課題への実質的進展はなく、両方とも不合格。5つの失敗パターン(出版基準の判断不足、研究デザイン欠陥への非創造的対応、デッドエンドからの非効率な切り返し、リソース認識の不足、指示ドリフト)を特定した。
RESEARCH / 04
arXiv:2608.12345で公開された「Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists」を、アブストラクトの一次情報に基づいて整理する。IntegrityBenchの設計(36対タスク・5段階圧力プロトコル・3領域・4研究段階)、18モデルでの評価結果、3側面の乖離とデプロイリスクを解説する。