TAG / TOPIC

評価

「評価」に関するAIニュースと解説記事の一覧です。

17 STORIES

LATEST STORIES

評価の新着記事

タグ一覧

RESEARCH / 04

Aleph Alpha、中国オープンウェイトLLMの政治的偏りを検証 — 967問ベンチマークで「バランスの取れた回答」は17〜41%

Aleph Alphaが2026年9月28日に公開した研究記事「Training on the Party Line」を一次情報に基づき整理。中国モデル6件の967プロンプト評価(17〜41%がバランス回答)、Nemotron Cascade 2の17%フラグとSFTデータ約930万行中の約3,500行の問題指摘、3つの対策提言を扱う。自社ベンチマークという留保付きの解説である。

RESEARCH / 04

IBM、エージェントの「たまに失敗」を半減させる consistency guidelines を公開 — 平均成功率は維持したまま Pass⁵ を53%→69%に

IBM Researchがエージェントの一貫性ギャップ(Mean@kとPass^kの差)を診断・改善するALTK-Evolveの拡張「consistency guidelines」を公開。AppWorld test_normalでPass⁵が53.0%→69.0%、ギャップが24.4pp→12.0ppに縮小したと報告。一次情報に基づき手法と数値を整理する。

GOVERNANCE / 07

Anthropic CEO Amodei氏、新エッセイ「We Must Pace the Frontier」でAI開発の減速を提唱 — 社員並み権限の外部評価者から始める3段階計画

AnthropicのCEO Dario Amodei氏が2026年9月12日にエッセイ「We Must Pace the Frontier」を公開し、AIモデルの能力向上ペースの減速を提唱。埋め込み型外部評価者の受け入れ、民主国家間の協調、国際協調の3段階計画と、得た時間の使い道(運用・ alignment・解釈可能性・評価)を一次情報に基づき整理する。

GOVERNANCE / 07

Google DeepMind、世界初の“二重盲検”AI評価を試験導入 — 暗号化された検証環境でベンチマーク汚染を防止

Google DeepMindは2026年8月27日、世界初のプロプライエタリ・フロンティアモデルに対する二重盲検評価のパイロットを発表した。Google CloudのConfidential Computing(Confidential Space)によりモデル重みと評価プロンプトを互いに秘匿したままGemini Flash Liteをテスト。パートナーにSingapore AI Safety Institute、OpenMined、AVERI、MLCommonsを迎え、暗号的検証による評価の信頼性向上を目指す。

RESEARCH / 04

Artificial Analysisが「Search Index」公開 — AIエージェント向け検索APIを同一条件で比較する新ベンチマーク

独立ベンチマーク機関のArtificial Analysisは2026年8月19日、AIエージェントの検索APIを比較する新ベンチマーク「Search Index」を公開した。12の検索APIプロダクト(7プロバイダ)を対象に、GPT-5.6 Luna(medium)を候補モデル、Stirrupハーネス(web_search・web_fetch・finish、最大25ターン)を固定して、検索プロバイダだけを変える同一条件で評価する。品質指標はDeepSearchQA(F1)・BrowseComp(正解率)・AA-Omniscience(正解率)の等加重平均。検索なしのモデル単体ベースライン(33点)に対し、上位はParallel Search(advanced)75点、Exa Search(auto)74点、Firecrawl Search 73点など。コスト(タスクあたり)と速度(タスクごとの所要時間)も併せて比較する。数値は全てArtificial Analysisの公開データに基づく。

RESEARCH / 04

IBM Research:エージェントメモリは「機能」ではなく「用量」— モデル能力に応じた投与量の較正が精度とコストを左右(ALTK-Evolve)

IBM Researchは2026年8月18日、Hugging Faceブログでエージェントメモリの「適正用量」を検証する研究を公開した。過去の実行軌跡から行動ガイドラインを蒸留し推論時に注入する「ALTK-Evolve」を、30B級の小型モデルからフロンティアのプロプライエタリモデルまで8モデルを対象にAppWorld(585タスク)で評価。強力なモデルは全ガイドラインを注入するのが最適(DeepSeek-V3.2はタスク達成率+9.5pp)、弱いモデルはコンパクトなコア+タスク別検索が最適(gpt-oss-120bは+16.1ppを+5%トークンで達成)、飽和モデルは改善なし(GLM-5)という3パターンを報告。費用面では、選択型検索が精度とコストの両面で最良になり得ることを示した。内容はIBM Researchの一次情報(Hugging Faceブログ)に基づく。

RESEARCH / 04

コンテキスト圧縮でユーザー指示が平均83%消失 — Penn Stateが「Lost in Compaction」で実測、90%超を保持する抽出器も提案(arXiv)

arXiv:2608.11242。ペンシルベニア州立大学のZhiqi Wang氏らが、LLMシステムがコンテキストを圧縮(コンパクション)する際に「セッション制約(Session Constraints, SC)」が消失する問題を定量化した研究。3つの長期コンテキストシナリオ(マルチターンチャット・エージェント軌跡・長時間研究)で12種のコンパクタを評価した結果、注入したSCの平均保持率は17%で、多くのケースで圧縮なしより悪化した。SC認識抽出器(Qwen3.5-9Bベース)をコンパクタと並置するだけで全シナリオで90%超の保持率を記録した。評価スイートと実装はGitHubで公開。

RESEARCH / 04

Alibaba Accio、実業務を再現するエージェント用ベンチマーク「RealReplicaBench」公開 — 107タスクで最上位モデルも完遂率は約62%

Alibaba InternationalのAccioチーム(电商AI AgentプラットフォームAccio Workを開発)が、実サービスを再現するローカルレプリカ上でエージェントのタスク完遂能力を評価するRealReplicaBenchをGitHubで公開(v1.3.1)。107タスクは53 CLI・28ブラウザ・16ファイル・10 API/MCPで構成され、65がテキストのみ、20がブラウザ+テキスト、22が視覚情報必須。各タスクはフレッシュなコンテナで実行され、決定論的またはLLM支援の検証器が採点する。12モデルファミリーをOpenClaw/Accioの2ハーネスで評価した結果、最上位はClaude Opus 5の60/107(56.1%, OpenClaw)と66/107(61.7%, Accio)、次いでClaude Opus 4.8(51.4%/55.1%)、GPT-5.6 Sol(49.5%/51.4%)。Qwen 3.8 MaxはAccioハーネスでOpus 4.7と並ぶ56/107(52.3%)。採点ジャッジはgemini-3.1-pro-previewで、スコアはAccio管理の評価エンドポイントによる。ハーネス・コードはApache 2.0、タスクセットはCC BY 4.0で公開され、ライブリーダーボードも運用中。

RESEARCH / 04

AIエージェントはオープンエンドなAI研究を遂行できるか — 論文著者が採点する「シャドウ評価」で2件とも不合格(arXiv)

arXiv 2607.27191。AIエージェントによるオープンエンドなAI研究の遂行能力を測る「シャドウ評価」を提案。未発表論文の中核研究課題をエージェントに与え、原著者が採点する。NeurIPS 2026投稿2件での実験では、エージェントはエンジニアリングを全て完了したが研究課題への実質的進展はなく、両方とも不合格。5つの失敗パターン(出版基準の判断不足、研究デザイン欠陥への非創造的対応、デッドエンドからの非効率な切り返し、リソース認識の不足、指示ドリフト)を特定した。

RESEARCH / 04

「共同科学者」としてのLLMの研究誠実性を測る「IntegrityBench」— ピーク圧力下で約3回に1回、誠実性に関わる判断を誤る

arXiv:2608.12345で公開された「Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists」を、アブストラクトの一次情報に基づいて整理する。IntegrityBenchの設計(36対タスク・5段階圧力プロトコル・3領域・4研究段階)、18モデルでの評価結果、3側面の乖離とデプロイリスクを解説する。