評価グラフと実験構造を重ねたAI研究の抽象ビジュアル
NAW / RESEARCH 04

IMAGE: AI生成ビジュアル

RESEARCH / Evaluation

英AI安全研究所がEvalEval基盤で評価結果を公開 — 5ベンチマーク・6モデルの検証済みデータを再現可能に

英AI安全研究所(UK AISI)は2026年9月22日、EvalEval Coalitionの共有基盤を使って評価結果の公開を始めたとHugging Faceが伝えた。HealthBenchやFrontierMathなど5ベンチマーク、Claude Opus 4系とGPT-5系の6モデルを対象に、検証済みの結果・文脈・設定情報をEvaluation Cards形式で提供する。

Hugging Faceは2026年9月22日、英国AI安全研究所(UK AI Security Institute)がEvalEval Coalitionの基盤を使って評価結果の公開を始めたと伝えた。評価結果が形式も公開場所もばらばらで、再現に必要な情報が不足しがちな現状に対し、共通スキーマとオープンプラットフォームで「検証可能で再現可能な評価科学」を支える狙いだ。以下は同ブログの内容の整理である。

何が公開されたか — 5ベンチマーク・6モデルの検証済みデータ

  • 対象ベンチマーク: HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0の5つについて、検証済みの結果・文脈・設定情報をEvaluation Cards形式で提供する。
  • 対象モデル: Claude Opus 4、Claude Opus 4.5、Claude Opus 4.6、GPT-5、GPT-5.2、GPT-5.4の6フロンティアモデルをカバーする。
  • サイバー評価: 上記に加え、Cyber CTFsとThe Last Onesという2つのサイバー関連評価の結果も含まれ、一部重なる別のモデル集合を対象とする。
  • 対応論文: 公開データはAISIの論文「How Inference Compute Shapes Frontier LLM Evaluation」に対応し、ベンチマーク性能が推論時計算量と評価プロトコルにどう依存するかを調べたものだ。
  • トランスクリプト級の透明性: 再現性だけでなく分析・診断のために、評価の詳細な実行記録レベルの透明性を重視している。設定情報があれば、見かけ上似たスコアが実は異なる条件で出たものかを見分けられる。

仕組み — Every Eval EverとEvaluation Cards

  • Every Eval Ever(EEE): 評価結果の共有報告スキーマ兼リポジトリ。NeurIPS 2025併催の合同ワークショップに始まるAISIとEvalEvalの協働で形作られ、今回その共有基盤が実践投入された。
  • Evaluation Cards: ベンチマークのメタデータ、評価実行データ、モデルのメタデータを解釈可能な記録に束ねるオープンプラットフォーム。ベンチマーク別・モデル別に探索でき、評価報告全体の現状把握にも使える。
  • AISI側の素地: AISIは評価の効率化(OptStop)、統計的厳密化(HiBayES)、トランスクリプト分析や能力引き出しの標準化に取り組んでおり、今回の連携はその延長線上にある。
  • 意義: 他の報告に詳細が欠ける場合でも、AISIのような検証済み公開データが文脈つきの参照点になる。設定の違いが報告性能にどう影響するかの解釈や、横断的なメタ研究の土台になるとしている。

参加の呼びかけ — 開発者・評価者・研究者へ

  • モデル開発者: 検証済みの評価結果の報告を。
  • 評価開発者: Every Eval Everスキーマに沿ったベンチマークと実行データの報告を。
  • ガバナンス・政策研究者: Evaluation Cardsをベンチマーク別・モデル別に探索し、評価報告の全体像の把握に活用を。
  • 限界: 本記事はHugging Faceブログの整理であり、公開データの完全な再現手順やライセンス条件の詳細は公開情報の範囲に限定される。個別の数値比較は原典のEvaluation Cardsで条件を確認すべきだ。

出典