NAW / RESEARCH 04
IMAGE: AI生成ビジュアル
RESEARCH / RESEARCH
AIエージェントはオープンエンドなAI研究を遂行できるか — 論文著者が採点する「シャドウ評価」で2件とも不合格(arXiv)
プリンストン大学のArvind Narayanan氏らは、未発表の高品質論文の中核研究課題をエージェントに与え、原著者が成果を採点する「シャドウ評価(shadow evaluation)」を提案した。NeurIPS 2026への未発表投稿2件を対象に、フロンティアエージェントが6日間・数千ドルの計算資源で挑んだ結果、エンジニアリングは全て完了したものの研究課題への実質的な進展はなく、2件とも明確に不合格と判定された。
AIの爆発的進歩を予測する議論の多くは、「AIエージェントがAI研究そのものを自動化する」ことに依存している。だが、エージェントがオープンエンドなAI研究を実際に遂行できるかどうかの証拠は乏しい。プリンストン大学のArvind Narayanan氏ら(Sayash Kapoor氏、Helen Toner氏、Rishi Bommasani氏らを含む共同研究)は、この問いを測る新しい評価手法「シャドウ評価(shadow evaluation)」を提案し、2件の未発表論文を使ったケーススタディの結果をarXivで公開した。
シャドウ評価とは
- 既存の評価には2つの方法しかなかったと指摘する: ①狭く検証可能なタスクのみをテストする方法(オープンエンドな研究を除外)、②AI生成論文を盲検ピアレビューに出す方法(負荷過多で不安定、レビュー品質も低い)
- 本研究は第3の方法としてシャドウ評価を導入: 高品質の未発表論文から「中核となるオープンエンドな研究課題」を取り出し、エージェントに取り組ませ、その論文の原著者が成果を採点する
- エージェントには未発表のNeurIPS 2026投稿2件の中核課題を与え、6日間と数千ドル相当の計算資源を使用
実験結果: 2件とも「明確に不合格」
- エージェントはエンジニアリング作業(実装など)はすべて人間の助けなしに完了した
- しかし、研究課題に対する実質的な進展は得られず、2件の論文はともに原著者によって明確に不合格(unambiguously rejected)と判定された
- 別のモデルと別のスキャフォールドを使ったロバストネスチェックでも、同じ失敗パターンが再現された
特定された5つの失敗パターン
- 出版可能な研究の水準に対する判断力の不足(poor judgment about the bar for publishable research)
- 研究デザインの欠陥に対する創造性のない対応(uncreative responses to shortcomings in the research design)
- 行き詰まり(デッドエンド)からの非効率な切り返し(ineffective backtracking from dead ends)
- リソース認識の不足(poor resource awareness)
- 指示ドリフト(instruction drift)
意味合い
- 著者らは、専門家レビュー、調査回答、エージェントのリポジトリ、ログを公開
- 結果は「今日のエージェントはAI研究のエンジニアリング部分は実行できるが、研究ライフサイクルの重要かつ困難な部分(研究課題の設定・方向性の判断など)では苦戦する」という初期証拠を提供するとしている
出典: arXiv 2607.27191(Can AI agents conduct open-ended AI research? Early evidence from two case studies)(2026-08-17確認、v2公開済み)。