IMAGE: AI生成ビジュアル
RESEARCH / RESEARCH
ICML 2026の論文2,200本超をエージェントで再現する大規模ハッカソン — 23%の論文で反証・異議、49本は全主張が反証に
1,221人が参加し19日間で6,816件の再現ログブックを公開。対象2,226本(採択論文の34%)のうち、少なくとも1つの主張が検証されたのは51%、反証・異議が出たのは23%。理論論文の証明崩れや損失関数の食い違いなど具体例も公表され、著者側の訂正が既に進行中。
Hugging FaceとalphaXivは2026年8月13日、コーディングエージェントを使ってICML 2026の論文を主張単位で再現するハッカソン「ICML 2026 Open Reproductions」の結果を公表した。2026年7月15日から8月2日まで開催され、1,221人のコミュニティメンバーが参加。19日間で6,816件の再現ログブックが公開され、採択論文の34%にあたる2,226本が再現対象となった。Hugging Faceはこれを「機械学習会議に対する、これまでで最大規模のオープンな主張単位監査」と位置づけている。
エージェントによる主張単位の再現監査
ICML 2026は23,918件の投稿に対し6,352件を採択しており、前年から約2倍という指数関数的な増加傾向にある。Hugging Faceは、論文の洪水に対してレビュー能力が追いつかない問題を、同じAIエージェント技術で監査側に立ち向かう試みとして本ハッカソンを設計した。
- 採択論文6,341本のアブストラクトから核となる科学的主張(claim)を抽出し、エージェントが具体的な検証対象から始められるようにした
- 参加者はClaude Code、Codex、Cursor、OpenResearchのorxなど各自のエージェントを持ち込み、再現結果はすべてTrackioログブック(コード・成果物・実行トレース付き)として公開
- 自動判定システム「Logbook Judge」がオープンウェイトモデルGLM-5.2で各ログブックを再読し、主張ごとに「検証済み/反証/縮小規模(toy)/判定不能」を発行。自己評価を信用しないよう明示的に指示されている
- 参加者にはHugging Faceの計算クレジット20ドルが付与され、クラウドジョブ2,962件が実行、完全なエージェントトレース274件がデータセットとして公開された
- データセットが非公開などの理由で完全再現が不可能な論文は、元の性質を模した合成データでの縮小規模再現(toy reproduction)を実施
検証と反証の統計
主張単位の判定を論文ごとに集計した結果、再現性は「検証か反証か」の二値ではなく、多数の独立チームによる対抗的な検証(adversarial)の様相を呈したという。
- 対象論文の51%(1,103本)で少なくとも1つの主張が独立に検証され、うち266本は全主張が検証された完全再現、632本は反証なしの部分再現
- 実実験で確認された主張は合計3,978件
- 23%(496本)で少なくとも1つの主張が反証・異議申し立てを受け、うち49本は全主張が反証され何も検証されなかった
- 同じ主張に対し独立チームが正反対の判定を下した論文は242本
- 縮小規模の証拠のみだったのは502本、何も確定できなかったのは280本(最も多かった原因は成果物の欠落)
確認された反証事例と著者の対応
反証を正式に主張した35人の参加者については、運営側が論文とログを読み直して対抗再検証し、確認された事例の一部が公表されている。運営側は確認できたすべての事例について著者へ連絡を始めており、複数の論文で著者が内容を認め、arXivの訂正が2件進行中という。
- 「Towards Optimal Robustness in Learning-Augmented Paging」: 主張されていたロバスト性の加算項が実際にはlog kに比例して成長することを再実装で確認。k=1,024までの拡張スイープで約9シグマの乖離を検出し、証明が崩れる箇所も特定された
- 「Attention’s forward pass and Frank-Wolfe」: 3つの独立チームが反例を発見。違反が現れるのはt=224、約3,800、6,416ステップと遅く、有限ステップで止める従来の検証が「検証済み」と誤判定していた原因と説明される。著者は同日中に確認し修正作業中
- 「Self-Distillation Enables Continual Learning」: 理論はreverse KLを解析しているが、公開コードの既定(論文の全結果の出所)はforward KLを計算しており、著者のコードとデータでも見出しの+4pp結果が再現できなかった。著者はclarified版をarXivにアップロード済み
- 「Do Transformers Need Three Projections?」: 評価対象ラベル位置の約66%がEOSパディングトークンで、perplexityを約3分の1に過小評価していた。アブストラクトの「3.1%の品質コスト」は補正後およそ9.4%になる
- 一方で誤った反証も確認された。あるログブックは「ベースライン比2倍遅い」と主張したが、単位の算術ミス(軌道あたりと50本バッチあたりの混同)で、正しく正規化すると論文主張の8倍高速化を裏付けるデータだった
エージェント時代の再現レビューと人間の役割
本ハッカソンの結果は、研究レビューにおける人間の役割について示唆を与える。エージェントだけの実行では、局所的なループに陥る、スケール依存の挙動を読み違える、単位の不一致の上に反証を組み立てるなどの限界が見られた。最も信頼できる結果は、人間がエージェントの方向を修正し前提を疑いながら進めるワークフローで生まれたという。
- 定量的指標では判定できない知覚的評価は不可分に人間の判断が必要(量子化された画像生成の実用性を人間が128ペアすべてを判定した事例を紹介)
- 運営側は「人間の役割はインテリジェンスの管理」と総括し、教授が大学院生に計算・ハーネス・データ・適時のフィードバックを与えるように、エージェントの環境を整え正しい質問をする参加者が高い成果を得たと報告
- 全ログブック・判定・トレース・成果物はチャレンジのSpaceから公開されており、Hugging Faceは「この記録を長く持ち続けさせない」として今後も再現イベントを開催する方針
なお、本記事の統計値はHugging Faceによる集計・公表に基づくものであり、独立した監査を経たものではない点に留意が必要だ。
出典: Hugging Face Blog「What We Learned by Reproducing 2,200 papers from ICML」(2026-08-14確認)。