評価グラフと実験構造を重ねたAI研究の抽象ビジュアル
NAW / RESEARCH 04

IMAGE: AI生成ビジュアル

RESEARCH / RRSI / エージェント自己改善

エージェント改善法「RRSI」 — 自己改善ハーネスのテスト暗記を正則化で抑え、OODでも最大4.7ポイント向上

Peng Xia氏らが2026年9月にarXivで公開した「RRSI: Regularized Recursive Self-Improvement of Agent Harnesses」は、エージェントのharness(プロンプト・制御フロー・ツール・記憶などの足回り)を再帰的に自己改善する際のベンチマーク過学習を、正則化の考え方で抑える手法である。改善対象の分割で最大14.1ポイント、5つの分布外ベンチマークで最大4.7ポイントの向上、ポリシートークン約3割減を報告し、コードはGoogle ResearchのGitHub組織で公開されている。

LLMエージェントの能力は、凍結された基盤モデル本体よりも、その周囲のharness(プロンプト、制御フロー、ツール、記憶、コンテキスト管理といった足回り)に大きく左右される。近年はこのharnessへの編集を反復的に提案・選択して自動化する手法が増え、エージェントシステム・レベルでの再帰的自己改善(RSI)が実質的に成立している。Peng Xia氏らが2026年9月21日にarXivで公開した論文「RRSI: Regularized Recursive Self-Improvement of Agent Harnesses」(v2は9月23日)は、この再帰的進化が学習タスクの暗記による過学習に陥り、分布内では大きく伸びても分布外ベンチマークでは改善が縮小・消失する問題を指摘し、正則化の原理を取り込んだ改善枠組みを提案するものである。以下は論文アブストラクトと公開コードの記載範囲の整理である。

問題設定 — 再帰的自己改善はテスト暗記に陥る

  • harnessの重要性: エージェントの能力は凍結されたバックボーンモデル単体ではなく、周辺のharness全体で決まるという立場を取る。
  • 過学習の構図: 要素ごとの編集を反復提案・選択する既存の自動化手法は、学習タスク群を暗記する形で過学習しうる。分布内では大きな改善に見えても、分布外では効果が縮小、場合によっては消失すると指摘している。
  • 狙い: ベンチマーク固有の付け焼き刃やノイズではなく、再利用可能なエージェントの仕組みが残るよう、進化の過程に制約(正則化)をかける。

提案手法 — 提案側の予算制限と選択側のcritic・pruner

  • 提案側(proposer): 時間的に減衰(アニーリング)する予算で、1候補に束ねられる編集数を制限する。進化履歴に基づき、未探索の軌道を奨励する。
  • 選択側(selector): criticがベンチマーク固有の提案をふるい落とし、prunerが小さすぎる・高コストすぎる・もはや有用でない変更を取り除く。
  • 編集空間の扱い: 再帰的改善の手順自体は維持し、harness編集の空間は開いたままにする。正則化するのは、その空間をどう移動するか(候補の提案と選択)である。

評価結果 — 8ベンチマークで検証、政策トークンは約3割減

  • 対象: コーディング、エージェント作業空間、エンジニアリング設計タスクにまたがる8ベンチマークで評価した。
  • 改善幅: 進化対象の分割で最大14.1ポイント、5つの分布外ベンチマークで最大4.7ポイントの向上を報告している。
  • 効率: 正則化なしの進化と比べ、ポリシートークン(policy tokens:行動決定モデルの消費トークン)が約3割少ないharnessになるとしている。
  • 再現性: コードはGoogle ResearchのGitHub組織(google-research/rrsi)で公開され、プロジェクトページ(regularized-rsi.com)も用意されている。いずれも本稿執筆時点でアクセスを確認した。
  • 留意点: 上記の数値はいずれも論文著者らの報告(ベンダー公称値に相当)であり、独立した第三者評価ではない。評価プロトコルの詳細や8ベンチマークの内訳は論文本文の確認が必要である。

出典