NAW / RESEARCH 04
IMAGE: AI生成ビジュアル
RESEARCH / Research
IBM、エージェントの「たまに失敗」を半減させる consistency guidelines を公開 — 平均成功率は維持したまま Pass⁵ を53%→69%に
AppWorld上のReActエージェント(GPT-4.1)は平均成功率77.4%でも、5回連続成功は53.0%にとどまる24.4ポイントの「consistency gap」があった。IBM ResearchのALTK-Evolve拡張は、1本の軌跡に対するブラックボックスな再サンプリングで不安定な判断点を特定し、ガイドライン化して推論時に注入する。平均精度を落とさずギャップを12.0ポイントまで縮めたと報告している。
エージェントのベンチマークで報告される「平均成功率」は、実際にそのエージェントを運用する利用者の問いには答えていない。利用者が知りたいのは「同じ依頼をもう一度出しても成功するか」である。IBM Researchは2026年9月15日、Hugging Face Blog上で、エージェントの実行ごとのばらつき(一貫性の欠如)を診断・改善する手法「consistency guidelines」を、オープンソースのALTK-Evolveの拡張として公開した。以下は同ブログ記事の内容整理であり、数値はすべてIBM側の報告値である。
指摘 — 平均は高いのに「5回連続成功」は低い
- 対象設定: AppWorld test_normal(168タスク)上のReActエージェント(GPT-4.1、temperature 0.0)。
- Mean@5は77.4%: タスクを5回ずつ実行した平均成功率は77.4%と高い。
- Pass⁵は53.0%: 一方、5回すべてで成功したタスクの割合は53.0%にとどまる。差分の24.4ポイントを同記事は「consistency gap(Mean@k − Pass^k)」と呼ぶ。難易度が高いタスク層では30ポイントに達する。
- 用語の整理: Pass@k(k回中1回でも成功)が楽観的な指標であるのに対し、Pass^k(k回すべて成功)は悲観的な指標であり、常に Pass^k ≤ Mean@k ≤ Pass@k が成り立つとしている。
- temperature 0でも残る: 実験はtemperature 0.0で行われており、ばらつきは通常のサンプリング由来ではない。記事は、トークン分布の形状(勝者が明確な「sharp」と接戦の「flat」)の違いと、GPU浮動小数点の非結合性やリクエストバッチングといったホスト側の微小な摂動で接戦の判断が反転することに原因を求めている。greedy decodingや固定シードは分布の形状自体には作用しないため、この問題はデコード設定では解消しないとしている。
手法 — Consistency Analyzerとガイドライン生成の2段階
- 検出(Consistency Analyzer): 記録済みの1本の軌跡(trace)に対し、各判断ステップを、記録済みコンテキストのまま追加のモデル呼び出し1回(k=5のcompletionを同時取得、既定)で再サンプリングし、出力のばらつきを測る。ツール呼び出しや環境との再実行は行わず、正解ラベルも不要で、logitなどのモデル内部にも触らないブラックボックス方式としている。ステップごとの一貫性スコアをスコアカードに記録し、次回反転しうる判断点を特定する。
- 生成(targeted guidelines): フラグが立ったステップごとに、ALTK-Evolveの標準形式のガイドライン候補を生成し、既存の保存・検索パイプラインに組み込む。記事が挙げる実例では、チェックボックス記号の数え方(部分文字列カウントではなく行アンカーの正規表現を使う)や、ノート検索結果の複数一致の確認といった、特定タスク固有ではなく多くのタスクに現れる不安定点がガイドライン化されている。
- 狙いの明示: 分析対象は「失敗」ではなく「不安定性」であり、今回はたまたま成功したが高い不確実性を抱えるステップも検出対象に含めるとしている。
結果 — ギャップをほぼ半減、平均精度は維持と報告
- 同一タスク: ベースラインの1軌跡から生成したガイドラインを適用し、5回の新規実行で評価したところ、Pass⁵は53.0%→69.0%(+16.0pp)、Mean@5は77.4%→81.0%に変化し、ギャップは24.4pp→12.0ppに縮小した。不安定だったタスクの約3分の1が毎回成功するタスクになったとしている。
- 難易度別: Mediumが+22.9pp(相対+44%)、Hardが+14.3pp(相対+45%)、Easyが+12.2ppで、中・高難易度層の改善が大きい。平均精度(Mean@5)は全難易度で維持または向上し、Pass⁵をMean@5とのトレードオフで稼いだものではないとしている。
- 汎化: ガイドラインを抽出したシナリオと同系列の別タスクに適用してもPass⁵が+13.0pp向上し、同一タスクの+16.0ppに近い。弱いモデル(gpt-oss-120b)では同一タスク+6.0pp(10.1%→16.1%)に対し類似タスク+8.7ppと、類似タスクの方が改善幅が大きく、単一軌跡の丸暗記ではなく再利用可能な失敗パターンを捉えている証拠と位置づけている。
解釈と限界
- ベンダー公称値: 上記の数値はすべてIBM Researchの報告値であり、独立した第三者による再現は本稿執筆時点で確認できていない。
- 評価範囲の限定: 結果はAppWorld test_normalと特定のエージェント構成(ReAct+GPT-4.1中心)におけるものであり、他のベンチマークやモデルへの一般化は未検証である。
- コストの未記載: 判断ステップごとの追加モデル呼び出し(オフライン1回)やガイドライン注入による推論時コンテキスト増大の実コストは、記事の要旨範囲では定量化されていない。
- 実務への示唆として: 記事は「Mean@kの横にPass^kを報告する」「まず大きいモデルに手を出す前に一貫性を疑う」「診断に採点者やライブ再生は不要」という3点を挙げている。これらは手法の宣伝を含む提言であり、採用の判断は各自の環境での測定に基づいて行うべきである。