IMAGE: AI生成ビジュアル
RESEARCH / AI AGENT RESEARCH
IBM Research:エージェントメモリは「機能」ではなく「用量」— モデル能力に応じた投与量の較正が精度とコストを左右(ALTK-Evolve)
IBM Researchは2026年8月18日、エージェント型AIのメモリ量をどうすべきかを8モデルで検証した研究「How Much Memory Does Your Agent Actually Need?」をHugging Faceブログで公開した。エージェントが過去の軌跡からガイドラインを自己蒸留して推論時に注入する「ALTK-Evolve」方式を、30B級の小型モデルからフロンティアのプロプライエタリモデルまで8モデルで評価。結果、メモリの「適正用量」はモデル能力に依存し、余力のある強力モデルは全ガイドラインを、弱いモデルは絞ったコア+タスク別検索が最適で、飽和したモデルは改善が得られないという3パターンに分類できると報告した。
IBM Researchは2026年8月18日、エージェント型AIに与えるメモリ量をどう決めるべきかを検証した研究**「How Much Memory Does Your Agent Actually Need?」をHugging Faceブログで公開した。過去の実行軌跡から行動の指針(ガイドライン)を自己蒸留し、推論時に文脈へ注入する「ALTK-Evolve」方式を、30B級の小型モデルからフロンティアのプロプライエタリモデルまで8モデル**にわたって評価した。
研究のコアとなる知見 — メモリは「用量」であり、モデル能力に応じて較正する
- エージェントメモリとは、過去のトランスクリプトの再生ではなく、過去の軌跡から「成功した方策・避けるべきミス・エッジケース」を蒸留したガイドライン集合を指す
- 仕組みはシンプルで、エージェントがタスクを試行して軌跡を生成 → ALTK-Evolveが成功・失敗の実行からガイドラインを抽出・集約 → 推論時に全量またはタスク関連分を注入する、というループ
- モデルの重みは一切更新されないため、8モデル横断の導入が安価で、移設も容易だとしている
- 検証の結果、メモリの「適正な投与量(dose)」はモデルの能力帯によって異なるというのが中心的な知見。同様のメモリを与えても、モデルごとに効果が異なる
3つのパターン — モデル能力とメモリ量の関係(AppWorld評価)
評価は、9つの模擬アプリにまたがる585の多段階タスク(test_normal 168件+test_challenge 417件)からなるAppWorldで実施された。個別タスクの完了率(TGC)と、シナリオ全バリアントをクリアした場合のみ合格とする厳格なSGCの双方で評価している。
- 余力のある強力モデル → 全ガイドライン注入が最適
- 「能力に余裕があり、全量を吸収・適用できる」パターン。ガイドラインを全量注入した場合に最も伸びる
- DeepSeek-V3.2(671B MoE)はタスク完了率(TGC)を +9.5pp、SGCを+16.1pp 向上
- Claude Opus 4.6はTGC +4.1pp(SGC +7.1pp)、GPT-5.5もTGC +2.9pp(SGC +7.2pp)
- 弱いモデル → コンパクトなコア+タスク別検索が最適
- 大量のガイドラインを注入すると「溺れて」しまう。高信頼のコア+タスクごとに必要な数件を取り出す検索方式が有効
- gpt-oss-120b(117B MoE)はこの選択型検索で、ベースライン39.9/21.4(TGC/SGC)から 56.0/37.5 へ。+16.1pp の向上
- 全量注入はこれより伸びず、トークンも約50%増と報告された
- 飽和したモデル → 有意な改善なし
- GLM-5(745B MoE)は今回の実行で改善が得られなかった。これは観測された「飽和パターン」であり、原因(モデルの天井・ガイドラインが課題に合っていない・適用が不十分)は今後の検証対象
コスト面の含意 — 「最も安い方法が最も正確」なケース
- 全ガイドライン注入は各ReActステップの入力が膨らむため、トークンコストが増加する(DeepSeek-V3.2ではベースライン148K→263Kで**+78%**)
- 一方、選択型検索(curated retrieval)はトークンをほぼ増やさない。gpt-oss-120bは**+16.1ppをトークン+5%**で達成しており、精度とコストの両面で最良になり得ることを示した
- 推論ループ自体は伸びず(DeepSeekはメモリ有無でReActステップ数がほぼ同数、平均約18〜19)、追加コストは入力トークンの膨張が主因
- 実運用での効率化の要はプロンプトキャッシングで、ガイドライン集合の静的プレフィックスを安定させてキャッシュ可能に保つ設計が重要だとしている
受け止めと今後の研究
- IBM Researchは「教訓は、学んだことをすべて与えることではなく、モデルが実際に使える量の経験を与えること」と総括。実際、「弱いモデル=コア+検索」は精度とコストの両面で最適になる
- 今後の課題として、ガイドラインの関連性ランキングを学習するセレクタ、ごく弱いモデル向けの教師蒸留メモリ、AppWorld以外のベンチマーク・実運用での検証、コンテキストウィンドウと能力の分離が挙げられている
- 手法はライブラリ「ALTK-Evolve」として公開されており、抽出・集約・検索パイプラインを利用できる
本記事の数値はすべてIBM Researchの一次情報(Hugging Faceブログ)に基づく。AppWorldは単一のベンチマークであり、実運用での一般化には別途検証が必要な点に留意が必要だ。
出典: