研究データと神経構造が融合した青い抽象ビジュアル
NAW / RESEARCH 04

IMAGE: AI生成ビジュアル

RESEARCH / RESEARCH

コンテキスト圧縮でユーザー指示が平均83%消失 — Penn Stateが「Lost in Compaction」で実測、90%超を保持する抽出器も提案(arXiv)

コンパクション(会話履歴の要約圧縮)をかけると、セッション中に守るべきユーザー規則が平均で83%失われる。ペンシルベニア州立大学の研究チームが評価スイート「COMPINT」で12種のコンパクタを実測し、コンパクタ・LLMを改造せず横に置くだけのSC認識抽出器で保持率90%超を達成した。

LLMのコンテキスト窓は、長い会話を1つのチャットに詰め込み続けるとすぐに逼迫する。その対策として各社が採用するのが「コンパクション(compaction)」、要約による履歴圧縮だ。しかしペンシルベニア州立大学の研究チームはこの圧縮過程で、ユーザーがそのセッション中ずっと守らせたい指示が静かに大量に失われていることを実測で示した。arXiv:2608.11242「Lost in Compaction: Evaluating Side-Constraint Loss under Context Compaction」は、3つの長期コンテキストシナリオで12種のコンパクタを評価し、**注入した「セッション制約(Session Constraints, SC)」の平均保持率は17%**だったと報告する。「メールを削除する前に私に確認して」「私の名前を返答で使わないで」といったルールは、メインタスクの継続とは別物として扱われ、圧縮の際に最初に切り捨てられる。

COMPINT: 3シナリオ × 12コンパクタで「指示の生存率」を測定

研究チームは、SCの消失を系統的に測る評価スイートCOMPINTを構築した。SCを5カテゴリに分類し、強度(選好/厳格)×明示性(文脈付け/直接)の4通りの言い回しと4つの注入位置(先頭・中間・末尾・複数)を組み合わせて長期コンテキストに注入し、圧縮後にSCが残っているか(保持率)と、SCに沿った行動をするか(準拠率)をLLM-as-a-Judgeとプローブで判定する。

COMPINTの構成(Figure 2: SC分類・注入条件・評価の3コンポーネント)

画像出典: arXiv 2608.11242v1(Lost in Compaction、Figure 2、CC BY 4.0)

  • 評価対象は3シナリオ: マルチターンチャット(WildChatベース)・エージェント軌跡(Hermes Agents)・長時間研究(OpenResearcher)。いずれも10万トークン級の長期コンテキストを合成した
  • コンパクタは12種: gpt-oss-120b(Anthropicプロンプト/pi-monoプロンプト)、Gemma 4-E4B、LLMLingua-2、Qwen30B-A3Bなどが含まれる
  • 平均保持率は17%。設定次第で98%から6%まで大きく振れ、コンパクタ・プロンプト・文脈長・SCの言い回し・注入位置に依存する「系統的な消失」であることが示された
  • SCタイプ別では「プロセス制約(作業の進め方に関する規則)」が最も失われやすく、どのコンパクタでも平均保持率36%を超えなかった

消失は「圧縮なし」より悪いケースも — 抽出器で90%超へ

保持率の低下は行動面にも波及する。SCが失われると、圧縮後にプローブ(「この変更は実行していい?」)を与えた際のSC準拠率も下がり、多くの設定で「圧縮しないでそのまま実行する」よりもパフォーマンスが悪化した。つまりコンパクション自体が、SC順守という観点ではコストになっている。

  • SC準拠の前提は保持であり、保持できなければ準拠もできない。保持と準拠はセットで評価されている
  • 論文は対処として、**SC認識抽出器(SC-aware extractor)**を提案。コンパクションの前段でSCを抽出して保持し、圧縮後コンテキストに付け加える「プラグアンドプレイ」モジュールとして動作する
  • Qwen3.5-9Bベースの実装で、3シナリオすべてで保持率90%超を達成。コンパクタとLLM本体は一切改造しない
  • 評価スイート・データセット構築・実験ランナー・分析コードはGitHub(ZhiqiEliWang/compaction-integrity)で公開されている

SC保持率のタイプ別比較(Figure 6: 3データセット平均。プロセス制約が最も失われやすい)

画像出典: arXiv 2608.11242v1(Lost in Compaction、Figure 6、CC BY 4.0)

今回の結果は、ChatGPTの「Compaction」やClaudeの自動コンパクションなど、日常的に使われる圧縮機能がユーザー指示を静かに落としている可能性を示唆する。研究チームは「消失は特定の設定に紐づくものではなく系統的」と強調しており、コンパクションの信頼性評価が新たな研究領域として立ち上がりつつある。

出典