FuguReport

ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning

著者 Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, Yuanchen Bei, Zhining Liu, Lingjie Chen, Ismini Lourentzou, Hanghang Tong, Jingrui He
所属 University of Illinois Urbana-Champaign
カテゴリ Method / Contextual Reasoning / Recursive evidence replay for long context, Evaluation / Long-Context Evaluation / 8 long-document datasets with 128K context, Application / LLM Reasoning / Improving long-document reasoning
ライセンス CC BY 4.0

Abstractの概要

本論文では、大規模言語モデル(LLM)を用いた長期コンテキスト推論のための、学習不要の推論手法であるReContextを提案している。本手法は、モデル内部の質問条件付き関連性シグナルを利用して、元の長期コンテキストから証拠候補を特定し、それらのシグナルを根拠に基づくテキストスパンとして実体化し、最終的な回答生成の前に選択された証拠を再提示(リプレイ)する。検索、圧縮、またはプルーニング(枝刈り)アプローチとは異なり、元のコンテキスト全体を利用可能な状態に保ち、コンテキストの除外ではなく強調のために、再提示された証拠プールを使用する。さらに本論文では、この手法の連想記憶に基づく解釈と、再帰的な証拠再提示による理論的な単調改善の結果についても提示している。

新規性

特徴的なアイデアは、プロンプト全体を保持したまま、内部のアテンションベースの関連性シグナルを明示的かつ再帰的に更新される証拠プールに変換し、質問の近くで再提示することである。また、この推論時のメカニズムを連想記憶の枠組みと組み合わせ、隠れ表現が回答の埋め込みに向けて単調改善されることを主張する定理を提示している点も独特である。

成果

8つの128Kコンテキストデータセットと3つのバックボーン(Qwen3-4B、Qwen3-8B、Llama3-8B)において、ReContextは3つのモデルファミリーすべてで最高の平均順位を達成し、ベースライン(Vanilla)の平均精度を0.24から0.30へと向上させ、相対的に24.6%の改善を報告している。また、64Kコンテキストの予算内や思考プロセスを有効にした場合でも競争力を維持しており、報告された効率分析では、追加される証拠トークンが128個未満であるため、メモリのオーバーヘッドが最小限に抑えられていると指摘されている。

論文の注目点

  1. ReContextは、元の完全なコンテキストへのアクセスを維持しながら、根拠となる証拠スパンを再帰的に選択して再提示することで、証拠の構成と回答生成を分離している。
  2. 本手法は、内部の「質問とコンテキスト間の関連性シグナル」に依存しており、最終的なデコード時において外部検索、プロンプトの枝刈り、バックボーンの変更を回避している。
  3. 経験的に、本手法は複数の長期コンテキストベンチマーク全体で一貫した総合的改善を示しており、アブレーション調査により、再帰の深さ、証拠の予算枠、元のコンテキストからの証拠選択がいずれも性能に影響を与えることが示されている。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。