論文の概要: Residual Vector-based Reconstruction as Long-Context Recall Regardless of Context Window Size
- arxiv url: http://arxiv.org/abs/2609.12686v1
- Date: Fri, 11 Sep 2026 10:31:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.717654
- Title: Residual Vector-based Reconstruction as Long-Context Recall Regardless of Context Window Size
- Title(参考訳): コンテキストウィンドウサイズに関わらず長期リコールとしての残差ベクトルベース再構成
- Abstract要約: 大きな言語モデル(LLM)は、長いドキュメントや長い会話を含む長いコンテキストを処理する。
LLMは入力長に比例して増加するトークンレベルのメモリ使用率に直面する。
本稿では,コンテクスト長が増加するにつれて,ニアコンスタントなGPUメモリ使用率を維持する長文リコール手法を提案する。
- 参考スコア(独自算出の注目度): 0.6155604731137828
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) process long contexts, including long documents and lengthy conversations, but face token-level memory usage that increases proportionally to input length. Although model optimization and lossy prompt compression are widely used, these methods still fail to solve the long-context recall problem beyond pretrained and size-constrained context windows. This paper proposes a long-context recall method that maintains near-constant GPU memory usage as context length increases, without additional training. The main idea is to reconstruct facts using parameter activations in the LLM's feed-forward layers, which store residual vectors representing facts from the source document. Utilizing residual vectors allows the LLM to deterministically reconstruct query relevant facts without referencing the original document, preserving high fidelity and reducing memory usage without fine-tuning weights. Experimental results show that the proposed method enables answering single-fact questions in two-million-token story contexts where previous methods fail.
- Abstract(参考訳): 大きな言語モデル(LLM)は長い文書や長い会話を含む長いコンテキストを処理しますが、入力長に比例して増加するトークンレベルのメモリ使用量です。
モデル最適化とロッキーなプロンプト圧縮が広く用いられているが、これらの手法は、事前訓練されたコンテキストウィンドウやサイズ制約のあるコンテキストウィンドウを超えて、長いコンテキストのリコール問題を解決するのに失敗している。
本稿では,コンテクスト長が増加するにつれてGPUメモリ使用率をほぼ一定に維持する長文リコール手法を提案する。
主なアイデアは、LCMのフィードフォワード層でパラメータアクティベーションを使用して事実を再構築することであり、ソース文書から事実を表す残差ベクトルを格納する。
残差ベクトルを利用することで、LCMは元の文書を参照せずにクエリ関連の事実を確定的に再構築し、高い忠実性を保持し、微調整の重みを伴わずにメモリ使用量を削減できる。
実験の結果,提案手法は,過去の手法が失敗する200万件のストーリーコンテキストにおいて,単品問合せに答えることができることがわかった。
関連論文リスト
- LazyMem: Retrieve Broadly, Construct Selectively for Efficient Long-Term Agent Memory [10.916121108457537]
クエリ時間にすべてのメモリ構成を遅延させるLazyMemを紹介します。
LongMemEvalでは、LazyMem-4B は LLM-judge の精度 0.85 を達成し、最強の非線形ベースラインを上回っている。
さらに、ターゲットドメイントレーニングなしでLoCoMoに一般化し、以前のクエリ時間ベースラインと比較して平均レイテンシを低減する。
論文 参考訳(メタデータ) (2026-07-17T12:49:57Z) - ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning [78.94047086588078]
長文推論のための LLM Harness として再帰的証拠を提案する。
長文推論を改善するための訓練不要推論法である。
128Kのコンテキスト長を持つ8つの長文データセットの実験は、エビデンスの利用を一貫して改善していることを示している。
論文 参考訳(メタデータ) (2026-07-02T17:59:26Z) - Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory [88.81430082035617]
LLMエージェントは、蓄積された対話履歴を忠実に保存し、効率的に検索し、深く推論できるメモリシステムを必要とする。
本稿では,ソース識別子に固定された生の対話セグメントを含む3つの共存表現の粒度を格納するTriMemを提案する。
論文 参考訳(メタデータ) (2026-05-19T15:05:06Z) - Context Recycling for Long-Horizon LLM Inference [0.3655021726150367]
大規模言語モデル(LLM)は、短文推論において強力な能力を示すが、長い会話の地平線上での性能は低下する。
タスク関連情報をターン毎に保持するコンテキストリサイクルシステムであるContextForgeを紹介する。
システムは、完全なコンテキスト再生に頼ることなく、事前計算の効率的な再利用を可能にする。
論文 参考訳(メタデータ) (2026-05-01T04:45:08Z) - NextMem: Towards Latent Factual Memory for LLM-based Agents [58.35585202907478]
NextMemは、自動回帰型オートエンコーダを使用して、潜時メモリを効率的に構築する、潜時ファクトメモリフレームワークである。
大規模な実験は、NextMemが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-26T14:35:27Z) - Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning [47.87361916374891]
本稿では,チャンクワイズ圧縮と選択的メモリリコールに基づく,効率的な長文推論のためのフレームワークを提案する。
このフレームワークは、長い入力をチャンクに分割し、各チャンクを学習圧縮機を用いて圧縮されたメモリ表現に符号化する。
ピークGPUメモリ使用量の最大2倍の削減と,MemAgent上での6倍の推論高速化を実現している。
論文 参考訳(メタデータ) (2026-02-09T08:33:11Z) - Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents [33.617262543252494]
本稿では、メモリ履歴全体からの選択的検索を可能にするコールバック強化メモリを備えたメモリ拡張エージェントReMemR1を提案する。
また,RLMLR(Reinforcement Learning with Multi-Level Rewards)を提案する。
論文 参考訳(メタデータ) (2025-09-27T01:36:46Z) - Needle in the Haystack for Memory Based Large Language Models [31.885539843977472]
現在の大規模言語モデル(LLM)は、単純な事実検索タスクではよく機能しない。
動的に適応可能な外部メモリをLCMに結合することでこの問題を軽減することができるか検討する。
テキストサンプルのエピソードを高速に書き書きできるLarimarの外部メモリは、テスト時に、トレーニング中に見られるものよりもはるかに長いコンテキストを扱うために使用できることを示した。
論文 参考訳(メタデータ) (2024-07-01T16:32:16Z) - Recurrent Context Compression: Efficiently Expanding the Context Window of LLM [22.595457889113668]
この研究はRecurrent Context Compression (RCC)と呼ばれる手法を導入し、Transformerベースの大規模言語モデル(LLM)のコンテキストウィンドウ長を効率的に拡張する。
我々は,複数のタスクに対するアプローチを検証し,BLEU4スコアが0.95に近いテキスト再構成タスクで最大32倍の圧縮率を実現し,シーケンス長1Mのパスキー検索タスクで約100%の精度を実現した。
論文 参考訳(メタデータ) (2024-06-10T08:50:59Z) - Hierarchical Context Merging: Better Long Context Understanding for Pre-trained LLMs [61.40047491337793]
本稿では,大規模言語モデルの制約を克服する新しいトレーニングフリースキームである階層型cOntext MERging(HOMER)を提案する。
HomeRは、長いインプットを管理可能なチャンクに分割する、分別/対数アルゴリズムを使用する。
トークン削減技術がマージ毎に先行し、メモリ使用効率が保証される。
論文 参考訳(メタデータ) (2024-04-16T06:34:08Z) - Recursively Summarizing Enables Long-Term Dialogue Memory in Large Language Models [30.48902594738911]
長い会話をすると、大きな言語モデル(LLM)は過去の情報を思い出さず、一貫性のない応答を生成する傾向がある。
本稿では,長期記憶能力を高めるために,大規模言語モデル(LLM)を用いて要約/メモリを生成することを提案する。
論文 参考訳(メタデータ) (2023-08-29T04:59:53Z) - Augmenting Language Models with Long-Term Memory [142.04940250657637]
既存の大規模言語モデル(LLM)では、入力長制限のため、固定サイズの入力しかできない。
本稿では,Long-Term Memory (LongMem) を付加した言語モデルを提案する。
論文 参考訳(メタデータ) (2023-06-12T15:13:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。