論文の概要: PReM: Learning What to Preserve and When to Refresh for Context Compression
- arxiv url: http://arxiv.org/abs/2607.14327v1
- Date: Wed, 15 Jul 2026 19:46:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.898283
- Title: PReM: Learning What to Preserve and When to Refresh for Context Compression
- Title(参考訳): PReM: コンテキスト圧縮のための保存方法と更新タイミングを学ぶ
- Authors: Bohan Yu, Lei Shen, Chenxi Zhou, Chen Han, Junlin Liu, Wenbo Su, Yu Cheng, Bo Zheng,
- Abstract要約: PReM(Preserve and Refresh Memory)は、長文推論のためのコンテキスト圧縮フレームワークである。
モデルの内部レイヤ単位のKVメモリとして長いコンテキストを維持し、何を保存するか、いつリフレッシュするかを学ぶ。
32Kのコンテキストでの実験では、PReMは16xと32xの圧縮において強いベースラインよりも優れていた。
- 参考スコア(独自算出の注目度): 24.88582494682977
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Efficient long-context inference is not only about reducing memory cost, but also about keeping useful contextual evidence accessible as generation proceeds. However, existing compression-oriented approaches, such as key-value (KV) cache compression and context compression, often either make an early decision about which contextual information to keep or rely on an external compressor. Such designs make it difficult to adapt the compressed context to the evidence needed by later reasoning steps. This paper introduces PReM (Preserve and Refresh Memory), a context-compression framework that maintains the long context as the model's internal layer-wise KV memory and learns what to preserve and when to refresh it. Specifically, PReM uses a dedicated memory layer to make memory-selection decisions, and a special memory token <m> to trigger refreshes during generation. To train this behavior, PReM introduces Phase-Separated Refresh Training, aligning memory selection with memory-conditioned generation while preserving continuity across refreshes. Experiments with 32K-token contexts show that PReM outperforms strong baselines under both 16x and 32x compression, while maintaining a favorable balance between answer quality and inference efficiency.
- Abstract(参考訳): 効率的な長文推論は、メモリコストの削減だけでなく、世代が進むにつれて有用な文脈的証拠を維持することでもある。
しかしながら、キー値(KV)キャッシュ圧縮やコンテキスト圧縮といった既存の圧縮指向のアプローチは、外部圧縮器をどのコンテキスト情報に保持するか、あるいは依存するかを早期に決定することが多い。
このような設計により、後続の推論ステップで必要とされる証拠に圧縮された文脈を適応させることが困難になる。
本稿では,PReM(Preserve and Refresh Memory)について紹介する。PReM(Preserve and Refresh Memory)は,モデル内部のKVメモリとして長期のコンテキストを維持し,保存方法と更新時期を学習するコンテキスト圧縮フレームワークである。
具体的には、PReMはメモリ選択決定のための専用メモリ層と、生成時にリフレッシュをトリガする特別なメモリトークン<m>を使用する。
この動作をトレーニングするために、PReMは相分離型リフレッシュトレーニングを導入し、メモリ選択とメモリ条件付き生成を整列させ、リフレッシュ間の連続性を保っている。
32K-tokenコンテキストによる実験では、PReMは16xと32xの圧縮において強いベースラインよりも優れ、応答品質と推論効率のバランスが良好である。
関連論文リスト
- Planning-aligned Token Compression for Long-Context Autonomous Driving [95.59023657139208]
条件付きVQ-VA上に構築した計画整合型ワーキングメモリフレームワークを提案する。
圧縮は歴史的軌跡と学習した計画意図の両方で条件付けられている。
歴史的文脈が行動の正確性に最も重要となる高信号動的シナリオについて評価する。
論文 参考訳(メタデータ) (2026-06-05T17:16:21Z) - Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding [55.7992006853979]
SAVEMemは、セマンティックな認識をメモリ生成にもたらすフレームワークで、クエリ毎に検索スコープを適応させる。
SAVEMemは、メモリ生成にセマンティックな認識をもたらし、クエリ毎に検索範囲を適応させる、トレーニングフリーのデュアルステージフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T15:40:40Z) - EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction [55.026048429595384]
EchoKVは、標準と圧縮された推論間のオンデマンド移行を可能にする柔軟なKVキャッシュ圧縮スキームである。
高速で低コストなトレーニングを可能にする2段階の微調整戦略を導入する。
論文 参考訳(メタデータ) (2026-03-24T07:58:42Z) - SWAN: Sparse Winnowed Attention for Reduced Inference Memory via Decompression-Free KV-Cache Compression [7.603859408568262]
大きな言語モデル(LLM)は、キーバリュー(KV)キャッシュの巨大なメモリフットプリントのため、自動回帰推論において重大なボトルネックに直面します。
SWANは、このオーバーヘッドをなくす、新しい、微調整不要なフレームワークである。
提案手法はオフライン行列を用いてKV-cacheを回転させプルークする。
論文 参考訳(メタデータ) (2025-11-24T09:41:24Z) - OjaKV: Context-Aware Online Low-Rank KV Cache Compression with Oja's Rule [54.37983890753086]
我々は,戦略的ハイブリッドストレージポリシとオンラインサブスペース適応を統合したフレームワークであるOjaKVを紹介する。
OjaKVは、重要かつ最新のトークンをフルランクで保存し、注意のために高忠実なアンカーを維持している。
オンライン主成分分析のためのOjaのアルゴリズムを用いて、プロジェクションベースを漸進的に適応させることにより、低ランク圧縮を適用する。
論文 参考訳(メタデータ) (2025-09-25T21:42:27Z) - ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference [61.412894960600205]
大きな言語モデル(LLM)は、長いテキストを処理する際に大きなGPUメモリを必要とする。
ChunkKVは、セマンティックチャンクを基本的な圧縮単位として扱うことで、KVキャッシュ圧縮を再定義する。
結果: ChunkKVは最先端の手法を最大8.7%精度で上回る。
論文 参考訳(メタデータ) (2025-02-01T03:49:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。