論文の概要: Compression Beyond the Uncompressed: A Two-Stage Training Recipe for Soft Context Compression in RAG
- arxiv url: http://arxiv.org/abs/2609.05152v1
- Date: Fri, 04 Sep 2026 13:53:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:24.062284
- Title: Compression Beyond the Uncompressed: A Two-Stage Training Recipe for Soft Context Compression in RAG
- Title(参考訳): 圧縮以外の圧縮:RAGにおけるソフトコンテクスト圧縮のための2段階トレーニング
- Abstract要約: 我々は、RAG推論のための2段階のトレーニングレシピであるDEX-Compを提案する。
DEX-Compは、検索したコンテキストを16times$で圧縮し、推論を4times$--24times$で高速化する。
検索深度における5つのオープンドメインのQAベンチマークでは、DeX-Compは検索したコンテキストを16Times$で圧縮し、推論を4times$--24times$で高速化する。
- 参考スコア(独自算出の注目度): 24.94881830262324
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-Augmented Generation (RAG) enhances language models with external knowledge, but the lengthy retrieved context inflates the input and degrades inference efficiency. Soft context compression encodes each document into a substantially shorter embedding sequence. However, most existing approaches are trained by distilling outputs from uncompressed RAG systems, inherently limiting their performance relative to the original model. To address this limitation, we propose DEX-Comp, a two-stage training recipe: Pure Distillation warm-starts the compression model on the uncompressed RAG's correct responses only, and Hard Exploration then runs reinforcement learning solely on queries the uncompressed RAG fails, forcing the model to explore computation patterns better suited to compressed representations. On five open-domain QA benchmarks at retrieval depths from top-5 to top-30, DEX-Comp compresses retrieved contexts by $16\times$ and accelerates inference by $4\times$--$24\times$, while achieving performance comparable to or exceeding the uncompressed RAG baseline across retrieval depths. Ablations and evaluations across diverse datasets and backbones further confirm the contribution of each stage and the generalization of our approach.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG)は言語モデルを外部知識で拡張するが、長い検索コンテキストは入力を膨らませ、推論効率を低下させる。
ソフトコンテキスト圧縮は、各文書をかなり短い埋め込みシーケンスに符号化する。
しかしながら、既存のほとんどのアプローチは、圧縮されていないRAGシステムの出力を蒸留することによって訓練されており、本質的には元のモデルと比較して性能を制限している。
純蒸留は、圧縮されていないRAGの正しい応答のみの圧縮モデルをウォームスタートし、ハード探索は、圧縮されていないRAGが失敗するクエリのみに強化学習を実行し、圧縮された表現に適した計算パターンを探索することを強制する。
トップ5からトップ30までの検索深度における5つのオープンドメインQAベンチマークでは、DeX-Compは検索したコンテキストを16\times$で圧縮し、推論を4\times$--24\times$で加速すると同時に、検索深度を越えて圧縮されていないRAGベースラインに匹敵するパフォーマンスを達成する。
多様なデータセットやバックボーンに対するアブレーションと評価により,各ステージの貢献とアプローチの一般化がさらに確認される。
関連論文リスト
- RAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation [7.540266838459537]
RAGOCRは、検索した文書を入力クエリで条件付けられたコンパクトな視覚表現に圧縮する新しいフレームワークである。
RAGOCRは、入力トークンの8分の1しか必要とせず、素数RAGを15%以上精度で上回ることを示す。
論文 参考訳(メタデータ) (2026-08-01T16:59:49Z) - CLAD: Efficient Log Anomaly Detection Directly on Compressed Representations [2.487363589269089]
圧縮バイトストリーム上でLADを直接実行する最初のディープラーニングフレームワークであるCLADを紹介する。
本稿では,拡張畳み込みバイトエンコーダ,ハイブリッドトランスフォーマー--mLSTM,4方向アグリゲーションプールを統合した汎用アーキテクチャを提案する。
CLADは5つのデータセットで評価され、最先端の平均F1スコアは0.9909であり、最高のベースラインを2.72ポイント上回る。
論文 参考訳(メタデータ) (2026-04-14T17:57:01Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - Proxy Compression for Language Modeling [58.904023114033954]
プロキシ圧縮は、圧縮された入力の効率性を維持する代替のトレーニングスキームである。
コード言語モデリングの実験では、プロキシ圧縮がトレーニング効率を大幅に向上することを示した。
モデルスケールが大きくなるにつれて、プロキシトレーニングされたモデルは最終的に一致するか、あるいは競合するトークン化アルゴリズムのアプローチになる。
論文 参考訳(メタデータ) (2026-02-04T07:36:46Z) - Rethinking Autoregressive Models for Lossless Image Compression via Hierarchical Parallelism and Progressive Adaptation [75.58269386927076]
自己回帰(AR)モデルは、しばしば計算コストの禁止のために非現実的に除外される。
この研究は、階層的並列性とプログレッシブ適応に基づくフレームワークを導入して、このパラダイムを再考する。
各種データセット(自然,衛星,医療)の実験により,本手法が新たな最先端圧縮を実現することを確認した。
論文 参考訳(メタデータ) (2025-11-14T06:27:58Z) - Simple Context Compression: Mean-Pooling and Multi-Ratio Training [12.049015994907629]
我々は、広く使われている圧縮トークンアーキテクチャを一貫して上回る軽量でシンプルな平均プール手法を開発した。
ドメイン内およびドメイン外QAデータセット、モデルファミリ、スケール、圧縮比にわたって、広範な実験を行います。
全体としては,複数の圧縮比のトレーニングを行う場合,比較的少ない低下率で,本手法は最強性能を達成する。
論文 参考訳(メタデータ) (2025-10-23T17:57:23Z) - CORE-RAG: Lossless Compression for Retrieval-Augmented LLMs via Reinforcement Learning [22.93037884068796]
Retrieval-Augmented Generation (RAG) は、知識更新のタイムラインと大規模言語モデルにおける応答の事実的正確性を高めるための有望なアプローチとして登場した。
RAG用に調整された文書圧縮への既存のアプローチは、しばしばタスクパフォーマンスを低下させる。
我々は、RAGにおけるロスレスコンテキスト圧縮の新しい手法であるCOREを提案する。
論文 参考訳(メタデータ) (2025-08-24T12:21:50Z) - Enhancing RAG Efficiency with Adaptive Context Compression [24.94881830262324]
検索拡張生成は、長い検索コンテキストのためにかなりの推論コストを発生させる。
既存の手法では、固定圧縮率、単純なクエリの過剰圧縮、複雑なクエリのアンダー圧縮などを適用している。
本稿では,入力複雑性に基づいて動的に圧縮率を調整するフレームワークであるRAG(ACC-RAG)の適応文脈圧縮を提案する。
論文 参考訳(メタデータ) (2025-07-24T13:46:51Z) - BRIEF: Bridging Retrieval and Inference for Multi-hop Reasoning via Compression [91.23933111083389]
Retrieval-augmented Generation (RAG)は、外部知識を統合することで、大きな言語モデル(LLM)を補完することができる。
本稿では,クエリ対応マルチホップ推論を行う軽量なアプローチであるBRIEFを提案する。
オープンソースモデルで構築した合成データに基づいて,BRIEFはより簡潔な要約を生成する。
論文 参考訳(メタデータ) (2024-10-20T04:24:16Z) - xRAG: Extreme Context Compression for Retrieval-augmented Generation with One Token [108.7069350303884]
xRAGは、検索拡張生成に適した、革新的なコンテキスト圧縮手法である。
xRAGは、言語モデル表現空間に文書の埋め込みをシームレスに統合する。
実験の結果、xRAGは6つの知識集約タスクで平均10%以上の改善を達成していることがわかった。
論文 参考訳(メタデータ) (2024-05-22T16:15:17Z) - Learning Accurate Performance Predictors for Ultrafast Automated Model
Compression [86.22294249097203]
フレキシブルネットワーク展開のための超高速自動モデル圧縮フレームワークSeerNetを提案する。
本手法は,探索コストを大幅に削減した競合精度・複雑度トレードオフを実現する。
論文 参考訳(メタデータ) (2023-04-13T10:52:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。