論文の概要: CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG
- arxiv url: http://arxiv.org/abs/2608.07458v1
- Date: Fri, 07 Aug 2026 17:51:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.588271
- Title: CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG
- Title(参考訳): CoinRAG:長期RAGのためのコンテキスト情報Nugget KVキャッシュ再利用
- Authors: Gyuwan Kim, Cheoneum Park, Tao Yang,
- Abstract要約: CoinRAG (Contextualized Information KV Cache Reuse for Long-Context RAG) を提案する。
CoinRAGはフルチャンクエンコーディングの代わりに、2段階の検索によって取得したチャンク内のクエリ関連セマンティックユニットを識別する。
LongBench質問応答タスクの広範囲な評価は、CoinRAGが運用コストを大幅に削減し、他のベースラインを上回っていることを示している。
- 参考スコア(独自算出の注目度): 6.614653387089263
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent optimization studies on Retrieval-Augmented Generation (RAG) have exploited chunk-level KV cache reuse to avoid processing long retrieved contexts for higher efficiency, while significant information redundancy and noise still remain in the coarse-grained chunks. This paper optimizes the Pareto frontier under low prefill latency constraints while maximizing accuracy by proposing CoinRAG (Contextualized Information Nugget KV Cache Reuse for Long-Context RAG). The name metaphorically reflects our core mechanism: much like assembling small tokens (or "coins") to accumulate a larger value, CoinRAG compositionally reuses offline-computed, fine-grained nugget caches to form a learned contextual representation efficiently in a more semantically relevant but compact manner. Specifically, instead of full-chunk encoding, CoinRAG identifies query-relevant semantic units within retrieved chunks through two-stage retrieval and seamlessly assembles their sliced KV representations with a chunk-level context. Extensive evaluations on LongBench multi-hop question answering tasks demonstrate that CoinRAG significantly reduces operational costs and outperforms the other baselines with a new Pareto frontier and an average 5.3% relative improvement in answer quality (F1) under a standard fast prefill latency budget.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) の最近の最適化研究は、チャンクレベルのKVキャッシュの再利用を利用して、より高効率で長時間検索されたコンテキストの処理を回避している。
本稿では,CoinRAG (Contextualized Information Nugget KV Cache Reuse for Long-Context RAG)を提案することにより,低プリフィル遅延制約下でのParetoフロンティアを最適化し,精度を最大化する。
CoinRAGは、オフラインで計算された、きめ細かなナゲットキャッシュを合成的に再利用し、より意味的に関連があるがコンパクトな方法で学習されたコンテキスト表現を効率的に形成します。
具体的には、全チャンクエンコーディングの代わりに、CoinRAGは検索されたチャンク内のクエリ関連セマンティックユニットを2段階の検索を通じて識別し、チャンクレベルのコンテキストでスライスされたKV表現をシームレスに組み立てる。
LongBenchマルチホップ質問応答タスクの広範囲な評価は、CoinRAGが運用コストを大幅に削減し、新しいParetoフロンティアと標準の高速プリフィル遅延予算の下で平均5.3%の回答品質(F1)で他のベースラインを上回っていることを示している。
関連論文リスト
- No More K-means: Single-Stage Sparse Coding for Efficient Multi-Vector Retrieval [51.43543998583709]
SSR(Single-stage Sparse Retrieval)は、高価なクラスタリングを効率的なスパースコーディングに置き換えるパラダイムシフトである。
ColBERTv2と比較してインデックス処理時間を15倍短縮し、検索レイテンシを半減させ、同時に検索性能を向上させる。
論文 参考訳(メタデータ) (2026-05-28T15:53:34Z) - Kwai Summary Attention Technical Report [69.40814939510126]
長文の能力は、次世代の大規模言語モデルの最も重要な方向性の1つになっている。
標準ソフトマックスアテンションは、シーケンスの長さに関して2次時間複雑性を示す。
歴史的文脈を圧縮することでシーケンスモデリングコストを削減する新しいアテンションメカニズムであるKwai Summary Attention (KSA)を提案する。
論文 参考訳(メタデータ) (2026-04-27T12:59:53Z) - $A^3$: Attention-Aware Accurate KV Cache Fusion for Fast Large Language Model Serving [42.02864241423696]
大きな言語モデル(LLM)は、長いコンテキストを処理する上で強力な能力を示している。
長いシーケンスを処理できるにもかかわらず、結果としてデコーディングのレイテンシとメモリオーバーヘッドは大きいままである。
KVキャッシュの再利用の最近の進歩は、これらのコストを軽減する可能性を示しているが、それでも顕著なパフォーマンス劣化に悩まされている。
論文 参考訳(メタデータ) (2025-11-13T07:28:59Z) - REFRAG: Rethinking RAG based Decoding [67.4862300145604]
REFRAGは効率的なデコードフレームワークで、RAGアプリケーションの遅延を圧縮し、感知し、拡張し、改善する。
本稿では,RAG,マルチターン会話,長期文書要約など,多種多様な長文タスクを対象としたREFRAGの厳密な検証を行う。
論文 参考訳(メタデータ) (2025-09-01T03:31:44Z) - SCBench: A KV Cache-Centric Analysis of Long-Context Methods [61.025422435235456]
KVキャッシュ中心の視点から長文の手法を評価するベンチマークであるSCBenchを紹介する。
我々は、Gated Linear RNNsやMamba-Attention Hybridsを含む8つのカテゴリの長期コンテキストソリューションについて、広範なKVキャッシュ中心の分析を行う。
本研究は,O(n)メモリとサブO(n2)プリフィルによるスパース符号化が堅牢に動作する一方で,サブO(n)メモリ手法がマルチターンシナリオに悩まされていることを示す。
論文 参考訳(メタデータ) (2024-12-13T17:59:52Z) - ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression [10.003118268356017]
ロングコンテキストは推論効率に重大な課題をもたらす。
本稿では,意味クラスタの粒度でトークンをリコールするClusterKVを紹介する。
実験結果から、ClusterKVは32kのコンテキスト長を持つ様々なタスクにおいて、無視可能な精度の損失が得られることがわかった。
論文 参考訳(メタデータ) (2024-12-04T10:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。