論文の概要: QCFuse: Query-Centric Cache Fusion for Efficient RAG Inference
- arxiv url: http://arxiv.org/abs/2604.08585v1
- Date: Mon, 30 Mar 2026 02:55:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.463688
- Title: QCFuse: Query-Centric Cache Fusion for Efficient RAG Inference
- Title(参考訳): QCFuse: 効率的なRAG推論のためのクエリ中心キャッシュフュージョン
- Authors: Jianxin Yan, Zeheng Qian, Wangze Ni, Zhitao Shen, Zhiping Wang, Haoyang Li, Jia Zhu, Lei Chen, Kui Ren,
- Abstract要約: QCFuseは、ユーザクエリを中心とした革新的なKVキャッシュ融合システムである。
QCFuseはLLMの応答効率を40%向上させる。
特定のシナリオでは、QCFuseはより高い応答精度をもたらす注意喚起効果を達成する。
- 参考スコア(独自算出の注目度): 23.22388531954795
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cache fusion accelerates generation process of LLMs equipped with RAG through KV caching and selective token recomputation, thereby reducing computational costs and improving efficiency. However, existing methods primarily rely on local perspectives for token selection and lack global awareness from the user query. Utilizing this global awareness is challenging due to the high cost of obtaining context-aware query representations and the strict pipeline constraints required for efficient attention analysis. Thus, this demonstration introduces QCFuse, an innovative KV cache fusion system centered on the user query. QCFuse leverages semantic summary anchors to enhance query representations and selectively recomputes query-related tokens to improve accuracy, updating tokens based on the attention distribution of the most critical Transformer layer to preserve the high efficiency of the pipeline structure. Evaluations on real-world datasets demonstrate that QCFuse significantly improves the response efficiency of LLMs by 40\% while maintaining equivalent accuracy compared to current methods. Additionally, in certain scenarios, QCFuse achieves an attention denoising effect that yields higher response accuracy, demonstrating substantial potential in the optimization of LLM inference.
- Abstract(参考訳): キャッシュ融合は、KVキャッシュと選択トークン再計算を通じてRAGを備えたLCMの生成を加速し、計算コストを低減し、効率を向上する。
しかし、既存のメソッドは主にトークンの選択のためのローカルな視点に依存しており、ユーザクエリからのグローバルな認識が欠如している。
このグローバルな認識を活用することは、コンテキスト対応クエリ表現の高コストと、効率的な注意分析に必要な厳格なパイプライン制約のため、難しい。
このデモでは、ユーザクエリを中心とした革新的なKVキャッシュ融合システムであるQCFuseが導入されている。
QCFuseはセマンティック・サマリ・アンカーを活用してクエリ表現を強化し、クエリ関連のトークンを選択的に再計算して精度を向上させる。
実世界のデータセットによる評価から,QCFの利用により,従来の手法に比べて同等の精度を維持しつつ,LCMの応答効率を40倍に向上することが示された。
さらに、あるシナリオでは、QCFuseはより高い応答精度をもたらす注意演示効果を達成し、LLM推論の最適化においてかなりの可能性を示す。
関連論文リスト
- SimpleMem: Efficient Lifelong Memory for LLM Agents [73.74399447715052]
セマンティックロスレス圧縮に基づく効率的なメモリフレームワークSimpleMemを紹介する。
本稿では,情報密度とトークン利用量の最大化を目的とした3段階パイプラインを提案する。
ベンチマークデータセットを用いた実験により,提案手法は精度,検索効率,推論コストにおいて,ベースラインアプローチを一貫して上回っていることがわかった。
論文 参考訳(メタデータ) (2026-01-05T21:02:49Z) - Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation [54.61034867177997]
キャッシング推論応答は、大きな言語モデルに他の前方を通さずに、それらを検索することができる。
従来の正確なキャッシュは、クエリ間のセマンティックな類似性を見落とし、不要な再計算をもたらす。
本稿では,未知のクエリおよびコスト分布下でのセマンティックキャッシュ消去のための,原則的,学習ベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-11T06:53:27Z) - TweakLLM: A Routing Architecture for Dynamic Tailoring of Cached Responses [2.1604594801267667]
大きな言語モデル(LLM)は、数百万のクエリを毎日処理します。
本稿では,LLMを用いた新しいルーティングアーキテクチャであるTweakLLMを紹介し,キャッシュされた応答を受信プロンプトに動的に適応させる。
論文 参考訳(メタデータ) (2025-07-31T15:50:57Z) - Distilling a Small Utility-Based Passage Selector to Enhance Retrieval-Augmented Generation [110.610512800947]
Retrieval-augmented Generation (RAG)は、取得した情報を組み込むことで、大規模言語モデル(LLM)を強化する。
RAGでは、重要度は実用性に移行し、正確な回答を生成するためのパスの有用性を考慮している。
提案手法は、ランク付けよりもユーティリティベースの選択に重点を置いており、固定しきい値を必要とせずに、特定のクエリに合わせた動的通過選択を可能にする。
本実験は, 実用性に基づく選択により, RAGの柔軟性とコスト効率が向上し, 計算コストが大幅に低減され, 応答品質が向上することを示した。
論文 参考訳(メタデータ) (2025-07-25T09:32:29Z) - Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning [37.16998362490576]
Representation Fine-tuning (ReFT) は、表現空間のみを編集することでパラメータ効率を大幅に向上させることで、広く注目を集めている。
本稿では,情報フロー解析によりこれらの重要な表現を識別し,最適化する新しい手法であるCritical Representation Fine-Tuning(CRFT)を提案する。
LLaMAとMistralモデルファミリを用いて,算術的および常識的推論のための8つのベンチマークで検証を行った。
論文 参考訳(メタデータ) (2025-07-14T09:11:33Z) - AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference [11.73134417321505]
本稿では,LVLM推論の高速化を目的とした新しいKVキャッシュ圧縮手法であるAirCacheを提案する。
本手法は,視覚的KVキャッシュの10%を保ちながら,フルキャッシュに匹敵する性能を実現する。
論文 参考訳(メタデータ) (2025-03-31T11:13:18Z) - PowerAttention: Exponentially Scaling of Receptive Fields for Effective Sparse Attention [73.26995918610669]
大きな言語モデル(LLM)は、長いコンテキストを処理する場合の注意機構の二次的な複雑さによって、効率のボトルネックに直面します。
本稿では,効果的かつ完全なコンテキスト拡張を容易にする新しいスパークアテンション設計であるPowerAttentionを紹介する。
実験によると、PowerAttentionは既存の静的スパースアテンションメソッドを5sim 40%$で上回っている。
論文 参考訳(メタデータ) (2025-03-05T15:24:11Z) - HAFLQ: Heterogeneous Adaptive Federated LoRA Fine-tuned LLM with Quantization [55.972018549438964]
LLM(Federated Fine-tuning of Pre-trained Large Language Models)は、さまざまなデータセットにまたがるタスク固有の適応を可能にすると同時に、プライバシの保護を可能にする。
本研究では, HAFLQ (Heterogeneous Adaptive Federated Low-Rank Adaptation Fine-tuned LLM with Quantization) を提案する。
テキスト分類タスクの実験結果から,HAFLQはメモリ使用量を31%削減し,通信コストを49%削減し,精度を50%向上し,ベースライン法よりも高速な収束を実現している。
論文 参考訳(メタデータ) (2024-11-10T19:59:54Z) - TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection [23.12497380673902]
Dynamic Token-Level KV Cache Selection (TokenSelect) は、高速で正確な長文推論のためのトレーニング不要な手法である。
TokenSelectの総合的な評価では、注意計算のスピードアップが最大23.84ドル、エンドツーエンドのレイテンシのアクセラレーションが最大2.28ドルである。
論文 参考訳(メタデータ) (2024-11-05T07:56:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。