論文の概要: WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering
- arxiv url: http://arxiv.org/abs/2606.00724v1
- Date: Sat, 30 May 2026 13:32:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.676005
- Title: WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering
- Title(参考訳): WaveFilter: Wavelet-Guided KVキャッシュフィルタによる拡散LDMの長期能力向上
- Authors: Jinnan Yang, Yan Wang, Zhen Bi, Kehao Wu, Xiaojie Li, Jungang Lou, Zechao Li, Jing Liu,
- Abstract要約: textbfWaveFilterは、普遍的でトレーニング不要なキャッシュフレームワークである。
人間の読解プロセスにインスパイアされたTextbfWaveFilterは、普遍的でトレーニング不要なキャッシュフレームワークである。
- 参考スコア(独自算出の注目度): 35.108892041355176
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion Large Language Models (DLMs) have demonstrated significant advantages across various tasks. However, constrained by their multi-step iterative inference mechanism, their computational overhead and inference latency in long-context tasks have become core bottlenecks restricting their large-scale deployment. When processing long sequences, existing Key-Value (KV) caching mechanisms often face a dilemma where generation quality degrades drastically, where the core challenge lies in precisely and efficiently filtering critical tokens within ultra-long contexts. Inspired by the human reading process, we propose \textbf{WaveFilter}, a universal and training-free caching framework. This framework innovatively introduces the wavelet transform for decomposition of long sequences to achieve precise identification of key tokens, based on which a sparse KV Cache is constructed to compute the final contextual representation. Experimental results demonstrate that WaveFilter, as a plug-and-play generic framework, significantly enhances the performance of existing mainstream KV Cache methods in complex long-context tasks.
- Abstract(参考訳): 拡散大言語モデル (DLM) は様々なタスクにおいて大きな優位性を示している。
しかし、その多段階反復推論機構に制約され、長いコンテキストタスクにおける計算オーバーヘッドと推論遅延は、大規模なデプロイメントを制限する中核的なボトルネックとなっている。
長いシーケンスを処理する場合、既存のキーバリュー(KV)キャッシングメカニズムは、生成品質が大幅に低下するジレンマに直面することが多い。
人間の読解プロセスに触発されて、普遍的でトレーニング不要なキャッシュフレームワークである \textbf{WaveFilter} を提案する。
このフレームワークは、キートークンの正確な識別を実現するために、長いシーケンスを分解するためのウェーブレット変換を革新的に導入する。
実験により、プラグイン・アンド・プレイの汎用フレームワークであるWaveFilterは、複雑な長時間コンテキストタスクにおいて、既存の主流KVキャッシュメソッドの性能を大幅に向上させることが示された。
関連論文リスト
- DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing [30.82607063015274]
DASH-KVは,非対称な深層ハッシュによる近接探索として注目を再構築する,革新的なアクセラレーションフレームワークである。
LongBenchの実験では、DASH-KVは、O(N2) から線形 O(N) への推論複雑性を低減しつつ、全注目性能を一致させながら、最先端のベースライン法を著しく上回ることを示した。
論文 参考訳(メタデータ) (2026-04-21T11:33:24Z) - Training-free Context-adaptive Attention for Efficient Long Context Modeling [57.703159205740185]
トレーニングフリーコンテキスト適応注意(TCA-Attention)は、学習不要なスパースアテンション機構であり、効率的な長文推論のための情報トークンのみに選択的に参画する。
TCA-Attentionは2.8$times$のスピードアップを実現し、128Kのコンテキスト長でKVキャッシュを61%削減し、フルアテンションに匹敵するパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-12-10T01:54:57Z) - UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression [86.33995240043936]
UniGistは、大規模言語モデルのためのシーケンスレベルのロングコンテキスト圧縮フレームワークである。
生のトークンを特別な圧縮トークン(gist)に微粒な方法で置き換えることで、コンテキスト情報を効率的に保存する。
提案手法は,圧縮トークンの実際の除去を可能にすることで,フレキシブルな推論もサポートしている。
論文 参考訳(メタデータ) (2025-09-19T08:47:37Z) - KVCompose: Efficient Structured KV Cache Compression with Composite Tokens [7.922206020386125]
大規模言語モデル(LLM)は、効率的な自己回帰復号化のためにキー値(KV)キャッシュに依存している。
我々は,注意誘導型,層適応型複合トークンに基づく,シンプルで効果的なKVキャッシュ圧縮フレームワークを提案する。
本手法は精度を保ちながらメモリの大幅な削減を実現し,従来手法と半構造化手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-09-05T14:58:24Z) - Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache [67.47789629197857]
本稿では,トランスヘッド次元の不均一な役割を生かした学習自由フレームワークを提案する。
フーリエアテンションは、長コンテキスト非感性次元をフーリエ基底に投影することにより、その時間的進化を固定長のスペクトル係数で近似する。
本稿では,FourierAttention が LongBench と Needle-In-A-Haystack 上で最高の長文精度を実現することを示す。
論文 参考訳(メタデータ) (2025-06-13T15:35:54Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z) - FreqKV: Frequency Domain Key-Value Compression for Efficient Context Window Extension [20.360392907997117]
本稿では、新しい周波数領域鍵値(KV)圧縮技術であるFreqKVを提案する。
Freq KVはデコーダのみの大規模言語モデル(LLM)のための効率的なコンテキストウィンドウ拡張を可能にする
長い文脈言語モデリングおよび理解タスクの実験は,提案手法の有効性と有効性を示す。
論文 参考訳(メタデータ) (2025-05-01T14:53:12Z) - RefreshKV: Updating Small KV Cache During Long-form Generation [54.00118604124301]
生成中の入力トークンのサブセットに対して、完全なコンテキストアテンションとアテンションを柔軟に交互に交互に切り替える新しい推論手法RefreshKVを提案する。
本手法をオフザシェルフ LLM に適用することにより,様々な長文生成タスクの性能を向上しつつ,エビクションベースの手法に匹敵する高速化を実現する。
論文 参考訳(メタデータ) (2024-11-08T18:57:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。