論文の概要: Affix Cache for Diffusion Large Language Models
- arxiv url: http://arxiv.org/abs/2608.26140v1
- Date: Fri, 26 Jun 2026 07:29:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.360704
- Title: Affix Cache for Diffusion Large Language Models
- Title(参考訳): 拡散大言語モデルのためのアフィクスキャッシュ
- Abstract要約: ACacheは、プレフィックスを超えたDLLMの共有テキストスパンのための、アフィクス指向のキャッシュ再利用メカニズムである。
ACacheは再計算のレイテンシを最大55.7%削減し、エンドツーエンドのスループットを最大1.68$times$に改善する。
- 参考スコア(独自算出の注目度): 13.249427925543321
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion Large Language Models (DLLMs) enable non-autoregressive decoding and bidirectional context modeling, but efficient inference remains challenging. Unlike autoregressive systems, whose key-value (KV) cache can be reused for shared prefixes, DLLMs couple the KV states of shared context tokens with evolving generated tokens through bidirectional attention, making naive cache reuse stale while full recomputation is expensive. We present ACache, an affix-oriented cache reuse mechanism for shared text spans in DLLMs beyond prefixes. ACache identifies a small request-specific subset of critical affix tokens, called Anchor Tokens, by measuring their influence on masked generation tokens, and selectively recomputes the KV states of only these tokens while reusing the remaining affix cache. Built on Fast-dLLM, ACache recovers the accuracy loss caused by direct affix-cache reuse across different settings when recomputing around 20% of affix tokens. We also build a shared-prefix prototype on top of the Nano-vLLM engine, showing that ACache reduces recompute latency by up to 55.7% and improves end-to-end throughput by up to 1.68$\times$.
- Abstract(参考訳): 拡散大言語モデル(DLLM)は、非自己回帰的デコーディングと双方向コンテキストモデリングを可能にするが、効率的な推論は依然として困難である。
共有プレフィックスに対してキー値(KV)キャッシュを再利用できる自己回帰システムとは異なり、DLLMは、共有コンテキストトークンのKV状態を双方向の注意を通して進化したトークンと結合し、完全な再計算が高価である間に、単純キャッシュの再利用が停滞する。
ACacheは接頭辞以外のDLLMにおける共有テキストスパンのためのアフィクス指向のキャッシュ再利用機構である。
ACacheは、Anchor Tokensと呼ばれる重要なアフィクストークンのリクエスト固有のサブセットを特定し、マスクされた生成トークンへの影響を測定し、残りのアフィクスキャッシュを再利用しながら、これらのトークンのみのKV状態を選択的に再計算する。
Fast-dLLM上に構築されたACacheは、アフィクストークンの約20%を再計算する際に、異なる設定間で直接アフィクスキャッシュの再利用によって生じる精度の損失を回復する。
また、Nano-vLLMエンジン上に共有プリフィックスのプロトタイプを構築し、ACacheが再計算のレイテンシを最大55.7%削減し、エンドツーエンドのスループットを最大1.68$\times$に改善することを示した。
関連論文リスト
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Enabling KV Caching of Shared Prefix for Diffusion Language Models [0.2740273306918099]
共有プレフィックスに対するキーバリュー(KV)キャッシュは、高スループットの大規模言語モデル(LLM)サービスに不可欠である。
拡散言語モデル(DLM)における共有プレフィックスのための最初のKVキャッシュ手法であるbicacheを提案する。
従来の精度崩壊のない手法と比較して,bicacheはサービススループットを36.3%~98.3%向上させることがわかった。
論文 参考訳(メタデータ) (2026-05-26T05:27:57Z) - PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache [61.57938553036056]
トレーニング不要なKVキャッシュ管理手法であるPackCacheを導入し,KVキャッシュを3つの協調機構でコンパクト化する。
効率の面では、PackCacheは48フレームの長いシーケンスで1.7-2.2倍のエンドツーエンド生成を高速化する。
論文 参考訳(メタデータ) (2026-01-07T19:51:06Z) - d$^2$Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive Caching [7.004421957218099]
拡散に基づく大規模言語モデル(dLLM)は推論効率が劣る。
我々は、dLLM推論を高速化するためのトレーニング不要な近似KVキャッシュフレームワークであるd$2$Cacheを紹介した。
論文 参考訳(メタデータ) (2025-09-27T04:07:23Z) - dKV-Cache: The Cache for Diffusion Language Models [53.85291644298835]
Diffusion Language Models (DLMs) は自己回帰型言語モデルにとって有望な競合と見なされている。
本稿では,DLMの復調過程に対するKVキャッシュ機構,遅延KVキャッシュを提案する。
我々のアプローチは、異なるトークンが拡散過程を通して異なる表現力学を持つという観察によって動機付けられている。
論文 参考訳(メタデータ) (2025-05-21T17:32:10Z) - EPIC: Efficient Position-Independent Caching for Serving Large Language Models [19.510078997414606]
キャッシングは、リクエスト間でキーバリューベクトルを再利用することで、パフォーマンスを向上させる。
既存のコンテキストキャッシュでは、リクエストにまたがる正確なプレフィックスが必要である。
位置独立キャッシング (PIC) を導入し, プレフィックスによらず KV ベクトルのモジュラー再利用を可能にする。
また、新しいLegoLinkアルゴリズムを取り入れたサービスシステムEPICも導入しています。
論文 参考訳(メタデータ) (2024-10-20T08:42:29Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference [78.65321721142624]
我々はキー値(KV)キャッシュによって課されるメモリボトルネックに焦点を当てる。
既存のKVキャッシュ手法は、比較的重要でないKVペアの大きなスワストを刈り取ったり、取り除いたりすることでこの問題に対処する。
本稿では,固定サイズキャッシュと退避型キャッシュを簡易に統合したLESSを提案する。
論文 参考訳(メタデータ) (2024-02-14T18:54:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。