論文の概要: Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2608.08086v2
- Date: Tue, 11 Aug 2026 12:16:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.544735
- Title: Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models
- Title(参考訳): Archer: 拡散言語モデルにおける効率的なロールバックのための隠れた状態の適応的再利用
- Authors: Xuning He, Zinan Sheng, Yongding Tao, Huanyu Liu, Ge Li, Xue Jiang, Yihong Dong,
- Abstract要約: 拡散言語モデル(DLM)は反復的にシーケンスを洗練し、コンテキストが進化するにつれて、以前の予測を修正できる。
更新毎にグローバルコンテキストが変更され、プロンプト状態とレスポンス状態の両方が再コンパイルされる。
効率的なロールバック(アーチャー)のための隠れた状態の適応的再利用について紹介する。
Archerは、ロールバック可能なDLMのためのトレーニング不要なKVキャッシュ手法である。
- 参考スコア(独自算出の注目度): 28.20034213862415
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion language models (DLMs) iteratively refine a sequence, allowing earlier predictions to be revised as context evolves. This rollback capability distinguishes them from irreversible autoregressive generation, but makes inference costly. Every denoising update alters the global context, forcing both prompt and response states to be recomputed even though only response tokens are revisable. Key-value (KV) caching could reduce this cost, yet conventional caching assumes immutable historical states and is therefore difficult to reconcile with rollback. In this paper, we introduce Adaptive Reuse of Cached Hidden States for Efficient Rollback (Archer), a training-free KV caching method for rollback-capable DLMs. Archer asymmetrically keeps the mutable response synchronized with the current hypothesis while reusing prompt K/V within a bounded state neighborhood. Although prompt representations also change under bidirectional attention, their token identities remain fixed; bounded reuse therefore amortizes repeated prompt computation without caching mutable response states. It also delays feedback from tentative tokens, reducing premature reinforcement of transient high-confidence errors and giving rollback more opportunity to correct them. Our analysis characterizes prompt reuse as a reversibility-aligned cache boundary, bounds its state-dependent approximation error, and gives a decoder-margin condition for preserving full-refresh decisions. Existing DLM acceleration often trades quality for speed. Archer shifts this frontier, attaining the best mean performance of 33.63% together with a 2.57x mean speedup on the main suite. Across evaluated settings, it improves Pass@1 by up to 3.05 points and reaches up to 2.95x speedup. Controlled analyses connect the quality gain to delayed prompt feedback and validate state-aware refresh. Our code is available at https://github.com/Hxnng/Archer.
- Abstract(参考訳): 拡散言語モデル(DLM)は反復的にシーケンスを洗練し、コンテキストが進化するにつれて、以前の予測を修正できる。
このロールバック機能は、可逆的な自己回帰生成と区別するが、推論にコストがかかる。
更新毎にグローバルコンテキストが変更され、応答トークンだけが修正可能であるにも関わらず、プロンプト状態とレスポンス状態の両方を再コンパイルせざるを得なくなる。
キーバリューキャッシュ(KV)はこのコストを削減できるが、従来のキャッシュは不変の履歴状態を前提としており、ロールバックとの整合が難しい。
本稿では,ロールバック可能なDLMのトレーニング不要なKVキャッシング手法である,効率的なロールバック(Archer)のためのキャッシュハイデン状態の適応再利用について紹介する。
アーチャーは、境界状態近傍でプロンプトK/Vを再利用しながら、現在の仮説と同期する可変応答を非対称に保持する。
プロンプト表現は双方向の注意の下でも変化するが、トークンのアイデンティティは固定されている。
また、一時的なトークンからのフィードバックを遅らせ、過度な高信頼度エラーの早期強化を減らし、ロールバックで修正する機会を与える。
本分析では, 即時再利用を可逆性に整合したキャッシュ境界として特徴付け, 状態依存近似誤差を境界とし, 完全更新決定を保存するためのデコーダ・マージン条件を与える。
既存のDLMアクセラレーションは、しばしば品質を高速に交換する。
アーチャーはこのフロンティアをシフトさせ、最高平均性能は33.63%、メインスイートの平均速度は2.57倍に達した。
評価された設定全体で、Pass@1を最大3.05ポイント改善し、最大2.95倍のスピードアップを達成した。
制御された分析は、品質向上を遅延した迅速なフィードバックに結び付け、状態認識のリフレッシュを検証する。
私たちのコードはhttps://github.com/Hxnng/Archer.comから入手可能です。
関連論文リスト
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Reflex: Real-Time VLA Control through Streaming Inference [12.85847066934547]
textbfReflexは,フローマッチングポリシに対して,テキストリアルタイムストリーミング推論を可能にするフレームワークである。
LIBEROとKinetixのベンチマークでは、Reflexは2.58$times$推論スピードアップと50Hzの安定したストリーミングを実現し、反応遅延を最大54%削減した。
論文 参考訳(メタデータ) (2026-07-16T07:56:43Z) - Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning [24.29101453473451]
ビデオ大言語モデル(ビデオモデル)は、強力なベンチマーク精度を達成するが、ダイナミックスを追跡するのではなく、シングルフレームキューや言語先行といったショートカットを通じてビデオ質問に答えることが多い。
この問題はRLポストトレーニングにおいてさらに悪化しており、ビデオダイナミクスを追跡せずに高い報酬を得るショートカットポリシーをさらに強化することができる。
視覚世界が変化したとしても、答えは変わっているか、同じままか、という問題に対処する。
論文 参考訳(メタデータ) (2026-05-21T04:38:02Z) - FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction [51.56484100374058]
ストリーミング3D再構築は、受信フレームからオンラインで更新される永続的な潜伏状態を維持する。
FILT3Rは、トークン空間における状態推定として、リカレントな状態更新をキャストする。
コードはhttps://github.com/jinotter3/FILT3Rでリリースされる。
論文 参考訳(メタデータ) (2026-03-19T04:56:36Z) - Stop the Flip-Flop: Context-Preserving Verification for Fast Revocable Diffusion Decoding [28.23607623451461]
COVERは、単一のフォワードパス内で、一括検証と安定したドラフトを実行する。
不確実性、下流の影響、キャッシュドリフトのバランスを保ち、ステップ毎に検証された種子の数に適応する。
ベンチマーク全体で、COVERは不要なリビジョンを減らし、出力品質を維持しながらより高速なデコードをもたらす。
論文 参考訳(メタデータ) (2026-02-05T19:58:48Z) - Stable Video Infinity: Infinite-Length Video Generation with Error Recycling [76.91310169118408]
本研究では、高時間一貫性、可視的シーン遷移、制御可能なストリーミングストーリーラインを有する無限長ビデオを生成することができる安定ビデオインフィニティ(SVI)を提案する。
SVIにはError-Recycling Fine-Tuningが組み込まれており、これはDiffusion Transformerの自己生成エラーをスーパーバイザのプロンプトにリサイクルする、新しいタイプの効率的なトレーニングである。
我々は、一貫性、創造性、条件設定を含む3つのベンチマークでSVIを評価し、その汎用性と最先端の役割を徹底的に検証した。
論文 参考訳(メタデータ) (2025-10-10T09:45:46Z) - ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion [30.897215456167753]
拡散モデルは、本質的に反復的推論プロセスのため、かなりの計算オーバーヘッドに悩まされる。
我々は、両方のエラータイプを共同で修正する原則的なキャッシュフレームワークであるERTACacheを提案する。
ERTACacheは最大2倍の推論スピードアップを実現します。
論文 参考訳(メタデータ) (2025-08-27T10:37:24Z) - dKV-Cache: The Cache for Diffusion Language Models [53.85291644298835]
Diffusion Language Models (DLMs) は自己回帰型言語モデルにとって有望な競合と見なされている。
本稿では,DLMの復調過程に対するKVキャッシュ機構,遅延KVキャッシュを提案する。
我々のアプローチは、異なるトークンが拡散過程を通して異なる表現力学を持つという観察によって動機付けられている。
論文 参考訳(メタデータ) (2025-05-21T17:32:10Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。