論文の概要: QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for World Models and Video Generation
- arxiv url: http://arxiv.org/abs/2609.26425v2
- Date: Wed, 23 Sep 2026 15:06:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.677973
- Title: QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for World Models and Video Generation
- Title(参考訳): QuantWM:世界モデルとビデオ生成のための時間一貫性2ビットKVキャッシュ量子化
- Abstract要約: KVキャッシュメモリは、ビデオ生成とワールドモデルにとって、大きなデプロイメントボトルネックとなっている。
既存の2ビットKVキャッシュ量子化法は、重度の時間的フリッカリングと視覚的劣化を引き起こす。
トレーニング不要かつ厳密な2ビットKVキャッシュ量子化フレームワークであるQuantWMを提案する。
- 参考スコア(独自算出の注目度): 58.40720767342501
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: KV cache memory has become a major deployment bottleneck for video generation and world models, which motivates low-bit quantization study for efficiency. Existing 2-bit KV cache quantization methods can achieve nearly lossless performance on video benchmarks such as VBench, however, we find that they still cause severe temporal flickering and visual degradation. Meanwhile, deeper investigates show that Key quantization produces smaller reconstruction errors than Value, but surprisingly leads to much larger output degradation. We trace this discrepancy to attention: small Key perturbations can change the attention logits, i.e., QK^\top, and shift the temporal-spatial tokens selected by Queries. These observations motivate us to explicitly preserve attention logits and temporal-spatial token selection during KV cache quantization to alleviate the visual degradation problem. To address this issue, we present QuantWM, a training-free and strictly causal 2-bit KV cache quantization framework. QuantWM introduces two complementary techniques to mitigate the attention shifts. Firstly, quantization-sensitivity-aware clustering (QSAC) jointly considers historical Query sensitivity and residual ranges to select INT2-friendly Key centroids, which reduces quantization errors in channels that are more critical to attention. In addition, principal-subspace attention compensation (PSAC) restores the remaining Key errors along the dominant Query subspace using low-rank projections, which provides a direct and efficient correction to stabilize attention logits. Extensive experiments on Causal-Forcing, LingBot-World-v2, HY-World 1.5, Matrix-Game-2 and Longcat-Video demonstrate that QuantWM significantly improves visual quality and temporal consistency, while outperforming existing methods across image and video quality metrics with up to 6.20x KV cache memory compression and limited additional overhead.
- Abstract(参考訳): KVキャッシュメモリは、低ビット量子化研究を効率よく進めるビデオ生成と世界モデルにとって、大きなデプロイメントボトルネックとなっている。
既存の2ビットKVキャッシュ量子化手法では、VBenchのようなビデオベンチマークでは、ほとんどロスレスな性能を達成できるが、時間的フレッカリングや視覚的劣化は依然として起こらない。
一方、より深い調査では、キー量子化はバリューよりも小さな再構成エラーを生成するが、驚くほど大きな出力劣化を引き起こす。
小さなキー摂動は、注意ログ、すなわちQK^\topを変更し、キューによって選択された時間空間トークンをシフトすることができる。
これらの観察は,KVキャッシュ量子化時の注意ログと時間空間トークンの選択を明確に保存し,視覚的劣化問題を緩和する動機となっている。
この問題に対処するため,トレーニング不要かつ厳格な2ビットKVキャッシュ量子化フレームワークQuantWMを提案する。
QuantWMは2つの補完技術を導入し、注目のシフトを緩和する。
第一に、QSAC(quantization-sensitive-aware clustering)は、IN2フレンドリーなキーセントロイドを選択するために、履歴クエリの感度と残留範囲を共同で検討する。
さらに、主部分空間のアテンション補償(PSAC)は、下位のプロジェクションを使用して支配的なクエリサブ空間に沿った残りのキーエラーを復元し、アテンションロジットを安定化するための直接的かつ効率的な修正を提供する。
Causal-Forcing、LingBot-World-v2、HY-World 1.5、Matrix-Game-2、Longcat-Videoに関する大規模な実験では、QuantWMは視覚的品質と時間的一貫性を著しく向上する一方で、画像およびビデオ品質のメトリクスを最大6.20KVのキャッシュメモリ圧縮と追加オーバーヘッドの制限により、既存の手法よりも優れていたことが示されている。
関連論文リスト
- Output-Aware Rotation for INT2 KV-Cache Quantization [21.398916187295992]
我々は,W_O$後の注目出力誤差を最小限に抑える出力対応回転法であるtextitOptRを提案する。
OptRはQuaRotとOSCARの両方を一貫して改善し、長文検索を強化し、ページ化されたKV-cacheフォーマットを無視可能な推論オーバーヘッドで保存する。
論文 参考訳(メタデータ) (2026-08-03T09:24:23Z) - Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion [1.1852406625172218]
KVキャッシュを低ビット幅に定量化する手法は、メモリ圧力を低減させるが、画質を低下させる。
この劣化の鍵となる要因は、注意重みの体系的なバイアスであることを示す。
我々は、この予測バイアスを除去するアテンションごとのスコア補正を導出する。
論文 参考訳(メタデータ) (2026-05-25T18:51:59Z) - XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression [54.28208936996186]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにまたがる顕著な機能を示している。
量子化は、歴史的情報を保持しながらメモリ消費を減らすための有望な解決策として現れてきた。
超低等価ビット幅KVキャッシュ量子化を実現するトレーニングフリーでプラグアンドプレイのフレームワークであるXQuantを提案する。
論文 参考訳(メタデータ) (2025-10-13T10:17:21Z) - KVLinC : KV Cache Quantization with Hadamard Rotation and Linear Correction [8.486713415198968]
我々は,KVキャッシュ量子化による注意欠陥を軽減するフレームワークKVLinCを提案する。
KVLinCは、値の量子化誤差を低減するアダマール回転と、軽量な線形補正アダプタを組み合わせたものである。
KVLinC は高い KV-cache 圧縮を達成しつつ, 高いベースラインを一貫して一致または超えることを示す。
論文 参考訳(メタデータ) (2025-10-06T21:08:11Z) - KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding [72.12756830560217]
Transformer Decodersをベースとした大規模言語モデル(LLM)が、会話生成AIの選択肢として好まれている。
デコーダアーキテクチャの全体的な優位性にもかかわらず、推論中にキーバリューキャッシュが徐々に増加し、主要な効率ボトルネックとなっている。
キーバリューベクトル次元を潜在空間にダウンサンプリングすることで、KVキャッシュのフットプリントを大幅に削減し、推論速度を向上させることができる。
論文 参考訳(メタデータ) (2025-07-15T12:52:12Z) - AttentionPredictor: Temporal Patterns Matter for KV Cache Compression [64.75459635661562]
我々は,KVキャッシュ圧縮とクリティカルトークン識別のための注意パターンを直接予測する,学習に基づく最初の手法であるAttentionPredictorを提案する。
AttentionPredictorは、注意スコアを正確に予測し、無視可能なメモリを消費する統一予測モデルを共有する。
注意情報の大半を保持することで、AttentionPredictorは、キャッシュオフロードシナリオで13$times$KVキャッシュ圧縮と5.6$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2025-02-06T13:41:46Z) - ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification [29.163757099307553]
大規模視覚言語モデル(LVLM)の効率は、プリフィルフェーズにおける注意機構の計算ボトルネックによって制約される。
本稿では,重要なトークンの動的比割り当て戦略を通じて,LVLM向けに設計された効率的な推論フレームワークZipVLを提案する。
論文 参考訳(メタデータ) (2024-10-11T07:24:21Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。