論文の概要: HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation
- arxiv url: http://arxiv.org/abs/2607.20125v1
- Date: Wed, 22 Jul 2026 13:29:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.091106
- Title: HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation
- Title(参考訳): HeadCast:効率的な自動回帰ビデオ生成のためのキャスティングアテンションヘッド
- Authors: Jinliang Shen, Lianghao Su, Zheming Li, Kang He, ZiLiang Lai, Yanbing Jiang, Chengru Song,
- Abstract要約: HeadCastは、訓練済みのARモデルのアテンションヘッドが安定して不均一な振る舞いを示すという観察に基づいて構築された、トレーニング不要でプラグアンドプレイのアクセラレーションフレームワークである。
HeadCastは720Pで1.62倍、1080Pで1.95倍まで推論を加速し、VBenchの品質は十分に注目されフリックフリーである。
- 参考スコア(独自算出の注目度): 7.896241308705432
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autoregressive (AR) video diffusion models have become a promising paradigm for long and streaming video synthesis, but the continuously growing Key-Value (KV) cache makes attention the dominant inference cost, especially at high resolution where each frame contributes many tokens. Existing remedies either evict the cache with coarse heuristics that cause inter-frame flickering, or require model re-training. We propose HeadCast, a training-free, plug-and-play acceleration framework built on the observation that a pre-trained AR model's attention heads exhibit stable, heterogeneous behaviors. After a short warm-up, HeadCast performs a one-time classification at the maximum-noise step that sorts every head into one of four archetypes: Sink, Dummy, Spatial, and Global, and restructures the monolithic KV cache into head-specific pathways. Crucially, it retains the Global heads that preserve the long-range temporal consistency aggressive eviction destroys. Because the Spatial pathway operates on a fixed-size grid, its savings grow with resolution: across state-of-the-art AR models, HeadCast accelerates inference by up to 1.62x at 720P and 1.95x at 1080P, while keeping VBench quality on par with full attention and largely flicker-free. Code is available at https://github.com/sjlgaga/HeadCast .
- Abstract(参考訳): 自己回帰(AR)ビデオ拡散モデルは、長大かつストリーミングなビデオ合成において有望なパラダイムとなっているが、連続的に増大するキーバリュー(KV)キャッシュは、特に各フレームが多くのトークンを寄与する高解像度において、主要な推論コストに注意を向けている。
既存の修正は、フレーム間のフレッカリングを引き起こす粗いヒューリスティックをキャッシュから排除するか、あるいはモデルの再トレーニングを必要とする。
本稿では,事前学習したARモデルのアテンションヘッドが安定かつ不均一な動作を示すという観察に基づいて構築された,訓練不要でプラグアンドプレイのアクセラレーションフレームワークであるHeadCastを提案する。
短いウォームアップの後、HeadCastは最大ノイズのステップで1回の分類を行い、すべてのヘッドを4つのアーチタイプ(シンク、ダミー、空間、グローバル)に分類し、モノリシックなKVキャッシュをヘッド固有の経路に再構成する。
極端に重要なことは、長距離の時間的一貫した積極的排除の破壊を維持するグローバルヘッドを保持することである。
HeadCastは720Pで1.62倍、1080Pで1.95倍まで推論を加速し、VBenchの品質は十分に注目されフリックフリーである。
コードはhttps://github.com/sjlgaga/HeadCastで入手できる。
関連論文リスト
- HASTE: Training-Free Video Diffusion Acceleration via Head-Wise Adaptive Sparse Attention [68.95533683996236]
トレーニング不要のスパースアテンションは、トレーニングなしで事前トレーニングされたモデルを加速するため、魅力的である。
既存のオンラインのトップ$p$のスパース・アテンションは、マスクの予測に何の費用もかからない。
これら2つの見過ごされた要因は、ビデオDiTにおけるトレーニング不要のスパースアテンションの実践的スピード品質トレードオフを制限していることを示す。
論文 参考訳(メタデータ) (2026-05-14T07:57:55Z) - Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity [21.347969441374506]
自己回帰ビデオ拡散モデルはリアルタイム合成をサポートするが、長い地平線上でのエラー蓄積とコンテキスト損失に悩まされる。
我々は、各ヘッドタイプにKVキャッシュ戦略を割り当てる訓練不要のフレームワークであるHead Forcingを提案する。
追加のトレーニングなしでは、Head Forcingは生成を5秒から分単位で延長し、マルチプロンプトのインタラクティブな合成をサポートし、既存のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-14T07:27:39Z) - Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation [14.413680197991356]
Pyramid ForcingはヘッドアウェアなKVCacheフレームワークで、ヘッドタイプをオフラインで識別し、振る舞い固有のキャッシュポリシーを割り当てる。
実験により、ピラミド強制はVBench-Longの長軸生成品質を一貫して改善することが示された。
論文 参考訳(メタデータ) (2026-05-13T07:23:02Z) - Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models [32.39747481484621]
自動回帰ビデオ拡散にKVキャッシュ圧縮を導入する。
本稿では,静的ヘッドに対する構造化静的プルーニングと動的ヘッドに対するセグメントワイド類似性に基づく動的プルーニングを行うハイブリッドKVキャッシュ圧縮戦略であるForcing-KVを提案する。
提案手法は,1つのNVIDIA H200 GPU上で毎秒29フレーム以上の生成速度と30%のキャッシュメモリ削減を実現し,LongLiveとSelf Forcingで最大1.35倍,1.50倍のスピードアップを実現し,さらに1080Pで2.82倍のスピードアップを実現した。
論文 参考訳(メタデータ) (2026-05-10T17:59:21Z) - Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention [37.91838955436801]
自動回帰ビデオ拡散モデルは、ストリーミング生成、ロングフォーム合成への扉を開くこと、ビデオワールドモデル、インタラクティブなニューラルゲームエンジンを可能にする。
生成が進むにつれて、KVキャッシュが増加し、レイテンシの増加とGPUメモリのエスカレーションが生じる。
我々は、自己回帰拡散のための統合されたトレーニングなしアテンションフレームワークを提案する: TempCacheは、時間的対応によるKVキャッシュをバウンドキャッシュ成長に圧縮し、AnnCAは、高速近傍マッチングを用いてフレーム関連プロンプトを選択することで、クロスアテンションを加速し、AnnSAは各クエリを制限して自己アテンションを拡大する。
論文 参考訳(メタデータ) (2026-02-02T08:31:21Z) - Efficient Autoregressive Video Diffusion with Dummy Head [35.72735205078644]
本研究では,異なるヘッド間のコンテキストアクセシビリティを制御するDummy Forcingを提案する。
具体的には、提案したヘテロジニアスメモリ割り当てにより、動的ヘッドプログラミングを伴う頭部コンテキスト冗長性が低減される。
追加のトレーニングなしでは、Dummy Forcingはベースライン上で最大2.0倍のスピードアップを実現し、ビデオ生成を0.5%以下の品質低下で24.3 FPSでサポートしています。
論文 参考訳(メタデータ) (2026-01-28T11:20:43Z) - Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers [95.68243351895107]
我々はtextbfVideo textbfFrame textbfInterpolation (LDF-VFI) のための textbfLocal textbfDiffusion textbfForcing for textbfVideo textbfFrame textbfInterpolation (LDF-VFI) という包括的でビデオ中心のパラダイムを提案する。
我々のフレームワークは、ビデオシーケンス全体をモデル化し、長距離時間的コヒーレンスを確保する自動回帰拡散変換器上に構築されている。
LDF-VFIは、挑戦的なロングシーケンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-21T12:58:52Z) - PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache [61.57938553036056]
トレーニング不要なKVキャッシュ管理手法であるPackCacheを導入し,KVキャッシュを3つの協調機構でコンパクト化する。
効率の面では、PackCacheは48フレームの長いシーケンスで1.7-2.2倍のエンドツーエンド生成を高速化する。
論文 参考訳(メタデータ) (2026-01-07T19:51:06Z) - Next Tokens Denoising for Speech Synthesis [51.320443764269726]
Dragon-FMは、ARとフローマッチングを統合する新しいテキスト音声(TTS)設計である。
毎秒12.5トークンのコンパクトレートで48kHzのオーディオトークンをチャンクで処理する。
ポッドキャストデータセットの実験では、高品質なゼロショットポッドキャストを効率的に生成できることが示されている。
論文 参考訳(メタデータ) (2025-07-30T15:03:36Z) - Training-Free Efficient Video Generation via Dynamic Token Carving [54.52061549312799]
Jengaは、ダイナミックアテンション彫刻とプログレッシブレゾリューション生成を組み合わせた推論パイプラインである。
プラグアンドプレイのソリューションとして、Jengaは現代のハードウェアで実用的な高品質のビデオ生成を可能にする。
論文 参考訳(メタデータ) (2025-05-22T16:21:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。