論文の概要: ACID: Adaptive Caching for vIDeo generation
- arxiv url: http://arxiv.org/abs/2607.12358v2
- Date: Thu, 16 Jul 2026 04:34:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.215352
- Title: ACID: Adaptive Caching for vIDeo generation
- Title(参考訳): ACID: vIDeo 生成のための適応キャッシング
- Abstract要約: ビデオ拡散モデルは、高品質な世代を生成するが、シーケンシャルなデノナイジング手順のために推論が遅いままである。
キャッシングベースの加速度法は、中間モデル出力を再利用することでこの問題に対処する。
ACIDラッパーは、各メソッドの既存のドリフト信号の変化率を監視し、ローとハイしきい値の間で動的に切り替える。
- 参考スコア(独自算出の注目度): 14.081444112966103
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video diffusion models produce high-quality generations but remain slow at inference due to their sequential denoising procedure. Caching-based acceleration methods address this by reusing intermediate model outputs: leading dynamic approaches such as TeaCache, EasyCache, and DiCache accumulate a drift signal and skip expensive model evaluations when accumulated drift stays below a fixed threshold $τ$. This threshold controls an apparent tradeoff - raising it yields faster generation at the cost of visual quality, while lowering it preserves quality but sacrifices speed. We show this tradeoff is not fundamental; it is an artifact of holding $τ$ constant throughout denoising. We identify the existence of critical steps - timesteps where the drift signal changes rapidly - and show that applying a low threshold selectively at these steps while caching aggressively elsewhere recovers most of the quality of conservative caching at substantially higher inference speeds. Building on this insight, we propose ACID, a lightweight, training-free wrapper that monitors the rate of change of each method's existing drift signal to dynamically switch between a low and a high threshold. ACID is signal-agnostic and modular: it requires no retraining and plugs directly into existing dynamic caching methods without modifying their core mechanisms. Evaluated across three caching methods (TeaCache, EasyCache, DiCache) and three open-source video diffusion models (HunyuanVideo, Wan 2.1, CogVideoX), ACID consistently expands the Pareto frontier of visual quality versus inference speed beyond what any fixed threshold achieves. In particular, on TeaCache and HunyuanVideo, ACID achieves up to 2.16x speedup over the no-caching baseline, and up to 38% additional speedup over the conservative fixed-threshold baseline with negligible (<0.3 dB PSNR, <0.01 SSIM, <0.01 LPIPS) quality degradation.
- Abstract(参考訳): ビデオ拡散モデルは、高品質な世代を生成するが、シーケンシャルなデノナイジング手順のために推論が遅いままである。
TeaCache、EasyCache、DiCacheといった動的なアプローチの先導者は、ドリフト信号を蓄積し、蓄積されたドリフトが固定しきい値以下にある場合、高価なモデル評価をスキップします。
このしきい値は明らかなトレードオフをコントロールします – 視覚的品質の犠牲で生成を高速化すると同時に,品質を維持しながら速度を犠牲にします。
私たちはこのトレードオフが基本的なものではないことを示しています。
ドリフト信号が急速に変化する時間ステップであるクリティカルステップの存在を特定し、これらのステップに低い閾値を選択的に適用し、他の場所で積極的にキャッシュすることで、かなり高い推論速度で保守的なキャッシュの品質を回復することを示す。
この知見に基づいて、我々は、各メソッドの既存のドリフト信号の変化率を監視し、低閾値と高閾値の間を動的に切り替える軽量でトレーニング不要なラッパーであるACIDを提案する。
ACIDは信号に依存しないモジュールであり、コアメカニズムを変更することなく、リトレーニングを必要とせず、既存の動的キャッシュメソッドに直接プラグインする。
3つのキャッシュ手法(TeaCache、EasyCache、DiCache)と3つのオープンソースビデオ拡散モデル(HunyuanVideo、Wan 2.1、CogVideoX)で評価され、ACIDは固定閾値以上の視覚的品質と推論速度のパレートフロンティアを一貫して拡張する。
特にTeaCacheとHunyuanVideoでは、ACIDはノキャッシュベースラインの最大2.16倍のスピードアップを達成するとともに、無視可能な(<0.3dB PSNR, <0.01 SSIM, <0.01 LPIPS)品質低下で保守的な固定閾値ベースラインを最大38%高速化する。
関連論文リスト
- EpaCache: Error-Propagation-Aware Caching for Accelerating Diffusion-Based Visual Generation [30.438361624564553]
キャッシングに基づく手法は、隣接する時間ステップで中間計算を再利用することで、推論遅延を低減する。
EpaCacheはトレーニング不要のキャッシュポリシーで、ダウンストリームの影響の少ないタイムステップで再利用予算を適応的に割り当てる。
EpaCacheは、既存のキャッシュメソッドに対するレイテンシーのトレードオフを一貫して改善する。
論文 参考訳(メタデータ) (2026-08-29T13:38:11Z) - Motion-Aware Caching for Efficient Autoregressive Video Generation [73.27762884730272]
MotionCacheは、ピクセルレベルのモーション特性の軽量プロキシとして、フレーム間の差異を利用する。
SkyReels-V2やMAGI-1のような最先端モデルの実験では、MotionCacheが大幅なスピードアップを実現している。
論文 参考訳(メタデータ) (2026-05-03T05:49:27Z) - WorldCache: Content-Aware Caching for Accelerated Video World Models [50.7543797435026]
我々はPerception-Constrained Dynamic CaCacheフレームワークであるtextbfWorldCacheを紹介する。
WorldCacheは、機能をいつ、どのように再利用するかを改善します。
PAI-Benchで評価されたCosmos-2.5-2Bでは、WorldCacheはtextbf$2.3times$推論スピードアップを実現し、textbf99.4%のベースライン品質を維持している。
論文 参考訳(メタデータ) (2026-03-23T17:59:54Z) - Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers [11.772150619675527]
ディフュージョントランスフォーマー(DiT)は高品質な画像生成とビデオ生成の主要なアーキテクチャとして登場してきた。
既存のキャッシュ手法は、タイムステップ間で中間計算を再利用することで、DiTを加速するが、それらは共通の制限を共有している。
本稿では、時間認識動的スケジューリング(TADS)、累積誤差予算(CEB)、周波数分解キャッシング(FDC)からなる統合キャッシュフレームワークであるSpectralCacheを提案する。
論文 参考訳(メタデータ) (2026-03-05T15:58:06Z) - SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching [75.02865981328509]
キャッシュは、以前計算されたモデル出力をタイムステップで再利用することで計算を減らす。
本稿では,動的キャッシュポリシーであるSensitivity-Aware Caching(SenCache)を提案する。
SenCacheは、同様の計算予算の下で、既存のキャッシュメソッドよりも視覚的品質が向上する。
論文 参考訳(メタデータ) (2026-02-27T17:36:09Z) - AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers [37.38708392928324]
Transformer Diffusion (TDis) は高忠実さと画像生成において最先端を実現するが、反復的デノイングにより高価な推論に苦しむ。
AdaCorrectionは適応的なオフセットキャッシュ補正フレームワークで、高ジェネレーションの忠実さを維持しつつ、拡散推論中にキャッシュ層間の効率的な再利用を可能にする。
提案手法は計算オーバーヘッドを最小限に抑えながら高い生成品質を実現し, ほぼオリジナルに近いFIDを維持しながら, 適度な加速を実現している。
論文 参考訳(メタデータ) (2026-02-13T08:11:54Z) - ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion [30.897215456167753]
拡散モデルは、本質的に反復的推論プロセスのため、かなりの計算オーバーヘッドに悩まされる。
我々は、両方のエラータイプを共同で修正する原則的なキャッシュフレームワークであるERTACacheを提案する。
ERTACacheは最大2倍の推論スピードアップを実現します。
論文 参考訳(メタデータ) (2025-08-27T10:37:24Z) - TaoCache: Structure-Maintained Video Generation Acceleration [4.594224594572109]
ビデオ拡散モデルのためのトレーニング不要のプラグイン・アンド・プレイキャッシュ戦略であるTaoCacheを提案する。
モデルのノイズ出力を予測するために固定点視点を採用しており、特に遅延雑音発生の段階で有効である。
論文 参考訳(メタデータ) (2025-08-12T14:40:36Z) - Less is Enough: Training-Free Video Diffusion Acceleration via Runtime-Adaptive Caching [57.7533917467934]
EasyCacheは、ビデオ拡散モデルのためのトレーニング不要のアクセラレーションフレームワークである。
我々は,OpenSora,Wan2.1,HunyuanVideoなどの大規模ビデオ生成モデルについて包括的な研究を行っている。
提案手法は,従来のベースラインと比較して推定時間を最大2.1-3.3$times$に短縮する。
論文 参考訳(メタデータ) (2025-07-03T17:59:54Z) - FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality [58.80996741843102]
FasterCacheは、高品質な生成を伴うビデオ拡散モデルの推論を高速化するために設計された、トレーニング不要の戦略である。
我々は、FasterCacheがビデオの質をベースラインと同等に保ちながら、ビデオ生成を著しく加速できることを示した。
論文 参考訳(メタデータ) (2024-10-25T07:24:38Z) - DeepCache: Accelerating Diffusion Models for Free [65.02607075556742]
DeepCacheは、モデルアーキテクチャの観点から拡散モデルを加速するトレーニング不要のパラダイムである。
DeepCacheは拡散モデルのシーケンシャルなデノナイジングステップで観測される時間的冗長性に乗じている。
同じスループットで、DeepCacheはDDIMやPLMSで、事実上同等または極端に改善された結果を達成する。
論文 参考訳(メタデータ) (2023-12-01T17:01:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。