論文の概要: EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation
- arxiv url: http://arxiv.org/abs/2608.02474v2
- Date: Wed, 12 Aug 2026 03:12:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.223167
- Title: EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation
- Title(参考訳): EchoCache: 効率的なオーディオ駆動ビデオ生成のためのエネルギー駆動型クロスモーダルキャッシング
- Authors: Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen,
- Abstract要約: 本稿では,効率的な音声駆動ビデオ生成のためのエネルギー誘導型クロスモーダルキャッシュフレームワークであるEchoCacheを提案する。
実験によると、EchoCacheは、生成品質とオーディオ-視覚的整合性を維持しながら、レイテンシ品質のトレードオフを一貫して改善している。
- 参考スコア(独自算出の注目度): 20.708887969060513
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Audio-driven video generation (A2V) has achieved promising progress in synthesizing temporally coherent and audio-visually aligned videos, yet its inference remains expensive due to the iterative denoising process of diffusion models. Existing caching methods mainly exploit temporal redundancy in visual features while overlooking the cross-modal alignment of A2V, where audio drives visual generation with highly non-uniform temporal importance. In this paper, we identify two levels of misalignment in existing A2V caching methods: temporal-semantic and computation-storage misalignment. To address them, we propose EchoCache, an energy-guided cross-modal caching framework for efficient A2V generation. EchoCache leverages audio time-frequency energy as a saliency anchor to guide latent-level cache updates and further introduces a dynamic timestep-latent caching mechanism with quantized cache management for joint efficiency and memory optimization. Extensive experiments on mainstream A2V models show that EchoCache consistently improves the latency-quality trade-off while preserving generation quality and audio-visual consistency. In particular, on Wan2.2-S2V over the EMTD benchmark, EchoCache achieves a 2.46x speedup with the best overall performance. Code is available at https://github.com/IF-LAB-PKU/EchoCache.
- Abstract(参考訳): 音声駆動ビデオ生成(A2V)は、時間的コヒーレントで視覚的に整列したビデオの合成において有望な進歩を遂げてきたが、拡散モデルの反復的デノイングプロセスのため、推論は高価である。
既存のキャッシング手法は主に視覚的特徴の時間的冗長性を利用しており、オーディオが非均一な時間的重要度で視覚生成を駆動するA2Vのクロスモーダルアライメントを見下ろしている。
本稿では,既存のA2Vキャッシング手法において,時間的意味と計算的記憶的ミスアライメントの2つのレベルを同定する。
そこで我々は,効率的なA2V生成のためのエネルギー誘導型クロスモーダルキャッシュフレームワークであるEchoCacheを提案する。
EchoCacheは、レイテンシアンカーとしてオーディオの時間周波数エネルギーを活用して、潜在レベルのキャッシュ更新をガイドし、さらに、量子化されたキャッシュ管理を備えた動的時間ステップ遅延キャッシュ機構を導入し、ジョイント効率とメモリ最適化を実現している。
主流のA2Vモデルに対する大規模な実験によると、EchoCacheは、生成品質とオーディオ-視覚的整合性を維持しながら、レイテンシ品質のトレードオフを一貫して改善する。
特に、EMTDベンチマーク上のWan2.2-S2Vでは、EchoCacheは2.46倍のスピードアップを達成した。
コードはhttps://github.com/IF-LAB-PKU/EchoCacheで入手できる。
関連論文リスト
- OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models [8.344012950413108]
SD3、FLUX、最近のビデオ拡散変換器を含む高解像度画像およびビデオ拡散モデルは、生成品質を大幅に改善したが、推論時には高価である。
モデル重みの変更や再トレーニングではなく,中間拡散特性の冗長性を活用することで,この非効率性に対処する。
多次元機能再利用を実現する階層型キャッシュフレームワークであるOmniCacheを提案する。
論文 参考訳(メタデータ) (2026-07-26T21:14:48Z) - SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation [72.09280113664535]
Diffusion Transformer (DiT) は、オーディオ駆動のポートレートアニメーションを著しく進歩させたが、その高い計算コストは、かなりの推論遅延をもたらす。
そこで我々は,DiT ベースのポートレートアニメーションに適した,トレーニング不要なキャッシュアクセラレーション手法 SyncCache を提案する。
論文 参考訳(メタデータ) (2026-06-29T19:26:13Z) - Motion-Aware Caching for Efficient Autoregressive Video Generation [73.27762884730272]
MotionCacheは、ピクセルレベルのモーション特性の軽量プロキシとして、フレーム間の差異を利用する。
SkyReels-V2やMAGI-1のような最先端モデルの実験では、MotionCacheが大幅なスピードアップを実現している。
論文 参考訳(メタデータ) (2026-05-03T05:49:27Z) - WorldCache: Content-Aware Caching for Accelerated Video World Models [50.7543797435026]
我々はPerception-Constrained Dynamic CaCacheフレームワークであるtextbfWorldCacheを紹介する。
WorldCacheは、機能をいつ、どのように再利用するかを改善します。
PAI-Benchで評価されたCosmos-2.5-2Bでは、WorldCacheはtextbf$2.3times$推論スピードアップを実現し、textbf99.4%のベースライン品質を維持している。
論文 参考訳(メタデータ) (2026-03-23T17:59:54Z) - PreciseCache: Precise Feature Caching for Efficient and High-fidelity Video Generation [35.47114707080758]
高い計算コストと遅い推論は、ビデオ生成モデルの実践的応用を妨げる。
我々は,真に冗長な計算を正確に検出し,スキップするプラグイン・アンド・プレイ・フレームワークである textbfPreciseCache を提案する。
論文 参考訳(メタデータ) (2026-03-01T08:08:49Z) - SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching [75.02865981328509]
キャッシュは、以前計算されたモデル出力をタイムステップで再利用することで計算を減らす。
本稿では,動的キャッシュポリシーであるSensitivity-Aware Caching(SenCache)を提案する。
SenCacheは、同様の計算予算の下で、既存のキャッシュメソッドよりも視覚的品質が向上する。
論文 参考訳(メタデータ) (2026-02-27T17:36:09Z) - Flow caching for autoregressive video generation [72.10021661412364]
自動回帰ビデオ生成に特化して設計された,最初のキャッシュフレームワークであるFlowCacheを紹介する。
本手法は,MAGI-1では2.38倍,SkyReels-V2では6.7倍,品質劣化は無視できない。
論文 参考訳(メタデータ) (2026-02-11T13:11:04Z) - ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion [30.897215456167753]
拡散モデルは、本質的に反復的推論プロセスのため、かなりの計算オーバーヘッドに悩まされる。
我々は、両方のエラータイプを共同で修正する原則的なキャッシュフレームワークであるERTACacheを提案する。
ERTACacheは最大2倍の推論スピードアップを実現します。
論文 参考訳(メタデータ) (2025-08-27T10:37:24Z) - MixCache: Mixture-of-Cache for Video Diffusion Transformer Acceleration [15.22288174114487]
キャッシングは、DiTモデルで広く採用されている最適化手法である。
効率的なビデオDiT推論のためのトレーニング不要なキャッシュベースのフレームワークであるMixCacheを提案する。
論文 参考訳(メタデータ) (2025-08-18T07:49:33Z) - dKV-Cache: The Cache for Diffusion Language Models [53.85291644298835]
Diffusion Language Models (DLMs) は自己回帰型言語モデルにとって有望な競合と見なされている。
本稿では,DLMの復調過程に対するKVキャッシュ機構,遅延KVキャッシュを提案する。
我々のアプローチは、異なるトークンが拡散過程を通して異なる表現力学を持つという観察によって動機付けられている。
論文 参考訳(メタデータ) (2025-05-21T17:32:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。