論文の概要: LearniBridge: Learnable Calibration of Feature Caching for Diffusion Models Acceleration
- arxiv url: http://arxiv.org/abs/2606.26778v1
- Date: Thu, 25 Jun 2026 09:12:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.22324
- Title: LearniBridge: Learnable Calibration of Feature Caching for Diffusion Models Acceleration
- Title(参考訳): LearniBridge: 拡散モデル高速化のための特徴キャッシングの学習可能な校正
- Authors: Xuyue Huang, Zhe Chen, Wang Shen, Xiao-Ping Zhang,
- Abstract要約: LearniBridgeは、軽量なLoRA更新を通じて複数のタイムステップをブリッジする機能キャッシングのための学習可能なキャリブレーションメカニズムである。
画像生成とビデオ生成の実験では、LeardiBridgeはFLUX、HunyuanVideo、WAN2.1で最大5.87times$、$5.75times$、$4.10times$加速を達成した。
- 参考スコア(独自算出の注目度): 13.139080503923248
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion Transformers (DiTs) have driven substantial progress in image and video generation but suffer from prohibitive computational costs. Feature caching accelerates inference by reusing intermediate representations. Existing methods rely on historical features for implementation simplicity, yet suffer from severe error accumulation at high acceleration ratios. To address this limitation, we investigate the nature of the requisite feature correction. We demonstrate that the optimal calibration update is characterized by a shared low-rank subspace across diverse prompts. Guided by this structural insight, we propose LearniBridge, a learnable calibration mechanism for feature caching that bridges multiple timesteps through lightweight LoRA updates. This mechanism enables effective calibration requiring only 3-5 training samples. Extensive experiments on image and video generation show that LearniBridge achieves up to $5.87\times$, $5.75\times$, and $4.10\times$ acceleration on FLUX, HunyuanVideo, and WAN2.1, respectively. On WAN2.1, it improves VBench by 1.28% over the previous SOTA at $4.10\times$ acceleration. Our code is available at https://github.com/Iiiiiiirene/LearniBridge.
- Abstract(参考訳): DiT(Diffusion Transformer)は画像生成とビデオ生成において大きな進歩をもたらしたが、計算コストの制限に悩まされている。
フィーチャーキャッシングは中間表現の再利用によって推論を加速する。
既存の手法は実装の単純さに歴史的な特徴を頼りにしているが、高い加速比で重大なエラーの蓄積に悩まされている。
この制限に対処するため、必要な特徴補正の性質について検討する。
最適キャリブレーション更新は多様なプロンプトにまたがる共有低ランク部分空間によって特徴づけられることを示す。
この構造的洞察に導かれ、軽量なLoRA更新を通じて複数のタイムステップをブリッジする機能キャッシングのための学習可能なキャリブレーション機構であるLeardiBridgeを提案する。
このメカニズムは、3-5のトレーニングサンプルのみを必要とする効果的なキャリブレーションを可能にする。
画像生成とビデオ生成に関する大規模な実験の結果、LeartiBridgeはFLUX、HunyuanVideo、WAN2.1で最大5.87\times$、$5.75\times$、$4.10\times$Acceleratorを達成した。
WAN2.1では、VBenchは以前のSOTAよりも1.28%向上し、4.10\times$Acceleratorである。
私たちのコードはhttps://github.com/Iiiiiiirene/LearniBridge.comで利用可能です。
関連論文リスト
- Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models [18.678454642609996]
L2P(Learnable Linear Predictor)は、固定係数を学習時間単位の重みで置き換えるデータ駆動キャッシングフレームワークである。
1つのGPUで20秒でトレーニングされたL2Pは、過去のトラジェクトリから現在の機能を正確に再構築する。
論文 参考訳(メタデータ) (2026-04-29T07:22:16Z) - Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration [58.19554276924402]
スペクトル拡散特徴予測器(Spectrum)を提案する。
我々はFLUX.1で4.79$times$スピードアップ、Wan2.1-14Bで4.67$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-03-02T08:59:11Z) - S$^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation [55.35880044416441]
ビデオ拡散モデル(V-DM)の学習後量子化フレームワークであるS$2$Q-VDiTを提案する。
W4A6量子化の下では、S$2$Q-VDiTは3.9倍のモデル圧縮と1.3倍の推論加速を実現している。
論文 参考訳(メタデータ) (2025-08-06T02:12:29Z) - Less is Enough: Training-Free Video Diffusion Acceleration via Runtime-Adaptive Caching [57.7533917467934]
EasyCacheは、ビデオ拡散モデルのためのトレーニング不要のアクセラレーションフレームワークである。
我々は,OpenSora,Wan2.1,HunyuanVideoなどの大規模ビデオ生成モデルについて包括的な研究を行っている。
提案手法は,従来のベースラインと比較して推定時間を最大2.1-3.3$times$に短縮する。
論文 参考訳(メタデータ) (2025-07-03T17:59:54Z) - MagCache: Fast Video Generation with Magnitude-Aware Cache [91.2771453279713]
我々は、様々なモデルとプロンプトで観察される統一等級法則という、新しく頑健な発見を導入する。
我々は、エラーモデリング機構と適応キャッシュ戦略を用いて、重要でないタイムステップを適応的にスキップするMagnitude-aware Cache(MagCache)を導入する。
実験の結果、MagCacheはOpen-Sora、CogVideoX、Wan 2.1、HunyuanVideoで2.10x-2.68倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2025-06-10T17:59:02Z) - From Reusing to Forecasting: Accelerating Diffusion Models with TaylorSeers [14.402483491830138]
Diffusion Transformers (DiT) は高忠実度画像とビデオ合成に革命をもたらしたが、リアルタイムアプリケーションでは計算要求は禁じられている。
機能キャッシングは、前のタイムステップで機能をキャッシュし、次のタイムステップでそれらを再利用することで、拡散モデルを加速するために提案されている。
我々はTaylorSeerを提案する。これはまず、将来の時間ステップにおける拡散モデルの特徴を、過去の時間ステップにおけるそれらの値に基づいて予測できることを示す。
論文 参考訳(メタデータ) (2025-03-10T05:09:42Z) - HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration [31.982294870690925]
我々はHarmoniCaと呼ばれる新しい学習ベースのキャッシュフレームワークを開発した。
SDT(Step-Wise Denoising Training)を取り入れて、Denoisingプロセスの継続性を保証する。
私たちのフレームワークは40%以上のレイテンシ削減(理論的スピードアップ)とPixArt-$alpha$のパフォーマンス向上を実現しています。
論文 参考訳(メタデータ) (2024-10-02T16:34:29Z) - DeepCache: Accelerating Diffusion Models for Free [65.02607075556742]
DeepCacheは、モデルアーキテクチャの観点から拡散モデルを加速するトレーニング不要のパラダイムである。
DeepCacheは拡散モデルのシーケンシャルなデノナイジングステップで観測される時間的冗長性に乗じている。
同じスループットで、DeepCacheはDDIMやPLMSで、事実上同等または極端に改善された結果を達成する。
論文 参考訳(メタデータ) (2023-12-01T17:01:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。