論文の概要: Rethinking What to Cache in Few-Step Diffusion Transformers: Solver-Aware Target Selection
- arxiv url: http://arxiv.org/abs/2610.03577v1
- Date: Fri, 02 Oct 2026 16:51:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.492127
- Title: Rethinking What to Cache in Few-Step Diffusion Transformers: Solver-Aware Target Selection
- Title(参考訳): 数ステップ拡散変圧器におけるキャッシュ方法の再考:ソルバー対応ターゲット選択
- Abstract要約: DiTサンプリングを加速する2つの一般的な方法は、ステップ蒸留とキャッシュである。
本稿では,与えられたモデル,ソルバ,再利用スケジュールのキャッシュテンソルを選択するAutoTargetを紹介する。
蒸留した画像とビデオのDiT実験により、最良のキャッシュターゲットがモデル、画像解像度、ソルバによって変化することが示された。
- 参考スコア(独自算出の注目度): 12.469737867256534
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion Transformers (DiTs) can generate high-quality images and videos, but generating each sample requires multiple costly DiT forward passes. Two common ways to accelerate DiT sampling are step distillation, which reduces the number of sampling steps, and caching, which skips some DiT evaluations by reusing a tensor computed at an earlier step. Most caching methods decide in advance which tensor to reuse. After distillation, adjacent sampling steps are farther apart. Reusing a tensor across this larger gap introduces more error, so choosing what to cache becomes especially important. We therefore introduce AutoTarget, a method that chooses the cached tensor for a given model, solver, and reuse schedule. AutoTarget uses a small set of runs without cache reuse to measure the error caused by reusing each candidate tensor, then selects the candidate with the lowest error. We also analyze how an error at one reuse step affects the final sample. For Euler sampling, we identify cache targets that produce the same trajectory and show why a stored solver update may not. Experiments on distilled image and video DiTs show that the best cache target changes with the model, image resolution, and solver. AutoTarget reduces DiT evaluations and retained cache storage. Generation quality remains close to the corresponding uncached run. On the tested PixArt-LCM and FLUX.1-schnell settings, its calibration ranking matches the ranking from held-out cached runs. To help others reproduce the method, we provide its core implementation on GitHub at https://github.com/wali1024-offical/AutoTarget.
- Abstract(参考訳): Diffusion Transformer (DiTs) は高品質な画像やビデオを生成することができるが、各サンプルを生成するには複数のコストを要する。
DiTサンプリングを加速する2つの一般的な方法は、サンプリングステップの数を減らすステップ蒸留と、初期のステップで計算されたテンソルを再利用することで、いくつかのDiT評価をスキップするキャッシュである。
ほとんどのキャッシュメソッドは、どのテンソルを再利用するかを事前に決める。
蒸留後、隣のサンプリング工程は遠く離れている。
この大きなギャップでテンソルを再利用するとエラーが増え、キャッシュすべきものを選択することが特に重要になる。
そこで我々は,与えられたモデル,ソルバ,再利用スケジュールのキャッシュテンソルを選択するAutoTargetを紹介した。
AutoTargetはキャッシュを再使用せずに、小さな実行セットを使用して、各候補テンソルの再利用によるエラーを測定し、最も低いエラーで候補を選択する。
また、ある再利用ステップにおけるエラーが最終サンプルにどのように影響するかを分析する。
Euler サンプリングでは,同じ軌跡を生成するキャッシュターゲットを特定し,ストアド・ソルバが更新されない理由を示す。
蒸留した画像とビデオのDiT実験により、最良のキャッシュターゲットがモデル、画像解像度、ソルバによって変化することが示された。
AutoTargetはDiT評価を削減し、キャッシュストレージを保持する。
生成品質は、対応する未キャッシュ実行に近いままである。
テストされたPixArt-LCMとFLUX.1-schnell設定では、キャリブレーションランキングはキャッシュアウトされたランのランキングと一致している。
メソッドの再現を支援するため、GitHubではhttps://github.com/wali1024-offical/AutoTarget.comでコア実装を提供しています。
関連論文リスト
- InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models [2.6735992385049663]
InvarDiffは、時間ステップスケールと層スケールの相対時間的不変性を利用する、トレーニング不要な加速度法である。
実験によると、InvarDiffは標準品質の指標に最小限の影響を伴って、エンドツーエンドのスピードアップで2~3ドルを達成している。
論文 参考訳(メタデータ) (2025-11-29T02:34:23Z) - MagCache: Fast Video Generation with Magnitude-Aware Cache [91.2771453279713]
我々は、様々なモデルとプロンプトで観察される統一等級法則という、新しく頑健な発見を導入する。
我々は、エラーモデリング機構と適応キャッシュ戦略を用いて、重要でないタイムステップを適応的にスキップするMagnitude-aware Cache(MagCache)を導入する。
実験の結果、MagCacheはOpen-Sora、CogVideoX、Wan 2.1、HunyuanVideoで2.10x-2.68倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2025-06-10T17:59:02Z) - Accelerating Diffusion Transformer via Error-Optimized Cache [17.666577782052205]
Diffusion Transformer (DiT) はコンテンツ生成の重要な方法である。
既存のキャッシュ手法は、前回のステップからDiT機能を再利用し、次のステップで計算をスキップすることで、生成を加速する。
我々はこの問題を解決するために textbfError-textbfOptimized textbfCache (textbfEOC) を提案する。
論文 参考訳(メタデータ) (2025-01-31T15:58:15Z) - Accelerating Diffusion Transformers with Dual Feature Caching [25.36988865752475]
拡散変換器(DiT)は画像およびビデオ生成において支配的な手法となっているが、依然としてかなりの計算コストを被っている。
DiTアクセラレーションの効果的なアプローチとして、機能キャッシング手法は、以前のタイムステップでDiTの特徴をキャッシュするように設計されている。
以前のタイムステップでキャッシュされたすべての機能を積極的に再利用することで、世代品質が大幅に低下する。
論文 参考訳(メタデータ) (2024-12-25T14:00:14Z) - Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching [56.286064975443026]
拡散変圧器内の多数の層をキャッシュ機構で計算することで、モデルパラメータを更新しなくても容易に除去できる。
本稿では,拡散変圧器の動的手法でキャッシングを学習するL2C(Learningto-Cache)を提案する。
実験の結果,L2C は DDIM や DPM-r など,キャッシュベースの従来の手法と同等の推論速度で性能を向上することがわかった。
論文 参考訳(メタデータ) (2024-06-03T18:49:57Z) - Cache Me if You Can: Accelerating Diffusion Models through Block Caching [67.54820800003375]
画像間の大規模なネットワークは、ランダムノイズから画像を反復的に洗練するために、何度も適用されなければならない。
ネットワーク内のレイヤの振る舞いを調査し,1) レイヤの出力が経時的にスムーズに変化すること,2) レイヤが異なる変更パターンを示すこと,3) ステップからステップへの変更が非常に小さいこと,などが分かる。
本稿では,各ブロックの時間経過変化に基づいて,キャッシュスケジュールを自動的に決定する手法を提案する。
論文 参考訳(メタデータ) (2023-12-06T00:51:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。