論文の概要: FlashDiff: Efficient Regional Execution and Scheduling for Diffusion Model Serving
- arxiv url: http://arxiv.org/abs/2607.12121v2
- Date: Wed, 15 Jul 2026 22:00:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.210914
- Title: FlashDiff: Efficient Regional Execution and Scheduling for Diffusion Model Serving
- Title(参考訳): FlashDiff: 拡散モデル実行のための効率的な地域実行とスケジューリング
- Authors: Yaqi Qiao, Ping He, Songrun Xie, Ayush Barik, Chensong Zhang, Zhengzhong Tu, Fan Lai,
- Abstract要約: FlashDiffは、適応的な地域実行とスケジューリングによって推論効率を改善する拡散サービスシステムである。
エンドツーエンドのサービスレイテンシを30~97%削減し、現実世界の画像、ビデオ、オーディオワークロード間のスループットを1.2~2.2倍改善する。
- 参考スコア(独自算出の注目度): 18.258661497221812
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion models have become the central backbone for modern image, video, and audio generation, but their efficient service remains a challenge. Unlike autoregressive decoding, diffusion inference repeatedly updates high-dimensional spatial or temporal latents over many denoising steps. This all-region execution pattern makes generation latency high and limits serving throughput. Existing multi-GPU parallelization methods can reduce per-step computation, but often introduce substantial activation exchange overhead, causing communication to offset or even outweigh the benefits of parallel execution. This paper presents FlashDiff, a diffusion serving system that improves inference efficiency through adaptive regional execution and scheduling. FlashDiff is based on the observation that diffusion refinement is not uniform across latent regions or denoising steps: different regions often stabilize at different rates, while neighboring steps exhibit strong temporal correlation. FlashDiff leverages these properties to selectively execute only regions that require further refinement and to reallocate the resulting compute slack across concurrent serving requests. FlashDiff consists of three mechanisms. First, it decomposes the latent representation into coherent execution regions using early-stage attention signals, preserving semantic structure while exposing fine-grained parallelism. Second, it uses a lightweight runtime controller to estimate region activity and bypass low-impact updates when further refinement is unlikely to affect output quality. Third, it applies an affinity-aware online scheduler that co-locates dependent regions, balances residual load across GPUs, and reuses reclaimed compute capacity to improve serving efficiency. Across real-world image, video, and audio workloads, FlashDiff reduces end-to-end serving latency by 30-97% and improves throughput by 1.2-2.2x.
- Abstract(参考訳): 拡散モデルは、現代の画像、ビデオ、オーディオ生成の中心的なバックボーンとなっているが、その効率的なサービスは依然として課題である。
自己回帰復号とは異なり、拡散推論は高次元の空間的あるいは時間的遅延を多くの復号ステップで繰り返し更新する。
この全リージョン実行パターンは、生成遅延を高くし、スループットを制限する。
既存のマルチGPU並列化手法では、ステップ毎の計算を削減できるが、アクティベーション交換のオーバーヘッドが大幅に増加し、通信がオフセットしたり、並列実行の利点を上回ることが少なくない。
本稿では,適応的な地域実行とスケジューリングにより推論効率を向上させる拡散サービスシステムであるFlashDiffを提案する。
FlashDiffは拡散微細化が潜伏した領域で均一でないことや、異なる領域が異なる速度で安定していること、隣接するステップが強い時間的相関を示すことに基づく。
FlashDiffはこれらのプロパティを活用して、さらなる改善を必要とするリージョンのみを選択的に実行し、コンカレントなサービス要求にまたがる計算スラックを再配置する。
FlashDiffは3つのメカニズムから構成される。
まず、初期アテンション信号を用いて潜在表現をコヒーレントな実行領域に分解し、セマンティック構造を保持しながら、きめ細かい並列性を露呈する。
第二に、軽量なランタイムコントローラを使用して、リージョンのアクティビティを見積もり、さらなる改善が出力品質に影響を与える可能性が低い場合、低影響の更新を回避します。
第三に、アフィニティ対応のオンラインスケジューラを適用して、依存するリージョンを共同配置し、GPU間で残負荷をバランスさせ、再利用された計算容量を再利用して、サービス効率を向上させる。
実世界のイメージ、ビデオ、オーディオワークロード全体で、FlashDiffはエンドツーエンドのサービスレイテンシを30~97%削減し、スループットを1.2~2.2倍改善した。
関連論文リスト
- FLARE: Diffusion for Hybrid Language Model [72.60770374799634]
FLAREは、ハイブリッドアテンションな大規模言語モデルのための体系的な変換フレームワークである。
トークン平等なAR/拡散目標、ハードウェア対応カーネル、統一推論を組み合わせることで、ひとつのチェックポイントがARスタイルの検証された復号化と拡散スタイルの並列復号化の両方をサポートすることができる。
この結果から,実際のdLLMは復号化アルゴリズムだけでなく,データ品質や現在のブロック拡散目標のトレーニング非効率によって制限されていることが示唆された。
論文 参考訳(メタデータ) (2026-06-01T06:58:15Z) - SoulX-LiveAct: Towards Hour-Scale Real-Time Human Animation with Neighbor Forcing and ConvKV Memory [25.57144961436966]
自己回帰(AR)拡散モデルは、ビデオ合成のような逐次生成タスクのための有望なフレームワークを提供する。
同じ雑音条件下で隣接フレームを時間的に伝播する拡散ステップ整合AR式であるNeighbor Forcingを提案する。
提案手法は,既存のAR拡散法と比較して,トレーニング収束,時間スケール生成品質,推論効率を著しく向上させる。
論文 参考訳(メタデータ) (2026-03-12T09:49:58Z) - OmniForcing: Unleashing Real-time Joint Audio-Visual Generation [51.031726911410594]
最近のジョイントオーディオ・視覚拡散モデルは、優れた生成品質を実現するが、高いレイテンシーに悩まされる。
OmniForcingは、オフラインの双方向拡散モデルを高忠実度ストリーミングオートレジェネレータに蒸留する最初のフレームワークである。
論文 参考訳(メタデータ) (2026-03-12T08:17:36Z) - Accelerating Diffusion via Hybrid Data-Pipeline Parallelism Based on Conditional Guidance Scheduling [10.012655130147413]
拡散モデルは高忠実度画像、ビデオ、オーディオ生成において顕著な進歩を遂げた。
本フレームワークは,SDXLとSD3でそれぞれ2.31times$と2.07times$のレイテンシ低減を実現している。
提案手法は,高分解能合成条件下での既存の高速化手法よりも優れている。
論文 参考訳(メタデータ) (2026-02-25T10:23:07Z) - Causal Autoregressive Diffusion Language Model [70.7353007255797]
CARDは厳密な因果注意マスク内の拡散過程を再構成し、単一の前方通過で密集した1対1の監視を可能にする。
我々の結果は,CARDが並列生成のレイテンシの利点を解放しつつ,ARMレベルのデータ効率を実現することを示す。
論文 参考訳(メタデータ) (2026-01-29T17:38:29Z) - Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation [50.04968365065964]
拡散に基づく音声ヘッドモデルは高品質でフォトリアリスティックなビデオを生成するが、推論が遅い。
我々はLightning-fast Caching-based Parallel Denoising Prediction (LightningCP)を紹介する。
また,より高速な注意計算を実現するために,DFA(Decoupled Foreground Attention)を提案する。
論文 参考訳(メタデータ) (2025-08-25T02:58:39Z) - FLEX: A Backbone for Diffusion-Based Modeling of Spatio-temporal Physical Systems [51.15230303652732]
FLEX (F Low Expert) は、時間物理系の生成モデリングのためのバックボーンアーキテクチャである。
拡散モデルにおける速度場の分散を低減し、トレーニングの安定化に役立つ。
少数の特徴を2つの逆拡散ステップとして用いて、超解像および予測タスクの正確な予測を行う。
論文 参考訳(メタデータ) (2025-05-23T00:07:59Z) - Communication-Efficient Diffusion Denoising Parallelization via Reuse-then-Predict Mechanism [26.365397387678396]
拡散モデルは、画像、ビデオ、音声合成を含む様々なモードにわたる強力な生成モデルのクラスとして登場した。
本論文では, 拡散推論を並列化する手法である textbfParaStep を提案する。
ParaStep は SVD の textbf3.88$times$、CogVideoX-2b の textbf2.43$times$、textbf6.56$times
論文 参考訳(メタデータ) (2025-05-20T06:58:40Z) - StreamDiffusion: A Pipeline-level Solution for Real-time Interactive Generation [52.56469577812338]
本稿では,インタラクティブな画像生成のためのリアルタイム拡散パイプラインStreamDiffusionを紹介する。
既存の拡散モデルは、テキストや画像プロンプトから画像を作成するのに適しているが、リアルタイムのインタラクションでは不足することが多い。
本稿では,従来のシーケンシャル・デノナイジングをデノナイジング・プロセスに変換する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2023-12-19T18:18:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。