論文の概要: DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse
- arxiv url: http://arxiv.org/abs/2607.15650v1
- Date: Fri, 17 Jul 2026 05:56:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.755631
- Title: DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse
- Title(参考訳): DiTango: 選択的注意状態再利用によるコスト効果のパラレル拡散生成
- Authors: Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai,
- Abstract要約: AI生成コンテンツの最近の進歩により、高解像度の長期コンテンツ生成に拡散変換器(DiT)が広く採用されている。
我々は、DiT生成のための効率的な並列フレームワークであるDiTangoを提案する。
DiTangoは、最大1.9倍のエンドツーエンドと3.2倍のアテンションスピードアップを実現し、マルチノード設定でのニア線形スケーリングを実現している。
- 参考スコア(独自算出の注目度): 9.472841051080133
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in AI-generated content have driven widespread adoption of Diffusion Transformers (DiTs) for high-resolution, long-duration content generation. While parallelization techniques accelerate diffusion inference, they face significant scalability challenges due to excessive communication overhead in multi-node environments. We observe that sequence partitions in Context Parallelism (CP) exhibit distinct heterogeneity: spatially proximate partitions contribute more significantly to attention computation results. By mapping this heterogeneous pattern to hierarchical communication topology, we can access high-contribution partitions with reduced communication cost. This insight motivates our novel selective attention state mechanism that strategically balances partial attention computation and historical result reuse across denoising steps. We present DiTango, an efficient parallel framework for DiT generation. DiTango features an anchor-guided state selection planner that optimizes computation-reuse decisions for each partition, complemented by a runtime that orchestrates efficient state-centric operations. This design achieves superior system efficiency while preserving generation quality. Experimental evaluation on popular diffusion models demonstrates that DiTango achieves up to 1.9x end-to-end and 3.2x attention speedup with near-linear scaling in multi-node settings, while maintaining generation quality comparable to state-of-the-art approaches.
- Abstract(参考訳): AI生成コンテンツの最近の進歩により、高解像度の長期コンテンツ生成に拡散変換器(DiT)が広く採用されている。
並列化技術は拡散推論を加速するが、マルチノード環境における過度な通信オーバーヘッドのため、スケーラビリティ上の大きな課題に直面している。
文脈並列性 (CP) における配列分割は, 空間的近接分割がより注意計算結果に寄与する, 異種性を示すことが観察された。
この異種パターンを階層的な通信トポロジにマッピングすることにより、通信コストを削減して高コントリビューションパーティションにアクセスできる。
この洞察は、偏見計算と歴史的結果の再利用とを戦略的にバランスさせる、新しい選択的注意状態機構を動機付けている。
我々は、DiT生成のための効率的な並列フレームワークであるDiTangoを提案する。
DiTangoは、各パーティションの計算-再利用決定を最適化するアンカー誘導状態選択プランナを備え、効率的なステート中心の操作を編成するランタイムによって補完される。
この設計は、生成品質を維持しつつ、優れたシステム効率を実現する。
一般的な拡散モデルの実験的評価により、DiTangoは、最先端のアプローチに匹敵する生成品質を維持しながら、マルチノード設定におけるニア線形スケーリングにより、最大1.9倍のエンドツーエンドと3.2倍のアテンションスピードアップを達成することが示されている。
関連論文リスト
- Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation [53.60856261088647]
本稿では,凝縮パラダイムを最適化に基づく逆転から決定論的潜在写像へシフトすることを提案する。
動作セグメントをノイズ多様体のスパース潜在点に固定された連続軌跡として表現する。
我々のフレームワークは,共通データセット間でのセグメンテーション性能において,最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-07-10T04:00:26Z) - Complexity-Balanced Diffusion Splitting [20.558008394592097]
Complexity-Balanced Splitting (CBS)は、時間的キャパシティ割り当てのための原則的なフレームワークである。
CBSは拡散時間軸を等近似重みのセグメントに分割する。
CBSは、ステップごとの推論コストを増大させることなく、継続的に品質を向上する。
論文 参考訳(メタデータ) (2026-06-04T17:57:15Z) - Rethinking Vector Field Learning for Generative Segmentation [50.08025820235397]
生成的セグメンテーションのためのモデリング拡散モデルが注目されている。
ベクトル場学習の観点から拡散セグメンテーションを再考する。
本稿では,学習した消滅速度場を距離認識補正項で拡張するベクトル場再構成手法を提案する。
この補正は、誘引的相互作用と反発的相互作用の両方を導入し、元の拡散訓練フレームワークを保ちながら、セントロイド付近の勾配等級を増大させる。
論文 参考訳(メタデータ) (2026-03-19T17:58:19Z) - Joint Optimization of Model Partitioning and Resource Allocation for Anti-Jamming Collaborative Inference Systems [52.842088497389746]
この手紙は、悪意のあるジャマーの存在下での、アンチジャミングの協調推論システムに焦点を当てている。
まず、ジャミングとDNNパーティショニングがデータ回帰による推測精度に与える影響を解析する。
問題を3つのサブプロブレムに分解する,効率的な交互最適化アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-03T03:52:52Z) - Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models [64.92045568376705]
コヒーレントコンテキストデコーディング(Coherent Contextual Decoding, CCD)は、2つのコアイノベーションに基づいて構築された新しい推論フレームワークである。
CCDは、歴史的文脈を活用してシーケンスコヒーレンスを高める軌道修正機構を採用している。
拡散ステップに基づく厳密なアロケーションの代わりに,各ステップのアンマスク予算を動的に調整する適応型サンプリング戦略を導入する。
論文 参考訳(メタデータ) (2025-11-26T09:49:48Z) - Communication-Efficient Diffusion Denoising Parallelization via Reuse-then-Predict Mechanism [26.365397387678396]
拡散モデルは、画像、ビデオ、音声合成を含む様々なモードにわたる強力な生成モデルのクラスとして登場した。
本論文では, 拡散推論を並列化する手法である textbfParaStep を提案する。
ParaStep は SVD の textbf3.88$times$、CogVideoX-2b の textbf2.43$times$、textbf6.56$times
論文 参考訳(メタデータ) (2025-05-20T06:58:40Z) - TS-HTFA: Advancing Time Series Forecasting via Hierarchical Text-Free Alignment with Large Language Models [14.411646409316624]
時系列予測の新しい手法である textbfHierarchical textbfText-textbfFree textbfAlignment (textbfTS-HTFA) を導入する。
我々は、QR分解語埋め込みと学習可能なプロンプトに基づいて、ペア化されたテキストデータを適応的な仮想テキストに置き換える。
複数の時系列ベンチマークの実験は、HTFAが最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2024-09-23T12:57:24Z) - State-Free Inference of State-Space Models: The Transfer Function Approach [132.83348321603205]
状態のない推論では、状態サイズが大きくなると大きなメモリや計算コストは発生しない。
提案した周波数領域転送関数のパラメトリゼーション特性を用いてこれを実現する。
長い畳み込みハイエナベースライン上での言語モデリングにおける難易度の改善を報告した。
論文 参考訳(メタデータ) (2024-05-10T00:06:02Z) - Bidirectional Long-Range Parser for Sequential Data Understanding [3.76054468268713]
BLRP(Bidirectional Long-Range)は,長距離タスクの性能向上と効率向上を目的とした,新規で汎用的なアテンション機構である。
我々は、最先端の手法に対する競争結果を示すことによって、ビジョンと言語ドメインに対するアプローチの利点と汎用性を示す。
論文 参考訳(メタデータ) (2024-04-08T05:45:03Z) - Conditional Denoising Diffusion for Sequential Recommendation [62.127862728308045]
GAN(Generative Adversarial Networks)とVAE(VAE)の2つの顕著な生成モデル
GANは不安定な最適化に苦しむ一方、VAEは後続の崩壊と過度に平らな世代である。
本稿では,シーケンスエンコーダ,クロスアテンティブデノナイジングデコーダ,ステップワイズディフューザを含む条件付きデノナイジング拡散モデルを提案する。
論文 参考訳(メタデータ) (2023-04-22T15:32:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。