論文の概要: DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2608.03082v1
- Date: Tue, 04 Aug 2026 03:51:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.022731
- Title: DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers
- Title(参考訳): DiverseDiT++:拡散変換器における表現多様性の定量化、解析、促進
- Authors: Binglei Li, Mengping Yang, Zhiyu Tan, Xiaomeng Yang, Zhizhong Huang, Junping Zhang, Hao Li,
- Abstract要約: ブロック間の表現の多様性は、DiTにおける効果的な表現学習にとって重要な要素であることを示す。
多様な表現学習を明示的に促進する新しいフレームワークであるDiverseDiT++を提案する。
提案手法は,ブロック間の入力表現を多角化するための長い残差接続と,ブロックに異なる特徴を学習させるための表現多様性損失を組み込んだものである。
- 参考スコア(独自算出の注目度): 48.96981796971673
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in Diffusion Transformers (DiTs) have enabled remarkable progress in visual synthesis, benefiting from their superior scalability. To facilitate DiTs' capability of capturing meaningful internal representations, recent works such as REPA incorporate external pretrained encoders for representation alignment. However, the underlying mechanisms governing representation learning within DiTs remain poorly understood in the community. To this end, this paper first presents a systematic analysis of the representation dynamics of DiTs via quantifying the diversity of block-wise representations. Specifically, we introduce a novel metric, termed the Weighted Diversity Score (WDS), to measure the representational discrepancies across different blocks. Through extensive investigations on the evolution and influence of internal representations under various settings, we reveal that representation diversity across blocks is a critical factor for effective representation learning in DiTs. More importantly, WDS exhibits a strong correlation with synthesis quality across diverse settings, model scales, and training stages (Pearson's $r=-0.869$ with $\log(\text{FID})$), suggesting its potential as an indicator to reflect model performance and a principled guide for model optimization. Based on this key finding, we propose DiverseDiT++, a novel framework that explicitly promotes diverse representation learning. Concretely, our method incorporates long residual connections to diversify input representations across blocks and a representation diversity loss to encourage blocks to learn distinct features. Extensive experiments on ImageNet $256\times256$ and $512\times512$ demonstrate that our DiverseDiT++ yields consistent performance gains and convergence acceleration when applied to different backbones with various sizes,...
- Abstract(参考訳): 拡散変換器(DiT)の最近の進歩は、その優れたスケーラビリティの恩恵を受けながら、視覚合成の顕著な進歩を可能にしている。
意味のある内部表現をキャプチャするDiTsの能力を促進するために、REPAのような最近の研究は、表現アライメントのための外部トレーニング済みエンコーダを組み込んでいる。
しかし、DiT内の表現学習を規定するメカニズムは、コミュニティではよく理解されていない。
本稿ではまず,ブロックワイズ表現の多様性を定量化することにより,DiTの表現力学の体系的解析を行う。
具体的には,WDS(Weighted Diversity Score)と呼ばれる,異なるブロックにまたがる表現の相違を計測する新しい尺度を導入する。
様々な環境下での内部表現の進化と影響に関する広範な研究を通じて、ブロック間の表現の多様性が、DiTにおける効果的な表現学習の重要な要素であることを明らかにした。
さらに重要なのは、WDSは、さまざまな設定、モデルスケール、トレーニングステージ(Pearsonの$r=-0.869$ with $\log(\text{FID})$)にわたる合成品質と強い相関を示し、モデルパフォーマンスを反映する指標としての可能性と、モデル最適化のための原則化されたガイドである可能性を示唆している。
この重要な発見に基づいて,多様な表現学習を明示的に促進する新しいフレームワークであるDiverseDiT++を提案する。
具体的には,ブロック間の入力表現を多角化するための長い残差接続と,ブロックに異なる特徴を学習させる表現の多様性損失を取り入れた。
ImageNet $256\times256$と512\times512$の大規模な実験は、我々のDiverseDiT++が、さまざまなサイズのバックボーンに適用した場合、一貫したパフォーマンス向上とコンバージェンスアクセラレーションをもたらすことを実証している。
関連論文リスト
- ViQ: Text-Aligned Visual Quantized Representations at Any Resolution [91.46185855575789]
本稿では,視覚的量子化表現フレームワークViQについて紹介する。
我々のアプローチは、量子化学習をテキスト整列事前学習と特徴分別という2つの段階に構成する。
マルチモーダル・タスクの実験では、ViQは最先端のマルチモーダル・ビジョン・エンコーダに比べて競争性能が高いことを示した。
論文 参考訳(メタデータ) (2026-06-25T17:29:27Z) - Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation [81.40978077888693]
対照的に、CLIP(Contrastive Language- Image Pre-training)は、下流のパフォーマンスにおいて重要なボトルネックとなっている。
近年のソリューションでは、拡散モデルを用いて、CLIP視覚トークンに画像再構成を条件付けることで表現を強化する。
我々は、より包括的な視覚表現を追求するために、コントラスト信号を拡散に基づく再構成に統合する。
論文 参考訳(メタデータ) (2026-03-05T04:45:49Z) - DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers [18.873998808314067]
拡散変換器(DiT)の効果的な学習には,ブロック間の表現の多様性が不可欠であることを示す。
表現の多様性を明確に促進する新しいフレームワークであるDiverseDiTを提案する。
我々の研究は、DiTの表現学習ダイナミクスに関する貴重な洞察を提供し、その性能を高めるための実践的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-03-04T16:21:42Z) - Test-Time Conditioning with Representation-Aligned Visual Features [9.262325724962485]
Representation-Aligned Guidance (REPA-G)を導入する。
我々は,事前学習した特徴抽出器から抽出した条件付き表現に対して,デノナイズ処理を行う。
提案手法は, 単一パッチによるきめ細かいテクスチャマッチングから, 広義の意味指導まで, 複数スケールで多目的制御を行う。
論文 参考訳(メタデータ) (2026-02-03T17:15:03Z) - DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model [22.28268642142352]
DiG (Differential Grounding) は、MLLM がより詳細な認識を学習する新しいプロキシ・タスク・フレームワークである。
この結果は,MLLMの微細な視覚的推論を向上するための,スケーラブルで堅牢なアプローチとして,微分接地に注目した。
論文 参考訳(メタデータ) (2025-12-14T10:40:27Z) - Dynamic Visual Semantic Sub-Embeddings and Fast Re-Ranking [0.5242869847419834]
情報エントロピーを低減するために動的ビジュアルセマンティックサブエンベッドディングフレームワーク(DVSE)を提案する。
生成した候補埋め込みに様々な意味的変動を捉えるよう促すため,混合分布を構築した。
3つのベンチマークデータセット上の4つの画像特徴エンコーダと2つのテキスト特徴エンコーダを用いて,既存のセットベース手法と比較した。
論文 参考訳(メタデータ) (2023-09-15T04:39:11Z) - UniDiff: Advancing Vision-Language Models with Generative and
Discriminative Learning [86.91893533388628]
本稿では、画像テキストコントラスト学習(ITC)、テキスト条件付き画像合成学習(IS)、相互意味整合性モデリング(RSC)を統合した統合マルチモーダルモデルUniDiffを提案する。
UniDiffはマルチモーダル理解と生成タスクの両方において汎用性を示す。
論文 参考訳(メタデータ) (2023-06-01T15:39:38Z) - Demystify Transformers & Convolutions in Modern Image Deep Networks [80.16624587948368]
本稿では,一般のコンボリューションとアテンション演算子の真の利益を,詳細な研究により同定することを目的とする。
注意や畳み込みのようなこれらの特徴変換モジュールの主な違いは、それらの空間的特徴集約アプローチにある。
様々なSTMが統合されたフレームワークに統合され、包括的な比較分析を行う。
論文 参考訳(メタデータ) (2022-11-10T18:59:43Z) - Investigating the Properties of Neural Network Representations in
Reinforcement Learning [35.02223992335008]
本稿では,強化学習における伝達を支援する表現の特性を実証的に検討する。
我々は、画素ベースのナビゲーション環境において、補助的損失が異なる深層Q学習エージェントについて検討する。
そこで我々は,ある表現が転送に適する理由を,体系的なアプローチでよりよく理解する手法を開発した。
論文 参考訳(メタデータ) (2022-03-30T00:14:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。