論文の概要: Pixel-Space Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2607.17585v2
- Date: Wed, 22 Jul 2026 07:24:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 16:42:31.573332
- Title: Pixel-Space Diffusion Transformers
- Title(参考訳): 画素空間拡散変換器
- Authors: Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao,
- Abstract要約: 遅延拡散モデル (LDMs) は, VAE圧縮された遅延空間をデノナイズすることにより, 効率的な高分解能画像合成を可能にする。
本稿では,Pixel-Space Diffusion Transformer(pDiT)について,モデルアーキテクチャ,連続生成機構,マルチモーダル統一モデリングの観点から検討する。
- 参考スコア(独自算出の注目度): 29.08838156660683
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Latent diffusion models (LDMs) enable efficient high-resolution image synthesis by denoising in a VAE-compressed latent space. However, fixed visual tokenizers can discard fine textures and structural details, while separate representation and diffusion training creates a mismatch between reconstruction and generation objectives. These limitations have renewed interest in pixel-space diffusion, which models raw pixels directly, removes the VAE bottleneck, and supports end-to-end optimization. This formulation better matches the demands of high-fidelity generation but introduces challenges in high-dimensional modeling, including noise scheduling, loss weighting, token efficiency, and scalable architecture design. Pixel-space modeling also offers a promising basis for unified multimodal systems: raw pixels, text, and task conditions can be represented in a shared token space and jointly processed by a single Transformer, narrowing the gap between visual understanding and generation. This paper reviews Pixel-Space Diffusion Transformers (pDiTs) from the perspectives of model architecture, continuous generative mechanisms, and unified multimodal modeling. We summarize representative methods, identify key technical challenges, and discuss future directions toward high-fidelity, end-to-end vision foundation models that integrate generation and understanding.
- Abstract(参考訳): 遅延拡散モデル (LDMs) は, VAE圧縮された遅延空間をデノナイズすることにより, 効率的な高分解能画像合成を可能にする。
しかし、固定されたビジュアル・トークンーザは微妙なテクスチャや構造の詳細を捨てることができ、一方、表現と拡散の訓練は再構成と生成の目的のミスマッチを生み出す。
これらの制限は、生のピクセルを直接モデル化し、VAEボトルネックを排除し、エンドツーエンドの最適化をサポートするピクセル空間拡散に再び関心を寄せている。
この定式化は高忠実度生成の要求によく適合するが、ノイズスケジューリング、損失重み付け、トークン効率、スケーラブルアーキテクチャ設計など、高次元モデリングにおける課題を提起する。
生のピクセル、テキスト、タスク条件を共有トークン空間で表現し、単一のトランスフォーマーで共同処理することで、視覚的理解と生成のギャップを狭めることができる。
本稿では,Pixel-Space Diffusion Transformer(pDiT)について,モデルアーキテクチャ,連続生成機構,マルチモーダル統一モデリングの観点から検討する。
我々は代表的手法を要約し、重要な技術的課題を特定し、生成と理解を統合する高忠実でエンドツーエンドのビジョン基盤モデルに向けた今後の方向性について議論する。
関連論文リスト
- Representation Forcing for Bottleneck-Free Unified Multimodal Models [76.99907273945493]
統一マルチモーダルモデル(UMM)は、単一モデルにおける知覚と生成を扱うことを目的としている。
既存のUMMは、画像生成のために別々に訓練された凍結したVAEに依存しており、構造的なボトルネックを示唆している。
本稿では,表現予測をモデルのネイティブ機能にすることで,このギャップを埋める手法であるRepresentation Forcing(RF)を提案する。
論文 参考訳(メタデータ) (2026-05-29T17:59:55Z) - RPiAE: A Representation-Pivoted Autoencoder Enhancing Both Image Generation and Editing [37.46832944462102]
拡散モデルは画像生成と編集において支配的なパラダイムとなっている。
近年、事前に訓練された視覚表現モデルをトークンライザとして活用しようとする試みは、拡散特徴を表現特徴に整合させるか、凍結トークンライザとして直接表現エンコーダを再利用するかのいずれかである。
生成と編集の両方を改善する表現ベースのトークン化器であるRepresentation-Pivoted AutoEncoderを提案する。
論文 参考訳(メタデータ) (2026-03-19T17:54:43Z) - Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation [0.0]
本研究では,視覚拡張大言語モデル(LLM)と高度なトランスフォーマベースアーキテクチャを統合するための変換フレームワークを提案する。
提案モデルでは, ノイズとデータを線形経路に接続し, 効率的かつ高品質な生成を可能にする整流機構を組み込んだ。
このフレームワークは、合成画像とコヒーレントなマルチモーダル表現において、非平行な忠実性を達成する。
論文 参考訳(メタデータ) (2025-12-14T08:28:50Z) - FARMER: Flow AutoRegressive Transformer over Pixels [39.864972164994946]
本稿では,正規化フロー(NF)と自己回帰(AR)モデルを統一した新しいエンドツーエンド生成フレームワークを提案する。
FARMERは非可逆自己回帰流を用いて画像を潜在シーケンスに変換し、その分布は自己回帰モデルによって暗黙的にモデル化される。
FARMERは,既存の画素ベース生成モデルと比較して,競合性能が高いことを示す。
論文 参考訳(メタデータ) (2025-10-27T17:54:08Z) - Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation [63.50827603618498]
マルチモーダル理解と生成のための統一型マスク付き拡散モデル(MDM)であるLavida-Oを提案する。
Lavida-Oは、画像レベルの理解、オブジェクトのグラウンド化、画像編集、高解像度のテキスト・ツー・イメージ合成を可能にする単一のフレームワークを提供する。
Lavida-Oは、RefCOCOオブジェクトグラウンド、GenEvalテキスト画像生成、ImgEdit画像編集など、幅広いベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-09-23T17:05:46Z) - Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation [54.588082888166504]
我々は、因果アプローチを通じてインターリーブされたマルチモーダル生成を可能にする統一的なフレームワークであるMogaoを提案する。
Mogooは、Deep-fusion設計、デュアルビジョンエンコーダ、インターリーブされた回転位置埋め込み、マルチモーダル分類器フリーガイダンスなど、アーキテクチャ設計における重要な技術的改善のセットを統合している。
実験により,モガオはマルチモーダル理解とテキスト・ツー・イメージ生成において最先端の性能を発揮するとともに,高品質でコヒーレントなインターリーブ・アウトプットの創出にも優れていることが示された。
論文 参考訳(メタデータ) (2025-05-08T17:58:57Z) - Visual Autoregressive Modeling for Image Super-Resolution [14.935662351654601]
次世代の予測モデルとして, ISRフレームワークの視覚的自己回帰モデルを提案する。
大規模データを収集し、ロバストな生成先行情報を得るためのトレーニングプロセスを設計する。
論文 参考訳(メタデータ) (2025-01-31T09:53:47Z) - Distance Weighted Trans Network for Image Completion [52.318730994423106]
本稿では,DWT(Distance-based Weighted Transformer)を利用した画像コンポーネント間の関係をよりよく理解するためのアーキテクチャを提案する。
CNNは、粗い事前の局所的なテクスチャ情報を強化するために使用される。
DWTブロックは、特定の粗いテクスチャやコヒーレントな視覚構造を復元するために使用される。
論文 参考訳(メタデータ) (2023-10-11T12:46:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。