論文の概要: PixelDiT2: Representation-Grounded Pixel Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2609.24919v2
- Date: Wed, 30 Sep 2026 17:27:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:25.351415
- Title: PixelDiT2: Representation-Grounded Pixel Diffusion Transformers
- Title(参考訳): PixelDiT2: 表現を囲むピクセル拡散変換器
- Abstract要約: PixelDiT2は、ピクセル生成から表現学習を分離するために設計された、エンドツーエンドのピクセル空間拡散モデルである。
ImageNet-256x256では、PixelDiT2は600エポック後のFIDが1.46、解像度が512x512、PixelDiT2は680エポック後のFIDが1.48である。
- 参考スコア(独自算出の注目度): 40.53372410965721
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in pixel-space diffusion models have narrowed the image quality gap with latent-space diffusion, but still converge more slowly and lag behind in final image quality. We argue that a key reason is the lack of an explicit representation prior: unlike latent diffusion, which usually denoises in a compact and structured latent space, pixel diffusion needs to learn denoising-friendly representations and pixel generation simultaneously from raw RGB space. To address this problem, we propose PixelDiT2, an end-to-end pixel-space diffusion model designed to decouple representation learning from pixel generation without introducing an autoencoder or latent reconstruction bottleneck. We propose representation grounding that uses a frozen pretrained vision foundation model to provide explicit per-patch representation guidance throughout denoising, allowing the pixel diffusion transformer to focus more on pixel generation. On ImageNet-256x256, PixelDiT2 achieves an FID of 1.46 after 600 epochs; at 512x512 resolution, PixelDiT2 achieves an FID of 1.48 after 680 epochs. Project page: https://pixeldit.github.io/pixeldit2/
- Abstract(参考訳): 画素空間拡散モデルの最近の進歩は、画像品質のギャップを遅延空間拡散と狭めているが、それでもよりゆっくりと収束し、最終的な画質が遅れている。
一般にコンパクトで構造化された潜在空間で denoise する潜在拡散とは異なり、ピクセル拡散は生の RGB 空間から denoising フレンドリーな表現とピクセル生成を同時に学ぶ必要がある。
この問題に対処するために,自動エンコーダや遅延再構成ボトルネックを導入することなく,表現学習と画素生成を分離するエンド・ツー・エンドの画素空間拡散モデルであるPixelDiT2を提案する。
我々は,凍結した事前学習された視覚基盤モデルを用いて,デノナイズ全体を通して明示的なパッチごとの表現ガイダンスを提供することにより,画素拡散変換器を画素生成に集中させることができる表現基盤を提案する。
ImageNet-256x256では、PixelDiT2は600エポック後のFIDが1.46、解像度が512x512、PixelDiT2は680エポック後のFIDが1.48である。
プロジェクトページ: https://pixeldit.github.io/pixeldit2/
関連論文リスト
- Advanced Pixel Diffusion Model with Guided Sparse Global Refinement [22.761844947334847]
Sparse Global Refinement を用いた新しい拡散フレームワーク PixSGR を提案する。
PixSGRは教師付き低チャネルボトルネックから始まり、自然画像の低次元多様体を効率的に捉える。
その後、チャネル次元と空間分解能を徐々に拡大し、より微細な構造を回復する。
論文 参考訳(メタデータ) (2026-09-01T06:50:37Z) - PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion [65.47126282928896]
latent-to-pixel デコーダは再構成指向であり、詳細を合成するのではなく、エンコーダを反転するように最適化されている。
条件付き画素拡散として遅延復号を再構成する画素拡散復号器であるPiDを導入する。
高解像度のピクセル空間で直接ノイズを発生させることで、PiDは低レイテンシで4倍、さらに8倍のアップスケールの画像を合成する。
論文 参考訳(メタデータ) (2026-05-22T17:59:42Z) - PixelGen: Pixel Diffusion Beats Latent Diffusion with Perceptual Loss [47.868429337792314]
知覚的監視機能を備えたシンプルなピクセル拡散フレームワークであるPixelGenを提案する。
フルイメージ多様体をモデル化する代わりに、PixelGenは2つの補完的な知覚的損失を導入した。
LPIPSの損失は、より優れた局所パターンの学習を促進する一方、DINOベースの知覚的損失は、グローバルな意味論を強化する。
論文 参考訳(メタデータ) (2026-02-02T18:59:42Z) - PixelDiT: Pixel Diffusion Transformers for Image Generation [48.456815413366535]
PixelDiTはDiffusion Transformers用の単一ステージのエンドツーエンドモデルである。
オートエンコーダの必要性を排除し、ピクセル空間内で拡散過程を直接学習する。
ImageNet 256x256で1.61 FIDを達成し、既存のピクセル生成モデルを大きく上回っている。
論文 参考訳(メタデータ) (2025-11-25T18:59:25Z) - DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation [93.6273078684831]
より効率的な画素拡散パラダイムを追求するために,周波数デカップリング方式の画素拡散フレームワークを提案する。
高速・低周波成分の生成を分離する直感によって, セマンティックガイダンスに基づく高周波細部を生成するために, 軽量画素デコーダを利用する。
実験の結果,DeCoは1.62 (256x256) と2.22 (512x512) の FID を実現した。
論文 参考訳(メタデータ) (2025-11-24T17:59:06Z) - InfGen: A Resolution-Agnostic Paradigm for Scalable Image Synthesis [51.81849724354083]
現在の拡散モデルでは、解像度で計算要求が2倍に増加し、4K画像生成が100秒以上遅れる。
本稿では, 任意の解像度画像を1ステップ生成器を用いて, コンパクトなラテントで復号する手法を提案する。
InfGenは、4K画像生成時間を10秒未満にカットしながら、任意の高解像度の時代に多くのモデルを改善することができる。
論文 参考訳(メタデータ) (2025-09-12T17:48:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。