論文の概要: Advanced Pixel Diffusion Model with Guided Sparse Global Refinement
- arxiv url: http://arxiv.org/abs/2609.00798v1
- Date: Tue, 01 Sep 2026 06:50:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.422782
- Title: Advanced Pixel Diffusion Model with Guided Sparse Global Refinement
- Title(参考訳): ガイド付きスパースグローバルリファインメントを用いた高度な画素拡散モデル
- Authors: Weiyi You, Jinhua Zhang, Xingyu Zhou, Wei Long, Junyu Lou, Shuhang Gu,
- Abstract要約: Sparse Global Refinement を用いた新しい拡散フレームワーク PixSGR を提案する。
PixSGRは教師付き低チャネルボトルネックから始まり、自然画像の低次元多様体を効率的に捉える。
その後、チャネル次元と空間分解能を徐々に拡大し、より微細な構造を回復する。
- 参考スコア(独自算出の注目度): 22.761844947334847
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pixel-space diffusion has recently emerged as a promising direction for high-fidelity image generation by modeling images directly in the original pixel domain. However, pixel-space diffusion is computationally demanding due to the extremely high dimensionality of natural images. For efficiency, existing pixel diffusion models either compromise fine details with large-patch tokenization or confine subsequent refinement within individual patches. Such intra-patch refinement inevitably restricts structural continuity across patch boundaries and long-range token interactions, limiting refinement quality. To address these issues, we propose PixSGR, a novel Pixel diffusion framework with Sparse Global Refinement tailored for modeling the distribution of natural images directly in pixel space. PixSGR starts from a supervised low-channel bottleneck to efficiently capture the low-dimensional manifold of natural images. It then progressively expands the channel dimensionality and spatial resolution to recover increasingly fine-grained structures. At the spatial refinement stage, coarse-scale attention maps preselect globally relevant interactions to pre-sparsify fine-scale attention, enabling non-local refinement beyond isolated patches without the quadratic cost of dense attention. Extensive experiments on ImageNet validate the effectiveness of PixSGR. It achieves an FID of 1.51 at 256$\times$256 and maintains performance when scaled to 512$\times$512, attaining an FID of 1.60.
- Abstract(参考訳): 近年,画素領域内の画像を直接モデリングすることで,高忠実度画像生成のための有望な方向として,画素空間拡散が出現している。
しかし、自然画像の超高次元性のため、ピクセル空間の拡散は計算的に要求される。
効率性のために、既存のピクセル拡散モデルは、大きなパッチトークン化によって細部を妥協するか、個別のパッチ内で後の精細化を封じ込めている。
このようなパッチ内精細化は、パッチ境界と長距離トークン相互作用の間の構造的連続性を必然的に制限し、精細化の品質を制限する。
これらの問題に対処するために,我々は,ピクセル空間内での自然画像の分布を直接モデル化するためのSparse Global Refinementを備えた新しいPixel拡散フレームワークPixSGRを提案する。
PixSGRは教師付き低チャネルボトルネックから始まり、自然画像の低次元多様体を効率的に捉える。
その後、チャネル次元と空間分解能を徐々に拡大し、より微細な構造を回復する。
空間的精細化の段階では、粗大な注意マップは、グローバルな関連する相互作用を事前に選択し、微細な注意を分離し、より密集した注意の二次的なコストを伴わずに、孤立パッチを越えて非局所的な精細化を可能にする。
ImageNetの大規模な実験はPixSGRの有効性を検証する。
256$\times$256で1.51のFIDを実現し、スケール時には512$\times$512まで性能を維持し、FIDは1.60に達する。
関連論文リスト
- PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion [16.22743300700166]
我々は、ピクセル空間に適した最小限の単段U字型拡散変換器であるPixelUを紹介する。
PixelUは「情報ハイウェイ」を提供するゼロコストスキップ接続に賛成して補助デコーダを放棄
実験により、この周波数の分離は、計算コストの約1/3で強いベースライン(JiT-G)より優れていることが示された。
論文 参考訳(メタデータ) (2026-06-26T06:39:06Z) - FrequencyBooster: Full-Frequency Modeling for High-Fidelity Pixel Diffusion [15.557373713923306]
FrequencyBoosterは、フル周波数モデリング機能を備えたピクセル拡散を、禁忌のオーバーヘッドなしに促進するように設計された、新しいフレームワークである。
我々のモデルは320エポックで256倍256$の解像度で textbf1.60 の最先端 FID を実現する。
FrequencyBoosterは512倍の512ドルの解像度で、textbf1.69のFIDを獲得し、既存のピクセル空間と潜在空間の生成モデルを大幅に上回っている。
論文 参考訳(メタデータ) (2026-05-18T02:25:07Z) - PixelGen: Pixel Diffusion Beats Latent Diffusion with Perceptual Loss [47.868429337792314]
知覚的監視機能を備えたシンプルなピクセル拡散フレームワークであるPixelGenを提案する。
フルイメージ多様体をモデル化する代わりに、PixelGenは2つの補完的な知覚的損失を導入した。
LPIPSの損失は、より優れた局所パターンの学習を促進する一方、DINOベースの知覚的損失は、グローバルな意味論を強化する。
論文 参考訳(メタデータ) (2026-02-02T18:59:42Z) - PixelDiT: Pixel Diffusion Transformers for Image Generation [48.456815413366535]
PixelDiTはDiffusion Transformers用の単一ステージのエンドツーエンドモデルである。
オートエンコーダの必要性を排除し、ピクセル空間内で拡散過程を直接学習する。
ImageNet 256x256で1.61 FIDを達成し、既存のピクセル生成モデルを大きく上回っている。
論文 参考訳(メタデータ) (2025-11-25T18:59:25Z) - DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation [93.6273078684831]
より効率的な画素拡散パラダイムを追求するために,周波数デカップリング方式の画素拡散フレームワークを提案する。
高速・低周波成分の生成を分離する直感によって, セマンティックガイダンスに基づく高周波細部を生成するために, 軽量画素デコーダを利用する。
実験の結果,DeCoは1.62 (256x256) と2.22 (512x512) の FID を実現した。
論文 参考訳(メタデータ) (2025-11-24T17:59:06Z) - DiP: Taming Diffusion Models in Pixel Space [91.51011771517683]
Diffusion Transformer (DiT) バックボーンは、効率的なグローバル構造構築のために大きなパッチで動作する。
共同トレーニングされた軽量パッチディーラーヘッドは、コンテキスト機能を活用して、きめ細かいローカル詳細を復元する。
論文 参考訳(メタデータ) (2025-11-24T06:55:49Z) - Simpler Diffusion (SiD2): 1.5 FID on ImageNet512 with pixel-space diffusion [34.70370851239368]
画素空間モデルは、品質と効率の両方において、潜在モデルと非常に競合することを示す。
エンド・ツー・エンドのピクセル空間拡散モデルを高分解能に拡張するための簡単なレシピを提案する。
論文 参考訳(メタデータ) (2024-10-25T06:20:06Z) - $\infty$-Brush: Controllable Large Image Synthesis with Diffusion Models in Infinite Dimensions [58.42011190989414]
無限次元における新しい条件拡散モデル、制御可能な大画像合成のための$infty$-Brushを導入する。
我々の知る限り、$infty$-Brushは関数空間における最初の条件拡散モデルであり、最大4096times4096$ピクセルの任意の解像度で画像を制御できる。
論文 参考訳(メタデータ) (2024-07-20T00:04:49Z) - Superpixel Segmentation Based on Spatially Constrained Subspace
Clustering [57.76302397774641]
独立意味情報を持つ各代表領域を部分空間とみなし,部分空間クラスタリング問題としてスーパーピクセルセグメンテーションを定式化する。
従来のサブスペースクラスタリングとスーパーピクセルセグメンテーションの簡単な統合は,画素の空間相関のために効果的に機能しないことを示す。
本稿では,空間隣接画素に類似の属性を付加してスーパーピクセルにクラスタリング可能な,凸局所性制約付きサブスペースクラスタリングモデルを提案する。
論文 参考訳(メタデータ) (2020-12-11T06:18:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。