論文の概要: DuSPiT: Dual-Branch Sub-Patch Pixel Diffusion Transformer
- arxiv url: http://arxiv.org/abs/2607.18510v1
- Date: Mon, 20 Jul 2026 21:08:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.244227
- Title: DuSPiT: Dual-Branch Sub-Patch Pixel Diffusion Transformer
- Title(参考訳): DuSPiT:Dual-Branch Sub-Patch Pixel Diffusion Transformer
- Abstract要約: ピクセル空間拡散は情報損失を回避するが、既存のアプローチは各生画像パッチを単一のトークンにマッピングする。
ローカルな外観モデルからグローバルな構造的推論を分離した新しいアーキテクチャ textbfDuSPiT を提案する。
以上の結果から,DuSPiTは高精細度で高精細度な画像を生成するとともに,従来の画素空間拡散変換器よりも高精細度かつ高精細度で高精細な画像を生成することがわかった。
- 参考スコア(独自算出の注目度): 34.812382551423575
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion Transformers achieve strong image generation performance, but most operate in compressed latent spaces. Pixel-space diffusion avoids this information loss, yet existing approaches map each raw image patch to a single token, forcing one representation to handle both global communication and fine-grained details. We address this issue by proposing a new architecture, \textbf{DuSPiT}, a \textbf{Du}al-branch \textbf{S}ub\textbf{P}atch \textbf{Pi}xel \textbf{T}ransformer. This model separates global structural reasoning from local appearance modeling. DuSPiT uses a compact base branch for efficient global reasoning and a parallel, high-capacity pixel branch, organized into subpatch groups, to preserve detailed appearance, with the two branches interacting through cross-attention. Our results show that DuSPiT generates images with richer details and stronger fine-grained structures, while also achieving a better quality--efficiency trade-off than prior pixel-space diffusion transformers.
- Abstract(参考訳): 拡散変換器は強い画像生成性能を実現するが、ほとんどの場合圧縮潜在空間で動作する。
ピクセル空間拡散は、この情報損失を回避するが、既存のアプローチでは、各生画像パッチを単一のトークンにマッピングし、グローバル通信と細かな詳細の両方を扱うように1つの表現を強制する。
本稿では,新しいアーキテクチャである \textbf{DuSPiT}, a \textbf{Du}al-branch \textbf{S}ub\textbf{P}atch \textbf{Pi}xel \textbf{T}ransformerを提案する。
このモデルは、局所的な外見モデルからグローバルな構造的推論を分離する。
DuSPiTは、効率的なグローバル推論のためのコンパクトなベースブランチと、サブパッチグループに編成された並列で高容量のピクセルブランチを使用して、細かな外観を保ちながら、2つのブランチがクロスアテンションを介して相互作用する。
以上の結果から,DuSPiTは高精細度で高精細度な画像を生成するとともに,従来の画素空間拡散変換器よりも高精細度かつ高精細度で高精細な画像を生成することがわかった。
関連論文リスト
- Pixel-Space Diffusion Transformers [29.08838156660683]
遅延拡散モデル (LDMs) は, VAE圧縮された遅延空間をデノナイズすることにより, 効率的な高分解能画像合成を可能にする。
本稿では,Pixel-Space Diffusion Transformer(pDiT)について,モデルアーキテクチャ,連続生成機構,マルチモーダル統一モデリングの観点から検討する。
論文 参考訳(メタデータ) (2026-07-20T06:04:08Z) - From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion [16.593435991566828]
マルチモーダル画像融合は、異なるモーダルからの相補的な情報を融合画像に統合することを目的としている。
非局所的な外見/ベース要素をモデル化するための凍結事前訓練画像トークン化器に基づくコンパクトな1Dトークンインタフェースを提案する。
提案手法は,グローバルコヒーレンスと局所忠実度の両方において,一貫したマルチメトリック改良を施し,全体的な性能を向上する。
論文 参考訳(メタデータ) (2026-06-10T16:40:18Z) - Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers [55.15722080205737]
Edit2Perceiveは、深度、正規度、マッティングの編集モデルを適応させる統合拡散フレームワークである。
私たちの単一ステップの決定論的推論は、比較的小さなデータセットでトレーニングしながら、より高速なランタイムをもたらす。
論文 参考訳(メタデータ) (2025-11-24T01:13:51Z) - High-resolution Photo Enhancement in Real-time: A Laplacian Pyramid Network [73.19214585791268]
本稿では,LLF-LUT++と呼ばれるピラミッドネットワークについて紹介する。
具体的には,ダウンサンプリング画像のグローバル音節特性を活かした画像適応型3D LUTを利用する。
LLF-LUT++は、HDR+データセット上でPSNRが2.64dB改善されただけでなく、4K解像度の画像を1つのGPUでわずか13msで処理することで、さらに削減されている。
論文 参考訳(メタデータ) (2025-10-13T16:52:32Z) - Pixel-Perfect Depth with Semantics-Prompted Diffusion Transformers [45.701222598522456]
Pixel-Perfect Depthはピクセル空間拡散生成に基づく単眼深度推定モデルである。
本モデルは,5つのベンチマークにおいて,すべての生成モデルの中で最高の性能を達成している。
論文 参考訳(メタデータ) (2025-10-08T17:59:33Z) - PiT: Progressive Diffusion Transformer [50.46345527963736]
拡散変換器(DiT)は変換器アーキテクチャを用いて画像生成において顕著な性能を発揮する。
DiTは以前信じられていたようなグローバルな情報に大きく依存していない。
Pseudo Progressive Diffusion Transformer (PiT)を提案する。
論文 参考訳(メタデータ) (2025-05-19T15:02:33Z) - IPT-V2: Efficient Image Processing Transformer using Hierarchical Attentions [26.09373405194564]
我々は,IPTV2と呼ばれる階層的な注意を払って,効率的な画像処理トランスフォーマアーキテクチャを提案する。
我々は、局所的およびグローバルな受容領域における適切なトークン相互作用を得るために、焦点コンテキスト自己注意(FCSA)とグローバルグリッド自己注意(GGSA)を採用する。
提案した IPT-V2 は,様々な画像処理タスクにおいて,デノナイズ,デブロアリング,デコライニングを網羅し,従来の手法よりも性能と計算の複雑さのトレードオフを得る。
論文 参考訳(メタデータ) (2024-03-31T10:01:20Z) - Xformer: Hybrid X-Shaped Transformer for Image Denoising [114.37510775636811]
本稿では,XformerというハイブリッドX字型視覚変換器について紹介する。
Xformerは、合成および実世界の画像復調タスクで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-03-11T16:32:09Z) - CSformer: Bridging Convolution and Transformer for Compressive Sensing [65.22377493627687]
本稿では,CNNからの詳細な空間情報を活用するためのハイブリッドフレームワークと,表現学習の強化を目的としたトランスフォーマーが提供するグローバルコンテキストを統合することを提案する。
提案手法は、適応的なサンプリングとリカバリからなるエンドツーエンドの圧縮画像センシング手法である。
実験により, 圧縮センシングにおける専用トランスアーキテクチャの有効性が示された。
論文 参考訳(メタデータ) (2021-12-31T04:37:11Z) - InfinityGAN: Towards Infinite-Resolution Image Synthesis [92.40782797030977]
任意の解像度画像を生成するinfinityganを提案する。
少ない計算資源でパッチバイパッチをシームレスに訓練し、推論する方法を示す。
論文 参考訳(メタデータ) (2021-04-08T17:59:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。