論文の概要: Pixel-Space Diffusion via Observation Operators
- arxiv url: http://arxiv.org/abs/2608.21885v2
- Date: Tue, 25 Aug 2026 07:30:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:33.961279
- Title: Pixel-Space Diffusion via Observation Operators
- Title(参考訳): 観測演算子による画素空間拡散
- Authors: Shaojie Guo, Lichen Ma, Haoyang Tong, Yu He, Zipeng Guo, Xiaoan Liu, Feng Yan, Yu Guo, Fei Wang, Junshi Huang, Yan Wang,
- Abstract要約: 本稿では,画像構造の本質的な回復順序とフルイメージの監督と特徴改善を一致させる統一的なフレームワークを提案する。
実験により,提案手法は画像Net-256上で1.52のFIDを達成し,生成品質を継続的に向上しながら,ほぼ高速に収束することが示された。
- 参考スコア(独自算出の注目度): 22.391778551506345
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pixel-space diffusion models directly model image distributions but remain difficult to optimize. Recent methods alleviate this challenge through target reparameterization, while still relying on a fixed clean-image target throughout denoising. Through empirical analysis, we identify a scale-time mismatch: image structures become predictable from coarse to fine as noise decreases, whereas existing models are forced to predict the full image even under high noise, resulting in low-SNR gradients that hinder optimization. To resolve this mismatch, we propose Observation Operator Diffusion, a unified framework that aligns both the supervision trajectory and feature refinement with the intrinsic recovery order of image structures. Specifically, we replace fixed full-image supervision along the standard flow path with a time-indexed observation trajectory that evolves from coarse structures to the full image during denoising. This trajectory is instantiated with a family of Gaussian-Lanczos operators at varying observation scales, yielding a path-consistent training objective. We further introduce GL-CoDA, a decoder that injects scale-specific Gaussian-Lanczos observations across decoding stages for coarse-to-fine feature refinement. Extensive experiments show that the proposed approach converges substantially faster while consistently improving generation quality, achieving an FID of 1.52 on ImageNet-256.
- Abstract(参考訳): 画素空間拡散モデルは直接画像分布をモデル化するが、最適化は困難である。
近年の手法では、目標再パラメータ化によってこの課題を緩和する一方で、デノナイジング全体を通じて固定されたクリーンイメージターゲットに依存している。
画像構造はノイズが減少するにつれて粗いものから細かいものへと予測できるが、既存のモデルでは高雑音下でもフルイメージを予測せざるを得ず、最適化の妨げとなる低SNR勾配が生じる。
このミスマッチを解決するために,画像構造の本質的な回復順序と,監督軌道と特徴改善の両方を整合させる統合されたフレームワークであるObservatory Operator Diffusionを提案する。
具体的には、標準的な流れ経路に沿って固定されたフルイメージの監督を、粗い構造からデノナイジング中のフルイメージへと進化するタイムインデクシングされた観測軌道に置き換える。
この軌道はガウス・ランツォス作用素の族で様々な観測スケールでインスタンス化され、経路一貫性のある訓練目標をもたらす。
さらに,粗大な特徴改善のためのデコード段階にわたって,スケール固有のガウス・ランチョス観測を注入するデコーダGL-CoDAを紹介する。
大規模な実験により,提案手法は画像Net-256上で1.52のFIDを達成し,生成品質を継続的に向上しながら,ほぼ高速に収束することが示された。
関連論文リスト
- CG-GLORE: A Conjugate Gradient-Based Global-Local Regularization Network for Sparse-View CT Reconstruction [3.7567584936415166]
スパースビューCT (Sparse-view Computed Tomography) はプロジェクションビューを少なくすることで放射線線量を減らすが、結果として生じる逆問題は非常に悪化する。
既存のディープリコンストラクション手法は有望な性能を達成したが、多くは1次更新や大規模な正規化ネットワークに依存している。
スパース・ビューCT再構成のための2次最適化にインスパイアされた,コンパクトなディープ・アンローリング・フレームワークである textbfCG-GLORE を提案する。
論文 参考訳(メタデータ) (2026-08-15T14:08:44Z) - LPNSR: Prior-Enhanced Diffusion Image Super-Resolution via LR-Guided Noise Prediction [4.609499769793957]
拡散に基づく画像超解像(SR)は、高分解能(HR)画像を対応する低分解能(LR)観測から再構成することを目的としている。
4段階の推論を効率よく行うと, 小型サンプリング軌道の劣化特性が著しく低下する。
これらの問題に対処するために,先進的な効率的な拡散フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-22T03:52:38Z) - Iterative Inference-time Scaling with Adaptive Frequency Steering for Image Super-Resolution [75.3690742776891]
適応周波数ステアリング(IAFS)を用いた反復拡散推論時間スケーリングを提案する。
IAFSは、構造的偏差の反復的補正によって生成した画像を徐々に精細化することで、知覚品質と構造的忠実性のバランスをとるという課題に対処する。
実験の結果、IAFSは知覚と忠実性の対立を効果的に解決し、知覚の細部と構造的精度を一貫して改善し、既存の推論時間スケーリング手法よりも優れていた。
論文 参考訳(メタデータ) (2025-12-29T15:09:20Z) - How Noise Benefits AI-generated Image Detection [15.496270003630451]
AI生成画像のアウト・オブ・ディストリビューションの一般化は、永続的な課題である。
雑音発生器と検出ネットワークを同時学習するCLIP(PiN-CLIP)を提案する。
提案手法は,従来の手法に比べて平均精度が5.4向上し,新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2025-11-20T08:16:24Z) - Diffusion Models for Solving Inverse Problems via Posterior Sampling with Piecewise Guidance [52.705112811734566]
断片的なガイダンススキームを用いて,逆問題を解決するための新しい拡散型フレームワークが導入された。
提案手法は問題に依存しず,様々な逆問題に容易に適応できる。
このフレームワークは, (4時間), (8時間) の超分解能タスクに対して, (23%), (24%) および (24%) の無作為マスクを塗布する場合の (25%) の推論時間を短縮する。
論文 参考訳(メタデータ) (2025-07-22T19:35:14Z) - Reconstruct-and-Generate Diffusion Model for Detail-Preserving Image
Denoising [16.43285056788183]
再構成・生成拡散モデル(Reconstruct-and-Generate Diffusion Model, RnG)と呼ばれる新しい手法を提案する。
提案手法は, 再構成型復調ネットワークを利用して, 基礎となるクリーン信号の大半を復元する。
拡散アルゴリズムを用いて残留する高周波の詳細を生成し、視覚的品質を向上させる。
論文 参考訳(メタデータ) (2023-09-19T16:01:20Z) - Advancing Unsupervised Low-light Image Enhancement: Noise Estimation, Illumination Interpolation, and Self-Regulation [55.07472635587852]
低光画像強調(LLIE)技術は、画像の詳細の保存とコントラストの強化に顕著な進歩をもたらした。
これらのアプローチは、動的ノイズを効率的に緩和し、様々な低照度シナリオを収容する上で、永続的な課題に直面する。
まず,低照度画像の雑音レベルを迅速かつ高精度に推定する方法を提案する。
次に、照明と入力の一般的な制約を満たすために、Learningable Illumination Interpolator (LII) を考案する。
論文 参考訳(メタデータ) (2023-05-17T13:56:48Z) - On Measuring and Controlling the Spectral Bias of the Deep Image Prior [63.88575598930554]
深層画像は、未学習のネットワークが逆画像問題に対処できることを実証している。
ピークに達するとパフォーマンスが低下するので、いつ最適化を止めるかを決めるにはオラクルが必要です。
これらの問題に対処するために、スペクトルバイアスの観点から先行した深部画像について検討する。
論文 参考訳(メタデータ) (2021-07-02T15:10:42Z) - Extrapolation for Large-batch Training in Deep Learning [72.61259487233214]
我々は、バリエーションのホストが、我々が提案する統一されたフレームワークでカバー可能であることを示す。
本稿では,この手法の収束性を証明し,ResNet,LSTM,Transformer上での経験的性能を厳格に評価する。
論文 参考訳(メタデータ) (2020-06-10T08:22:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。