論文の概要: Steering Optimisation Trajectories in Diffusion Representation Learning
- arxiv url: http://arxiv.org/abs/2607.05319v1
- Date: Mon, 06 Jul 2026 16:58:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.250846
- Title: Steering Optimisation Trajectories in Diffusion Representation Learning
- Title(参考訳): 拡散表現学習におけるステアリング最適化軌道
- Abstract要約: 本研究では,拡散型オートエンコーダが画像品質をほぼ異なる潜在構造を学習しながら,類似の画質を実現する方法について検討する。
復元体制のモデルが早期に画像の忠実度を優先するのに対し、解体体制のモデルでは、再建・ゆがみをより徐々に改善する。
本稿では, ゲート残差U-Netと簡単なノイズレベル露光カリキュラムを組み合わせたSteeringDRLを提案する。
- 参考スコア(独自算出の注目度): 13.581218966317232
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study why diffusion autoencoders can achieve similar image quality while learning substantially different latent structures. We trace this behaviour to optimisation dynamics; we analyse curves of image reconstruction against latent representation quality, revealing trajectories that organise around two distinct regimes early in training. Models in the reconstruction regime prioritise image fidelity early, whereas those in the disentanglement regime improve reconstruction and disentanglement more gradually. We hypothesise that this behaviour can be influenced by targeting shortcut pathways in the diffusion U-Net and controlling early noise-level exposure, thereby shaping the reconstruction-disentanglement trade-off during training. To steer optimisation toward stronger representations, we introduce SteeringDRL, combining gated residual U-Nets with a simple noise-level exposure curriculum for training. Across disentanglement benchmarks, SteeringDRL improves representation quality and reduces seed sensitivity. Our method further extends to spatial disentanglement in object-centric learning, improving segmentation quality on synthetic and real-world datasets.
- Abstract(参考訳): 本研究では,拡散型オートエンコーダが画像品質をほぼ異なる潜在構造を学習しながら,類似の画質を実現する方法について検討する。
画像再構成の曲線を遅延表現の質に対して解析し、訓練の早い段階で2つの異なる体制を包含する軌跡を明らかにする。
復元体制のモデルが早期に画像の忠実度を優先するのに対し、解体体制のモデルでは、再建・ゆがみをより徐々に改善する。
拡散U-Netにおけるショートカット経路を目標とし,早期ノイズレベルの露光を制御することにより,トレーニング中の再構成・アンタングルメントトレードオフを形成できると仮定する。
より強力な表現に向けて最適化を行うため,ゲート付き残差U-Netと簡易なノイズレベル露光カリキュラムを組み合わせたステアリングDRLを提案する。
アンタングルメントベンチマーク全体を通じて、SteeringDRLは表現品質を改善し、シード感度を低下させる。
提案手法は,オブジェクト中心学習における空間的ゆがみにさらに拡張され,合成および実世界のデータセットにおけるセグメンテーション品質が向上する。
関連論文リスト
- Next-Acceleration-Scale Prediction for Autoregressive MRI Reconstruction [52.32112533846212]
MRI再建は本質的に不完全な逆問題である。
この制限は、再構成を離散的なマルチスケールの潜在空間に移動させ、自己回帰的次加速スケールの予測として機能させることによって解決する。
提案手法は,過度のアンサンプ下での多種多様なサンプリングパターンの再構成性能の向上を図っている。
論文 参考訳(メタデータ) (2026-05-19T04:40:50Z) - Stage-adaptive audio diffusion modeling [3.3115063666033167]
我々は、セマンティックな獲得と世代指向の洗練のバランスの進化に、非効率の主な源泉があると主張している。
本研究では,初期セマンティックブートストラップのためのSSLガイダンス,状態変数によって駆動される自己適応時間ステップサンプリング,パラメータ空間内の収束群組織から活性化される構造認識正規化の3つの段階認識機構を開発する。
論文 参考訳(メタデータ) (2026-05-06T06:54:00Z) - Your Pre-trained Diffusion Model Secretly Knows Restoration [55.7186754179308]
本研究では,事前学習した拡散モデルが本質的に復元動作を有しており,即時埋め込みを直接学習することで解錠可能であることを示す。
トレーニング済みのWANビデオモデルとFLUX画像モデルに軽量な学習プロンプトを導入し、それらを高性能な復元モデルに変換する。
論文 参考訳(メタデータ) (2026-04-06T17:59:04Z) - Implicit Neural Representation-Based Continuous Single Image Super Resolution: An Empirical Study [50.15623093332659]
入射神経表現(INR)は任意のスケール画像超解像(ASSR)の標準的アプローチとなっている
既存の手法を多様な設定で比較し、複数の画像品質指標に対して集計結果を示す。
トレーニング中, エッジ, テクスチャ, 細部を保存しながら, 強度変化をペナライズする新たな損失関数について検討した。
論文 参考訳(メタデータ) (2026-01-25T07:09:20Z) - Physics-Guided Null-Space Diffusion with Sparse Masking for Corrective Sparse-View CT Reconstruction [5.479463752172751]
拡散モデルは画像処理タスクにおいて顕著な生成能力を示した。
スパース・ビューCT再構成のためのスパース・コンディション・リワイト統合分布推定誘導拡散モデル(STRIDE)を提案する。
実験結果から,PSNRでは2.58dB,SSIMでは2.37%,MSEでは0.236に改善した。
論文 参考訳(メタデータ) (2025-09-07T09:42:16Z) - Sparsity-Driven Parallel Imaging Consistency for Improved Self-Supervised MRI Reconstruction [2.8237889121096034]
本稿では,PD-DLネットワークを慎重に設計した摂動を用いてトレーニングする方法を提案する。
提案手法は,アーティファクトのエイリアスを効果的に低減し,高加速速度での雑音増幅を緩和することを示す。
論文 参考訳(メタデータ) (2025-05-30T02:11:25Z) - Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think [72.48325960659822]
生成のための大規模拡散モデルの訓練における主要なボトルネックは、これらの表現を効果的に学習することにある。
本稿では,RePresentation Alignment (REPA) と呼ばれる単純な正規化を導入し,ノイズの多い入力隠れ状態の投影を,外部の事前学習された視覚エンコーダから得られるクリーンな画像表現と整合させる手法を提案する。
我々の単純な戦略は、一般的な拡散やDiTsやSiTsといったフローベースのトランスフォーマーに適用した場合、トレーニング効率と生成品質の両方に大きな改善をもたらす。
論文 参考訳(メタデータ) (2024-10-09T14:34:53Z) - Learning Efficient and Effective Trajectories for Differential Equation-based Image Restoration [59.744840744491945]
本稿では, この手法の軌道最適化を改良し, 復元品質と効率の両立に焦点をあてる。
反復サンプリングに伴うかなりの計算負担を軽減するため,コストを考慮したトラジェクトリー蒸留法を提案する。
提案アルゴリズムを用いて基礎拡散モデル(FLUX)を12Bパラメータで微調整し、7種類の画像復元タスクを処理する統一的なフレームワークを作成する。
論文 参考訳(メタデータ) (2024-10-07T07:46:08Z) - Improved Noise Schedule for Diffusion Training [51.849746576387375]
本稿では,拡散モデルのトレーニングを強化するため,ノイズスケジュールを設計するための新しい手法を提案する。
我々は,標準のコサインスケジュールよりもノイズスケジュールの方が優れていることを実証的に示す。
論文 参考訳(メタデータ) (2024-07-03T17:34:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。