論文の概要: Geometry-Aware Preference Optimization for Text-to-Image Diffusion Models
- arxiv url: http://arxiv.org/abs/2610.04980v1
- Date: Sun, 04 Oct 2026 05:55:08 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:01:19.458276
- Title: Geometry-Aware Preference Optimization for Text-to-Image Diffusion Models
- Title(参考訳): テキストと画像の拡散モデルのための幾何学的手法による選好最適化
- Abstract要約: 拡散-DPOは基本的に、好ましくないサンプルを抑えながら、好ましくないサンプルの可能性を奨励する。
APOは基準復調関数が高感度な方向の正則化を適応的に強化する。
APOは、様々なアライメント手法に対して、強い性能と平均勝利率を60%以上達成する。
- 参考スコア(独自算出の注目度): 49.55999164524554
- License:
- Abstract: Preference alignment has become a standard practice for text-to-image diffusion models. Direct Preference Optimization (DPO) simplifies this process by eliminating explicit reward modeling. Its diffusion variant, Diffusion-DPO, has become a widely adopted baseline. Diffusion-DPO essentially encourages the likelihood of preferred samples while suppressing dispreferred ones. In this paper, we revisit DPO-style alignment methods for diffusion models from the perspective of the manifold hypothesis. Under this view, natural images concentrate near a low-dimensional manifold embedded in the high-dimensional ambient space, whereas DPO directly optimizes preference distributions in the full space without accounting for this geometric structure. This creates a mismatch in the optimization dynamics: it suppresses geometry-preserving tangential updates, while insufficiently restricting hazardous normal-direction updates. This mismatch gradually degrades image quality and diversity. To address this issue, we propose Anisotropic Geometry-Aware Preference Optimization (APO), which replaces the uniform Euclidean treatment of prediction errors with a geometry-aware anisotropic metric derived from the reference model. Concretely, APO adaptively strengthens regularization in directions where the reference denoising function is highly sensitive, while relaxing constraints in directions that permit safe semantic adjustment. This recalibrates preference optimization according to the local manifold geometry, and maintains the original manifold structure. Experiments show that APO achieves strong performance and an average win rate exceeding 60\% against various existing alignment methods across diverse benchmarks. It requires significantly fewer training steps than prior methods, and preserves generation diversity throughout training.
- Abstract(参考訳): 参照アライメントは、テキストから画像への拡散モデルの標準的プラクティスとなっている。
直接選好最適化(DPO)は、明示的な報酬モデリングを排除し、このプロセスを単純化する。
その拡散変種であるDiffusion-DPOは広く採用されているベースラインとなっている。
拡散-DPOは基本的に、好ましくないサンプルを抑えながら、好ましくないサンプルの可能性を奨励する。
本稿では、多様体仮説の観点から拡散モデルに対するDPOスタイルのアライメント法を再検討する。
この観点では、自然像は高次元の周囲空間に埋め込まれた低次元多様体の近傍に集中し、一方DPOは、この幾何学的構造を考慮せずに、全空間の好み分布を直接最適化する。
これは、幾何保存された接点更新を抑えると同時に、有害な正規方向更新を十分に制限する、という最適化力学におけるミスマッチを生み出します。
このミスマッチは徐々に画質と多様性を低下させる。
そこで本研究では,予測誤差の均一な処理を基準モデルから導出した幾何対応異方性計量に置き換えたAnisotropic Geometry-Aware Preference Optimization (APO)を提案する。
具体的には、APOは、安全な意味調整を可能にする方向の制約を緩和しつつ、基準復調関数が非常に敏感な方向の正規化を適応的に強化する。
これにより、局所多様体幾何に従って好みの最適化が再検討され、元の多様体構造が維持される。
実験により、APOは様々なベンチマークにおいて、様々なアライメント手法に対して、強い性能と平均勝利率を60 %以上達成していることが示された。
従来の方法よりもはるかに少ないトレーニングステップを必要とし、トレーニング全体を通じて生成の多様性を維持する。
関連論文リスト
- Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models [5.527466367347639]
統合逆時間SDEフレームワークによる拡散とフローマッチングの両方をカバーする汎用DPO目標を導出する。
攻撃的シグモイドベースユーティリティ関数を持続的線形ユーティリティに置き換え,EMA更新参照モデルを組み込んだLinear-DPOを提案する。
論文 参考訳(メタデータ) (2026-05-20T12:54:51Z) - Towards General Preference Alignment: Diffusion Models at Nash Equilibrium [12.039242093129625]
拡散アライメントのための直感的な汎用的選好フレームワークを提案する。
Diff.-NPOは、自己改善を達成し、より良い整合性をもたらすために、現在の方針に反抗するように奨励する。
Diff.-NPO の様々なメトリクスによるテキスト・画像生成作業における有効性を示す。
論文 参考訳(メタデータ) (2026-05-06T04:50:42Z) - LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models [48.68246945083386]
Likelihood-Free Policy Optimization (LFPO) は、ベクトル場フローの概念を離散トークン空間にマッピングするネイティブフレームワークである。
LFPOは幾何速度補正としてアライメントを定式化し、対照的な更新によって直接対流を最適化する。
実験によると、LFPOはコードと推論ベンチマークの最先端のベースラインを上回るだけでなく、拡散ステップの削減によって推論を約20%加速する。
論文 参考訳(メタデータ) (2026-03-02T07:42:55Z) - Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models [38.27881260102189]
Diffusion-SDPOは、勝者勾配との整合性に応じて、敗者勾配を適応的にスケーリングすることで勝者を保護する安全な更新ルールである。
提案手法は,既存のDPOスタイルのアライメントフレームワークと広く互換性があり,限界計算オーバーヘッドのみを付加する。
論文 参考訳(メタデータ) (2025-11-05T09:30:49Z) - Divergence Minimization Preference Optimization for Diffusion Model Alignment [66.31417479052774]
Divergence Minimization Preference Optimization (DMPO) は、逆KL分散を最小化して拡散モデルを整列する原理的手法である。
DMPOは、異なるベースモデルとテストセットで既存のテクニックを一貫して上回り、適合させることができる。
論文 参考訳(メタデータ) (2025-07-10T07:57:30Z) - Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences [13.588231827053923]
直接選好最適化(DPO)は、テキスト・ツー・イメージ(T2I)生成モデルと、ペアの選好データを用いた人間の選好を一致させる。
本稿では, DPO の目的を改善するために, 好み分布をモデル化する新しい手法である SmPO-Diffusion を提案する。
提案手法は,既存手法における過度な最適化と客観的なミスアライメントの問題を効果的に軽減する。
論文 参考訳(メタデータ) (2025-06-03T09:47:22Z) - Refining Alignment Framework for Diffusion Models with Intermediate-Step Preference Ranking [50.325021634589596]
拡散モデルと人間の嗜好を整合させるためのTalored Optimization Preference(TailorPO)フレームワークを提案する。
提案手法は,ステップワイド報酬に基づいて,中間雑音のサンプルを直接ランク付けし,勾配方向の問題を効果的に解決する。
実験結果から,本手法は審美的,人為的な画像生成能力を大幅に向上させることが示された。
論文 参考訳(メタデータ) (2025-02-01T16:08:43Z) - Diffusion Model Alignment Using Direct Preference Optimization [103.2238655827797]
拡散DPOは,ヒトの比較データを直接最適化することにより,拡散モデルを人間の嗜好に合わせる手法である。
拡散DPOを用いた最先端安定拡散XL(SDXL)-1.0モデルの基礎モデルを微調整する。
また、AIフィードバックを使用し、人間の好みのトレーニングに匹敵するパフォーマンスを持つ亜種も開発しています。
論文 参考訳(メタデータ) (2023-11-21T15:24:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。