論文の概要: Towards General Preference Alignment: Diffusion Models at Nash Equilibrium
- arxiv url: http://arxiv.org/abs/2605.04494v1
- Date: Wed, 06 May 2026 04:50:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.647326
- Title: Towards General Preference Alignment: Diffusion Models at Nash Equilibrium
- Title(参考訳): 一般選好整合に向けて:ナッシュ平衡における拡散モデル
- Authors: Jiaming Hu, Jiamu Bai, Haoyu Wang, Debarghya Mukherjee, Ioannis Ch. Paschalidis,
- Abstract要約: 拡散アライメントのための直感的な汎用的選好フレームワークを提案する。
Diff.-NPOは、自己改善を達成し、より良い整合性をもたらすために、現在の方針に反抗するように奨励する。
Diff.-NPO の様々なメトリクスによるテキスト・画像生成作業における有効性を示す。
- 参考スコア(独自算出の注目度): 12.039242093129625
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning from human feedback (RLHF) has been popular for aligning text-to-image (T2I) diffusion models with human preferences. As a mainstream branch of RLHF, Direct Preference Optimization (DPO) offers a computationally efficient alternative that avoids explicit reward modeling and has been widely adopted in diffusion alignment. However, existing preference-based methods for diffusion alignment still rely on reward-induced preference signals and typically assume that human preferences can be adequately modeled by the Bradley--Terry (BT) model, which may fail to capture the full complexity of human preferences. In this paper, we formulate diffusion alignment from a game-theoretic perspective. We propose Diffusion Nash Preference Optimization (Diff.-NPO), an intuitive general preference framework for diffusion alignment. Diff.-NPO encourages the current policy to play against itself to achieve self improvement and lead to a better alignment. Empirically, we demonstrate the effectiveness of Diff.-NPO on the text-to-image generation task via various metrics. Diff.-NPO consistently outperforms existing preference-based diffusion alignment methods.
- Abstract(参考訳): 人間からのフィードバックからの強化学習(RLHF)は、テキスト・ツー・イメージ(T2I)拡散モデルと人間の嗜好の整合に人気がある。
RLHFの主流のブランチとして、直接選好最適化(DPO)は、明示的な報酬モデリングを回避し、拡散アライメントにおいて広く採用されている、計算的に効率的な代替手段を提供する。
しかし、既存の嗜好に基づく拡散アライメントの手法は、報酬によって引き起こされる嗜好信号に依存しており、人間の嗜好はBradley-Terry(BT)モデルによって適切にモデル化できると仮定する。
本稿では,ゲーム理論の観点から拡散アライメントを定式化する。
そこで我々は,拡散アライメントのための直感的な汎用選好フレームワークである拡散ナッシュ選好最適化(Diff.-NPO)を提案する。
Diff
-NPOは、自己改善を達成し、より良い整合性をもたらすために、現在の政策を自らに反抗するよう奨励する。
実験では,Diffの有効性を実証した。
-様々なメトリクスによるテキスト・画像生成タスクにおけるNPO。
Diff
-NPOは、既存の嗜好に基づく拡散アライメント法より一貫して優れている。
関連論文リスト
- PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier [36.21450058652141]
拡散モデル(PC拡散)における人間の嗜好アライメントのための新しい枠組みを提案する。
PC-Diffusionは軽量でトレーニング可能なPreferenceを使用して、サンプル間の相対的な嗜好を直接モデル化する。
そこで,PC-Diffusion は DPO に匹敵する選好整合性を実現し,トレーニングコストを大幅に削減し,効率の良い選好誘導生成を可能にすることを示す。
論文 参考訳(メタデータ) (2025-11-11T03:53:06Z) - Towards Better Optimization For Listwise Preference in Diffusion Models [19.40269067848114]
本稿では、リストワイズデータを持つ拡散モデルにおいて、リストワイズ選好最適化のためのフレームワークであるDiffusion-LPOを提案する。
キャプションが与えられた場合、ユーザからのフィードバックをランク付けされた画像のリストに集約し、Planet-Luceモデルの下でDPOの目的をリストワイドに拡張する。
テキスト・ツー・イメージ生成や画像編集,パーソナライズされた嗜好アライメントなど,様々なタスクにおける拡散-LPOの有効性を実証的に示す。
論文 参考訳(メタデータ) (2025-10-02T00:26:37Z) - Divergence Minimization Preference Optimization for Diffusion Model Alignment [66.31417479052774]
Divergence Minimization Preference Optimization (DMPO) は、逆KL分散を最小化して拡散モデルを整列する原理的手法である。
DMPOは、異なるベースモデルとテストセットで既存のテクニックを一貫して上回り、適合させることができる。
論文 参考訳(メタデータ) (2025-07-10T07:57:30Z) - Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences [13.588231827053923]
直接選好最適化(DPO)は、テキスト・ツー・イメージ(T2I)生成モデルと、ペアの選好データを用いた人間の選好を一致させる。
本稿では, DPO の目的を改善するために, 好み分布をモデル化する新しい手法である SmPO-Diffusion を提案する。
提案手法は,既存手法における過度な最適化と客観的なミスアライメントの問題を効果的に軽減する。
論文 参考訳(メタデータ) (2025-06-03T09:47:22Z) - Self-NPO: Negative Preference Optimization of Diffusion Models by Simply Learning from Itself without Explicit Preference Annotations [60.143658714894336]
拡散モデルは、画像、ビデオ、および3Dコンテンツ生成を含む様々な視覚生成タスクにおいて顕著な成功を収めている。
優先度最適化(PO)は、これらのモデルを人間の嗜好に合わせることを目的とした、顕著で成長している研究分野である。
モデル自体からのみ学習する負の選好最適化アプローチであるSelf-NPOを導入する。
論文 参考訳(メタデータ) (2025-05-17T01:03:46Z) - Refining Alignment Framework for Diffusion Models with Intermediate-Step Preference Ranking [50.325021634589596]
拡散モデルと人間の嗜好を整合させるためのTalored Optimization Preference(TailorPO)フレームワークを提案する。
提案手法は,ステップワイド報酬に基づいて,中間雑音のサンプルを直接ランク付けし,勾配方向の問題を効果的に解決する。
実験結果から,本手法は審美的,人為的な画像生成能力を大幅に向上させることが示された。
論文 参考訳(メタデータ) (2025-02-01T16:08:43Z) - Diffusion-RPO: Aligning Diffusion Models through Relative Preference Optimization [68.69203905664524]
拡散に基づくT2Iモデルと人間の嗜好をより効率的に整合させる新しい手法であるDiffusion-RPOを紹介する。
我々は,高いコストと低い解釈可能性の課題を克服することを目的とした,新しい評価基準であるスタイルアライメントを開発した。
その結果,拡散-RPO は安定拡散バージョン1.5 と XL-1.0 の調整において超微調整や拡散-DPO などの確立された手法よりも優れていた。
論文 参考訳(メタデータ) (2024-06-10T15:42:03Z) - Diffusion Model Alignment Using Direct Preference Optimization [103.2238655827797]
拡散DPOは,ヒトの比較データを直接最適化することにより,拡散モデルを人間の嗜好に合わせる手法である。
拡散DPOを用いた最先端安定拡散XL(SDXL)-1.0モデルの基礎モデルを微調整する。
また、AIフィードバックを使用し、人間の好みのトレーニングに匹敵するパフォーマンスを持つ亜種も開発しています。
論文 参考訳(メタデータ) (2023-11-21T15:24:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。