論文の概要: Distributed Direct Preference Optimization
- arxiv url: http://arxiv.org/abs/2605.20696v1
- Date: Wed, 20 May 2026 04:49:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.478677
- Title: Distributed Direct Preference Optimization
- Title(参考訳): 分散直接参照最適化
- Authors: Zhanhong Jiang,
- Abstract要約: 直接選好最適化(DPO)は、明示的な報酬モデリングを避けるが、連合的および分散的なトレーニングの下での収束保証が欠如している。
分散環境におけるDPOの最初の収束解析と時間複雑度解析を行う。
連合DPOでは、クライアントのドリフト、通信周波数、嗜好の不均一性の影響を定量化する収束率を導出する。
分散DPOでは、一般的な通信グラフに対する収束を確立し、スペクトル接続が最適化速度とコンセンサスをどのように支配するかを示す。
- 参考スコア(独自算出の注目度): 3.0957695592556007
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Preference-based reinforcement learning (RL) is a key paradigm for aligning policies with human judgments, yet its theoretical behavior in distributed settings where preference data are fragmented across heterogeneous users remains poorly understood. Direct Preference Optimization (DPO) avoids explicit reward modeling but lacks convergence guarantees under federated and decentralized training, where communication constraints and non-IID preferences fundamentally alter optimization dynamics. We provide the first convergence and time-complexity analysis of DPO in distributed environments. Modeling personalized offline RL with user-specific preference distributions, we characterize the induced global optimization landscape. For federated DPO, we derive convergence rates that quantify the impact of client drift, communication frequency, and preference heterogeneity; for decentralized DPO, we establish convergence over general communication graphs and show how spectral connectivity governs optimization speed and consensus. Empirically, we corroborate our theoretical insights on standard alignment benchmarks, demonstrating that our proposed methods not only enjoy strong theoretical guarantees but also deliver robust and scalable performance in practice. The code base is available here.
- Abstract(参考訳): 嗜好に基づく強化学習(RL)は、政策を人的判断と整合させるための重要なパラダイムであるが、不均一なユーザ間で嗜好データが断片化されている分散環境での理論的挙動はよく分かっていない。
直接選好最適化(DPO)は、明示的な報酬モデリングを避けるが、コミュニケーション制約や非IID選好が最適化のダイナミクスを根本的に変えるような、連合的かつ分散化されたトレーニングの下での収束保証が欠如している。
分散環境におけるDPOの最初の収束解析と時間複雑度解析を行う。
ユーザ固有の嗜好分布を持つ個人化されたオフラインRLをモデル化し、大域的最適化の展望を特徴付ける。
連合DPOでは、クライアントのドリフト、通信周波数、嗜好の不均一性の影響を定量化する収束率を導出し、分散DPOでは、一般的な通信グラフに対する収束を確立し、スペクトル接続が最適化速度とコンセンサスをどのように支配するかを示す。
実証的には、標準アライメントベンチマークに関する理論的洞察を裏付け、提案手法が強力な理論的保証を享受するだけでなく、実際に堅牢でスケーラブルなパフォーマンスを提供することを示す。
コードベースはここにある。
関連論文リスト
- Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution [47.604070468150844]
優先学習において、よく知られた過最適化問題を緩和するために、単段階直接選好最適化のようなアルゴリズムPEPOを導入する。
PEPOは、不整合データサブセットに基づいて訓練された嗜好最適化ポリシーのアンサンブルを通じて悲観的を達成する。
論文 参考訳(メタデータ) (2026-02-05T22:31:07Z) - Latent Adversarial Regularization for Offline Preference Optimization [21.271580780278473]
本稿では,ポリシーモデルの内部表現と参照モデルとの相違を罰し,潜在空間の正則化を実現するGANPOを紹介する。
複数のモデルアーキテクチャとタスクにわたる実験は、潜在空間の正規化から一貫した改善を示している。
論文 参考訳(メタデータ) (2026-01-29T18:21:57Z) - Multi-Objective Reward and Preference Optimization: Theory and Algorithms [3.316593788543852]
この論文は、制御、嗜好学習、大規模言語モデルのアライメントを越えて制約付き強化学習(RL)を進める理論的枠組みとアルゴリズムを開発する。
ACPO, e-COP, warmPref-PS, PSPL, MOPOは, 平均コスト, エピソード, 嗜好駆動のパラダイムでRLを推し進める。
集合的に、論文はRLを平均的コスト、エピソード、および嗜好駆動のパラダイムで統一し、理論的な進歩と、安全で整合した意思決定のための実践的なツールを提供する。
論文 参考訳(メタデータ) (2025-12-11T12:51:21Z) - Stable Preference Optimization for LLMs: A Bilevel Approach Beyond Direct Preference Optimization [2.384797824772941]
確率進化の観点からDPOのダイナミクスを包括的に分析する。
本稿では,教師付き微調整とDPO目標,すなわち安定な選好最適化とを密に統合する理論的基礎を持つ二段階最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-10T12:57:39Z) - Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization [75.1240295759264]
本稿では,BMC という名前のペアデータにおけるブリッジ・アンド・モデリングの効果的なフレームワークを提案する。
目的の修正によって、ペアの選好信号の一貫性と情報性が向上する。
DPOだけではこれらの相関をモデル化し、ニュアンス付き変動を捉えるには不十分である。
論文 参考訳(メタデータ) (2024-08-14T11:29:47Z) - Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF [80.32171988565999]
オンラインとオフラインのRLHFに統一的なアプローチを導入します。
VPOは、報酬関数の最大値推定を対応する値関数で正規化する。
テキスト要約とダイアログの実験は、VPOの実用性と有効性を検証する。
論文 参考訳(メタデータ) (2024-05-29T17:51:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。