論文の概要: Towards Disentangled Preference Optimization Dynamics Beyond Likelihood Displacement
- arxiv url: http://arxiv.org/abs/2604.18239v2
- Date: Sat, 25 Apr 2026 16:04:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:06.893908
- Title: Towards Disentangled Preference Optimization Dynamics Beyond Likelihood Displacement
- Title(参考訳): 擬似転位を超越した非交互選好最適化のダイナミクスを目指して
- Abstract要約: 本稿では、選好最適化のインセンティブ・スコアを統一的に分解する。
遠近距離帯域 (DB) は, トレーニングが回避できる場合に特徴付ける, 単純で検証可能な条件である。
そこで本稿では,DB と確率変位を満たすために,選択された更新と削除された更新のバランスを適応的に調整するプラグイン・アンド・プレイ・アンフレワード・キャリブレーション(RC)を提案する。
- 参考スコア(独自算出の注目度): 33.80669933764735
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Preference optimization is widely used to align large language models (LLMs) with human preferences. However, many margin-based objectives suppress the chosen response along with the rejected one, a phenomenon known as likelihood displacement, and no general mechanism currently prevents this across objectives. We bridge this gap by presenting a unified \emph{incentive-score decomposition} of preference optimization, revealing that diverse objectives share identical local update directions and differ only in their scalar weighting coefficients. Building on this decomposition, by analyzing the dynamics of the chosen/rejected likelihoods, we identify the \emph{disentanglement band} (DB), a simple, testable condition that characterizes when training can avoid likelihood displacement by realizing the preferred pathway: suppressing the loser while maintaining the winner, possibly after an initial transient. Leveraging the DB, we propose a plug-and-play \emph{reward calibration} (RC) that adaptively rebalances chosen versus rejected updates to satisfy the DB and mitigate likelihood displacement, without redesigning the base objective. Empirical results show that RC steers training toward more disentangled dynamics and often improves downstream performance across a range of objectives. Our code is available at https://github.com/IceyWuu/DisentangledPreferenceOptimization.
- Abstract(参考訳): 優先度最適化は、大きな言語モデル(LLM)を人間の好みに合わせるために広く使われている。
しかし、多くのマージンに基づく目的は、除去された反応とともに選択された反応を抑制し、これは確率変位と呼ばれる現象であり、現在は汎用的なメカニズムが目的を越えてこれを阻止することはない。
このギャップを、選好最適化の統一された 'emph{incentive-score decomposition} を示し、多様な目的が同一の局所更新方向を共有し、スカラー重み付け係数だけが異なることを明らかにすることによって橋渡しする。
この分解に基づいて、選択された/棄却された確率の力学を解析することにより、訓練が望まれる経路を具現化し、例えば初期過渡期以降の勝者を維持しながら敗者を抑制することで、遠方変位を回避できる場合に特徴付ける、単純で検証可能な条件である 'emph{disentanglement band} (DB) を同定する。
DBを応用し、基本目的を再設計することなく、DBを満たすために選択された更新と削除された更新のバランスを適応的に調整し、可能性のずれを軽減するプラグイン・アンド・プレイ \emph{reward calibration} (RC)を提案する。
実験結果から, RCステアリングはより不整合なダイナミックスを指向し, 様々な目標に対して下流性能を向上させることが示唆された。
私たちのコードはhttps://github.com/IceyWuu/DisentangledPreferenceOptimizationで利用可能です。
関連論文リスト
- Preference Data Selection for Mitigating the Alignment Tax in Large Language Models [52.18310687523229]
BALIGNは、アライメント効率を最適化しながら破滅的な忘れを緩和するバランスのとれたデータ選択戦略である。
3つの重要なデータ中心の機能を統一された複合リスクスコアに集約することにより、BALIGNは、ハイリスクな選好サンプルを体系的にフィルタリングする。
標準的な人間の嗜好データセットの実験では、BALIGNはアライメントゲインを損なうことなく基礎的能力を強く保持している。
論文 参考訳(メタデータ) (2026-08-25T07:58:42Z) - Unbiased Alignment for Large Language Models with Noisy Preferences [74.69408994904965]
本稿では,Unbiased Reward Model(URM)損失とUnbiased Direct Preference Optimization(UDPO)損失を導入した非バイアスアライメントの理論的枠組みを提案する。
好み雑音によって引き起こされる歪みを数学的に補正することにより、我々の新しい目的はノイズの多いデータセットから直接バイアスのないモデルトレーニングを可能にする。
論文 参考訳(メタデータ) (2026-07-03T12:04:43Z) - Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings [11.551054698858266]
4つの選好設定における逐次直接選好最適化について検討する。
シーケンシャルなDPOは単一の忘れパターンを生成しない。
メカニカル診断では、Stage2グラデーションとアダプタの更新は、すべての設定で以前の目的とほぼ直交している。
論文 参考訳(メタデータ) (2026-06-18T03:20:41Z) - DynamicPO: Dynamic Preference Optimization for Recommendation [25.125204801416587]
大規模言語モデル(LLM)ベースのレコメンデーションシステムでは、ダイレクトリコメンデーション最適化(DPO)は、リコメンデーションとユーザのリコメンデーションを効果的に整合させる。
実験により, 負のサンプル数の増加が性能劣化を引き起こすという, 直感的現象, 選好最適化の崩壊が明らかになった。
動的境界負選択とデュアルマージン動的ベータ調整という2つの適応的なメカニズムからなる軽量でプラグアンドプレイのフレームワークであるDynamicPOを提案する。
論文 参考訳(メタデータ) (2026-05-01T01:06:38Z) - ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints [26.309376587678354]
非対称制約参照最適化(ACPO)を提案する。
ACPOは動的でターゲット指向のスケーリングを好みの最適化に適用する。
本稿では,ACPOが標準DPOの選択逆劣化を効果的に逆転させることを示す。
論文 参考訳(メタデータ) (2026-03-23T16:26:11Z) - From Noisy Traces to Stable Gradients: Bias-Variance Optimized Preference Optimization for Aligning Large Reasoning Models [90.45197506653341]
大規模推論モデルは最終回答を生成する前に中間的推論トレースを生成する。
LRMと人間の好みの整合性は、モデルデプロイメントにとって重要な前提条件であり、まだ過小評価されていない。
共通の回避策は1つのサンプル軌道を最適化し、トレースサンプリングからかなり勾配のばらつきをもたらす。
論文 参考訳(メタデータ) (2025-10-06T17:58:01Z) - Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors [13.630818884973127]
タスク演算にインスパイアされた新しいフレームワークであるPreference Vectorを提案する。
単一の目的内で複数の選好を最適化する代わりに、個々の選好について別々のモデルをトレーニングし、選好ベクトルとして振る舞いシフトを抽出し、テスト時に動的にマージします。
実験の結果,提案するPreference Vectorフレームワークは,過度な保守性のない利便性の向上,好みのトレードオフのスムーズな制御,スケーラブルなマルチ参照アライメントをサポートすることがわかった。
論文 参考訳(メタデータ) (2025-04-27T12:16:51Z) - Leveraging Robust Optimization for LLM Alignment under Distribution Shifts [51.74394601039711]
人間の値に整合した出力を生成するために、大規模言語モデルを操る上で、優先順位アライメント手法はますます重要になっている。
このようなシフトに拘わらず、好みのアライメントを改善する新しい分布対応最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-08T09:14:38Z) - Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes [50.544186914115045]
大きな言語モデル(LLM)は、日々のアプリケーションにますます組み込まれています。
個人ユーザの多様な嗜好との整合性を確保することは、重要な課題となっている。
数発のステアライメントのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-18T16:14:59Z) - Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization [60.176008034221404]
直接選好最適化(DPO)とその変種は、言語モデルと人間の選好の整合にますます利用されている。
以前の研究では、トレーニング中に好まれる反応の可能性が減少する傾向が見られた。
確率変位は破滅的になりうることを示し、確率質量を好ましくない反応から反対の意味の反応へとシフトさせる。
論文 参考訳(メタデータ) (2024-10-11T14:22:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。