論文の概要: LSC-DPO: Learning-Signal-Controlled Direct Preference Optimization
- arxiv url: http://arxiv.org/abs/2610.07592v1
- Date: Tue, 06 Oct 2026 01:32:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.746254
- Title: LSC-DPO: Learning-Signal-Controlled Direct Preference Optimization
- Title(参考訳): LSC-DPO:学習信号による直接参照最適化
- Abstract要約: 我々はLSC-DPO(Learning-Signal-Controlled Direct Preference Optimization)を提案する。
LSC-DPOは、DPOと強い嗜好最適化ベースラインよりも一貫して改善されている。
我々は、過渡差分を補償するために目標学習信号を調整する信号予算補償規則を導出する。
- 参考スコア(独自算出の注目度): 8.816383029383728
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Direct Preference Optimization (DPO) has become a standard reward-model-free approach for aligning language models with preference data. However, as the scaled preference margin grows during training, the logistic DPO loss becomes progressively less sensitive to further changes. We study DPO from a loss-level geometric perspective and identify the sigmoid factor as a learning signal that characterizes the local sensitivity of the objective. Based on this view, we propose Learning-Signal-Controlled Direct Preference Optimization (LSC-DPO), which dynamically regulates the learning signal near a target regime. A log-space analysis establishes conditions for stable tracking of the target learning-signal regime. Experiments on AlpacaEval 2, MT-Bench, and Anthropic-HH show that LSC-DPO consistently improves over DPO and strong preference-optimization baselines. We further find that different coefficient initializations induce distinct transient learning-signal trajectories even when their later signal levels become similar. Based on this observation, we derive a signal-budget compensation rule that adjusts the target learning signal to compensate for these transient differences. The resulting compensation substantially reduces performance variation across coefficient initializations.
- Abstract(参考訳): 直接選好最適化(DPO)は、言語モデルと嗜好データとを整合させる標準的な報奨モデルのないアプローチとなっている。
しかし、トレーニング中にスケールした嗜好マージンが増大するにつれて、ロジスティックDPO損失は、さらなる変化に対して徐々に敏感になる。
損失レベルの幾何学的視点からDPOを研究し、目的の局所感度を特徴付ける学習信号としてシグモイド因子を同定する。
そこで本研究では,目標条件近傍の学習信号を動的に制御するLSC-DPO(Learning-Signal-Controlled Direct Preference Optimization)を提案する。
対数空間解析は、目標学習信号状態の安定な追跡条件を確立する。
AlpacaEval 2, MT-Bench, Anthropic-HHの実験では, LSC-DPOはDPOと強い嗜好最適化ベースラインよりも一貫して改善されている。
さらに、異なる係数初期化は、後続の信号レベルが類似した場合でも、一過性の学習信号軌跡を導出する。
この観測に基づいて,これらの過渡差分を補償するために,目標学習信号を調整する信号予算補償規則を導出する。
結果として生じる補償は係数の初期化における性能変化を著しく減少させる。
関連論文リスト
- A Journey to the Edge of Stability [53.81268610971847]
深層学習は、最大ヘッセン固有値モデルが学習率と相反する値で安定化される「安定性の端」(EoS)でしばしば起こる。
深層学習問題を解き、深層学習率のスイープで一階最適化法を変化させる。
次に、学習軌跡の特徴量、すなわち損失、鋭さ、連続的な勾配間のアライメントを追跡する。
論文 参考訳(メタデータ) (2026-09-26T06:28:18Z) - Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning [60.83841532299041]
本稿では、強化学習後学習を行うための2レベルデータスケジューリングフレームワークであるAdaptive Data Scheduling (ADS)を提案する。
ADSは、セマンティックパターンに従ってサンプルを整理し、適応的なクラスタ間分布を維持して、現在のトレーニングの進捗を固める。
3つのLCMと7つの推論ベンチマークによる実験結果から、ADSはグループ相対ポリシー最適化よりも平均精度を5.2%向上することが示された。
論文 参考訳(メタデータ) (2026-06-21T02:19:17Z) - Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings [11.551054698858266]
4つの選好設定における逐次直接選好最適化について検討する。
シーケンシャルなDPOは単一の忘れパターンを生成しない。
メカニカル診断では、Stage2グラデーションとアダプタの更新は、すべての設定で以前の目的とほぼ直交している。
論文 参考訳(メタデータ) (2026-06-18T03:20:41Z) - Zero-Order Optimization for LLM Fine-Tuning via Learnable Direction Sampling [40.94400211806987]
摂動方向のサンプリング分布を学習可能なポリシとして扱う政策駆動型ZOフレームワークを提案する。
学習したサンプリングは、品質勾配情報を改善し、$d$の収束境界への明示的な依存を緩和することを示す。
以上の結果から,適応方向サンプリングはZOの微調整を大規模に実現する上で有望な方法であることが示唆された。
論文 参考訳(メタデータ) (2026-02-14T08:01:41Z) - What Is Preference Optimization Doing, How and Why? [73.78865043839939]
一般的な考え方は、DPOは教師付き学習であり、PPOは強化学習である。
まず、勾配に基づく更新の目標方向を調べ、DPOが安定した目標に従うのに対し、PPOは探索とエクスプロイトのバランスをとる動的目標に従う。
第2に、PO法における3つの重要な要素である正の学習、負の学習、損失再重み付けの役割について検討する。
論文 参考訳(メタデータ) (2025-11-30T08:27:59Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - Robust LLM Alignment via Distributionally Robust Direct Preference Optimization [17.365569075274543]
大規模言語モデル(LLM)と人間の好みを一致させる上での大きな課題は、分散シフトの問題である。
We developed two novel distributionally robust direct preference optimization (DPO) algorithm、すなわち Wasserstein DPO (WDPO) and Kullback-Leibler DPO (KLDPO)。
WDPO と KLDPO が優先分布シフトの際のアライメントを大幅に改善する上で,優れた性能を示す。
論文 参考訳(メタデータ) (2025-02-04T02:03:19Z) - Uncertainty-Penalized Direct Preference Optimization [52.387088396044206]
我々は、優先不確実性ペナル化スキームを導入し、DPOの悲観的な枠組みを開発する。
ペナル化は、不確実なサンプルの損失勾配を減衰させる損失の補正として機能する。
我々は,バニラDPOと比較して全体的な性能が向上し,高い不確実性選択/拒絶反応によるプロンプトの完成度も向上した。
論文 参考訳(メタデータ) (2024-10-26T14:24:37Z) - Geometric-Averaged Preference Optimization for Soft Preference Labels [78.2746007085333]
LLMを人間の嗜好と整合させる多くのアルゴリズムは、人間の嗜好は二進的かつ決定論的であると仮定する。
本研究では,分散ソフトな選好ラベルを導入し,損失関数におけるLLM出力確率の重み付き幾何平均を用いて直接選好最適化(DPO)を改善する。
論文 参考訳(メタデータ) (2024-09-10T17:54:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。