論文の概要: Efficient Exploration for Iterative Nash Preference Optimization
- arxiv url: http://arxiv.org/abs/2606.01382v1
- Date: Sun, 31 May 2026 18:11:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:29.675777
- Title: Efficient Exploration for Iterative Nash Preference Optimization
- Title(参考訳): イテレーティブ・ナッシュ選好最適化のための効率的な探索
- Authors: Tianlong Nan, Xiaopeng Li, Christian Kroer, Tianyi Lin,
- Abstract要約: 本稿では,SFTに基づく正規化と逆ポリシー探索を組み合わせた探索的反復的NLHFアルゴリズムを提案する。
我々は,この後悔をミニマックスオラクルへのアクセスで$O(sqrtT)$に改善できることを示し,一般的な嗜好ゲーム学習における計算統計的トレードオフを明らかにした。
- 参考スコア(独自算出の注目度): 36.20982376978038
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Preference alignment is central to improving large language models, but standard reward-based formulations can be restrictive when human preferences are cyclic, non-transitive, or otherwise not representable by a scalar reward. Nash Learning from Human Feedback (NLHF) addresses this limitation by modeling alignment as a preference game and targeting a Nash equilibrium rather than a reward maximizer. However, the learning-theoretic foundations of scalable NLHF remain limited. Existing regret guarantees rely on oracle-based methods that estimate a general preference model and solve KL-regularized minimax problems, while iterative NLHF methods directly optimize policy-level preference losses and are easier to implement but lack regret guarantees. We study online iterative NLHF under general preference models and identify exploration as the key obstacle. First, we show that standard iterative NLHF can suffer an exponential dependence on the KL-regularization parameter, revealing that implicit exploration through policy updates is insufficient for controlling regret. Second, we propose an explicitly exploratory iterative NLHF algorithm that combines SFT-based regularization with adversarial policy exploration. The resulting method retains the direct policy optimization structure of iterative NLHF, avoids explicit preference model estimation, and achieves an $O(\sqrt{T})$ regret bound without an exponential dependence on the KL-regularization parameter. We show that the regret can be improved to $O(\log(T))$ with access to a minimax oracle, clarifying the computational-statistical tradeoff in learning general preference games. Finally, we instantiate our method for LLM fine-tuning and evaluate it on \texttt{Llama-3-8B-Instruct} across multiple benchmarks, where explicit exploration yields consistent improvements over existing NLHF baselines.
- Abstract(参考訳): 優先アライメントは、大きな言語モデルの改善の中心であるが、標準的な報酬に基づく定式化は、人間の嗜好が循環的、非推移的、あるいはそれ以外はスカラー報酬によって表現できない場合に制限される。
人間のフィードバックからのナッシュラーニング (Nash Learning from Human Feedback, NLHF) は、アライメントを選好ゲームとしてモデル化し、報酬最大化よりもナッシュ均衡を目標にすることで、この制限に対処する。
しかし、スケーラブルなNLHFの学習理論の基礎は依然として限られている。
既存の後悔の保証は、一般的な嗜好モデルを推定し、KL規則化されたミニマックス問題を解くオラクルベースの方法に依存し、一方、反復的なNLHF法はポリシーレベルの選好損失を直接最適化し、実装が容易であるが、後悔の保証は欠如している。
我々は,オンライン反復的NLHFを一般的な嗜好モデルの下で研究し,探索を重要な障害とみなす。
まず,標準反復NLHFがKL規則化パラメータに指数関数的依存を負う可能性を示し,ポリシー更新による暗黙的な探索が後悔を抑えるには不十分であることを示した。
次に,SFTに基づく正規化と逆ポリシー探索を組み合わせた探索的反復的NLHFアルゴリズムを提案する。
得られた方法は、反復的NLHFの直接的なポリシー最適化構造を保持し、明示的な選好モデル推定を回避し、KL-正則化パラメータに指数的依存することなく、$O(\sqrt{T})$ regretboundを達成する。
我々は,この後悔をミニマックスオラクルへのアクセスにより$O(\log(T))$に改善できることを示し,一般的な嗜好ゲーム学習における計算統計的トレードオフを明らかにした。
最後に, LLM の微調整法をインスタンス化し, 既存の NLHF ベースラインよりも一貫した改善が得られた場合, 複数ベンチマークにわたる \texttt{Llama-3-8B-Instruct} 上で評価する。
関連論文リスト
- One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Towards Efficient Online Exploration for Reinforcement Learning with Human Feedback [12.158181906895186]
人間のフィードバックによる強化学習は、大きな言語モデルと人間の好みを整合させる中心的なパラダイムとして現れてきた。
オンラインRLHFの探索原理について検討し、報酬モデルとポリシーの両方をデータ効率のよい方法で洗練しようとする。
そこで本研究では,報酬差の不確実性を抑えるために,嗜好クエリを指示する新たな探索手法を提案する。
論文 参考訳(メタデータ) (2025-09-26T17:57:17Z) - Explicit Preference Optimization: No Need for an Implicit Reward Model [18.225409932618657]
直接選好最適化(DPO)とそのオフシュートは、個別の報酬トレーニングステップの必要性を回避する。
DPOをベースとした目的は,しかしながら,準最適正規化や反直観的アーティファクトの対象であることを示す。
論文 参考訳(メタデータ) (2025-06-09T07:11:01Z) - Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference [15.038210624870656]
リワード推論は、ヒューマンフィードバックパイプラインからの強化学習における重要な中間ステップである。
本稿では,帯域幅を超える一般RL問題と決定論的MDP帯域幅,Bradley-Terryモデルを超える一般選好モデルについて,報酬推論のない2つのRLHFアルゴリズムを開発した。
論文 参考訳(メタデータ) (2024-09-25T22:20:11Z) - Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization [78.82586283794886]
$chi2$-Preference Optimization(chi$PO)は、オーバー最適化に対して確実に堅牢なオフラインアライメントアルゴリズムである。
$chi$POは、正規化による不確実性に直面して悲観主義の原理を実装している。
$chi$POの単純さと強力な保証により、オーバー最適化に対して確実に堅牢な、実用的で汎用的なオフラインアライメントアルゴリズムとなった。
論文 参考訳(メタデータ) (2024-07-18T11:08:40Z) - Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning [55.65738319966385]
我々は、新しいオンラインアルゴリズム、反復的ナッシュポリシー最適化(INPO)を提案する。
従来の方法とは異なり、INPOは個々の応答に対する期待される勝利率を推定する必要性を回避している。
LLaMA-3-8BベースのSFTモデルで、INPOはAlpacaEval 2.0で42.6%、Arena-Hardで37.8%の勝利率を達成した。
論文 参考訳(メタデータ) (2024-06-30T08:00:34Z) - Direct Preference Optimization: Your Language Model is Secretly a Reward Model [119.65409513119963]
本稿では,RLHFにおける報酬モデルの新たなパラメータ化について紹介する。
DPO(Direct Preference Optimization)と呼ばれる結果のアルゴリズムは、安定的で、性能が高く、計算的にも軽量である。
我々の実験は、DPOが人間の好みに合わせて微調整できるだけでなく、既存の方法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-29T17:57:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。