論文の概要: Distributionally Robust Listwise Preference Optimization
- arxiv url: http://arxiv.org/abs/2607.01715v1
- Date: Thu, 02 Jul 2026 05:12:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.68166
- Title: Distributionally Robust Listwise Preference Optimization
- Title(参考訳): 分布ロバストなリストワイズ選好最適化
- Abstract要約: ランキングラベルの不確実性の下で、リストワイズ選好の最適化について検討する。
本稿では,候補リスト上のランキングラベル条件を直接的確に定式化する,ポイントワイド全変量ロバストなPackett--Luce目標を提案する。
実験により,提案したロバスト補正はクリーンラベル下での性能を保ち,ノイズ下でのロバスト性を向上させることが示された。
- 参考スコア(独自算出の注目度): 47.053005334474896
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing robust preference optimization for language-model alignment mainly studies pairwise supervision and places robustness at the dataset, prompt, or preference-pair level. We instead study listwise preference optimization under ranking-label uncertainty: given a prompt and a candidate list, the observed ranking over that list may be ambiguous due to annotator inconsistency, near-ties, lossy rankwise feedback, or reward-model noise. We propose a pointwise total-variation robust Plackett--Luce objective that directly robustifies the ranking label conditional on the candidate list. The robust loss admits an exact decomposition into the nominal PL loss plus a worst-case PL correction, and the worst-case ranking is obtained by sorting current implicit scores in ascending order, reducing the inner maximization from $K!$ enumeration to $O(K\log K)$. This tractable structure yields strong offline and online optimization guarantees. In the offline fixed-list setting, the robust objective is convex and projected stochastic subgradient reaches global $ε$-suboptimality with $O(ε^{-2})$ sample complexity. In the online policy-induced setting, where candidate lists are generated by the current policy, we establish weak convexity and $\widetilde O(ε^{-2})$ Moreau-envelope stationarity. Experiments in offline LLM alignment show that the proposed robust correction largely preserves performance under clean labels and improves robustness under noise. In online alignment, it makes reward-model-ranked candidate expansion more reliable and improves both reward-model and external GPT-4 judge metrics.
- Abstract(参考訳): 既存の言語モデルアライメントのためのロバストな選好最適化は、主にペアの監督を研究し、データセット、プロンプト、または選好ペアレベルでロバストさを配置する。
プロンプトと候補リストが与えられた場合、そのリスト上の観測されたランクは、アノテーションの不整合、近縁性、損失のあるランクのフィードバック、報酬モデルノイズのために曖昧である可能性がある。
本稿では,候補リスト上のランキングラベル条件を直接的確に定式化する,ポイントワイド全変量ロバストなPlackett--Luce目標を提案する。
このロバストな損失は、名目PL損失と最悪のPL補正の正確な分解を認め、その最悪ケースランキングは、現在の暗黙のスコアを上昇順にソートして、内部最大化をK!
$ enumeration to $O(K\log K)$.
この抽出可能な構造は、強いオフラインとオンラインの最適化を保証する。
オフラインの固定リスト設定では、ロバストな目的は凸であり、射影確率次数は大域的に$ε$-suboptimality に達し、$O(ε^{-2})$サンプル複雑性となる。
現在の政策によって候補リストが生成されるオンライン政策誘導設定では、弱い凸性と$\widetilde O(ε^{-2})$ Moreau-envelope固定性を確立する。
オフラインLLMアライメント実験により、提案したロバスト補正はクリーンラベル下での性能を保ち、ノイズ下でのロバスト性を向上させることが示された。
オンラインアライメントにおいては、報酬モデルランクの候補拡張をより信頼性が高くし、報酬モデルと外部GPT-4判定基準の両方を改善している。
関連論文リスト
- Position Bias Undermines Preference Consistency in Listwise LLM-Based Reranking [2.5827686695037335]
位置バイアスがLLMによるリランカーのランク付けプロセスにどのように影響するかを検討する。
本稿では、ペアワイズな選好不安定性、グローバルな選好不整合性、リストワイズな出力整合性を測定する評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-04T04:04:12Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization [20.259122922188126]
大規模言語モデル(LLM)は、入力要素の配列順序に影響される順序バイアスに悩まされる。
textbfDGAOはモデル精度と順序安定性を同時に向上することを目的としている。
論文 参考訳(メタデータ) (2026-05-12T11:31:18Z) - Talos: Optimizing Top-$K$ Accuracy in Recommender Systems [14.229918568280729]
本稿では,Talosレコメンデーションの精度を最適化するために特別に設計された損失関数であるTalosを提案する。
我々は,効率的なしきい値推定のためのサンプリングベース回帰アルゴリズムを開発した。
我々は不連続性に対処し、分布シフトに対する堅牢性を高めるために、調整された代理関数を組み込んだ。
論文 参考訳(メタデータ) (2026-01-27T07:04:09Z) - RLPO: Residual Listwise Preference Optimization for Long-Context Review Ranking [50.709454968853954]
ポイントワイドスコアは効率的だが、しばしばリストレベルの相互作用を考慮に入れない。
リストワイズアプローチはグローバルなコンテキストを活用することができるが、計算コストが高く、候補リストが大きくなるにつれて不安定になる。
本稿では,リストワイズ表現レベルの残差補正としてランク付けするResidual Listwise Preference Optimization (RLPO)を提案する。
論文 参考訳(メタデータ) (2026-01-12T11:45:19Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization [78.82586283794886]
$chi2$-Preference Optimization(chi$PO)は、オーバー最適化に対して確実に堅牢なオフラインアライメントアルゴリズムである。
$chi$POは、正規化による不確実性に直面して悲観主義の原理を実装している。
$chi$POの単純さと強力な保証により、オーバー最適化に対して確実に堅牢な、実用的で汎用的なオフラインアライメントアルゴリズムとなった。
論文 参考訳(メタデータ) (2024-07-18T11:08:40Z) - Optimizing Partial Area Under the Top-k Curve: Theory and Practice [151.5072746015253]
トップk曲線下部分領域(AUTKC)と呼ばれる新しい計量法を開発した。
AUTKCはより優れた識別能力を持ち、ベイズ最適スコア関数は条件付き確率に対して正しいトップKランクを与えることができる。
提案手法を最適化するために,実証的なサロゲートリスク最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2022-09-03T11:09:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。