論文の概要: Objective Shaping with Hard Negatives: Windowed Partial AUC Optimization for RL-based LLM Recommenders
- arxiv url: http://arxiv.org/abs/2604.22504v1
- Date: Fri, 24 Apr 2026 12:31:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-27 15:36:26.454802
- Title: Objective Shaping with Hard Negatives: Windowed Partial AUC Optimization for RL-based LLM Recommenders
- Title(参考訳): ハードネガティティブな形状:RL型LLMレコメンダの窓部分AUC最適化
- Abstract要約: ビームサーチの負のトレーニングは、ランダムな負のトレーニングよりも一貫して優れている。
ここでは,ウィンドウに偽陽性率(FPR)を制約し,Top-K$メトリクスとより直接整合させるウィンドウ付き部分AUC(WPAUC)を紹介する。
4つの実世界のデータセットの実験は、理論を検証し、一貫した最先端のパフォーマンスを提供する。
- 参考スコア(独自算出の注目度): 74.55181072260713
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Reinforcement learning (RL) effectively optimizes Large Language Model (LLM)-based recommenders by contrasting positive and negative items. Empirically, training with beam-search negatives consistently outperforms random negatives, yet the mechanism is not well understood. We address this gap by analyzing the induced optimization objective and show that: (i) Under binary reward feedback, optimizing LLM recommenders with Group Relative Policy Optimization (GRPO) is theoretically equivalent to maximizing the Area Under the ROC Curve (AUC), which is often misaligned with Top-$K$ recommendation; and (ii) Replacing random negatives with beam-search negatives reshapes the objective toward partial AUC, improving alignment with Top-$K$ metrics. Motivated by this perspective, we introduce Windowed Partial AUC (WPAUC), which constrains the false positive rate (FPR) to a window [$α,α+d$] to more directly align with Top-$K$ metrics. We further propose an efficient Threshold-Adjusted Windowed reweighting (TAWin) RL method for its optimization, enabling explicit control over the targeted Top-$K$ performance. Experiments on four real-world datasets validate the theory and deliver consistent state-of-the-art performance.
- Abstract(参考訳): 強化学習(RL)は,肯定的,否定的な項目を対比することにより,Large Language Model(LLM)ベースのレコメンデータを効果的に最適化する。
経験的に、ビームサーチの負のトレーニングはランダムな負よりも一貫して優れているが、そのメカニズムはよく理解されていない。
誘導最適化の目的を解析して、このギャップに対処する。
(i)二進的報酬フィードバックの下では、グループ相対政策最適化(GRPO)によるLLM勧告を最適化することは理論上はROC曲線(AUC)の下でのエリアの最大化と等価であり、しばしばトップ・ドル・レコメンデーションと不一致である。
(II)ビームサーチ陰性によるランダムな負の置き換えは、部分的なAUCに対する目的に反し、Top-K$メトリクスとの整合性を改善する。
この観点から、FPR(False positive rate)をウィンドウ[$α,α+d$]に制約し、Top-$K$メトリクスとより直接整合するウィンドウ部分AUC(WPAUC)を導入する。
さらに,最適化のためのThreshold-Adjusted Windowed Reweighting (TAWin) RL法を提案する。
4つの実世界のデータセットの実験は、理論を検証し、一貫した最先端のパフォーマンスを提供する。
関連論文リスト
- RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts [84.20747697259326]
グループ相対政策最適化(GRPO)は、検証可能なフィードバックからの強化学習において大きな効果を示している。
我々は,直接正当性に基づく優位性構築を参照相対的比較に置き換えることでGRPOを一般化するtextbfReference-Relative Policy Optimization (RRPO)を提案する。
我々は,タスクベーストラス検証に頼らずに,ポリシー最適化全体を通じてアンカーベースのコントラスト的優位性を用いてRRPOを評価する。
論文 参考訳(メタデータ) (2026-07-20T19:40:25Z) - Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation [13.272542054938258]
非効率な勾配でトレーニングバッチの割合を定量化する最初の指標であるAdvantage Collapse Rate (ACR)を導入する。
次に、仮想報酬サンプルを注入するGRPOの軽量拡張であるAdaptive Virtual Sample Policy Optimization (AVSPO)を提案する。
AVSPOはGRPOに対して58~63%の利害崩壊を減少させ、すべてのモデルスケールで4~6ポイントの一貫した精度向上をもたらす。
論文 参考訳(メタデータ) (2026-05-20T12:57:37Z) - LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models [34.349722314481824]
グループ相対政策最適化は、明示的な価値批判を先導する効果で評価されている。
群平均のようなモノリシックな統計ベースラインへの依存は、軌道空間の相対トポロジーを1つのスカラーに分解する。
我々は、この情報理論のボトルネックに対処する新しいフレームワークLambda Policy Optimization(LambdaPO)を紹介します。
論文 参考訳(メタデータ) (2026-05-19T06:10:24Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - On Negative-aware Preference Optimization for Recommendation [10.082739500992545]
LLMに基づくリコメンデーションにおいて、優先最適化のための拡張されたフレームワークであるNAPOを提案する。
NAPO は,(1) 負のサンプルのプールをメモリオーバーヘッドを伴わずに拡張する in-batch 負の共有,(2) 負のサンプルの信頼度に基づいてモデル更新を適応する dynamic reward margin adjust という2つの重要なイノベーションを導入している。
論文 参考訳(メタデータ) (2025-08-13T09:37:07Z) - Accelerating RL for LLM Reasoning with Optimal Advantage Regression [52.0792918455501]
本稿では,最適優位関数を直接近似する新しい2段階ポリシー最適化フレームワークを提案する。
A$*-POは、幅広い数学的推論ベンチマークで競合性能を達成する。
PPO、GRPO、REBELと比較して、トレーニング時間を最大2$times$、ピークメモリ使用率を30%以上削減する。
論文 参考訳(メタデータ) (2025-05-27T03:58:50Z) - Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts [17.243429150450886]
応答集合全体の最適化のために,$textbfMulti-Preference Optimization (MPO)を提案する。
MPOは偏差に基づく重み付けを採用しており、平均的な報酬から最も逸脱する外れ値の応答を強調している。
理論的には、MPOはクエリ毎のレスポンス数に対して$mathcalOleft(frac1sqrtnright)$でアライメントバイアスを低減する。
論文 参考訳(メタデータ) (2024-12-05T21:50:22Z) - Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer [52.09480867526656]
人間の嗜好を学習する際の分布変化と不確実性の一形態として,不一致の原因を同定する。
過度な最適化を緩和するために、まず、逆選択された報酬モデルに最適なポリシーを選択する理論アルゴリズムを提案する。
報奨モデルとそれに対応する最適ポリシーの等価性を用いて、優先最適化損失と教師付き学習損失を組み合わせた単純な目的を特徴とする。
論文 参考訳(メタデータ) (2024-05-26T05:38:50Z) - $i$REPO: $i$mplicit Reward Pairwise Difference based Empirical Preference Optimization [12.266207199002604]
大規模言語モデル(LLM)は、人間の期待から外れた出力を生成することがある。
経験的選好最適化に暗黙的逆差分回帰を利用する,$i$REPO という新しいフレームワークを提案する。
i$REPOは, ソフトラベル, 自己生成応答, 経験的AIアノテータのロジットを用いて, 効果的に自己アライメントを実現することを示す。
論文 参考訳(メタデータ) (2024-05-24T05:42:11Z) - Lower-Left Partial AUC: An Effective and Efficient Optimization Metric
for Recommendation [52.45394284415614]
我々は,AUCのように計算効率が良く,Top-Kランキングの指標と強く相関する新しい最適化指標であるLLPAUCを提案する。
LLPAUCはローワーレフト角のROC曲線の下の部分領域のみを考慮し、最適化はトップKに焦点をあてる。
論文 参考訳(メタデータ) (2024-02-29T13:58:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。