論文の概要: Exposure-Based Reinforcement Learning to Rank
- arxiv url: http://arxiv.org/abs/2607.18689v1
- Date: Tue, 21 Jul 2026 04:11:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.305955
- Title: Exposure-Based Reinforcement Learning to Rank
- Title(参考訳): 被曝型強化学習のランク化
- Abstract要約: 強化学習法(Reinforcement Learning, RL)は、例えば、精度や累積ゲインから公正な露光、蒸留のランク付けまで、あらゆるランク付け目標を(ほぼ)最適化することができる。
既存の手法は、カスタム勾配アルゴリズムによって計算効率に達するが、実装は非常に複雑であり、しばしば自動微分と衝突する。
- 参考スコア(独自算出の注目度): 28.688480043859894
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) methods for learning-to-rank (LTR) can optimize (almost) any ranking goal, e.g., from precision or discounted cumulative gain to fairness-of-exposure or ranking distillation. However, standard RL is ineffective and computationally costly due to the enormous action space in LTR settings. Existing methods reach computational efficiency through custom gradient computation algorithms, but they are very complex to implement and often clash with auto-differentiation. Consequently, existing RL for LTR is not attractive to many practitioners. We reconsider RL for LTR while actively avoiding reliance on custom gradients. Contrary to the existing approaches, we focus on variance reduction and GPU computation. In doing so, we discover that high sample-efficiency can be reached through baseline corrections and partial marginalization. Furthermore, we propose an abstraction that places gradient estimation behind a document-exposure distribution, this enables seamless plug-and-play integration with auto-differentiation. Thereby, one only has to implement a loss as a differentiable function of exposure and RL for LTR can optimize it using auto-differentiation. Our experimental results reveal that our new exposure-based RL for LTR approach converges considerably faster and at significantly higher ranking performance than existing custom gradients, with no additional costs in computation time when using GPUs. In contrast, existing custom gradients result in severe stability issues when converging over many epochs, which never occur for our methods. Thus, we considerably improve RL for LTR methodology by increasing its effectiveness, efficiency, and ease of application.
- Abstract(参考訳): ラーニング・トゥ・ランク(LTR)のための強化学習(Reinforcement Learning, RL)法は、例えば、精度や累積ゲインからフェアネス・オブ・エクスポージャー(Fairness-of-Exposure)、またはランキング蒸留まで、あらゆるランクゴールを(ほぼ)最適化することができる。
しかし、標準RLはLTR設定の巨大なアクション空間のため、非効率で計算コストがかかる。
既存の手法は、カスタム勾配計算アルゴリズムによって計算効率に達するが、実装は非常に複雑であり、しばしば自動微分と衝突する。
したがって、既存のLTR用RLは、多くの実践者にとって魅力的ではない。
我々は、カスタム勾配への依存を積極的に回避しつつ、LTRに対するRLを再考する。
既存のアプローチとは対照的に、分散削減とGPU計算に重点を置いている。
そこで本研究では,ベースライン補正と部分的辺縁化により,高い試料効率を達成できることを見出した。
さらに,文書露出分布の後方に勾配推定を配置し,自動微分によるシームレスなプラグ・アンド・プレイ統合を実現する抽象化を提案する。
これにより、露光の微分可能な関数として損失を実装し、LTR用のRLは自動微分を用いてそれを最適化できる。
実験の結果,新しい露光ベースのLL for LTRアプローチは,GPUを用いた場合の計算時間に要するコストを伴わず,既存のカスタム勾配よりもはるかに高速で,格付け性能が高いことがわかった。
対照的に、既存のカスタム勾配は、我々の手法では決して起こらない多くのエポックに収束する際の深刻な安定性の問題をもたらす。
そこで本研究では,LTR法の有効性,効率,適用容易性を向上させることにより,LTR法におけるRLを大幅に改善する。
関連論文リスト
- Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models? [30.438505697106496]
ほとんどの研究は、RLをフルデノナイジング軌道に適用し、計算的にコストがかかり、選好アライメントが弱まる。
計算コストを低減しつつ生成品質を向上させるRL拡張プラグインであるAdaScopeを提案する。
最先端の手法と比較して、AdaScopeは計算コストを59%削減しながら、パフォーマンスを66%向上させる。
論文 参考訳(メタデータ) (2026-05-15T11:14:13Z) - $\
abla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space [71.23672814629448]
$nabla$-Reasonerは、トークンログに対する差別化可能な最適化をデコードループに統合する反復生成フレームワークである。
$nabla$-Reasonerは、挑戦的な数学的推論ベンチマークで20%以上の精度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-05T08:42:54Z) - Lotus: Efficient LLM Training by Randomized Low-Rank Gradient Projection with Adaptive Subspace Switching [0.5390933335965427]
GaLoreは、低ランクのサブスペースで勾配を更新することで、メモリ効率のトレーニングを可能にする。
勾配上のSingular Value Decomposition(SVD)プロセスにより、同等のトレーニング時間コストが発生する。
提案するLotusは,投影過程を単純に修正することで,このトレードオフを解決する手法である。
論文 参考訳(メタデータ) (2026-02-01T13:48:00Z) - Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle [65.14124923451077]
強化学習(Reinforcement Learning, RL)は、マルチモーダル大言語モデル(MLLM)の推論能力を高めるための効果的なポストトレーニングパラダイムとして登場した。
しかしながら、現在のRLパイプラインは、アドバンテージ・コラプシング(Advantage Collapsing)とロールアウト・サイレンシング(Rollout Silencing)という2つの未解決の問題によって、トレーニングの非効率に悩まされることが多い。
軌道サンプリングとバッチ合成を動的に再構成することにより、RLの微調整効率を向上する、シンプルだが原則化されたフレームワークであるShuffle-R1を提案する。
論文 参考訳(メタデータ) (2025-08-07T17:53:47Z) - Effective Reinforcement Learning for Reasoning in Language Models [30.994610715391776]
強化学習(Reinforcement Learning, RL)は、数学やコーディングといった分野における言語モデル(LM)の推論能力を改善するための有望な戦略として登場した。
我々は,計算制約による比較的小さなモデルに焦点をあて,LM推論のためのRLアルゴリズム設計決定を解析する。
その結果, (i) オンラインRLは, 教師付き微調整(SFT)よりも優れ, (ii) PPOをベースとしたオフポリチクスの更新により, ばらつきを抑えて精度が向上し, (iii) KLのばらつきの除去により, より簡潔な世代と精度が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-22T18:48:09Z) - Efficient Differentiable Approximation of Generalized Low-rank Regularization [64.73416824444328]
低ランク正規化(LRR)は様々な機械学習タスクに広く応用されている。
本稿では,LRRの効率的な微分可能近似を提案する。
論文 参考訳(メタデータ) (2025-05-21T11:49:17Z) - Efficient Diffusion as Low Light Enhancer [63.789138528062225]
RATR(Reflectance-Aware Trajectory Refinement)は、イメージの反射成分を用いて教師の軌跡を洗練するための、シンプルで効果的なモジュールである。
textbfReDDiT (textbfDistilled textbfTrajectory) は低照度画像強調(LLIE)に適した効率的で柔軟な蒸留フレームワークである。
論文 参考訳(メタデータ) (2024-10-16T08:07:18Z) - Estimating the Hessian Matrix of Ranking Objectives for Stochastic Learning to Rank with Gradient Boosted Trees [63.18324983384337]
グラディエントブースト決定木(GBDT)のランク付け手法について紹介する。
我々の主な貢献は、二階微分、すなわちヘッセン行列に対する新しい推定器である。
推定器を既存のPL-Rankフレームワークに組み込む。
論文 参考訳(メタデータ) (2024-04-18T13:53:32Z) - The Virtues of Pessimism in Inverse Reinforcement Learning [38.98656220917943]
逆強化学習(Inverse Reinforcement Learning)は、専門家によるデモンストレーションから複雑な振る舞いを学ぶための強力なフレームワークである。
内ループRLにおける専門家のデモンストレーションを活用することにより、探査負担を軽減することが望ましい。
我々は、IRLにおけるRLの高速化のための代替アプローチとして、Emphpessimism、すなわち、オフラインのRLアルゴリズムを用いてインスタンス化された専門家のデータ分布に近づき続けることを考える。
論文 参考訳(メタデータ) (2024-02-04T21:22:29Z) - Dual RL: Unification and New Methods for Reinforcement and Imitation
Learning [26.59374102005998]
我々はまず,共有構造を持つ2つのRLアプローチのインスタンスとして,最先端のオフラインRLとオフライン模倣学習(IL)アルゴリズムをいくつか導入した。
本稿では、任意のオフポリシーデータから模倣を学習し、ほぼ専門的な性能を得る新しい差別化手法であるReCOILを提案する。
オフラインRLでは、最近のオフラインRLメソッドXQLをデュアルフレームワークにフレーム化し、Gumbel回帰損失に対して代替的な選択肢を提供する新しい方法f-DVLを提案する。
論文 参考訳(メタデータ) (2023-02-16T20:10:06Z) - Learning to Optimize for Reinforcement Learning [58.01132862590378]
強化学習(Reinforcement Learning, RL)は、教師付き学習とは本質的に異なり、実際、これらの学習は単純なRLタスクでもうまく機能しない。
エージェント勾配分布は非独立で同一分布であり、非効率なメタトレーニングをもたらす。
おもちゃのタスクでしか訓練されていないが、我々の学習はブラックスの目に見えない複雑なタスクを一般化できることを示した。
論文 参考訳(メタデータ) (2023-02-03T00:11:02Z) - Accelerated Convergence for Counterfactual Learning to Rank [65.63997193915257]
IPS重み付き勾配を持つSGD手法の収束速度は、IPS重みによる大きなばらつきに悩まされることを示す。
本稿では,従来のIPS重み付け勾配降下法よりも優れた収束性を有する新しい学習アルゴリズムであるCounterSampleを提案する。
我々は、CounterSampleがより早く収束し、理論的な結果と経験的な結果とを補完することを証明する。
論文 参考訳(メタデータ) (2020-05-21T12:53:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。