論文の概要: Long-Term Optimization for Large-Scale Generative Retrieval with Off-Policy REINFORCE
- arxiv url: http://arxiv.org/abs/2607.02818v1
- Date: Thu, 02 Jul 2026 23:13:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 13:24:59.645318
- Title: Long-Term Optimization for Large-Scale Generative Retrieval with Off-Policy REINFORCE
- Title(参考訳): オフポリティReINFORCEを用いた大規模生成検索の長期最適化
- Abstract要約: セッションレベルのシーケンシャルな意思決定問題としてレコメンデーションを定式化する。
本稿では、事前収集データに基づいて、外部のREINFORCEを用いて生成検索者を訓練するための自己回帰的アプローチを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative retrieval has become a popular paradigm for large-scale recommendation. However, it is typically trained with supervised next-item prediction objectives that do not directly optimize long-term user satisfaction. In this work, we formulate recommendation as a session-level sequential decision-making problem and introduce an autoregressive approach for training generative retrievers with off-policy REINFORCE on pre-collected data. Unlike the one-step off-policy correction used in prior work, we propose a multi-step approximation of importance weights enabled by the autoregressive formulation. To support offline evaluation, we train a user feedback model that simulates user responses to generated recommendations. This lets us adapt doubly robust off-policy evaluation for sequential decision-making to recommendation, a setting that has received limited attention. We further introduce a feedback-model-based test-time scaling procedure that simulates future responses and selects recommendations with the highest predicted long-term returns. Experiments on the public large-scale Yambda-5B dataset show that our RL agent improves offline estimates of cumulative session reward over next-item and next-positive prediction baselines, while largely preserving retrieval quality. Moreover, allocating more inference-time compute to simulating future responses improves model-based long-term return estimates without updating the policy.
- Abstract(参考訳): 生成的検索は大規模レコメンデーションの一般的なパラダイムとなっている。
しかし、一般的には、長期ユーザー満足度を直接最適化しない、監督された次のイテム予測目標で訓練される。
本研究では,セッションレベルの逐次意思決定問題として推奨事項を定式化するとともに,事前収集データに基づいて,外部のREINFORCEを用いて生成検索者を訓練するための自己回帰的アプローチを導入する。
先行研究で用いられる一段階のオフポリシー補正とは異なり, 自己回帰的定式化による重み付けの多段階近似を提案する。
オフライン評価を支援するために,ユーザからのレコメンデーションに対するユーザの反応をシミュレートするユーザフィードバックモデルを訓練する。
これにより、連続的な意思決定のために、二重に堅牢な非政治評価をレコメンデーションに適用できます。
さらに、将来の応答をシミュレートするフィードバックモデルに基づくテストタイムスケーリング手順を導入し、予測される最も高い長期的なリターンでレコメンデーションを選択する。
大規模なYammbda-5Bデータセットを用いた実験により,RLエージェントは,検索品質をほぼ保ちながら,次点および次点の予測基準よりも累積セッション報酬のオフライン推定を改善することが示された。
さらに、将来の応答をシミュレートするために、より推論時間の計算を割り当てることにより、ポリシーを更新することなく、モデルベースの長期的なリターン推定を改善する。
関連論文リスト
- Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving [54.46325690390831]
本稿では,事前学習したE2E運転エージェントのロバスト性と安全性を高めるための汎用フレームワークとして,モデルベースポリシー適応(MPA)を提案する。
MPAは、ジオメトリ一貫性のあるシミュレーションエンジンを用いて、まず様々な対物軌道を生成する。
MPAは拡散ベースのポリシーアダプタを訓練し、基本方針の予測を洗練させ、Q値モデルを多段階に分けて長期的な結果を評価する。
論文 参考訳(メタデータ) (2025-11-26T17:01:41Z) - Reinforcement Learning for Durable Algorithmic Recourse [49.54997446851335]
提案手法は,提案手法を用いて,候補集団が推薦に応じてどのように適応するかを明示的にモデル化する。
また、環境の進化的ダイナミクスをキャプチャするRLベースのリコースアルゴリズムも導入する。
論文 参考訳(メタデータ) (2025-09-26T09:24:12Z) - Churn-Aware Recommendation Planning under Aggregated Preference Feedback [6.261444979025644]
本稿では,近年の規制と技術の変化を動機とした逐次的意思決定問題について考察する。
我々はRec-APCモデルを導入し、匿名ユーザを既知の先行ユーザ型から抽出する。
最適ポリシが有限時間で純粋な利用に収束することを証明し、それらを効率的に計算するための分岐とバウンドのアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-07-06T19:22:47Z) - What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context [56.590259941275434]
RecPOは、シーケンシャルなレコメンデーションのための優先順位最適化フレームワークである。
これは、推定された嗜好階層と時間信号に基づいて適応的な報酬マージンを利用する。
タイムリーな満足感、コヒーレントな嗜好の維持、変化する状況下での識別の行使など、人間の意思決定の重要な特徴を反映している。
論文 参考訳(メタデータ) (2025-06-02T21:09:29Z) - CSRec: Rethinking Sequential Recommendation from A Causal Perspective [25.69446083970207]
シーケンシャルなレコメンデータシステム(RecSys)の本質は、ユーザが意思決定を行う方法を理解することです。
我々は、CSRec(Causal Sequential Recommendation)と呼ばれる、シーケンシャルレコメンデーションの新しい定式化を提案する。
CSRecは、シーケンシャルなコンテキスト内で推奨項目が受け入れられる確率を予測し、現在の決定がどのようになされるかをバックトラックすることを目的としている。
論文 参考訳(メタデータ) (2024-08-23T23:19:14Z) - Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment [104.18002641195442]
既存のペアデータを必要としない、効果的でスケーラブルなトレーニングパラダイムである自己拡張型優先度最適化(SAPO)を導入する。
負の反応を自律的に生成するセルフプレイの概念に基づいて、我々はさらに、データ探索とエクスプロイトを強化するために、非政治的な学習パイプラインを組み込む。
論文 参考訳(メタデータ) (2024-05-31T14:21:04Z) - Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation [46.61909578101735]
AdvPO(Adversarial Policy Optimization)は、人間からの強化学習における報酬過度最適化の問題に対する新しい解決策である。
本稿では,報酬モデルの最後の層埋め込みにのみ依存して,報酬の不確実性を定量化する軽量な手法を提案する。
論文 参考訳(メタデータ) (2024-03-08T09:20:12Z) - AURO: Reinforcement Learning for Adaptive User Retention Optimization in Recommender Systems [25.18963930580529]
強化学習(Reinforcement Learning, RL)は、レコメンデーションシステムにおけるユーザ保持の最適化能力に注目が集まっている。
本稿では,この課題に対処するため,textbfAdaptive textbfUser textbfRetention textbfOptimization (AURO) という新しいアプローチを提案する。
論文 参考訳(メタデータ) (2023-10-06T02:45:21Z) - Online Statistical Inference for Contextual Bandits via Stochastic
Gradient Descent [10.108468796986074]
意思決定の文脈的包括的枠組みにおけるモデルパラメータのオンライン統計的推測について検討する。
本稿では,重み付き勾配勾配による決定規則の更新が可能な,オンラインおよび適応型データ収集環境のための汎用フレームワークを提案する。
論文 参考訳(メタデータ) (2022-12-30T18:57:08Z) - Improving Long-Term Metrics in Recommendation Systems using
Short-Horizon Offline RL [56.20835219296896]
セッションベースのレコメンデーションシナリオについて検討し、シーケンシャルなインタラクションの間、ユーザに対してアイテムを推薦し、長期的なユーティリティを改善する。
我々は、セッション間のポリシーによる分散シフトを近似するショートホライズンポリシー改善(SHPI)と呼ばれる新しいバッチRLアルゴリズムを開発した。
論文 参考訳(メタデータ) (2021-06-01T15:58:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。