論文の概要: Efficient Offline Learning of Ranking Policies via Top-$k$ Policy Decomposition
- arxiv url: http://arxiv.org/abs/2609.36740v1
- Date: Tue, 29 Sep 2026 05:12:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.204679
- Title: Efficient Offline Learning of Ranking Policies via Top-$k$ Policy Decomposition
- Title(参考訳): トップ$k政策分割によるランク付け政策の効率的なオフライン学習
- Abstract要約: 我々は、R-POD(Top-k$ Policy Decomposition)によるランク付けポリシー最適化(Roping Policy Optimization)という新しいOPL手法を提案する。
R-PODはランキングポリシーを、上位$$アクションを選択するための第1ステージポリシーと、上位$アクションが与えられた下位アクションを選択するための第2ステージポリシーに分解する。
新しい政策勾配推定器と回帰に基づくアプローチで第2段階の政策を学習する。
- 参考スコア(独自算出の注目度): 18.238122092105748
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many recommender systems such as for e-commerce and news platforms aim to provide users with rankings they are likely to interact with. Off-Policy Learning (OPL) of ranking policies enables us to learn new ranking policies using only historical logged data. However, ranking settings make OPL remarkably challenging because their action spaces consist of permutations of unique items, being extremely large. Existing methods primarily use either policy- or regression-based approaches. The policy-based approach, which typically uses importance-weighted policy gradients, can suffer from high variance due to large action spaces. The regression-based approach, on the other hand, estimates the expected reward using conventional machine learning methods, avoiding variance issues but potentially suffering from severe bias. To circumvent these issues of existing methods, we propose a new OPL method for ranking, named Ranking Policy Optimization via Top-$k$ Policy Decomposition (R-POD), which combines the policy- and regression-based approaches in an effective fashion. Specifically, R-POD decomposes a ranking policy into a first-stage policy for selecting top-$k$ actions and a second-stage policy for choosing the bottom actions given the top-$k$ actions. It learns the first-stage policy using a new policy gradient estimator and the second-stage policy via the regression-based approach. This method can substantially reduce variance, since it applies importance weighting only to the top-$k$ actions. We also demonstrate that our policy-gradient estimator for the first-stage policy is unbiased under a conditional pairwise correctness condition, which only requires that the expected reward differences of pairs of rankings sharing the same top-$k$ actions can be estimated correctly.
- Abstract(参考訳): eコマースやニュースプラットフォームなどのレコメンデーションシステムの多くは、ユーザと対話する可能性のあるランキングを提供することを目指している。
ランキングポリシのオフライン学習(OPL)により,過去のログデータのみを用いて新たなランキングポリシを学習することができる。
しかし、OPLのアクション空間はユニークなアイテムの順列で構成されており、非常に大きいため、ランキング設定は極めて困難である。
既存のメソッドは主にポリシーベースのアプローチまたは回帰ベースのアプローチを使用する。
政策に基づくアプローチは、一般的に重み付けされた政策勾配を使用するが、大きなアクション空間のために高い分散に悩まされる。
一方、回帰に基づくアプローチでは、従来の機械学習手法を用いて予測される報酬を推定し、分散問題を回避するが、深刻なバイアスに悩まされる可能性がある。
既存の手法のこれらの問題を回避するため,政策と回帰に基づくアプローチを効果的に組み合わせた,R-POD (Top-k$ Policy Decomposition) によるランク付け政策最適化手法を提案する。
具体的には、R-PODはランキングポリシーを、上位$$アクションを選択するための第1段階ポリシーと、上位$アクションを与えられた下位アクションを選択するための第2段階ポリシーに分解する。
新しい政策勾配推定器と回帰に基づくアプローチで第2段階の政策を学習する。
この方法は、最上位のk$アクションのみに重み付けを施すため、かなり分散を減らすことができる。
また, 条件付きペアワイドの正当性条件下では, 政策の段階的評価が不偏であることを実証し, 同じ上位k$の行動を共有するランクのペアの報奨差を正確に推定することのみを要求した。
関連論文リスト
- Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies [17.672063433232196]
オフ・ポリティ・アセスメント(OPE)は、ランキングシステムにおいて重要な実践的問題である。
目標は、異なるログポリシの下で収集されたオフラインデータのみを使用して、新たなランキングポリシのパフォーマンスを見積もることである。
本稿では,この課題に対処するために,ユーザクリック動作の本質性を活かしたClick-based Inverse Propensity Score (CIPS) を提案する。
論文 参考訳(メタデータ) (2026-03-23T02:13:39Z) - Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning [52.97053840476386]
我々は、よく設計された行動ポリシーを用いて、分散リターン推定を確実に低くするために、政治外のデータを収集できることを示します。
我々は、この重要な洞察を、政策評価と改善の両方がインターリーブされるオンライン強化学習環境に拡張する。
論文 参考訳(メタデータ) (2025-11-13T23:06:40Z) - EXPO: Stable Reinforcement Learning with Expressive Policies [74.30151915786233]
2つのパラメータ化ポリシーで値の最大化を実現するために,サンプル効率のよいオンライン強化学習アルゴリズムを提案する。
提案手法は, 従来手法に比べて試料効率を最大2~3倍向上させる。
論文 参考訳(メタデータ) (2025-07-10T17:57:46Z) - Policy Gradient with Active Importance Sampling [55.112959067035916]
政策勾配法(PG法)はISの利点を大いに生かし、以前に収集したサンプルを効果的に再利用することができる。
しかし、ISは歴史的サンプルを再重み付けするための受動的ツールとしてRLに採用されている。
我々は、政策勾配のばらつきを減らすために、サンプルを収集する最良の行動ポリシーを模索する。
論文 参考訳(メタデータ) (2024-05-09T09:08:09Z) - POTEC: Off-Policy Learning for Large Action Spaces via Two-Stage Policy
Decomposition [40.851324484481275]
大規模離散行動空間における文脈的バンディット政策の非政治的学習について検討する。
本稿では,2段階ポリシー分解によるポリシー最適化という新しい2段階アルゴリズムを提案する。
特に大規模かつ構造化された行動空間において,POTECはOPLの有効性を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-02-09T03:01:13Z) - Clipped-Objective Policy Gradients for Pessimistic Policy Optimization [3.2996723916635275]
政策勾配法は、政策出力の有界変化を通じて単調な改善を図っている。
本研究では,PPOの性能を連続的な作用空間に適用した場合,目的の単純変化によって一貫した改善が期待できることを示す。
PPO と PPO の両目標に比較して, COPG の目標が平均的な「悲観的」であること, 2) この悲観主義は探索を促進させることを示した。
論文 参考訳(メタデータ) (2023-11-10T03:02:49Z) - Off-Policy Evaluation for Large Action Spaces via Policy Convolution [60.6953713877886]
ポリシ・コンボリューション(Policy Convolution)のファミリーは、アクション内の潜在構造を使用して、ログとターゲットポリシを戦略的に畳み込みます。
合成およびベンチマークデータセットの実験では、PCを使用する場合の平均二乗誤差(MSE)が顕著に改善されている。
論文 参考訳(メタデータ) (2023-10-24T01:00:01Z) - Local Policy Improvement for Recommender Systems [8.617221361305901]
我々は、以前デプロイされたポリシーから収集されたデータをもとに、新しいポリシーをトレーニングする方法を示す。
我々は,地方政策改善の代替策として,非政治的是正を伴わないアプローチを提案する。
この局所的な政策改善パラダイムはレコメンデーションシステムに理想的であり、以前の方針は一般的に適切な品質であり、ポリシーは頻繁に更新される。
論文 参考訳(メタデータ) (2022-12-22T00:47:40Z) - Supervised Off-Policy Ranking [145.3039527243585]
オフポリシー評価(OPE)は、他のポリシーによって生成されたデータを活用して、ターゲットポリシーを評価する。
本稿では,訓練方針と既知の実績を正しくランク付けすることで,政策スコアリングモデルを学習する教師付き非政治ランキングを提案する。
本手法は,上位3つのポリシーのうち,最良と最良の双方のランク相関と性能差の両面から,強力なベースラインOPE法より優れる。
論文 参考訳(メタデータ) (2021-07-03T07:01:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。