論文の概要: On-Policy and Off-Policy Learning for Large Action Spaces
- arxiv url: http://arxiv.org/abs/2607.28408v1
- Date: Thu, 30 Jul 2026 15:56:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.646046
- Title: On-Policy and Off-Policy Learning for Large Action Spaces
- Title(参考訳): 大規模行動空間のためのオン・ポリティとオフ・ポリティ・ラーニング
- Abstract要約: この論文は、エージェントがコンテキストを観察し、非常に大きなセットからアクションを選択し、部分的なフィードバックを受け取る、インタラクティブなシステムにおけるポリシー学習を研究する。
メインのフレームワークは、環境と順次対話し、後悔を最小限に抑えるオンライン学習と、ロギングポリシによって収集されたログデータから学習するオフライン学習の2つのパラダイムである。
- 参考スコア(独自算出の注目度): 2.995087247817663
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This thesis studies policy learning in interactive systems where an agent observes a context, selects an action from a very large set, and receives partial feedback. The main framework is contextual bandits, with two paradigms: on-policy learning, where the agent interacts sequentially with the environment and minimizes regret, and off-policy learning, where it learns from logged data collected by a logging policy. In large action spaces, both settings face major challenges: inefficient exploration, sparse data coverage, high-variance importance weights, extrapolation bias, and difficult optimization landscapes. The first part develops structured Bayesian methods for on-policy learning. We introduce meTS, a mixed-effect extension of Thompson sampling, and dTS, which leverages diffusion-inspired priors to model dependencies between actions. These methods share information across actions and yield regret guarantees depending on an effective number of actions. The second part addresses off-policy learning. We propose sDM, a structured direct method based on latent variables, show that optimization error can dominate estimation error in large action spaces, and introduce concave, efficiently optimizable policy-weighted log-likelihood objectives. Finally, we develop differentiable pessimistic methods based on exponential smoothing and PAC-Bayesian bounds to control the bias-variance trade-off of regularized importance-sampling estimators.
- Abstract(参考訳): この論文は、エージェントがコンテキストを観察し、非常に大きなセットからアクションを選択し、部分的なフィードバックを受け取る、インタラクティブなシステムにおけるポリシー学習を研究する。
メインのフレームワークは、環境と順次対話し、後悔を最小限に抑えるオンライン学習と、ロギングポリシによって収集されたログデータから学習するオフライン学習の2つのパラダイムである。
大きなアクション空間では、両方の設定は、非効率な探索、スパースデータカバレッジ、高分散の重要度重み、外挿バイアス、難しい最適化ランドスケープといった大きな課題に直面します。
第1部は、政治学習のための構造化ベイズ的手法を開発する。
我々はトンプソンサンプリングの混合効果拡張である meTS と dTS を導入する。
これらの方法は行動間で情報を共有し、効果的な行動数に応じて後悔の保証を与える。
第2部では、政治以外の学習について論じている。
本稿では,遅延変数に基づく構造的直接手法であるsDMを提案する。これは,大規模なアクション空間において,最適化誤差が推定誤差を支配できることを示す。
最後に,指数的平滑化とPAC-ベイズ境界に基づく微分可能な悲観的手法を開発し,正規化重要サンプリング推定器のバイアス分散トレードオフを制御する。
関連論文リスト
- Think2Go: Generative Next POI Recommendation with LLM Reasoning [57.37706163990998]
Next Point-of-Interest (POI)レコメンデーションタスクは、ユーザの行動選好パターンを過去のチェックインからマイニングすることに焦点を当て、次の目的地へのパーソナライズされた提案を提供する。
既存の手法は、次のPOIを予測するために、浅いコンテキスト情報と手作りの特徴相互作用に依存している。
本稿では,SID表現の理解を深め,テスト時間計算による多様な時空間パターンを探索する新しい次世代POIレコメンデーションフレームワークThink2Goを提案する。
論文 参考訳(メタデータ) (2026-07-31T03:52:20Z) - Efficient Adaptive Data Acquisition via Pretrained Belief Representations [35.0706688594896]
信条表現を用いた政策学習(POLAR)を紹介する。
POLARは、事前訓練された予測基盤モデルを信念状態エンコーダとして活用することにより、政策学習からの表現学習を分離する。
POLARは様々なタスクにまたがって、最先端のアモートされたメソッドよりも優れています。
論文 参考訳(メタデータ) (2026-06-23T21:40:47Z) - PAWS: Preference Learning with Advantage-Weighted Segments [61.590521943273]
本稿では,セグメントレベルの優位関数を用いて,ポリシー更新を直接行うセグメントベース優先学習手法を提案する。
シミュレーションされたロボット操作と移動タスクの実験は、PAWSが既存のPbRLアプローチを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-06-10T12:00:17Z) - Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only [70.43369087819332]
Supervised Fine-tuning (SFT) は、大規模な言語モデルと人間のアノテーションによる実演を整合させる重要な方法として登場した。
本稿では, 自己回帰型PPOを提案する。
論文 参考訳(メタデータ) (2025-10-24T02:02:13Z) - ACT-JEPA: Novel Joint-Embedding Predictive Architecture for Efficient Policy Representation Learning [90.41852663775086]
ACT-JEPAは模倣学習と自己教師型学習を統合する新しいアーキテクチャである。
我々はアクションシーケンスと抽象的な観察シーケンスを予測するポリシーを訓練する。
実験の結果,ACT-JEPAは時間環境の動的学習によって表現の質を向上させることがわかった。
論文 参考訳(メタデータ) (2025-01-24T16:41:41Z) - C$^{2}$INet: Realizing Incremental Trajectory Prediction with Prior-Aware Continual Causal Intervention [10.189508227447401]
複雑なシナリオにおけるマルチエージェントの軌道予測は、自律運転のようなアプリケーションには不可欠である。
既存の手法は、しばしば環境バイアスを見落とし、一般化の低さにつながる。
一般化可能なマルチエージェント軌道予測のための連続因果干渉法(C$2$INet)を提案する。
論文 参考訳(メタデータ) (2024-11-19T08:01:20Z) - Off-Policy Evaluation for Large Action Spaces via Policy Convolution [60.6953713877886]
ポリシ・コンボリューション(Policy Convolution)のファミリーは、アクション内の潜在構造を使用して、ログとターゲットポリシを戦略的に畳み込みます。
合成およびベンチマークデータセットの実験では、PCを使用する場合の平均二乗誤差(MSE)が顕著に改善されている。
論文 参考訳(メタデータ) (2023-10-24T01:00:01Z) - Statistically Efficient Variance Reduction with Double Policy Estimation
for Off-Policy Evaluation in Sequence-Modeled Reinforcement Learning [53.97273491846883]
本稿では、オフラインシーケンスモデリングとオフライン強化学習をダブルポリシー推定と組み合わせたRLアルゴリズムDPEを提案する。
D4RLベンチマークを用いて,OpenAI Gymの複数のタスクで本手法を検証した。
論文 参考訳(メタデータ) (2023-08-28T20:46:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。