論文の概要: Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization
- arxiv url: http://arxiv.org/abs/2606.21271v1
- Date: Fri, 19 Jun 2026 09:47:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 06:52:32.932258
- Title: Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization
- Title(参考訳): 職業被覆最大化による強化学習のためのリワードフリー事前学習
- Authors: Marco Pratticò, Pietro Novelli, Massimiliano Pontil, Carlo Ciliberto,
- Abstract要約: スパース報酬は、エージェントが目標に到達するまで情報信号を受け取らないため、強化学習において中心的な課題となる。
本稿では,下流タスク時間におけるスパース報酬に迅速に適応するトランスファー可能な探索ポリシーを事前訓練する手法を提案する。
- 参考スコア(独自算出の注目度): 31.035684025590417
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse rewards pose a central challenge in reinforcement learning, since agents receive no informative signal until they reach their goal. Intrinsic-reward methods address this issue by optimizing non-stationary objectives such as novelty, prediction error, or skill diversity, thereby injecting a supervision signal into the problem. While effective, these methods often require that the extrinsic (sparse) reward can be evaluated -- either online or during offline relabeling of the stored transitions. This limitation is particularly vexing for multi-task, meta-, and continual reinforcement learning, where agents' interactions with the environment are usually reward-free. In this work, we present a method to pre-train transferable exploration policies that rapidly adapt to sparse rewards at downstream task time. Our objective maximizes state-space covering for the occupancy measure, and can be framed in terms of entropy maximization. Its algorithmic implementation, ROVER, leverages recent advances on the operatorial formulation of RL to estimate occupancy with a learned resolvent world model, bypassing common hurdles associated with density and entropy estimation. ROVER further introduces a virtual "sink" state for unexplored regions, balancing coverage of known states with expansion into unseen ones and preventing cyclic expansion-collapse behavior during learning. In tabular and pixel-based sparse navigation tasks, ROVER produces more uniform aggregate coverage and stronger initializations for downstream tasks than standard reward-free baselines.
- Abstract(参考訳): スパース報酬は、エージェントが目標に到達するまで情報信号を受け取らないため、強化学習において中心的な課題となる。
Intrinsic-Reward法は、新規性、予測誤差、スキル多様性などの非定常目標を最適化することによりこの問題に対処する。
有効ではあるが、これらのメソッドは、オンラインまたはオフラインで保存されたトランジションを緩和するときに、外部(スパース)報酬を評価する必要があることが多い。
この制限は、特にマルチタスク、メタ、連続的な強化学習において、エージェントと環境との相互作用は通常報酬のないものである。
本研究では,下流タスク時間におけるスパース報酬に迅速に適応するトランスファー可能な探索ポリシーを事前訓練する手法を提案する。
我々の目的は、占有度測定のための状態空間被覆を最大化し、エントロピー最大化の観点でフレーム化できる。
そのアルゴリズム的実装であるROVERは、RLの演算的定式化の最近の進歩を活用して、密度とエントロピーの推定に関連する共通のハードルを回避し、学習された解決可能な世界モデルで占有率を推定する。
ROVERはさらに、探索されていない領域に対する仮想的な「シンク状態」を導入し、未知の領域への拡張による既知の状態のカバレッジのバランスを保ち、学習中の循環的な膨張・崩壊行動を防止する。
表やピクセルベースのスパースナビゲーションタスクでは、ROVERは標準の報酬のないベースラインよりも、より均一な集約カバレッジと下流タスクの初期化を実現している。
関連論文リスト
- Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation [91.20850436220267]
Referring-Aware Visuomotor Policy(ReV)について紹介する。
ReVは、人間または高レベルの推論プランナーによって提供されるスパース参照ポイントを組み込む。
これは、専門家のデモンストレーションにターゲットの摂動を適用することでのみ訓練される。
論文 参考訳(メタデータ) (2026-04-07T07:41:11Z) - Sample-Efficient Neurosymbolic Deep Reinforcement Learning [49.60927398960061]
本稿では,背景記号知識を統合し,サンプル効率を向上させるニューロシンボリックディープRL手法を提案する。
オンライン推論は2つのメカニズムを通じてトレーニングプロセスのガイドを行う。
我々は、最先端の報奨機ベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-01-06T09:28:53Z) - TD-JEPA: Latent-predictive Representations for Zero-Shot Reinforcement Learning [63.73629127832652]
本稿では,TDに基づく潜在予測表現を教師なしRLに活用するTD-JEPAを紹介する。
TD-JEPAは、明示的な状態とタスクエンコーダ、ポリシー条件付きマルチステップ予測器、パラメータ化されたポリシーのセットを潜時空間で直接訓練する。
実証的には、TD-JEPAは13のデータセットにわたる移動、ナビゲーション、操作のタスクにおいて、最先端のベースラインをマッチまたは上回る。
論文 参考訳(メタデータ) (2025-10-01T10:21:18Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Imagine Beyond! Distributionally Robust Auto-Encoding for State Space Coverage in Online Reinforcement Learning [15.884955846999246]
GCRL(Goal-Conditioned Reinforcement Learning)は、エージェントが自律的に多様な行動を取得することを可能にする。
エージェントが探索中に表現を学ぶオンライン環境では、潜伏空間はエージェントのポリシーによって進化する。
論文 参考訳(メタデータ) (2025-05-23T12:43:55Z) - Zero-Shot Whole-Body Humanoid Control via Behavioral Foundation Models [71.34520793462069]
教師なし強化学習(RL)は、複雑な環境下で幅広い下流タスクを解くことができる事前学習エージェントを目標としている。
本稿では,ラベルのない行動データセットからトラジェクトリを模倣するための,教師なしRLの正規化アルゴリズムを提案する。
我々は,この手法の有効性を,挑戦的なヒューマノイド制御問題において実証する。
論文 参考訳(メタデータ) (2025-04-15T10:41:11Z) - Learning to Stabilize Online Reinforcement Learning in Unbounded State Spaces [13.544995860887298]
多くの強化学習(RL)応用において、我々は望ましい状態に到達し、制御されたシステムを許容範囲内に維持する政策を望んでいる。
本研究では,オンライントレーニング中の所望状態への距離を直接最小化する深いRLアルゴリズムが,しばしば不安定なポリシーをもたらすことを発見した。
1)リアプノフに基づくコスト形成手法と,2)非有界状態空間への状態変換の2つの考え方に基づくアプローチを導入する。
論文 参考訳(メタデータ) (2023-06-02T20:01:09Z) - Let Offline RL Flow: Training Conservative Agents in the Latent Space of
Normalizing Flows [58.762959061522736]
オフライン強化学習は、追加の環境相互作用なしに、事前に記録された、固定されたデータセット上でポリシーをトレーニングすることを目的としている。
我々は、最近、潜在行動空間における学習ポリシーを基礎として、生成モデルの構築に正規化フローの特別な形式を用いる。
提案手法が最近提案したアルゴリズムより優れていることを示すため,様々な移動タスクとナビゲーションタスクについて評価を行った。
論文 参考訳(メタデータ) (2022-11-20T21:57:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。