論文の概要: Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2604.20627v1
- Date: Wed, 22 Apr 2026 14:41:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-23 15:36:11.180462
- Title: Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning
- Title(参考訳): Occupancy Reward Shaping:Offline Goal-Conditioned Reinforcement Learningにおけるクレジットアサインメントの改善
- Authors: Aravind Venugopal, Jiayu Chen, Xudong Wu, Chongyi Zheng, Benjamin Eysenbach, Jeff Schneider,
- Abstract要約: 我々は、世界モデルに格納された時間情報が、世界の基盤となる幾何学をエンコードする方法を定式化する。
得られた方法である Occupancy Rewarding は、スパース報酬設定におけるクレジット代入の問題を大幅に軽減する。
- 参考スコア(独自算出の注目度): 31.421592852664546
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The temporal lag between actions and their long-term consequences makes credit assignment a challenge when learning goal-directed behaviors from data. Generative world models capture the distribution of future states an agent may visit, indicating that they have captured temporal information. How can that temporal information be extracted to perform credit assignment? In this paper, we formalize how the temporal information stored in world models encodes the underlying geometry of the world. Leveraging optimal transport, we extract this geometry from a learned model of the occupancy measure into a reward function that captures goal-reaching information. Our resulting method, Occupancy Reward Shaping, largely mitigates the problem of credit assignment in sparse reward settings. ORS provably does not alter the optimal policy, yet empirically improves performance by 2.2x across 13 diverse long-horizon locomotion and manipulation tasks. Moreover, we demonstrate the effectiveness of ORS in the real world for controlling nuclear fusion on 3 Tokamak control tasks. Code: https://github.com/aravindvenu7/occupancy_reward_shaping; Website: https://aravindvenu7.github.io/website/ors/
- Abstract(参考訳): アクションと長期的な結果の間の時間的遅延は、データからゴール指向の振る舞いを学ぶ際に、クレジットの割り当てを困難にします。
生成的世界モデルは、エージェントが訪問する未来の状態の分布をキャプチャし、時間的情報をキャプチャしたことを示す。
その時間情報をどうやって抽出して信用代行を行うのか?
本稿では,世界モデルに格納された時間情報がどのように世界の基盤となる幾何学を符号化するかを定式化する。
最適輸送を生かしたこの幾何学は,学習した占有度尺度から,目標獲得情報を取得する報奨関数へと抽出する。
得られた手法であるOccupancy Reward Shapingは、スパース報酬設定におけるクレジット代入の問題を大幅に軽減する。
ORSは最適方針を変更しないが、13種類の長距離移動および操作タスクに対して2.2倍の性能を実証的に改善する。
さらに,3つのトカマク制御タスクにおける核融合制御におけるORSの有効性を示す。
コード: https://github.com/aravindvenu7/occupancy_reward_shaping; Website: https://aravindvenu7.github.io/website/ors/
関連論文リスト
- DeformPAM: Data-Efficient Learning for Long-horizon Deformable Object Manipulation via Preference-based Action Alignment [47.273405862634085]
本稿では、優先学習と報酬誘導行動選択に基づくデータ効率の一般学習フレームワークを提案する。
DeformPAMは、長い水平タスクを複数のアクションプリミティブに分解し、3Dポイントクラウド入力と拡散モデルを利用する。
実世界の長軸変形可能な3つのオブジェクト操作タスクの実験により,本手法の有効性が示された。
論文 参考訳(メタデータ) (2024-10-15T13:19:16Z) - Spatial Reasoning and Planning for Deep Embodied Agents [2.7195102129095003]
この論文は空間的推論と計画タスクのためのデータ駆動手法の開発を探求する。
学習効率、解釈可能性、新しいシナリオ間の伝達可能性の向上に重点を置いている。
論文 参考訳(メタデータ) (2024-09-28T23:05:56Z) - HIQL: Offline Goal-Conditioned RL with Latent States as Actions [81.67963770528753]
オフラインデータからゴール条件付きRLの階層的アルゴリズムを提案する。
この階層的な分解によって、推定値関数のノイズに頑健になることを示す。
提案手法は,従来の手法を巧みに操り,高次元画像観察にスケールできるとともに,アクションフリーなデータを容易に利用することができる。
論文 参考訳(メタデータ) (2023-07-22T00:17:36Z) - Reinforcement Learning from Passive Data via Latent Intentions [86.4969514480008]
我々は、下流RLを加速する機能を学ぶために、受動的データが引き続き使用できることを示す。
我々のアプローチは、意図をモデル化することで受動的データから学習する。
実験では、クロス・エボディメント・ビデオデータやYouTubeビデオなど、さまざまな形式の受動的データから学習できることを実証した。
論文 参考訳(メタデータ) (2023-04-10T17:59:05Z) - Efficient Spatial-Temporal Information Fusion for LiDAR-Based 3D Moving
Object Segmentation [23.666607237164186]
本稿では,LiDAR-MOSの性能向上のために,空間時空間情報とLiDARスキャンの異なる表現モダリティを併用した新しいディープニューラルネットワークを提案する。
具体的には、まず、空間情報と時間情報とを別々に扱うために、レンジ画像に基づくデュアルブランチ構造を用いる。
また、3次元スパース畳み込みによるポイントリファインメントモジュールを使用して、LiDAR範囲の画像とポイントクラウド表現の両方からの情報を融合する。
論文 参考訳(メタデータ) (2022-07-05T17:59:17Z) - Retrieval-Augmented Reinforcement Learning [63.32076191982944]
過去の経験のデータセットを最適な行動にマップするために、ネットワークをトレーニングします。
検索プロセスは、現在のコンテキストで有用なデータセットから情報を取得するために訓練される。
検索強化R2D2はベースラインR2D2エージェントよりもかなり高速に学習し,より高いスコアを得ることを示す。
論文 参考訳(メタデータ) (2022-02-17T02:44:05Z) - Counterfactual Credit Assignment in Model-Free Reinforcement Learning [47.79277857377155]
強化学習における信用割当は、将来の報酬に対する行動の影響を測定する問題である。
我々は因果理論からモデルフリーなRL設定への反事実の概念を適応する。
我々は、将来の条件値関数をベースラインや批評家として使用するポリシーアルゴリズムのファミリーを定式化し、それらが明らかに低分散であることを示す。
論文 参考訳(メタデータ) (2020-11-18T18:41:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。