論文の概要: Reward as Observation: Learning Reward-Based Policies for Rapid Adaptation
- arxiv url: http://arxiv.org/abs/2610.00729v2
- Date: Mon, 05 Oct 2026 21:19:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.25019
- Title: Reward as Observation: Learning Reward-Based Policies for Rapid Adaptation
- Title(参考訳): Reward as Observation: Learning Reward-based Policies for Rapid Adaptation
- Abstract要約: ディープニューラルネットワークポリシーは、しばしば新しい環境に適応するのに苦労し、転送を成功させるためにかなりの量のサンプルを必要とする。
本稿では,報酬と行動のみを条件とした新たな報酬に基づく政策を提案し,新たな環境へのゼロショット適応を可能にする。
報奨方針は,ポイントマス,カートポール,2Dカーレーシングの3つの異なる環境で訓練でき,完全に異なる観察に移行できることを示す。
- 参考スコア(独自算出の注目度): 7.419088030901445
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper explores a reward-based policy to achieve zero-shot transfer between source and target environments with completely different observation spaces. While humans can demonstrate impressive adaptation capabilities, deep neural network policies often struggle to adapt to a new environment and require a considerable amount of samples for successful transfer. Instead, we propose a novel reward-based policy only conditioned on rewards and actions, enabling zero-shot adaptation to new environments with completely different observations. We discuss the challenges and feasibility of a reward-based policy and then propose a practical algorithm for training. We demonstrate that a reward policy can be trained within three different environments, Pointmass, Cartpole, and 2D Car Racing, and transferred to completely different observations, such as different color palettes or 3D rendering, or Stretch robot navigation in Habitat-Sim, in a zero-shot manner. We also demonstrate that a reward-based policy can further guide the training of an observation-based policy in the target environment.
- Abstract(参考訳): 本稿では,全く異なる観測空間を持つソースとターゲット環境間のゼロショット転送を実現するための報酬ベースのポリシーについて検討する。
人間は印象的な適応能力を示すことができるが、ディープニューラルネットワークポリシーは、しばしば新しい環境への適応に苦慮し、転送を成功させるためにかなりの量のサンプルを必要とする。
代わりに、報酬と行動のみを条件とした新たな報酬ベースのポリシーを提案し、全く異なる観察で新しい環境へのゼロショット適応を可能にした。
我々は報酬に基づく政策の課題と実現可能性について議論し、訓練のための実践的なアルゴリズムを提案する。
我々は,ポイントマス,カートポール,2Dカーレーシングの3つの異なる環境で報酬ポリシーをトレーニングできることを実証し,異なるカラーパレットや3Dレンダリング,Habitat-Simのストレッチロボットナビゲーションなど,まったく異なる観察にゼロショットで移行した。
また、報酬に基づく政策は、目標環境における観察に基づく政策の訓練をさらに指導することができることを実証する。
関連論文リスト
- Reinforcement Learning from Bagged Reward [46.16904382582698]
強化学習(RL)では、エージェントが取るアクション毎に即時報奨信号が生成されることが一般的である。
多くの実世界のシナリオでは、即時報酬信号の設計は困難である。
本稿では,双方向の注意機構を備えた新たな報酬再分配手法を提案する。
論文 参考訳(メタデータ) (2024-02-06T07:26:44Z) - A Conservative Approach for Few-Shot Transfer in Off-Dynamics Reinforcement Learning [3.1515473193934778]
オフダイナミックス強化学習(英語: Off-dynamics Reinforcement Learning)は、ソース環境から、異なるが類似したダイナミクスによって特徴づけられるターゲット環境へポリシーを移そうとする。
我々は近年のImitation Learningと保守的RLアルゴリズムの進歩に触発された革新的なアプローチを提案する。
論文 参考訳(メタデータ) (2023-12-24T13:09:08Z) - Adaptive Tracking of a Single-Rigid-Body Character in Various
Environments [2.048226951354646]
単剛体キャラクタのシミュレーションに基づく深層強化学習手法を提案する。
中心運動モデル (CDM) を用いて, 全身特性を単一剛体 (SRB) として表現し, 基準運動を追跡する政策を訓練することにより, 様々な未観測環境変化に適応できる政策を得ることができる。
弊社の政策は、超ポータブルラップトップ上で30分以内に効率よく訓練され、学習中に経験されていない環境に対処できることを実証する。
論文 参考訳(メタデータ) (2023-08-14T22:58:54Z) - Learning Transferable Reward for Query Object Localization with Policy
Adaptation [49.994989590997655]
我々は、順序距離学習によって表される模範集合を用いて、伝達可能な報酬信号を学習する。
提案手法は,報酬信号が手軽に利用できない新しい環境へのテスト時ポリシー適用を可能にする。
論文 参考訳(メタデータ) (2022-02-24T22:52:14Z) - Self-Supervised Policy Adaptation during Deployment [98.25486842109936]
セルフスーパービジョンでは、報酬を使わずに、デプロイ後のトレーニングを継続することができる。
DeepMind Control スイートと ViZDoom の様々なシミュレーション環境で実証評価を行う。
提案手法は,36環境中31環境での一般化を向上し,多くの環境においてドメインランダム化に優れる。
論文 参考訳(メタデータ) (2020-07-08T17:56:27Z) - Environment Shaping in Reinforcement Learning using State Abstraction [63.444831173608605]
状態抽象化を用いた環境形成の新しい枠組みを提案する。
私たちのキーとなるアイデアは、ノイズの多い信号で環境の大きな状態空間を抽象空間に圧縮することです。
エージェントの方針は, 形状の環境において学習し, 元の環境において, ほぼ最適動作を保っていることを示す。
論文 参考訳(メタデータ) (2020-06-23T17:00:22Z) - Ecological Reinforcement Learning [76.9893572776141]
このような条件下での学習を容易にする環境特性について検討する。
環境の特性が強化学習エージェントのパフォーマンスにどのように影響するかを理解することは、学習を魅力的にする方法でタスクを構造化するのに役立ちます。
論文 参考訳(メタデータ) (2020-06-22T17:55:03Z) - Learning Adaptive Exploration Strategies in Dynamic Environments Through
Informed Policy Regularization [100.72335252255989]
本研究では,動的環境に効果的に適応する探索探索探索戦略の課題について検討する。
本稿では,各タスクにおける報酬を最大化するために訓練された情報ポリシを用いて,RNNベースのポリシーのトレーニングを規則化する新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-05-06T16:14:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。