論文の概要: S3: Stable Subgoal Selection by Constraining Uncertainty of Coarse Dynamics in Hierarchical Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.19232v1
- Date: Tue, 21 Jul 2026 16:03:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.483917
- Title: S3: Stable Subgoal Selection by Constraining Uncertainty of Coarse Dynamics in Hierarchical Reinforcement Learning
- Title(参考訳): S3:階層強化学習における粗大ダイナミクスの不確かさの抑制による安定部分選択
- Abstract要約: 本研究では,ハイレベルエージェントによるサブゴール選択をより戦略的に行うことができるかどうかを,ダイナミックスを意識した本質的なモチベーションを提供することにより検討する。
このアプローチは、粗い力学に関連する予測的不確実性を最小化するために学習することで、高レベルの政策を安定化する。
実験により,高密度で動的に認識される本質的な報酬がリスク・アバースなサブゴール選択につながり,非定常長水平環境における最先端のHRL法より優れることを示した。
- 参考スコア(独自算出の注目度): 1.160208922584163
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hierarchical Reinforcement Learning (HRL) intends to separate strategic planning from primitive execution. It has been widely successful in solving long-horizon and complex tasks, where flat-RL algorithms have difficulty in learning. However, while the low-level agent in HRL benefits from dense feedback and abundant trial opportunities, the high-level agent receives sparse, delayed feedback from the environment and its performance depends on the low-level execution capability. In this paper, we study whether subgoal selection by the high-level agent can be performed more strategically, by providing it with dynamics-aware intrinsic motivation. Since motivation based on primitive transition dynamics would require broad coverage of the state-action space, we propose to use coarse dynamics, i.e., environment transitions aggregated over multiple steps at the temporal scale at which the high-level agent operates. This approach stabilizes the high-level policy by learning to minimize the predictive uncertainty associated with the coarse dynamics, and provides a guided structure for navigation. We model the predictive uncertainty by evaluating different dispersion metrics as approximated by a Mixture Density Network (MDN). Empirically, we observe that a dense, dynamics-aware intrinsic reward leads to risk-averse subgoal selection, enabling it to outperform state-of-the-art HRL methods in non-stationary long-horizon environments.
- Abstract(参考訳): 階層強化学習(HRL:hierarchical Reinforcement Learning)は、戦略的な計画と原始的な実行を分離することを目的としている。
フラットRLアルゴリズムが学習を困難にしている、長期的および複雑なタスクの解決に成功している。
しかし,HRLの低レベルエージェントは高いフィードバックと豊富な試行機会の恩恵を受けるが,高レベルエージェントは環境からの疎度で遅延したフィードバックを受け,その性能は低レベルの実行能力に依存する。
本稿では,ハイレベルエージェントによるサブゴール選択をより戦略的に行うことができるかどうかを,ダイナミックスを意識した本質的なモチベーションを提供することにより検討する。
プリミティブ・トランジション・ダイナミクスに基づくモチベーションは、状態-アクション空間の広範なカバレッジを必要とするため、高レベルのエージェントが動作する時間スケールにおいて、複数のステップで集約された環境遷移を粗いダイナミクスとして使用することを提案する。
このアプローチは、粗いダイナミクスに関連する予測の不確実性を最小化するために学習することにより、高レベルのポリシーを安定化し、ナビゲーションのためのガイド付き構造を提供する。
混合密度ネットワーク(MDN)により近似された分散度を推定することにより予測の不確かさをモデル化する。
実験により,高密度で動的に認識される本質的な報酬がリスク・アバースなサブゴール選択につながり,非定常長水平環境における最先端のHRL法より優れることを示した。
関連論文リスト
- On Distributional Reinforcement Learning in Chaotic Dynamical Systems [6.932921577765093]
カオス力学系は強化学習(RL)に根本的な課題をもたらす
軽度の統計的安定性仮定の下では、1ドル=ワッサーシュタイン計量で測定すると、回帰分布は個々の軌道よりも周期的に進化する。
カオスシステムにおける分散手法の利点とカオス下でのRL目標の最適化について、原理的な説明を提供する。
論文 参考訳(メタデータ) (2026-05-28T16:17:32Z) - RAY-TOLD: Ray-Based Latent Dynamics for Dense Dynamic Obstacle Avoidance with TDMPC [5.838266102141284]
RAY-TOLDは、障害情報を潜在力学に統合するハイブリッド制御アーキテクチャである。
本稿では,MPPI候補人口を学習方針から派生した軌道で増加させる政策混合サンプリング戦略を提案する。
その結果、短時間の水平物理学に基づくロールアウトと学習された長い水平意図を組み合わせることで、ナビゲーションの信頼性と安全性が著しく向上することが確認された。
論文 参考訳(メタデータ) (2026-04-30T05:44:46Z) - PACEvolve: Enabling Long-Horizon Progress-Aware Consistent Evolution [64.15555230987222]
PACEvolveはエージェントのコンテキストと検索ダイナミクスを堅牢に管理するように設計されたフレームワークである。
PACEvolveは、一貫性のある長期自己改善のための体系的なパスを提供する。
論文 参考訳(メタデータ) (2026-01-15T18:25:23Z) - Sample-Efficient Neurosymbolic Deep Reinforcement Learning [49.60927398960061]
本稿では,背景記号知識を統合し,サンプル効率を向上させるニューロシンボリックディープRL手法を提案する。
オンライン推論は2つのメカニズムを通じてトレーニングプロセスのガイドを行う。
我々は、最先端の報奨機ベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-01-06T09:28:53Z) - Push Smarter, Not Harder: Hierarchical RL-Diffusion Policy for Efficient Nonprehensile Manipulation [8.7216199131049]
HeRDは階層的な強化学習拡散政策であり、プッシュタスクを高レベルの目標選択と低レベルの軌道生成という2つのレベルに分解する。
我々は、中間空間目標を選択するための高レベル強化学習エージェントと、それに到達するための実用的で効率的な軌道を生成するための低レベル目標条件拡散モデルを用いる。
この結果から,階層的制御を低レベル計画に組み込むことが,スケーラブルで目標指向の非包括的操作において有望な方向であることが示唆された。
論文 参考訳(メタデータ) (2025-12-10T21:40:22Z) - Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning [56.496001894673235]
強化学習(RL)は,大規模言語モデル(LLM)の複雑な推論能力の向上に有効であることが証明された。
解析の結果,アハモーメント,長さスケーリング,エントロピーのダイナミクスといったファズリング現象は異なる現象ではなく,創発的推論階層の目印であることがわかった。
論文 参考訳(メタデータ) (2025-09-03T18:52:49Z) - Direct Preference Optimization for Primitive-Enabled Hierarchical Reinforcement Learning [75.9729413703531]
DIPPERは階層的な政策学習を二段階最適化問題として定式化する新しいHRLフレームワークである。
DIPPERは、スパース報酬シナリオにおいて、最先端のベースラインよりも最大40%改善されていることを示す。
論文 参考訳(メタデータ) (2024-11-01T04:58:40Z) - Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement [67.1393112206885]
大規模言語モデル(LLM)は、対話的な意思決定タスクにおいてインテリジェントなエージェントとして期待されている。
本稿では,トークンレベルでのLLMの最適化に適したエントロピー拡張RL法である,エントロピー正規化トークンレベル最適化(ETPO)を導入する。
我々は,データサイエンスコード生成を多段階対話型タスクのシリーズとしてモデル化したシミュレーション環境におけるETPOの有効性を評価する。
論文 参考訳(メタデータ) (2024-02-09T07:45:26Z) - Hierarchical Reinforcement Learning with Timed Subgoals [11.758625350317274]
Timed Subgoals (HiTS) を用いた階層型強化学習の導入
HiTSはエージェントがどの目標状態に到達すべきか、いつ到達するかを指定することで、そのタイミングを動的環境に適応させることを可能にする。
実験により,既存の最先端のサブゴールベースHRL法が安定した解を学習できない場合,本手法はサンプル効率のよい学習が可能であることが確認された。
論文 参考訳(メタデータ) (2021-12-06T15:11:19Z) - Provable Hierarchy-Based Meta-Reinforcement Learning [50.17896588738377]
HRLをメタRL設定で解析し、下流タスクで使用するメタトレーニング中に学習者が潜在階層構造を学習する。
我々は、この自然階層の標本効率の回復を保証し、抽出可能な楽観主義に基づくアルゴリズムとともに「多様性条件」を提供する。
我々の境界は、時間的・状態的・行動的抽象化などのHRL文献に共通する概念を取り入れており、我々の設定と分析が実際にHRLの重要な特徴を捉えていることを示唆している。
論文 参考訳(メタデータ) (2021-10-18T17:56:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。