論文の概要: On Semi-Markov Suboptimality in Hierarchical Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.05338v1
- Date: Sun, 04 Oct 2026 16:01:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 21:28:44.781535
- Title: On Semi-Markov Suboptimality in Hierarchical Reinforcement Learning
- Title(参考訳): 階層型強化学習におけるセミマルコフの準最適性について
- Abstract要約: 階層的強化学習は、時間的に拡張されたサブタスクを使用して探索するが、その実行にコミットすることは、デプロイメントとポリシー学習の両方を制限することができる。
得られた実行とポリシーの亜最適性を識別し、分離する。
HRLの統一値関数と4段一般化階層ベルマン方程式は、両方の損失の共通解析をサポートする。
- 参考スコア(独自算出の注目度): 3.805976359799901
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hierarchical reinforcement learning uses temporally extended subtasks for exploration, yet committing to their execution can restrict both deployment and policy learning. We identify and separate the resulting execution and policy suboptimality. Task and execution trees distinguish reward objectives from policy choices and decision interruption. A Unified Value Function for HRL and a four-stage Generalized Hierarchical Bellman Equation then support a common analysis of both losses. Under bounded rewards and uniform termination, we establish hierarchical policy and execution improvement results. With the remaining node policies fixed, task-subtree compatibility and node-policy optimality under the original execution mode establish when Markov execution is optimal. The resulting decomposition leads to independent execution choices for behavior, targets, and deployment. We instantiate this principle through execution improvement and one-stage or two-stage policy improvement at arbitrary hierarchy depth. Option-based and goal-conditioned experiments demonstrate complementary gains from changing execution and changing the learning target. Controlled stochastic environments show how these gains depend on stochastic transition strength and spatial structure. This framework makes execution design an explicit component of hierarchical policy optimization.
- Abstract(参考訳): 階層的強化学習は、時間的に拡張されたサブタスクを使用して探索するが、その実行にコミットすることは、デプロイメントとポリシー学習の両方を制限することができる。
得られた実行とポリシーの亜最適性を識別し、分離する。
タスクと実行ツリーは、報酬の目的とポリシーの選択と決定の中断を区別します。
HRLの統一値関数と4段一般化階層ベルマン方程式は、両方の損失の共通解析をサポートする。
制限付き報酬と一様終了の下で、階層的な政策と実行改善結果を確立する。
残りのノードポリシーを固定し、タスク-サブツリーの互換性と、元の実行モード下でのノード-ポリティの最適性は、Markovの実行が最適であるときに確立される。
結果として生成された分解は、振る舞い、ターゲット、デプロイメントに対する独立した実行選択につながります。
我々はこの原則を、実行改善と任意の階層深さで1段階または2段階のポリシー改善を通じてインスタンス化する。
オプションベースおよび目標条件付き実験は、実行の変更と学習目標の変更による相補的な利益を示す。
制御された確率環境は、これらの利得がどのように確率遷移強度と空間構造に依存するかを示す。
このフレームワークは、実行設計を階層的なポリシー最適化の明示的なコンポーネントにする。
関連論文リスト
- Unified Trajectory Matching Policy Optimization: Diverse T2I Generation and VLA Generalization [70.25625746203777]
Reward-maximizing reinforcement learning (RL) は、テキスト・トゥ・イメージ(T2I)生成のための後流拡散とフローポリシーに広く用いられている。
T2Iでは、報酬最大化RLは基準KLやエントロピー正規化の下でもポリシーモードの崩壊を引き起こす。
拡散・流路政策のためのRLポストトレーニングフレームワークであるUnified Trajectory Matching Policy Optimization (Uni-TMPO)を紹介する。
論文 参考訳(メタデータ) (2026-09-28T09:13:03Z) - Hierarchical Decision Making with Structured Policies: A Principled Design via Inverse Optimization [5.406955022340469]
本稿では,上層目標の抽象化と下層決定の構造化を統合したフレームワークを提案する。
提案手法は, エンド・ツー・エンドのRL, 学習拡張最適制御, 既存の階層的RLアプローチに基づいて, 効率と意思決定品質の両面で, 高いベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-27T06:46:37Z) - ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization [6.976223727680188]
政策最適化(ISEP)によるインプシットサポート拡張
ISEPは、ディストリビューションデータとポリシーサンプルの間の値関数を使用して、実行可能なアクションサポートを暗黙的に拡張する。
条件付きフローマッチング。
論文 参考訳(メタデータ) (2026-05-18T12:39:30Z) - Switching Successor Measures for Hierarchical Zero-shot Reinforcement Learning [49.24483784910263]
我々は、強化学習における階層的制御を可能にする後継尺度である切替後継尺度を導入する。
後継策の切り替えは,その構造を保ちながら,古典的後継措置から自然に生じることを示す。
FB$-Switchは非階層的ベースラインよりも改善されている。
論文 参考訳(メタデータ) (2026-05-13T08:58:33Z) - Learning Policy Representations for Steerable Behavior Synthesis [80.4542176039074]
マルコフ決定プロセス(MDP)を前提として,テスト時の行動ステアリングを促進するために,さまざまなポリシーの表現を学習する。
これらの表現は、セットベースアーキテクチャを用いて、様々なポリシーに対して均一に近似できることを示す。
変動生成法を用いてスムーズな潜伏空間を導出し,さらにコントラスト学習により、潜伏距離が値関数の差と一致するように形成する。
論文 参考訳(メタデータ) (2026-01-29T21:52:06Z) - Direct Preference Optimization for Primitive-Enabled Hierarchical Reinforcement Learning [75.9729413703531]
DIPPERは階層的な政策学習を二段階最適化問題として定式化する新しいHRLフレームワークである。
DIPPERは、スパース報酬シナリオにおいて、最先端のベースラインよりも最大40%改善されていることを示す。
論文 参考訳(メタデータ) (2024-11-01T04:58:40Z) - PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback [106.63518036538163]
我々は、強化学習におけるポリシーアライメントの最近強調された重要な問題に対処するために、新しい統合された二段階最適化ベースのフレームワーク、textsfPARLを提案する。
本フレームワークは, 上向きの目標(逆設計)の分布を, 下向きの最適変数で明示的にパラメータ化することにより, これらの問題に対処する。
その結果,提案したtextsfPARL が RL のアライメントの懸念に対処できる可能性が示唆された。
論文 参考訳(メタデータ) (2023-08-03T18:03:44Z) - Multi-Task Off-Policy Learning from Bandit Feedback [54.96011624223482]
本稿では,階層型非政治最適化アルゴリズム (HierOPO) を提案する。
学習方針の準最適性にタスクごとのバウンダリを証明し、階層モデルを使用しないよりも明確な改善を示す。
我々の理論的および実証的な結果は、各タスクを個別に解くよりも、階層を使うことの明確な利点を示している。
論文 参考訳(メタデータ) (2022-12-09T08:26:27Z) - Option-Aware Adversarial Inverse Reinforcement Learning for Robotic
Control [44.77500987121531]
階層的模倣学習 (Hierarchical Imitation Learning, HIL) は, 長期作業における複雑度の高い動作を, 専門家による実証から再現するために提案されている。
逆逆強化学習に基づく新しいHILアルゴリズムを開発した。
また,目的をエンド・ツー・エンドで学習するための変分オートエンコーダフレームワークを提案する。
論文 参考訳(メタデータ) (2022-10-05T00:28:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。