論文の概要: Mind the Gap: Promises and Pitfalls of Hierarchical Planning in LeWorldModel
- arxiv url: http://arxiv.org/abs/2607.12547v2
- Date: Wed, 15 Jul 2026 08:41:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 14:31:40.675104
- Title: Mind the Gap: Promises and Pitfalls of Hierarchical Planning in LeWorldModel
- Title(参考訳): Mind the Gap: LeWorldModelにおける階層的計画の約束と落とし穴
- Abstract要約: 事前学習した低レベルLeWMを凍結する拡張であるHi-LeWMを導入し、潜在サブゴールに対して高レベルプランニングを追加する。
我々は、PushTとCube上のHi-LeWMをゴールオフセットの増加によって評価した。
- 参考スコア(独自算出の注目度): 0.10262304700896198
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We investigate whether temporal hierarchy can improve LeWorldModel on long-horizon goal-conditioned control. We introduce Hi-LeWM, an extension that freezes the pretrained low-level LeWM and adds high-level planning over latent subgoals. We evaluate Hi-LeWM on PushT and Cube across increasing goal offsets. Hierarchy does not automatically improve performance: at short horizons, the best configuration uses a one-step high-level horizon, while longer horizons reveal a mismatch between the learned high-level action space and the inference-time search distribution. Experiments with true future latent subgoals show that the frozen low-level controller can execute well-aligned intermediate targets, indicating that high-level subgoal generation is the main bottleneck. Unconstrained search can select latent macro-actions that appear favorable under the learned model but produce poor control targets. Constraining search around macro-actions encoded from training trajectories, with appropriate subgoal execution timing, recovers useful hierarchical regimes, improving over flat LeWM by +11.3 percentage points at medium-range horizons and +14.7 percentage points at the longest PushT horizon. Overall, temporal abstraction can benefit compact frozen LeWM, but only when high-level search remains compatible with the low-level controller
- Abstract(参考訳): 長期目標条件制御において時間的階層構造がLeWorldModelを改善できるかどうかを検討する。
事前学習した低レベルLeWMを凍結する拡張であるHi-LeWMを導入し、潜在サブゴールに高レベルプランニングを追加する。
我々は、PushTとCube上のHi-LeWMをゴールオフセットの増加によって評価した。
短期的には、最良の構成は1ステップのハイレベルな水平線を使い、長い水平線は学習されたハイレベルな行動空間と推論時探索分布のミスマッチを示す。
将来の潜在サブゴールを用いた実験では、凍結した低レベルコントローラが適切に整合した中間ターゲットを実行できることが示され、ハイレベルサブゴール生成が主なボトルネックであることが示された。
制約のない探索は、学習モデルの下で好ましくないように見える潜在マクロアクションを選択できるが、制御ターゲットは貧弱である。
訓練軌跡から符号化されたマクロアクションの探索と適切なサブゴール実行タイミングにより、有用な階層構造を回復し、中距離地平線で+11.3ポイント、最長のPushT地平線で+14.7ポイント向上する。
全体としては、時間的抽象化はコンパクトな冷凍LeWMの恩恵を受けるが、低レベルコントローラとの互換性が保たれている場合のみである。
関連論文リスト
- LePlanner: An Iterative Amortized Controller For World Models [0.0]
本研究では,凍結したワールドモデル予測器を用いて遅延動作シーケンスの構築と洗練を学習する,償却反復制御器LePlannerを提案する。
LePlannerは、最初期の地平線で目標に達するようコントローラに促し、そこに留まるよう、到着と保持の目的で訓練されている。
成功率はPushTが98%、Reacherが100%、TwoRoomsが100%、OGBench Cubeが92%である。
論文 参考訳(メタデータ) (2026-09-12T10:01:21Z) - Offline RL with Hierarchical Action Chunking [0.0]
HiQC(Hierarchical Implicit Q-Chunking)は、高レベル遅延計画と低レベルアクションチャンキングを組み合わせたオフラインゴール条件RLアルゴリズムである。
HiQCは、OGBenchスイートで比較したメソッドの中で、最も高い集計性能を達成している。
論文 参考訳(メタデータ) (2026-07-23T01:48:46Z) - HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning [51.95194664412812]
大規模言語モデル(LLM)は、幅広いタスクにまたがる自律エージェントとして強力な能力を示している。
長期LLMエージェント学習のための階層的計画と情報フォールディング(HIPIF)を提案する。
HIPIFはエージェントをエンドツーエンドにトレーニングし、明示的なサブゴールの周りに長い水平実行を組織すると同時に、完了したサブゴール履歴を折り畳み、長いコンテキスト干渉を減らす。
論文 参考訳(メタデータ) (2026-06-09T07:35:14Z) - Adaptive Coarse-to-Fine Subgoal Refinement for Long-Horizon Offline Goal-Conditioned Reinforcement Learning [16.15046948057208]
我々は,実行前に遠隔目標を適応的に洗練する完全オフライン目標条件強化学習フレームワークを提案する。
OGBenchの実験は、提案された改善と停止機構を検証し、いくつかの長期的タスクに対してかなりの効果を示した。
論文 参考訳(メタデータ) (2026-05-27T08:17:01Z) - Switching Successor Measures for Hierarchical Zero-shot Reinforcement Learning [49.24483784910263]
我々は、強化学習における階層的制御を可能にする後継尺度である切替後継尺度を導入する。
後継策の切り替えは,その構造を保ちながら,古典的後継措置から自然に生じることを示す。
FB$-Switchは非階層的ベースラインよりも改善されている。
論文 参考訳(メタデータ) (2026-05-13T08:58:33Z) - Lifting Embodied World Models for Planning and Control [59.09016913513998]
我々は、ハイレベルなアクションを低レベルなジョイントアクションのシーケンスにマッピングする軽量なポリシーを訓練する。
我々は、この枠組みを人間的な実施のためにインスタンス化し、ハイレベルなアクション空間を2次元のウェイポイントの小さなセットとして定義する。
昇降した世界モデルは,低レベルな関節空間で直接探索するよりもかなり優れていることを示す。
論文 参考訳(メタデータ) (2026-04-28T23:59:19Z) - Push Smarter, Not Harder: Hierarchical RL-Diffusion Policy for Efficient Nonprehensile Manipulation [8.7216199131049]
HeRDは階層的な強化学習拡散政策であり、プッシュタスクを高レベルの目標選択と低レベルの軌道生成という2つのレベルに分解する。
我々は、中間空間目標を選択するための高レベル強化学習エージェントと、それに到達するための実用的で効率的な軌道を生成するための低レベル目標条件拡散モデルを用いる。
この結果から,階層的制御を低レベル計画に組み込むことが,スケーラブルで目標指向の非包括的操作において有望な方向であることが示唆された。
論文 参考訳(メタデータ) (2025-12-10T21:40:22Z) - Hierarchical LoRA MoE for Efficient CTR Model Scaling [56.608809143548946]
HiLoMoEは階層的なLoRA MoEフレームワークで、パラメータ効率のよい全体的なスケーリングを可能にする。
従来のスタックとは異なり、HiLoMoEルートは出力ではなく前のレイヤスコアに基づいており、すべてのレイヤが並列に実行される。
論文 参考訳(メタデータ) (2025-10-12T03:54:11Z) - Divide and Conquer: Grounding LLMs as Efficient Decision-Making Agents via Offline Hierarchical Reinforcement Learning [32.260964481673085]
大規模言語モデル(LLM)は、不十分な探索と長期クレジット割り当てのために、長期的な意思決定タスクに苦しむ。
本稿では, LLMポリシーにパラメータ効率が高く, 一般に適用可能な階層構造を導入する, 革新的なフレームワークを提案する。
我々は,低レベル制御器を抽象的なステップバイステップ計画で制御し,高レベル制御器で学習・指導する手法を開発した。
論文 参考訳(メタデータ) (2025-05-26T09:43:40Z) - CHD: Coupled Hierarchical Diffusion for Long-Horizon Tasks [10.13048343565914]
拡散に基づくプランナーは、短期水平タスクでは強い性能を示してきたが、しばしば複雑な長期水平設定では失敗する。
本稿では,HLサブゴールとLL軌道を統一拡散過程内で共同でモデル化するフレームワークであるCoupled Hierarchical Diffusionを提案する。
迷路のナビゲーション、テーブルトップ操作、家庭環境における実験は、CHDがフラットな拡散ベースラインと階層的な拡散ベースラインの両方を一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-05-12T06:21:48Z) - PlanDQ: Hierarchical Plan Orchestration via D-Conductor and Q-Performer [47.924941959320996]
我々はPlanDQと呼ばれるオフラインRL用に設計された階層型プランナを提案する。
PlanDQはD-Conductorという名前の拡散型プランナーを高レベルに組み込んでおり、サブゴールを通じて低レベル政策を導く。
低レベルでは、これらのサブゴールを達成するためにQ-Performerと呼ばれるQ-ラーニングベースのアプローチを使用しました。
論文 参考訳(メタデータ) (2024-06-10T20:59:53Z) - Modular Deep Reinforcement Learning for Continuous Motion Planning with
Temporal Logic [59.94347858883343]
本稿では,マルコフ決定過程(MDP)をモデルとした自律動的システムの運動計画について検討する。
LDGBA と MDP の間に組込み製品 MDP (EP-MDP) を設計することである。
モデルフリー強化学習(RL)のためのLDGBAベースの報酬形成と割引スキームは、EP-MDP状態にのみ依存する。
論文 参考訳(メタデータ) (2021-02-24T01:11:25Z) - From proprioception to long-horizon planning in novel environments: A
hierarchical RL model [4.44317046648898]
本稿では,異なるタイプの推論を反映した,単純で3段階の階層型アーキテクチャを提案する。
本手法をMujoco Ant環境における一連のナビゲーションタスクに適用する。
論文 参考訳(メタデータ) (2020-06-11T17:19:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。