論文の概要: LePlanner: An Iterative Amortized Controller For World Models
- arxiv url: http://arxiv.org/abs/2609.13845v1
- Date: Sat, 12 Sep 2026 10:01:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.580292
- Title: LePlanner: An Iterative Amortized Controller For World Models
- Title(参考訳): LePlanner:世界モデルのための反復的アモータライズドコントローラ
- Abstract要約: 本研究では,凍結したワールドモデル予測器を用いて遅延動作シーケンスの構築と洗練を学習する,償却反復制御器LePlannerを提案する。
LePlannerは、最初期の地平線で目標に達するようコントローラに促し、そこに留まるよう、到着と保持の目的で訓練されている。
成功率はPushTが98%、Reacherが100%、TwoRoomsが100%、OGBench Cubeが92%である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World models trained with joint-embedding predictive architectures learn compact, structured latent representations from physical interaction, yet planning in these latent spaces typically relies on one of two costly approaches. Search-based planners such as CEM, MPPI, and iCEM optimize action sequences through many predictor rollouts, achieving strong performance at the cost of high per-decision compute and latency. Policy-based methods amortize inference into a single forward pass but can degrade on contact-rich tasks where the demonstration distribution is multimodal. We propose LePlanner, an amortized iterative controller that learns to construct and refine latent action sequences through a frozen world-model predictor. LePlanner is trained with an arrival-and-hold objective that encourages the controller to reach the goal at the earliest feasible horizon and remain there. This addresses horizon-reset procrastination, a failure mode in which repeated receding-horizon replanning continually postpones goal arrival. An additional action-Gaussian loss keeps generated actions near the support of the offline dataset. Across navigation, contact-rich manipulation, and continuous-control environments, LePlanner matches or exceeds search-based planners while requiring an order of magnitude fewer predictor evaluations and 3-49x lower wall-clock time per decision. It achieves success rates of 98% on PushT, 100% on Reacher, 100% on TwoRooms, and 92% on the OGBench Cube task. These results show that much of the structure discovered through online search can be amortized into a lightweight iterative policy, enabling fast, horizon-aware, nonlinear physical control without online optimization.
- Abstract(参考訳): 共同埋め込み予測アーキテクチャで訓練された世界モデルは、物理的相互作用からコンパクトで構造化された潜在表現を学ぶが、これらの潜在空間における計画は通常2つのコストのかかるアプローチの1つに依存する。
CEM、MPPI、iCEMなどの検索ベースのプランナは、多くの予測ロールアウトを通じてアクションシーケンスを最適化し、高い計算とレイテンシを犠牲にして高いパフォーマンスを達成する。
ポリシーベースの手法は、推論を1つのフォワードパスに補正するが、デモ分布がマルチモーダルなコンタクトリッチなタスクで分解できる。
本研究では,凍結したワールドモデル予測器を用いて遅延動作シーケンスの構築と洗練を学習する,償却反復制御器LePlannerを提案する。
LePlannerは、最初期の地平線で目標に達するようコントローラに促し、そこに留まるよう、到着と保持の目的で訓練されている。
このことは水平リセットの確率化に対処し、繰り返しリフレディング・ホライゾンを計画し、ゴールの到達を延期する失敗モードである。
追加のアクション-ガウス損失は、オフラインデータセットのサポートの近くで生成されたアクションを保持します。
ナビゲーション、コンタクトリッチな操作、連続制御環境を通じて、LePlannerは検索ベースのプランナーにマッチするか、あるいは超過するが、予測器の評価は桁違いに少なく、決定毎に3,49倍低い壁時計時間を必要とする。
成功率はPushTが98%、Reacherが100%、TwoRoomsが100%、OGBench Cubeが92%である。
これらの結果から、オンライン検索によって発見された構造の多くは軽量な反復ポリシーに改ざんされ、高速で地平線を意識した非線形物理制御をオンラインでの最適化なしに実現できることが示唆された。
関連論文リスト
- Geometric Distributional Control: Learning Progress with Partial Structural Knowledge [6.099441855983951]
予測的最適化とモデルベース制御は、動的、パラメータ、目的、オンライン計画モデルが指定されたときに強力である。
強化学習はこの要件を緩和することができるが、シーケンシャルなデータと相互作用から長い水平値の信号を推測する必要がある。
この中間体制は、自動運転、倉庫ロボット、交通制御、配送ドローンを含むシステムで一般的である。
幾何分布制御(GDC)はこの部分的知識設定のために設計されており、制御を実現可能性と進歩に分解する。
論文 参考訳(メタデータ) (2026-09-06T01:39:05Z) - Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control [8.39933163242427]
JEPAsは、ピクセルを再構築するのではなく、表現空間で予測することで世界モデルを学ぶ。
以前のJEPAプランナーは、しばしば埋め込み幾何学(典型的には遅れたユークリッド距離)からランキングを継承する。
本稿では,LWMエンコーダのバックボーンを保持するテンポラルディスタンスJEPAを提案する。
論文 参考訳(メタデータ) (2026-07-28T06:38:16Z) - PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models [50.232333672172395]
VLA(Vision-Language-Action)モデルは、ロボット操作の統一パラダイムを提供するが、実際のデプロイメントは実行効率によってボトルネックになることが多い。
強化学習に基づくポストトレーニングフレームワークである textbfPolicyTrim を提案する。
私たちのフレームワークは、タスクの成功率を損なうことなく、最大5.83$times$エンドツーエンドのデプロイメントスピードアップを提供します。
論文 参考訳(メタデータ) (2026-06-21T14:54:07Z) - Latent Geometry Beyond Search: Amortizing Planning in World Models [17.571800971505787]
学習した表現は、単に予測を有効にするのではなく、制御を単純化できることを示す。
反復計画を手軽なゴール条件逆ダイナミクスモデル(GC-IDM)に置き換える
コントローラは環境プロトコール設定8つのうち7つでCEMと一致または超過し、判定あたりのコストを100-130倍に削減する。
論文 参考訳(メタデータ) (2026-05-09T06:36:23Z) - Predictive but Not Plannable: RC-aux for Latent World Models [44.63243875072762]
到達可能性補正補助(RC-aux)
本稿では,このミスマッチに対する軽量な補正法であるReachability-Correctionssisted (RC-aux)を提案する。
RC-auxは世界モデルのバックボーンを変更せず、2つの軸に沿って計画に沿った監督を追加する。
論文 参考訳(メタデータ) (2026-05-08T05:43:33Z) - Long-Horizon Manipulation via Trace-Conditioned VLA Planning [55.80061850746898]
LoHo-Manipは、短い水平VLA実行を専用のタスク管理VLMを介して長い水平命令にスケールするフレームワークである。
LoHo-Manipは、サブタスクシーケンスと明示的な完了+残り分割を軽量言語メモリとして組み合わせた、進捗対応の残計画を予測する。
実行器VLAは、レンダリングされたトレースの条件に適合し、長い水平決定を繰り返しローカル制御に変換する。
論文 参考訳(メタデータ) (2026-04-23T17:59:04Z) - Anticipatory Planning for Multimodal AI Agents [77.62643381558613]
予測推論を明示的に訓練する2段階強化学習フレームワークであるTraceR1を紹介する。
TraceR1は、オンラインコンピュータ使用、オフラインコンピュータ使用ベンチマーク、マルチモーダルツール使用推論タスクを含む、7つのベンチマークで評価されている。
以上の結果から,予測軌道推論は,複雑な実環境において効果的に推論,計画,行動が可能なマルチモーダルエージェント構築の鍵となる原理であることが示唆された。
論文 参考訳(メタデータ) (2026-03-17T16:55:11Z) - Compositional Planning with Jumpy World Models [70.74595987225908]
我々は、事前訓練されたポリシーを構成するエージェントを時間的に拡張したアクションとして研究し、構成員だけでは解決できない複雑なタスクに対する解決を可能にする。
arXiv:2206.08736で導入された幾何学的ポリシー構成フレームワークをモチベーションとして,多段階力学の予測モデルを学習することにより,これらの課題に対処する。
論文 参考訳(メタデータ) (2026-02-23T09:22:21Z) - Variable Time-Step MPC for Agile Multi-Rotor UAV Interception of Dynamic Targets [6.0967385124149756]
既存の非線形モデル予測制御手法を使用したアジャイルプランニングは、ますます需要が高まるにつれて計画手順の数によって制限される。
本稿では,変動時間ステップを導入し,予測水平長と組み合わせることで,これらの制約に対処することを提案する。
簡易な点質量運動プリミティブは、四重項力学の微分平坦性と、平坦な出力空間における可能な軌道の軌道生成を利用するために用いられる。
論文 参考訳(メタデータ) (2025-03-18T11:59:24Z) - Model-Based Reinforcement Learning via Latent-Space Collocation [110.04005442935828]
我々は、行動だけでなく、状態の順序を計画することで、長期的タスクの解決がより容易であると主張する。
我々は、学習された潜在状態空間モデルを利用して、画像に基づく設定に最適な制御文献における長い水平タスクに対する良い結果を示すコロケーションの概念を適応させる。
論文 参考訳(メタデータ) (2021-06-24T17:59:18Z) - Long-Horizon Visual Planning with Goal-Conditioned Hierarchical
Predictors [124.30562402952319]
未来に予測し、計画する能力は、世界で行動するエージェントにとって基本である。
視覚的予測と計画のための現在の学習手法は、長期的タスクでは失敗する。
本稿では,これらの制約を克服可能な視覚的予測と計画のためのフレームワークを提案する。
論文 参考訳(メタデータ) (2020-06-23T17:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。