論文の概要: ELVIS: Ensemble-Calibrated Latent Imagination for Long-Horizon Visual MPC
- arxiv url: http://arxiv.org/abs/2605.04709v1
- Date: Wed, 06 May 2026 09:59:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.760026
- Title: ELVIS: Ensemble-Calibrated Latent Imagination for Long-Horizon Visual MPC
- Title(参考訳): ELVIS:Long-Horizon Visual MPCのためのEnsemble-Calibrated Latent Imagination
- Abstract要約: 本稿では,長期計画の実現を目的とした潜在モデル予測制御(MPC)ELVISを提案する。
ELVISは14のDeepMind Control Suiteビジュアルタスクにおいて、TD-MPC2やDreamerV3と比較して最先端の性能を確立している。
- 参考スコア(独自算出の注目度): 5.4655013062645175
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A central challenge of visual control with model-based reinforcement learning (RL) is reliable long-horizon planning: long rollouts with learned latent dynamics exhibit branching futures and multi-modal action-value distributions. In addition, compounding model errors amplified by visual occlusions make deep imagination brittle. We present ELVIS, a latent model predictive controller (MPC) designed to make long-horizon planning practical. ELVIS plans in a Dreamer-style recurrent state space model (RSSM) and replaces standard unimodal model predictive path integral (MPPI) with a Gaussian-mixture MPPI that maintains multiple coherent hypotheses over long horizons, avoiding mode averaging under branching rollouts. In parallel, ELVIS stabilizes deep imagination with a shared uncertainty-aware lambda-return: an ensemble of latent critics defines an upper-confidence-bound (UCB) score that gates a time-varying lambda, adaptively trading off bootstrapping versus look-ahead to limit compounding error during planning. The same return is used both to train an actor-critic prior from imagined rollouts and to score candidate trajectories inside GMM-MPPI, aligning RL objectives with the planner's long-horizon optimization. On fourteen DeepMind Control Suite visual tasks, ELVIS establishes state-of-the-art performance compared with TD-MPC2 and DreamerV3. Finally, ELVIS transfers zero-shot to a real-world sand-spraying task with severe occlusions, improving surface-quality metrics and demonstrating robustness beyond simulation.
- Abstract(参考訳): モデルベース強化学習(RL)による視覚的制御の課題は、信頼できる長期計画である。
さらに、視覚的閉塞によって増幅された複合モデル誤差は、深い想像力の脆さを生じさせる。
本稿では,長期計画の実現を目的とした潜在モデル予測制御(MPC)ELVISを提案する。
ELVISはDreamerスタイルのリカレントステートスペースモデル(RSSM)を計画し、標準の単調モデル予測パス積分(MPPI)をガウス混合MPPIに置き換える。
ELVISは、共有された不確実性を認識したラムダ-リターンで、深い想像力を安定化する。 潜伏評論家のアンサンブルは、高信頼度バウンド(UCB)スコアを定義し、時間変化のあるラムダをゲートし、計画中の複合エラーを制限するためにブートストラップ対ルックアヘッドを適応的にトレーディングする。
同じリターンは、想定されたロールアウトからアクター-クリティカルをトレーニングしたり、GMM-MPPI内の候補軌跡をスコア付けしたり、RL目標をプランナーの長距離最適化と整合させるのに使用される。
ELVISは14のDeepMind Control Suiteビジュアルタスクにおいて、TD-MPC2やDreamerV3と比較して最先端の性能を確立している。
最後に、ELVISはゼロショットを深刻な閉塞を伴う現実世界のサンドスプレータスクに転送し、表面品質のメトリクスを改善し、シミュレーションを超えた堅牢性を示す。
関連論文リスト
- Koopman Dreamer: Spectrally Constrained Latent Dynamics for Stable World-Model Imagination [15.52449172412875]
潜在世界モデルは、想像された潜在軌道に対するポリシーを最適化することで、連続制御におけるサンプル効率を改善する。
我々は,スペクトル制約付き決定論的潜在動力学コアを持つドリーマースタイルの世界モデルであるクープマン・ドリーマーを提案する。
DeepMind Control Suite と UAV-LiDAR の自律航法による自己受容型連続制御タスクの実験結果から,Koopman Dreamer が長距離潜伏ロールアウトの安定性を向上させることが示された。
論文 参考訳(メタデータ) (2026-07-22T03:38:15Z) - Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning [11.461705552241163]
Closed-Loop Visual Reasoning (CLVR)は、視覚言語論理計画とピクセルレベルの拡散生成を結合した総合システムである。
CLVRは、信頼性の高い推論軌跡を合成するためのステップレベルの視覚的検証を備えた自動データエンジンを導入している。
繰り返し復調による遅延ボトルネックを軽減するため,DSWM($$-Space Weight)を提案する。
論文 参考訳(メタデータ) (2026-05-14T14:22:25Z) - GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control [0.0]
GIRL(Generative Imagination Reinforcement Learning)は、この障害モードに2つの重要なコンポーネントで対処する潜在的世界モデルフレームワークである。
GIRLは、DreamerV3に対するタスク間の遅延ロールアウトドリフトを38~61%削減し、リターンを改善し、長距離タスクでの環境相互作用を少なくする。
蒸留前の変種はオーバーヘッドを減らし、フルモデルに対する計算効率を向上させる。
論文 参考訳(メタデータ) (2026-04-08T17:14:21Z) - SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning [104.01865949020304]
エージェント・マルチモーダル・大規模言語モデル(MLLM)は,反復的な視覚的ツールの実行によって顕著な推論能力を達成する。
しかし、カスケード認識、推論、ツール呼び出しループは、重要なシーケンシャルなオーバーヘッドをもたらす。
このオーバーヘッドはエージェントディープと呼ばれ、禁止されたレイテンシを発生させ、システムレベルのスループットを著しく制限します。
本稿では,エージェントレベルの投機的アクセラレーションフレームワークであるSpecEyesを提案する。
論文 参考訳(メタデータ) (2026-03-24T17:45:47Z) - SPIRAL: A Closed-Loop Framework for Self-Improving Action World Models via Reflective Planning Agents [135.00390535239129]
本稿では,自己改善型計画および反復的行動世界モデリングフレームワークであるSPIRALを紹介する。
SPIRALはActWMをクローズドループシンク-アクト-リフレクションプロセスとして定式化し、そこで生成は明示的な計画とフィードバックの下で段階的に進行する。
複数のTI2Vバックボーンに対する実験は、ActWM-Benchとメインストリームのビデオ生成ベンチマークで一貫した利得を示している。
論文 参考訳(メタデータ) (2026-03-09T14:00:36Z) - Climber-Pilot: A Non-Myopic Generative Recommendation Model Towards Better Instruction-Following [19.550149895505683]
Climber-Pilotは統合された生成検索フレームワークである。
TAMIP(Time-Aware Multi-Item Prediction)は、遺伝的検索において固有の近視を緩和する新しいトレーニングパラダイムである。
また,ビジネス制約をスパース・アテンションを介して生成プロセスに直接組み込むコンディションガイド付きスパース・アテンション(CGSA)を提案する。
論文 参考訳(メタデータ) (2026-02-14T03:46:06Z) - Unifying Quadrotor Motion Planning and Control by Chaining Different Fidelity Models [23.059638804041672]
Uniqueは統一的なMPCであり、単一の最適化内で異なる忠実度のモデルをカスケードする。
水平線に沿った標準的障害物を変形させる3Dプログレッシブ・スムースティング・スケジュールを提案する。
Uniqueは、標準的なMPCや階層的なプランナートラッカーベースラインと比較して、クローズドループ位置または速度トラッキングを最大75%改善する。
論文 参考訳(メタデータ) (2025-12-13T18:53:34Z) - Bench2Drive-R: Turning Real World Data into Reactive Closed-Loop Autonomous Driving Benchmark by Generative Model [63.336123527432136]
我々は,リアクティブ閉ループ評価を可能にする生成フレームワークであるBench2Drive-Rを紹介する。
既存の自動運転用ビデオ生成モデルとは異なり、提案された設計はインタラクティブなシミュレーションに適したものである。
我々は、Bench2Drive-Rの生成品質を既存の生成モデルと比較し、最先端の性能を達成する。
論文 参考訳(メタデータ) (2024-12-11T06:35:18Z) - Oscillatory State-Space Models [61.923849241099184]
長いシーケンスを効率的に学習するための線形状態空間モデル(LinOSS)を提案する。
高速な連想並列スキャンを用いて時間とともに統合された安定な離散化により、提案した状態空間モデルが得られる。
我々はLinOSSが普遍であること、すなわち時間変化関数間の連続および因果作用素写像を近似できることを示す。
論文 参考訳(メタデータ) (2024-10-04T22:00:13Z) - ViR: Towards Efficient Vision Retention Backbones [97.93707844681893]
視覚保持ネットワーク(ViR)と呼ばれる新しいコンピュータビジョンモデルを提案する。
ViRは並列および繰り返しの定式化を持ち、高速推論と並列トレーニングと競合性能の最適なバランスをとる。
我々は,様々なデータセットサイズと様々な画像解像度を用いた広範囲な実験により,ViRの有効性を検証した。
論文 参考訳(メタデータ) (2023-10-30T16:55:50Z) - PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For
Vision-and-Language Navigation [6.11362142120604]
ヴィジュアル・アンド・ランゲージ・ナビゲーション(VLN)は、重要な、しかし困難なクロスモーダル・ナビゲーションタスクである。
VLNの性能を高める強力な手法の1つは、データ拡張のための擬似命令を提供する独立話者モデルを使用することである。
本稿では,ネットワークのコアとしてトランスフォーマーを用いるPASTSモデルを提案する。
論文 参考訳(メタデータ) (2023-05-19T02:25:56Z) - Modular Deep Reinforcement Learning for Continuous Motion Planning with
Temporal Logic [59.94347858883343]
本稿では,マルコフ決定過程(MDP)をモデルとした自律動的システムの運動計画について検討する。
LDGBA と MDP の間に組込み製品 MDP (EP-MDP) を設計することである。
モデルフリー強化学習(RL)のためのLDGBAベースの報酬形成と割引スキームは、EP-MDP状態にのみ依存する。
論文 参考訳(メタデータ) (2021-02-24T01:11:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。