論文の概要: World Action Modeling with Progressive Visual Planning
- arxiv url: http://arxiv.org/abs/2610.02508v1
- Date: Thu, 01 Oct 2026 21:32:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.09291
- Title: World Action Modeling with Progressive Visual Planning
- Title(参考訳): プログレッシブ・ビジュアル・プランニングによる世界行動モデリング
- Abstract要約: 本稿では,協調して行動を予測するプログレッシブ・ワールド・アクション・モデルであるProWAMについて述べる。
この設計は、大規模アクションフリービデオからサブゴール予測を学ぶことができるため、自然にスケールする。
効率的なアクション生成のために、ProWAMは単一のビデオバックボーンフォワードパスを実行し、スパースサブゴール機能をキャッシュする。
- 参考スコア(独自算出の注目度): 42.47105321176084
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: World action models (WAMs) have emerged as a promising paradigm for robotic control by jointly predicting future visual dynamics and actions from an initial observation and instruction. However, existing WAMs struggle with long-horizon prediction, as generating dense video rollouts is highly inefficient. Some recent WAMs address this by predicting a single future frame without generating the full video, but this approach neglects how to progress toward the goal. We present ProWAM, a progressive world action model that jointly predicts actions and an ordered sequence of sparse visual sub-goals, providing explicit visual guidance to anchor action generation throughout task execution. This design scales naturally, as sub-goal prediction can be learned from large-scale action-free videos, allowing the video backbone to offload complex visual planning from the action policy. For efficient action generation, ProWAM executes a single video-backbone forward pass to cache sparse sub-goal features, eliminating iterative full-video generation and requiring only lightweight action denoising during replanning. Across extensive evaluations, ProWAM achieves superior out-of-distribution robustness. On simulation benchmarks, it sets new state-of-the-art results on LIBERO-Plus (85.8%) and randomized RoboTwin (75.7%), outperforming the strongest baseline with relative gains of up to +35.9%. On RoboCasa365, ProWAM achieves a 48.1% success rate and 18.2% on the challenging Composite-Unseen split, ranking 4th overall. Crucially, in zero-shot real-world experiments, ProWAM achieves 70.0% success, outperforming the strongest baseline by +15.0 (from 55.0% to 70.0%, a +27.3% relative gain) in novel scenes. These results demonstrate the value of progress-indexed visual foresight for closed-loop control. Our program is in https://sii-ferenas.github.io/ProWAM-page.
- Abstract(参考訳): 世界行動モデル(WAM)は、初期の観察と指示から将来の視覚力学とアクションを共同で予測することで、ロボット制御のための有望なパラダイムとして登場した。
しかし、既存のWAMは高密度ビデオのロールアウトの発生が非常に非効率であるため、長期にわたる予測に苦慮している。
最近のWAMでは、フルビデオを生成することなく、単一の将来のフレームを予測することでこの問題に対処しているが、このアプローチは目標に向かって進む方法を無視している。
ProWAMは,タスク実行中にアクション生成をアンカーするための視覚的ガイダンスを提供するとともに,アクションの予測と,スパースな視覚サブゴールの順序を協調的に行うプログレッシブワールドアクションモデルを提案する。
この設計は、大規模なアクションフリービデオからサブゴール予測を学ぶことができ、ビデオバックボーンがアクションポリシーから複雑なビジュアルプランニングをオフロードできるようにするため、自然にスケールする。
効率的なアクション生成のために、ProWAMは単一のビデオバックボーンフォワードパスを実行し、スパースサブゴールの機能をキャッシュし、反復的なフルビデオ生成を排除し、リプラン中の軽量アクションしか必要としない。
ProWAMは広範に評価され、より優れたアウト・オブ・ディストリビューション・ロバスト性を実現する。
シミュレーションベンチマークでは、LIBERO-Plus (85.8%) とランダム化されたRoboTwin (75.7%) に新たな最先端の結果を設定し、高いベースラインを上回り、相対利得は+35.9%となった。
RoboCasa365では、ProWAMが48.1%の成功率と18.2%を達成し、総合4位となった。
重要なことは、ゼロショットの実世界実験において、ProWAMは70.0%の成功を達成し、新規シーンにおいて最強のベースラインである+15.0(55.0%から70.0%、+27.3%の相対的なゲイン)を上回っている。
これらの結果から,閉ループ制御における進捗予測値が得られた。
私たちのプログラムはhttps://sii-ferenas.github.io/ProWAM-pageにある。
関連論文リスト
- The Planning Limits of Latent World Models [27.2709460237741]
5つの凍結した自己教師付き視覚バックボーン上に構築された動作条件付き予測器を使用する。
私たちは、世界モデルが、ゴールが計画中に想定される軌道内にあるとき、あるいは少し先にあるときのみ、アクションの選択を確実に導くことに気付きました。
論文 参考訳(メタデータ) (2026-09-30T08:05:32Z) - EVO-WAM: Evolving World Action Models through Video-Action Verification [51.68210232964847]
EVO-WAMは、自身の生成したビデオアクション軌跡から学習することで、WAMを見えないタスクに適応するフレームワークである。
コスモス3の平均成功率は20.0%から76.7%に改善され、56.7%となった。
論文 参考訳(メタデータ) (2026-09-29T17:25:35Z) - Achieve What You Imagined: Learning to Align Actions with Visual Plans [37.7412146305617]
世界行動モデルは、将来の視覚的な観察とロボットのアクションを共同で予測することができる。
視覚的予測と、生成された行動によって引き起こされる結果の間には、相違がある可能性がある。
我々は、フリーズされた行動条件付き世界モデルを用いて、行動条件付き結果の予測とフィードバックの構築を行う。
論文 参考訳(メタデータ) (2026-09-27T18:32:40Z) - DeltaWAM: Delta World Action Models for Bimanual Manipulation [61.57435324858005]
ワールドアクションモデル(WAM)は、事前訓練されたビデオジェネレータから、視覚力学とアクションを共同でモデル化することによって、視覚と動きの先行をロボット制御に転送する。
本稿では,高密度アンカー,スパースデルタ,アクションストリームを用いて,視覚的デルタとアクションを共同で予測するDeltaWAMを提案する。
RoboTwinでは、SDMを使用したDeltaWAMは、Fast-WAMの平均的な成功を81.3%から85.4%に改善し、ビジュアルランダム化の下で75.8%から83.9%に改善した。
論文 参考訳(メタデータ) (2026-09-23T21:45:16Z) - Latent Action as Intention Enables Efficient Future Imagination for World Action Models [20.031922437200524]
提案するアーキテクチャ**LAWA**は,コンパクトな潜伏動作を将来の意図の操作的表現として利用するWAMアーキテクチャである。
RoboCasaでは、LAWAは数ショットと全データ設定で65.6%と80.8%という最先端の平均的な成功率を達成した。
また、一致したJoint-WAMモデルの性能レベルも保持し、42.9%の遅延時間を必要とする。
論文 参考訳(メタデータ) (2026-08-25T17:59:03Z) - Grounded World Model for Semantically Generalizable Planning [94.53923128709965]
我々は、視覚言語対応の潜在空間において、グラウンドドワールドモデル(GWM)を学習する。
提案された各アクションは、タスク命令に対する将来の結果がどの程度近いかに基づいてスコアされる。
提案したWISERベンチマークでは、GWM-MPCはテストセットで87%の成功率を達成した。
論文 参考訳(メタデータ) (2026-04-13T17:25:41Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。