論文の概要: StageWAM: Joint-Embedding Stage Prediction for World-Action Models in Robot Manipulation
- arxiv url: http://arxiv.org/abs/2608.10780v3
- Date: Fri, 14 Aug 2026 09:29:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.211067
- Title: StageWAM: Joint-Embedding Stage Prediction for World-Action Models in Robot Manipulation
- Title(参考訳): StageWAM: ロボットマニピュレーションにおけるワールドアクションモデルの複合埋め込みステージ予測
- Abstract要約: 汎用ロボット政策は多モード観察と言語課題指示を多様なタスクにわたる行動にマッピングすることを目的としている。
この短期的未来は、アクション実行のためのローカルシーンの進化をキャプチャするが、タスクが現在のステージから次のステージへとどのように進むかを明確に記述していない。
本稿では,モータスをベースとしたワールドアクションモデル(WAM)を,目標条件付きJEPA予測器であるStage-JEPAで拡張するステージWAMを紹介する。
- 参考スコア(独自算出の注目度): 38.32341379152637
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generalist robot policies aim to map multimodal observations and linguistic task instructions to actions across diverse tasks. However, existing methods typically represent the future as a fixed, short video-action chunk. This short-term future captures local scene evolution for action execution, but it does not explicitly describe the stage-level future that specifies how a task should progress from its current stage to the next. We therefore distinguish two complementary futures for robot manipulation: a short-term physical future to capture local scene evolution and a stage-level semantic future to represent task progress. We introduce StageWAM, which augments a Motus-based World Action Model (WAM) with Stage-JEPA, a goal-conditioned Joint-Embedding Predictive Architecture (JEPA) predictor. Given the current observation and task instruction, Stage-JEPA uses a frozen V-JEPA2 encoder to extract the current-state representation and predicts the latent target of the next inferred stage. Across 50 RoboTwin 2.0 tasks in clean and randomized environments, StageWAM achieves 90.25% overall success and reduces the mean number of execution steps in successful rollouts by 5.97% relative to the strongest baseline.
- Abstract(参考訳): 汎用ロボット政策は多モード観察と言語課題指示を多様なタスクにわたる行動にマッピングすることを目的としている。
しかし、既存の手法は、通常、未来を固定された短いビデオアクションチャンクとして表現する。
この短期的未来は、アクション実行のためのローカルシーンの進化をキャプチャするが、タスクが現在のステージから次のステージへとどのように進むかを明確に記述していない。
そこで我々は,ロボット操作における2つの補完的未来を,局所的なシーンの進化を捉えた短期的な物理的未来と,タスクの進行を表現した段階的な意味的未来とを区別した。
本稿では,モータスをベースとしたワールドアクションモデル(WAM)を,目標条件付きJEPA予測器であるStage-JEPAで拡張するステージWAMを紹介する。
現在の観測とタスク命令が与えられた場合、Stage-JEPAは凍結したV-JEPA2エンコーダを使用して現在の状態表現を抽出し、次の推論ステージの潜在目標を予測する。
クリーンでランダムな環境における50のRoboTwin 2.0タスクのうち、StageWAMは90.25%の全体的な成功を達成し、最も強いベースラインに対するロールアウトにおける実行手順の平均を5.97%削減する。
関連論文リスト
- Learning to Use Imagination: Progress-Conditioned Future Utilization for World Action Models [72.02240114225107]
World Action Models (WAM) は、将来の視覚力学をアクション生成に組み込むことでビジョン・ランゲージ・アクション(VLA)モデルを拡張する。
既存のWAMは、実行の進行に限られた適応性を持つ想像上の未来をしばしば利用し、注意散らしや信頼性の低い予測方法を導入する可能性がある。
本稿では,プログレッシブ・コンディションド・ワールド・アクション・モデルであるProWAMを提案する。
論文 参考訳(メタデータ) (2026-09-06T12:46:20Z) - S2-HWM: Sparse Event-Structured Hierarchical World Model for Long-Horizon Surgical Robot Manipulation [8.13774443902788]
不規則な間隔で意味のある相互作用が生じる一方で、タスク報酬が不足しているため、長期手術ロボットの操作は困難である。
本稿では,スパースイベント構造化階層的世界モデルであるS2-HWMを提案する。
SurRoLベースのPegTransferタスクでは、S2-HWMが98.7%の成功率を獲得し、GAS DreamerV3ベースラインを22.7%上回る。
論文 参考訳(メタデータ) (2026-08-13T11:29:20Z) - JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling [23.76460420882974]
我々は,事前訓練されたV-JEPA空間に構築された潜水型WAMであるJEPA-WAMを紹介する。
遅延遷移予測と、共有予測器による連続的なアクション生成を結合する。
LIBERO-Plusでは、JEPA-WAMは79.2%を達成し、大規模なロボット政策の事前訓練を行わない最も良い結果となった。
論文 参考訳(メタデータ) (2026-08-10T09:57:54Z) - LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies [31.88655699486955]
ラワント・アクション条件付きラワント・ワールドモデル(LaWM)を提案する。
LaWAMは、将来のビデオの再構成ではなく、コンパクトで潜伏した視覚サブゴールを通じて、ロボットポリシーに対する予測ダイナミクスを公開する。
LaWAMはアクションチャンク予測あたり187msで動作し、画素空間のWAMよりも最大24倍の遅延時間を実現する。
論文 参考訳(メタデータ) (2026-06-14T12:06:58Z) - When to Trust Imagination: Adaptive Action Execution for World Action Models [42.51856318901667]
世界行動モデル(WAM)は、近ごろ、将来の視覚的観察と将来の行動を共同で予測することによって、ロボット操作のための有望なパラダイムとして登場した。
現在のWAMは、各モデル推論の後、一定の数の予測アクションを実行し、ロボットは、想像された未来が実際の物理的なロールアウトと一致しているかどうかを無視する。
我々は,将来性検証問題として適応型WAM実行を定式化し,WAM予測された未来が信頼性を保ちながらロボットはより長く実行すべきであり,現実が想像力から逸脱した場合にはより早く再計画する。
論文 参考訳(メタデータ) (2026-05-07T13:18:28Z) - Grounded World Model for Semantically Generalizable Planning [94.53923128709965]
我々は、視覚言語対応の潜在空間において、グラウンドドワールドモデル(GWM)を学習する。
提案された各アクションは、タスク命令に対する将来の結果がどの程度近いかに基づいてスコアされる。
提案したWISERベンチマークでは、GWM-MPCはテストセットで87%の成功率を達成した。
論文 参考訳(メタデータ) (2026-04-13T17:25:41Z) - ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation [57.07494675832939]
ロボット操作のための既存の視覚言語アクション(VLA)モデルは、進歩意識を欠いている。
本研究では,textbf vla という新しいモデルを提案し,タスク進捗の推定と統合について検討する。
CALVINとLIBEROベンチマークの実験は、実世界のロボットの展開とともに、成功率の大幅な改善を一貫して示している。
論文 参考訳(メタデータ) (2026-03-29T12:38:11Z) - Value-guided action planning with JEPA world models [44.84158001773079]
環境を推論できるディープラーニングモデルを構築するには、その基盤となるダイナミクスをキャプチャする必要がある。
JEPA(Joint-Embeded Predictive Architectures)は、そのようなダイナミクスをモデル化するための有望なフレームワークを提供する。
本稿では,JEPAワールドモデルを用いて,表現空間を形作ることで計画を強化する手法を提案する。
論文 参考訳(メタデータ) (2025-12-28T20:17:49Z) - REMAC: Self-Reflective and Self-Evolving Multi-Agent Collaboration for Long-Horizon Robot Manipulation [57.628771707989166]
本稿では,ReMACと呼ばれる適応型マルチエージェント計画フレームワークを提案する。
ReMACには2つの重要なモジュールが組み込まれており、ループ内で事前条件と後条件チェックを実行し、進捗と計画の洗練を評価する。
論文 参考訳(メタデータ) (2025-03-28T03:51:40Z) - Progressive Pretext Task Learning for Human Trajectory Prediction [44.07301075351432]
本稿では,PPT(Progressive Pretext Task Learning)フレームワークについて紹介する。
トランスフォーマーを用いたトラジェクトリ予測器を設計し,高効率な2段階推論を実現する。
論文 参考訳(メタデータ) (2024-07-16T10:48:18Z) - Waypoint Models for Instruction-guided Navigation in Continuous
Environments [68.2912740006109]
本稿では,言語条件付きウェイポイント予測ネットワークのクラスを開発し,この問題について検討する。
プロファイリングされたLoCoBotロボット上でのタスク性能と実行時間の推定を行う。
我々のモデルは、VLN-CEにおける以前の仕事を上回り、新しい最先端の技術を公衆のリーダーボードに置きました。
論文 参考訳(メタデータ) (2021-10-05T17:55:49Z) - TNT: Target-driveN Trajectory Prediction [76.21200047185494]
我々は移動エージェントのための目標駆動軌道予測フレームワークを開発した。
我々は、車や歩行者の軌道予測をベンチマークする。
私たちはArgoverse Forecasting、InterAction、Stanford Drone、および社内のPedestrian-at-Intersectionデータセットの最先端を達成しています。
論文 参考訳(メタデータ) (2020-08-19T06:52:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。