論文の概要: Inferring Action from Future Latent State for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2608.22067v2
- Date: Tue, 25 Aug 2026 03:06:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.02351
- Title: Inferring Action from Future Latent State for Robotic Manipulation
- Title(参考訳): ロボットマニピュレーションのための将来の潜伏状態からの推論
- Authors: Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren,
- Abstract要約: 我々は、ビデオ生成がワールドアクションモデリングの不要な目的であると主張している。
ロボット操作においては、世界モデルの目的は、中間の瞬間に世界がどのように見えるかを再現するのではなく、アクションの実行後に世界が到達する状態を予測することである。
本稿では,映像生成に頼らずに将来予測状態からロボット動作を推定するDELE-w0.5を提案する。
- 参考スコア(独自算出の注目度): 11.665741844323984
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: World-Action Models (WAMs) build robot control on video-generation backbones, which jointly predict dense future visual trajectories and robot actions. We argue that video generation is an unnecessary intermediate objective for world-action modeling. For robotic manipulation, the goal of a world model is not to reproduce how the world looks at every intermediate moment, but to predict the state that the world will reach after an action is executed. The intermediate frames only describe the visual transition between physical states, which consumes substantial model capacity and computation, but do not directly specify the physical outcome that the robot action is intended to produce. In this paper, we propose DELE-w0.5, which infers robot actions from predicted future states without relying on video generation. Concretely, DELE-w0.5 infers the action sequence from its corresponding compact future latent state. The future latent state captures the action-relevant physical outcome of robot interaction and serves as an explicit bridge between world modeling and action generation. The core design principle of DELE-w0.5 is to model how the physical world changes under robot actions, rather than how its visual appearance evolves frame by frame. This formulation removes the high-dimensional visual redundancy introduced by dense video representations, and it therefore enables cheaper training and low-latency inference. Across 480 real-robot trials on four long-horizon manipulation tasks, our DELE-w0.5 achieves the best performance among all compared policies, attaining 62.5 overall full-task success and 81.3 macro ordered-stage progress, outperforming the strongest baseline by 47.5 and 30.7 percentage points, respectively.
- Abstract(参考訳): World-Action Models (WAMs)は、ビデオ世代のバックボーンにロボット制御を構築する。
我々は、ビデオ生成がワールドアクションモデリングの不要な中間目的であると主張している。
ロボット操作においては、世界モデルの目的は、中間の瞬間に世界がどのように見えるかを再現するのではなく、アクションの実行後に世界が到達する状態を予測することである。
中間フレームは、実際のモデルの容量と計算を消費する物理状態間の視覚的遷移のみを記述するが、ロボットのアクションが生成しようとする物理的結果を直接規定しない。
本稿では,映像生成に頼らずに将来予測状態からロボット動作を推定するDELE-w0.5を提案する。
具体的には、DELE-w0.5はその対応するコンパクトな将来の潜在状態からアクションシーケンスを推論する。
未来の潜伏状態は、ロボット相互作用のアクション関連物理的成果を捉え、世界モデリングとアクション生成の間に明確な橋渡しとなる。
DELE-w0.5の中核となる設計原理は、視覚的な外観がフレームごとにどのように進化するかではなく、ロボットの動作の下で物理的な世界がどのように変化するかをモデル化することである。
この定式化は、濃密なビデオ表現によって導入された高次元の視覚的冗長性を取り除き、より安価なトレーニングと低レイテンシ推論を可能にする。
4つの長距離操作タスクにおける480個の実ロボット試行において、我々のDELE-w0.5は、全タスク成功率62.5、マクロオーダステージ進行率81.3、最強ベースライン47.5、30.7%でそれぞれ最高のパフォーマンスを達成している。
関連論文リスト
- H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models [56.60098789696351]
H2R-Benchは、人間とロボットの相互操作ビデオ生成を評価するためのベンチマークである。
各ベンチマークインスタンスには、人間のデモビデオ、ターゲットの実施制約、ソース地上アノテーションが含まれている。
我々は、6つの操作ファミリーと2つのロボットエボディメントで11の最先端のビデオ生成モデルをベンチマークした。
論文 参考訳(メタデータ) (2026-08-13T10:14:33Z) - Robot-Factored World Models via Robot Rendering [25.12876640584098]
アクション条件付きビデオワールドモデルは、初期観測と行動信号から将来の観測を予測する。
本研究では,ロボット特異的な2つの要素を世界モデル外へ移動させるロボット駆動世界モデルを提案する。
実験により, レンダリングインタフェースはベクトル条件付きベースラインより優れており, 未知のロボットエンボディメント推論に一般化されていることがわかった。
論文 参考訳(メタデータ) (2026-07-24T17:59:57Z) - Masked Visual Actions for Unified World Modeling [96.12988421978463]
Masked Visual Actionsは、ビデオ内の任意の実体の部分的に明らかな軌跡としてアクションを表現するピクセル空間制御インタフェースである。
Revealing Robot Motionは、このモデルをフォワードダイナミクスモデルとして機能させ、低レベルのロボット動作に対するシーンの反応を予測する一方で、望ましい物体の動きを明らかにすることにより、同じモデルがロボットの動作をその結果と一致させる。
論文 参考訳(メタデータ) (2026-07-21T17:59:11Z) - LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies [31.88655699486955]
ラワント・アクション条件付きラワント・ワールドモデル(LaWM)を提案する。
LaWAMは、将来のビデオの再構成ではなく、コンパクトで潜伏した視覚サブゴールを通じて、ロボットポリシーに対する予測ダイナミクスを公開する。
LaWAMはアクションチャンク予測あたり187msで動作し、画素空間のWAMよりも最大24倍の遅延時間を実現する。
論文 参考訳(メタデータ) (2026-06-14T12:06:58Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control [16.562259973551786]
本稿では,ビデオ拡散変換器とアクション拡散変換器を結合したエンドツーエンドのビデオ・アクション・モデルであるDiT4DiTを紹介する。
DiT4DiTは、再構成後のフレームに頼る代わりに、ビデオ生成プロセスから中間的なデノイング機能を抽出する。
これは最先端の結果を達成し、LIBEROでは98.6%、RoboCasa GR1では50.8%という平均的な成功率に達した。
論文 参考訳(メタデータ) (2026-03-11T06:03:53Z) - Large Video Planner Enables Generalizable Robot Control [117.49024534548319]
汎用ロボットは、様々なタスクや環境にまたがって一般化する意思決定モデルを必要とする。
最近の研究は、マルチモーダル大言語モデル(LM)をアクション出力で拡張し、視覚-アクション(VLA)システムを構築することで、ロボット基盤モデルを構築している。
本稿では,ロボット基礎モデル構築における主要なモダリティとして,大規模ビデオ事前学習を用いるための代替パラダイムについて検討する。
論文 参考訳(メタデータ) (2025-12-17T18:35:54Z) - MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training [102.850162490626]
人間のロボットによる相互模倣事前学習による視覚-言語-行動モデルであるMiVLAを提案する。
MiVLAは、最先端のVLAよりも優れた、強力な改良された一般化能力を実現する。
論文 参考訳(メタデータ) (2025-12-17T12:59:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。