論文の概要: Masked Visual Actions for Unified World Modeling
- arxiv url: http://arxiv.org/abs/2607.19343v1
- Date: Tue, 21 Jul 2026 17:59:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.526256
- Title: Masked Visual Actions for Unified World Modeling
- Title(参考訳): 統一世界モデリングのためのマスクビジュアルアクション
- Abstract要約: Masked Visual Actionsは、ビデオ内の任意の実体の部分的に明らかな軌跡としてアクションを表現するピクセル空間制御インタフェースである。
Revealing Robot Motionは、このモデルをフォワードダイナミクスモデルとして機能させ、低レベルのロボット動作に対するシーンの反応を予測する一方で、望ましい物体の動きを明らかにすることにより、同じモデルがロボットの動作をその結果と一致させる。
- 参考スコア(独自算出の注目度): 96.12988421978463
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video models absorb rich priors over how the visual world moves, interacts, and responds to contact, making them promising substrates for robotic world modeling. The central challenge is how to communicate action to such models in a form aligned with the visual space in which they learned these interaction priors, yet still grounded in physical manipulation. We introduce Masked Visual Actions, a pixel-space control interface that expresses action as a partially revealed trajectory of an arbitrary entity in a video. Revealing robot motion makes the model act as a forward dynamics model that predicts the scene's response to low-level robot actions, while revealing desired object motion makes the same model recover robot behavior consistent with that outcome. Finetuned with only 15 hours of masked examples from real videos and simulation, a single checkpoint achieves strong visual fidelity and controllability across diverse scenes and multiple embodiments. In downstream manipulation settings, the model produces imagined rollouts whose outcomes correlate with real-world execution for policy evaluation, improves decision making by ranking candidate futures in model-based planning, and supports inverse modeling by synthesizing robot motion from desired object motion.
- Abstract(参考訳): ビデオモデルは、視覚世界がどのように動き、相互作用し、接触に反応するかに関して、豊富な優先順位を吸収し、ロボットの世界モデリングのための有望な基質となる。
中心的な課題は、これらの相互作用を前もって学習した視覚空間と整合した形で、そのようなモデルにアクションを伝達する方法である。
Masked Visual Actionsは、ビデオ内の任意の実体の部分的に明らかな軌跡としてアクションを表現するピクセル空間制御インタフェースである。
Revealing Robot Motionは、このモデルをフォワードダイナミクスモデルとして機能させ、低レベルのロボット動作に対するシーンの反応を予測する一方で、望ましい物体の動きを明らかにすることにより、同じモデルがロボットの動作をその結果と一致させる。
実際のビデオやシミュレーションからわずか15時間分のマスク付きサンプルで調整された単一のチェックポイントは、多様なシーンと複数の実施形態の強い視覚的忠実さとコントロール性を実現する。
下流の操作設定では、実際の実行とポリシー評価の相関関係のあるロールアウトが生成され、モデルベースプランニングにおける候補候補のランク付けによる意思決定が改善され、ロボットの動きを所望の物体の動きから合成することで、逆モデリングがサポートされる。
関連論文リスト
- AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization [88.25615187835321]
我々は,クロス・エボディメント・ワールド・モデリング・フレームワークであるAnyWorldを提案する。
私たちのモデルは、アクション、カメラ、エンボディメントへのインタラクションを分解します。
大規模なヒューマンインタラクション事前トレーニングでモデルをトレーニングする。
論文 参考訳(メタデータ) (2026-08-29T12:55:15Z) - ContactFlow: A video action conditioning that transfers across embodiments [23.81895581513295]
接触フロー(英: Contact Flow)は、3次元接触点の軌跡を通して操作を符号化するエンボディメントに依存しない行動表現である。
本研究では,コンタクトフローを条件とした人間とロボットの両方のインタラクションビデオに対して,大規模ビデオ生成モデルを訓練する。
生成したロールアウトは実行前に視覚言語モデルによって評価される。
論文 参考訳(メタデータ) (2026-07-29T07:59:47Z) - Robot-Factored World Models via Robot Rendering [25.12876640584098]
アクション条件付きビデオワールドモデルは、初期観測と行動信号から将来の観測を予測する。
本研究では,ロボット特異的な2つの要素を世界モデル外へ移動させるロボット駆動世界モデルを提案する。
実験により, レンダリングインタフェースはベクトル条件付きベースラインより優れており, 未知のロボットエンボディメント推論に一般化されていることがわかった。
論文 参考訳(メタデータ) (2026-07-24T17:59:57Z) - World Action Models: A Survey [100.95337034529263]
ワールドアクションモデル(World Action Models, WAM)は、将来を予測できる予測モデルである。
近年のWAMは大規模なビデオ生成モデルを再利用しており、並列線はビデオ生成コアを持たない言語や視覚言語によるバックボーンに依存している。
この調査は、フィールドに共通の説明を与えます。まず、これらの境界を明確にし、2つの補完的な視点で既存の作業を整理します。
論文 参考訳(メタデータ) (2026-06-18T17:05:19Z) - iMaC: Translating Actions into Motion and Contact Images for Embodied World Models [77.395425755122]
身体的世界モデルは、視覚ロボットによる意思決定と対話型環境シミュレーションのための重要なパラダイムとして登場した。
本稿では,実画像を実世界モデルのためのネイティブアクション表現として扱う,新しい統一制御パラダイムである「イメージ・アズ・アクション・コントロール」を提案する。
論文 参考訳(メタデータ) (2026-06-08T17:55:41Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps [7.710034405765985]
AIMは、明示的な空間的インターフェースを通じてこのギャップを橋渡しする意図認識の統一世界行動モデルである。
事前訓練されたビデオ生成モデルに基づいて構築されたAIMは、共有変換器アーキテクチャ内の将来の観測と値マップを共同でモデル化する。
RoboTwin 2.0ベンチマークの実験では、AIMは平均94.0%の成功率に達し、以前の統合された世界行動ベースラインを著しく上回っている。
論文 参考訳(メタデータ) (2026-04-13T07:48:58Z) - Learning to Generate Object Interactions with Physics-Guided Video Diffusion [28.191514920144456]
我々は,現実的な剛体制御,インタラクション,エフェクトを可能にする物理誘導型ビデオ生成のアプローチであるKineMaskを紹介する。
本研究では,物体マスクによる将来の運動監視を段階的に除去する2段階のトレーニング戦略を提案する。
実験により、KineMaskは、同等の大きさの最近のモデルよりも強力な改善を達成している。
論文 参考訳(メタデータ) (2025-10-02T17:56:46Z) - Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control [72.00655365269]
本稿では,協調的軌跡定式化を通じてオブジェクト間ダイナミクスをモデル化する新しいフレームワークであるRoboMasterを紹介する。
オブジェクトを分解する従来の方法とは異なり、我々のコアは、相互作用プロセスを3つのサブステージ(相互作用前、相互作用後、相互作用後)に分解することである。
提案手法は既存の手法よりも優れており,ロボット操作のための軌道制御ビデオ生成における最先端性能を確立している。
論文 参考訳(メタデータ) (2025-06-02T17:57:06Z) - Controlling the World by Sleight of Hand [26.874176292105556]
我々は、物体と相互作用する人間の手のラベルなしビデオから学習することで、行動条件生成モデルを学ぶ。
画像と、所望のハンドインタラクションの形状/位置が与えられた場合、CosHandは、インタラクションが発生した後の未来のイメージを合成する。
実験により、結果のモデルが手動物体の相互作用の効果をよく予測できることが示されている。
論文 参考訳(メタデータ) (2024-08-13T18:33:45Z) - Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot Manipulation [65.46610405509338]
我々は、ゼロショットロボット操作を可能にする汎用的な目標条件ポリシーを学習することを目指している。
私たちのフレームワークであるTrack2Actは、ゴールに基づいて将来のタイムステップで画像内のポイントがどのように動くかを予測する。
学習したトラック予測を残留ポリシーと組み合わせることで,多種多様な汎用ロボット操作が可能となることを示す。
論文 参考訳(メタデータ) (2024-05-02T17:56:55Z) - RoboCraft: Learning to See, Simulate, and Shape Elasto-Plastic Objects
with Graph Networks [32.00371492516123]
弾塑性物体のモデリングと操作のためのモデルベース計画フレームワークを提案する。
我々のシステムであるRoboCraftは、グラフニューラルネットワーク(GNN)を用いて粒子ベースの力学モデルを学び、基礎となるシステムの構造を捉える。
実世界のロボットインタラクションデータの10分で、ロボットは制御信号を合成し、弾塑性の物体を様々な形状に変形させるダイナミックスモデルを学習できることを示す。
論文 参考訳(メタデータ) (2022-05-05T20:28:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。