論文の概要: ContactFlow: A video action conditioning that transfers across embodiments
- arxiv url: http://arxiv.org/abs/2607.26579v1
- Date: Wed, 29 Jul 2026 07:59:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.575385
- Title: ContactFlow: A video action conditioning that transfers across embodiments
- Title(参考訳): ContactFlow: エンボディメント間で転送するビデオアクションコンディショニング
- Abstract要約: 接触フロー(英: Contact Flow)は、3次元接触点の軌跡を通して操作を符号化するエンボディメントに依存しない行動表現である。
本研究では,コンタクトフローを条件とした人間とロボットの両方のインタラクションビデオに対して,大規模ビデオ生成モデルを訓練する。
生成したロールアウトは実行前に視覚言語モデルによって評価される。
- 参考スコア(独自算出の注目度): 23.81895581513295
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World models offer a promising route toward robot planning by enabling agents to imagine and verify the consequences of actions before execution. However, current video-based world models often struggle to capture the physical constraints that govern manipulation, particularly contact. Further, their action conditioning is often constrained to specific embodiments such as parallel grippers. We propose \emph{Contact Flow}, an embodiment-agnostic action representation that encodes manipulation through the trajectory of 3D contact points between an actor and a target object. By discarding actor-specific appearance and kinematics, Contact Flow provides a shared conditioning signal for both human demonstrations and robotic execution. Therefore, we can train a large-scale video generative model on both human and robotic object interaction videos conditioned on Contact Flow, yielding a world model that predicts physically plausible manipulation outcomes. We integrate this model into a propose-imagine-verify-act pipeline, where generated rollouts are assessed by a vision-language model before execution. Experiments on the DROID dataset and real-world tabletop manipulation tasks demonstrate that Contact Flow enables transfer between human demonstrations and different robotic embodiments.
- Abstract(参考訳): 世界モデルは、エージェントが実行前にアクションの結果を想像し、検証できるようにすることで、ロボット計画への有望なルートを提供する。
しかし、現在のビデオベースの世界モデルは、操作、特に接触を支配する物理的な制約を捉えるのに苦労することが多い。
さらに、アクションコンディショニングは、しばしばパラレルグリップパーのような特定の実施形態に制約される。
本研究では,アクターとターゲットオブジェクト間の3次元接触点の軌跡を符号化し,操作をエンコードするエンボディメントに依存しない動作表現である「emph{Contact Flow}」を提案する。
アクター固有の外観とキネマティクスを捨てることで、Contact Flowは人間のデモンストレーションとロボット実行の両方に共用条件信号を提供する。
そこで我々は,人間とロボットの両方の対話ビデオ上で,接触フローを条件とした大規模ビデオ生成モデルを訓練し,物理的に妥当な操作結果を予測する世界モデルを生成する。
生成したロールアウトは実行前に視覚言語モデルによって評価される。
DROIDデータセットと実世界のテーブルトップ操作タスクの実験は、Contact Flowが人間のデモと異なるロボティクスの移動を可能にすることを実証している。
関連論文リスト
- AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization [88.25615187835321]
我々は,クロス・エボディメント・ワールド・モデリング・フレームワークであるAnyWorldを提案する。
私たちのモデルは、アクション、カメラ、エンボディメントへのインタラクションを分解します。
大規模なヒューマンインタラクション事前トレーニングでモデルをトレーニングする。
論文 参考訳(メタデータ) (2026-08-29T12:55:15Z) - H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models [56.60098789696351]
H2R-Benchは、人間とロボットの相互操作ビデオ生成を評価するためのベンチマークである。
各ベンチマークインスタンスには、人間のデモビデオ、ターゲットの実施制約、ソース地上アノテーションが含まれている。
我々は、6つの操作ファミリーと2つのロボットエボディメントで11の最先端のビデオ生成モデルをベンチマークした。
論文 参考訳(メタデータ) (2026-08-13T10:14:33Z) - Masked Visual Actions for Unified World Modeling [96.12988421978463]
Masked Visual Actionsは、ビデオ内の任意の実体の部分的に明らかな軌跡としてアクションを表現するピクセル空間制御インタフェースである。
Revealing Robot Motionは、このモデルをフォワードダイナミクスモデルとして機能させ、低レベルのロボット動作に対するシーンの反応を予測する一方で、望ましい物体の動きを明らかにすることにより、同じモデルがロボットの動作をその結果と一致させる。
論文 参考訳(メタデータ) (2026-07-21T17:59:11Z) - Hand-centric Human-to-Robot Trajectory Transfer from Video Demonstrations via Open-World Contact Localization [28.23926683554352]
EmphHOWTransferは、人間のデモを接触認識、分類情報、多様なロボット軌道に蒸留する手中心のフレームワークである。
emphHOWTransferは、時間的に一貫した3次元手の動きを回復し、観察された手と物体の相互作用の手がかりを解析することで、時間的接触間隔を局所化する。
実験によると、emphHOWTransferは86%の精度で正確な接触位置決めと高品質なロボットの動きを可能にする。
論文 参考訳(メタデータ) (2026-06-09T11:53:29Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents [85.77432303199176]
EmbodMocapは2つの動くiPhoneを使ったポータブルで安価なデータ収集パイプラインである。
私たちのキーとなるアイデアは、二重RGB-Dシーケンスを共同で校正し、人間とシーンの両方を再構築することです。
収集したデータに基づいて、我々は3つの具体的AIタスクを強化した: モノクラーヒューマン・シーン・リコンストラクション(モノクラーヒューマン・シーン・リコンストラクション)、メトリックスケールで世界空間に整合した人間とシーンを出力するフィードフォワードモデル、物理ベースのキャラクターアニメーション。
論文 参考訳(メタデータ) (2026-02-26T16:53:41Z) - DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos [110.98100817695307]
私たちはDreamDojoを紹介します。DreamDojoは、多種多様なインタラクションと、エゴセントリックな人間ビデオの44万時間から厳密なコントロールを学ぶ基礎的な世界モデルです。
本研究は, 遠隔操作, 政策評価, モデルベース計画など, 生成的世界モデルに基づくいくつかの重要な応用を可能にする。
論文 参考訳(メタデータ) (2026-02-06T18:49:43Z) - Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow [21.658558775915267]
本研究では3次元オブジェクトフローを中間表現として,映像生成とロボット制御をブリッジするフレームワークDream2Flowを紹介する。
本手法は,生成した映像から3次元物体の動きを再構成し,物体軌跡追跡として定式化する。
Dream2Flowは、エボディメントギャップを克服し、事前訓練されたビデオモデルからのゼロショットガイダンスにより、さまざまなカテゴリのオブジェクトを操作することができる。
論文 参考訳(メタデータ) (2025-12-31T10:25:24Z) - NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos [13.84832813181084]
NovaFlowは、タスク記述をターゲットロボットの実行可能な計画に変換する、自律的な操作フレームワークである。
我々は,テーブルトップのフランカアームとスポット四足歩行ロボットを用いて,剛性,調音性,変形可能な物体操作タスクを検証した。
論文 参考訳(メタデータ) (2025-10-09T17:59:55Z) - Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot Manipulation [65.46610405509338]
我々は、ゼロショットロボット操作を可能にする汎用的な目標条件ポリシーを学習することを目指している。
私たちのフレームワークであるTrack2Actは、ゴールに基づいて将来のタイムステップで画像内のポイントがどのように動くかを予測する。
学習したトラック予測を残留ポリシーと組み合わせることで,多種多様な汎用ロボット操作が可能となることを示す。
論文 参考訳(メタデータ) (2024-05-02T17:56:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。