論文の概要: GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency
- arxiv url: http://arxiv.org/abs/2607.09191v1
- Date: Fri, 10 Jul 2026 08:32:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.428267
- Title: GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency
- Title(参考訳): GenVid2Robot:rigid-Geometric Consistencyによるビデオ生成からロボット操作へ
- Authors: Haohui Huang, Xi Yuan, Panpan Liao, Tao Teng, Chenguang Yang, Jing Guo, Yi Guo,
- Abstract要約: GenVid2Robotは、生成されたビデオモーションを実行可能なリアルタイムロボット操作トラジェクトリに変換するフレームワークである。
実験により、GenVid2Robotは、視運動前兆を粗いメトリ幾何でグラウンドすることで、生成ビデオ誘導操作の信頼性を向上させることが示された。
- 参考スコア(独自算出の注目度): 19.566368780107613
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generated videos provide useful visual motion priors for robot manipulation, but their visual plausibility does not imply physical executability. A generated video usually lacks metric geometry, grasp grounding, robot kinematic feasibility, and execution-time feedback, which makes direct trajectory replay unreliable in real-world manipulation. This paper presents GenVid2Robot, a rigid-geometric consistency framework that converts generated video motion into executable real-robot manipulation trajectories. Given an initial RGB-D observation and a task instruction, GenVid2Robot samples task-relevant semantic anchors from the real first frame, tracks these anchors through generated video candidates, and verifies whether the resulting 2D motion can be explained by first-frame RGB-D anchors under a sparse relative $SE(3)$ model. In this way, generated videos are treated as uncertain visual motion hypotheses rather than direct robot demonstrations. Only geometrically consistent motion is transferred to the robot. The accepted relative motion is then applied to the real grasp-time TCP pose selected by mask-constrained grasping, producing a grasp-conditioned execution trajectory that is consistent with both the visual motion prior and the physical grasp configuration. To reduce execution mismatch caused by RGB-D noise, calibration residuals, and small contact-induced displacement, a bounded depth-compensation module corrects local depth-direction errors without assuming full online replanning. Real-robot experiments demonstrate that GenVid2Robot improves the reliability of generated-video-guided manipulation by grounding visual motion priors with sparse metric geometry, grasp constraints, robot feasibility checking, and bounded execution feedback.
- Abstract(参考訳): 生成されたビデオは、ロボット操作に有用な視覚運動の先行情報を提供するが、その視覚的可視性は、物理的な実行可能性を意味するものではない。
生成されたビデオは通常、メートル法、グリップグラウンド、ロボットの運動能力、実行時のフィードバックを欠いている。
本稿では,生成した映像の動きを実ロボット操作に変換する剛性幾何整合性フレームワークGenVid2Robotを提案する。
初期RGB-D観察とタスク命令を与えられたGenVid2Robotは、実際の第1フレームからタスク関連セマンティックアンカーをサンプリングし、生成されたビデオ候補を通してこれらのアンカーを追跡し、その結果の2D動作が、スパースな$SE(3)$モデルの下で、第1フレームRGB-Dアンカーによって説明できるかどうかを検証する。
このようにして、生成したビデオは、直接ロボットのデモンストレーションではなく、不確実な視覚運動仮説として扱われる。
幾何学的に一貫した動きのみがロボットに転送される。
次に、マスク拘束型グリップによって選択された実グリップタイムTCPポーズに対して、受理された相対運動を印加し、視覚運動前と身体的グリップ構成の両方に整合したグリップ条件付き実行軌跡を生成する。
RGB−Dノイズ、校正残差、接触誘起変位による実行ミスマッチを低減するため、有界深度補償モジュールは、完全なオンラインリプランニングを仮定することなく、局所深度補正誤差を補正する。
実ロボット実験により、GenVid2Robotは、疎度なメートル法、制約の把握、ロボットの実用性確認、バウンダリされた実行フィードバックによって、生成ビデオ誘導操作の信頼性を向上させることを示した。
関連論文リスト
- PhysV2A: Reachability-Gated and Semantic-Mask-Constrained Feasibility Completion for Video-to-Robot Manipulation [17.70834422785338]
ビデオベースの操作は、人間のデモ、生成されたビデオ、RGB-D観察からオブジェクト中心の動作を先取りする。
PhysV2Aは、ビデオ由来の6Dオブジェクトの動きをロボット実行可能な操作軌道に変換するためのフレームワークである。
論文 参考訳(メタデータ) (2026-07-10T12:43:00Z) - PointAction: 3D Points as Universal Action Representations for Robot Control [42.12570897523391]
本稿では,映像予測をロボット行動にブリッジするフレームワークであるPointActionについて,明示的なポイントベース4Dモデリングにより紹介する。
PointActionは、ロボットシーンにおける最先端の4D生成品質を実現し、シミュレーションにおいて既存のベースラインを上回り、事前トレーニング中に見えない2つの本物のロボットアームに一般化する。
論文 参考訳(メタデータ) (2026-06-02T17:30:50Z) - GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation [72.52773248997929]
ビデオワールドモデルは、1つの命令から現実的な未来を生成できるが、時間とともに一貫したポイントレベルの動きを維持できないことが多い。
GEM-4Dは、トレーニング中にビデオ生成バックボーンに高密度な4D対応制御を注入する幾何学的地上ビデオワールドモデルである。
Inverse dynamicsモジュールは、対応性のあるビデオロールアウトを実行可能なロボットトラジェクトリに変換し、現実世界とシミュレーション操作の両方で直接デプロイできる。
論文 参考訳(メタデータ) (2026-05-20T21:36:44Z) - EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards [47.255807408091755]
ビデオ生成モデルは、ロボット工学の世界モデルとしてますます使われている。
現在のビデオワールドモデルは、明示的な実行可能性の制約を欠いている。
本稿では,ビデオワールドモデルを調整するための強化学習フレームワークであるExecutable Video Alignment (EVA)を紹介する。
論文 参考訳(メタデータ) (2026-03-18T15:02:19Z) - DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos [24.681248200255975]
ビデオモデルは、組み込みAIのための強力な現実世界シミュレータを提供するが、ロボット操作の制御性には制限がある。
入力軌跡から複数の表現を抽出するトラジェクトリ条件付きビデオ生成フレームワークであるDRAW2ACTを提案する。
DRAW2ACTは、既存のベースラインよりも高い操作成功率を示しながら、より優れた視覚的忠実度と一貫性を実現する。
論文 参考訳(メタデータ) (2025-12-16T09:11:36Z) - VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation [53.63540587160549]
VidBotは、WildのモノクルなRGBのみの人間ビデオから学習した3Dアベイランスを使って、ゼロショットロボット操作を可能にするフレームワークである。
VidBotは、人間の日常的なビデオを利用してロボットの学習をよりスケーラブルにする。
論文 参考訳(メタデータ) (2025-03-10T10:04:58Z) - Robot See Robot Do: Imitating Articulated Object Manipulation with Monocular 4D Reconstruction [51.49400490437258]
本研究は,1つの単分子RGB人間の実演から音声による物体操作を模倣する手法を開発した。
まず,モノクロ映像から3次元部分運動を復元する4次元微分可能部品モデル(4D-DPM)を提案する。
この4D再構成を前提として、ロボットは物体の軌道を再現し、両腕の動きを計画し、実証された物体部分の動きを誘導する。
両用するYuMiロボットを用いて,4D-DPMの3D追跡精度を実写3D部分軌跡に基づいて評価し,9つのオブジェクトに対してRSRDの物理的実行性能を評価した。
論文 参考訳(メタデータ) (2024-09-26T17:57:16Z) - Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot Manipulation [65.46610405509338]
我々は、ゼロショットロボット操作を可能にする汎用的な目標条件ポリシーを学習することを目指している。
私たちのフレームワークであるTrack2Actは、ゴールに基づいて将来のタイムステップで画像内のポイントがどのように動くかを予測する。
学習したトラック予測を残留ポリシーと組み合わせることで,多種多様な汎用ロボット操作が可能となることを示す。
論文 参考訳(メタデータ) (2024-05-02T17:56:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。