論文の概要: Grounding Generated Video Plans in Simulation Towards Versatile Dexterous Controllers
- arxiv url: http://arxiv.org/abs/2609.10050v2
- Date: Sat, 12 Sep 2026 12:27:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.788648
- Title: Grounding Generated Video Plans in Simulation Towards Versatile Dexterous Controllers
- Title(参考訳): 可変デキサラス制御系に向けたシミュレーションにおけるグラウンドティング生成ビデオプラン
- Abstract要約: 本稿では,手作業の介入を最小限に抑えたHOI再構成によるスケーラブルな参照生成を実現する手法を提案する。
実世界のクローズドループ実験では、機能的把握、非包括的操作、グラフ後の対象物追跡など、多様な把握を達成している。
- 参考スコア(独自算出の注目度): 46.68550761666706
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generated hand-object interaction (HOI) videos provide a controllable way to propose manipulation motions. Simulation-based HOI tracking can translate such kinematic references into feasible low-level control, but its scalability is limited by the lack of reliable reference motions. We therefore combine generated videos with simulation-based HOI grounding: during training, generated videos provide diverse motion references for learning a multi-object, multi-trajectory HOI tracker, and at deployment, the video model produces motion plans that are executed by the learned tracker. In particular, we propose a method that enables scalable reference generation by HOI reconstruction with minimal manual intervention and successfully grounds more than 1,500 generated videos in simulation, achieving success rates over 25 percentage points higher than those of baselines during simulation-based training. In real-world closed-loop experiments, it achieves diverse grasps, including functional grasps, non-prehensile manipulation, and post-grasp object-pose tracking. Videos and code are available at https://boyuan-an.github.io/GALATEA/.
- Abstract(参考訳): 生成ハンドオブジェクトインタラクション(HOI)ビデオは、操作動作を提案する制御可能な方法を提供する。
シミュレーションに基づくHOIトラッキングは、そのようなキネマティックな参照を実現可能な低レベル制御に変換することができるが、そのスケーラビリティは信頼性のある参照モーションの欠如によって制限される。
そこで我々は,生成したビデオとシミュレーションに基づくHOIグラウンドを組み合わさって,生成したビデオは多目的多軌道HOIトラッカーを学習するための多様なモーション参照を提供し,デプロイ時には,学習したトラッカーによって実行されるモーションプランを生成する。
特に,手動操作を最小限に抑えたHOI再構成によるスケーラブルな参照生成を実現し,1500本以上の動画をシミュレーションでグラウンドアウトし,シミュレーションベーストレーニングにおけるベースラインよりも25ポイント以上の成功率を達成する手法を提案する。
実世界のクローズドループ実験では、機能的把握、非包括的操作、グラフ後の対象物追跡など、多様な把握を達成している。
ビデオとコードはhttps://boyuan-an.github.io/GALATEA/.comで公開されている。
関連論文リスト
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving [66.93548079427477]
我々は、将来の映像予測を訓練時間監視信号として活用する、シンプルで効果的なWAMであるSimWAMを提案する。
孤立した注意マスクは、将来のフレームとは独立して行動予測を保持し、推論時に明示的な将来のフレーム生成なしに軌道予測を可能にする。
我々のSimWAMは、NAVSIM上の91.5 PDMSを達成し、最先端のWAMベースのプランナをはるかに低レイテンシで超越し、ゼロショットをnuScenesに転送する。
論文 参考訳(メタデータ) (2026-08-07T17:59:09Z) - TrackMAE: Video Representation Learning via Track Mask and Predict [53.79942817343784]
Masked Video Modeling (MVM)は、シンプルでスケーラブルな自己教師付き事前トレーニングパラダイムとして登場した。
動作情報を復元信号として明示的に利用するシンプルなマスク付きビデオモデリングパラダイムであるTrackMAEを提案する。
我々は、さまざまな下流設定の6つのデータセットを評価し、TrackMAEが最先端のビデオ自己教師型学習ベースラインを一貫して上回っていることを発見した。
論文 参考訳(メタデータ) (2026-03-28T13:35:23Z) - Direct Motion Models for Assessing Generated Videos [38.04485796547767]
ビデオ生成ビデオモデルの現在の制限は、可視的に見えるフレームを生成するが、動きが貧弱であることである。
ここでは、妥当な物体の相互作用と動きをよりよく測定する指標を開発することで、FVDを超えていく。
画素再構成や動作認識の代わりに点線を用いると、合成データの時間歪みに顕著に敏感な測定結果が得られることを示す。
論文 参考訳(メタデータ) (2025-04-30T22:34:52Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z) - Waymax: An Accelerated, Data-Driven Simulator for Large-Scale Autonomous
Driving Research [76.93956925360638]
Waymaxは、マルチエージェントシーンにおける自動運転のための新しいデータ駆動シミュレータである。
TPU/GPUなどのハードウェアアクセラレータで完全に動作し、トレーニング用のグラフ内シミュレーションをサポートする。
我々は、一般的な模倣と強化学習アルゴリズムのスイートをベンチマークし、異なる設計決定に関するアブレーション研究を行った。
論文 参考訳(メタデータ) (2023-10-12T20:49:15Z) - Learn the Force We Can: Enabling Sparse Motion Control in Multi-Object
Video Generation [26.292052071093945]
単一のフレームとスパース動作入力からビデオを生成する教師なしの手法を提案する。
我々の訓練されたモデルは、目に見えない現実的なオブジェクト間相互作用を生成できる。
ヨダは、制御性と映像品質の両面において、先行するアートビデオ生成の状況と同等かそれ以上であることを示す。
論文 参考訳(メタデータ) (2023-06-06T19:50:02Z) - Trace and Pace: Controllable Pedestrian Animation via Guided Trajectory
Diffusion [83.88829943619656]
本研究では,現実的な歩行者軌跡生成手法と,ユーザ定義目標を達成するために制御可能なフルボディアニメーションを提案する。
我々のガイド付き拡散モデルでは,対象とする経路,速度,特定社会集団による軌道の制約が可能である。
本稿では,アニメーションコントローラのRLトレーニング中に学習した値関数を用いて,拡散を誘導し,特定のシナリオに適した軌道を生成することを提案する。
論文 参考訳(メタデータ) (2023-04-04T15:46:42Z) - DriveGAN: Towards a Controllable High-Quality Neural Simulation [147.6822288981004]
DriveGANと呼ばれる新しい高品質のニューラルシミュレータを紹介します。
DriveGANは、異なるコンポーネントを監督なしで切り離すことによって制御性を達成する。
実世界の運転データ160時間を含む複数のデータセットでdriveganをトレーニングします。
論文 参考訳(メタデータ) (2021-04-30T15:30:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。