論文の概要: VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes
- arxiv url: http://arxiv.org/abs/2606.30645v1
- Date: Mon, 29 Jun 2026 17:59:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.376562
- Title: VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes
- Title(参考訳): VLK: 再構成シーンにおける合成相互作用によるヒューマノイドロコマニピュレーションの学習
- Abstract要約: 知覚に基づくヒューマノイド・ロコ・マニピュレーションは、自我中心の観察とタスク・インストラクションを全身の動きに結びつける必要がある。
既存のデータソースがこれを完全に提供するものはありません。
このボトルネックに対処するために、再構成シーンで視覚・言語・運動学を総合的に指導する手法を提案する。
- 参考スコア(独自算出の注目度): 71.14444761145435
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Perception-based humanoid loco-manipulation requires connecting egocentric observations and task instructions to whole-body motion. Learning this mapping requires synchronized egocentric images, language commands, and robot-compatible kinematic trajectories, yet no existing data source provides this complete tuple at scale. We address this bottleneck by generating vision-language-kinematics (VLK) supervision synthetically in reconstructed scenes. Our pipeline leverages 3D Gaussian Splatting to reconstruct metric-scale indoor environments, synthesizes navigation and object-interaction trajectories using privileged scene information, and renders paired egocentric observations after the fact. We produce 48,000 paired trajectories with no human intervention and train a VLK policy that predicts short-horizon whole-body kinematic trajectories. A whole-body tracker converts these predictions into actions on the physical humanoid. We evaluate on the physical Unitree G1 performing navigation and single-object transport, demonstrating that synthesized interactions in reconstructed scenes provide effective supervision for sim-to-real perception-based humanoid loco-manipulation. Project Website: https://vision-language-kinematics.github.io/
- Abstract(参考訳): 知覚に基づくヒューマノイド・ロコ・マニピュレーションは、自我中心の観察とタスク・インストラクションを全身の動きに結びつける必要がある。
このマッピングを学習するには、同期されたエゴセントリックなイメージ、言語コマンド、ロボット互換の運動軌道が必要ですが、この完全なタプルを大規模に提供する既存のデータソースはありません。
本稿では,視覚言語動態(VLK)を再構成シーンで合成的に生成することで,このボトルネックに対処する。
我々のパイプラインは3次元ガウシアン・スプレイティングを利用して、メートルスケールの屋内環境を再構築し、特権的なシーン情報を用いてナビゲーションとオブジェクト・インタラクション・トラジェクトリを合成し、その後にペア化されたエゴセントリックな観察を行う。
人間の介入なしに48,000のペア軌道を生成し、短水平全体運動軌道を予測するVLKポリシーを訓練する。
全身トラッカーは、これらの予測を物理的ヒューマノイドのアクションに変換する。
本研究は, ナビゲーションと単一対象輸送を行う物理Unitree G1について評価し, 再構成シーンにおける合成相互作用が, 擬似現実認識に基づくヒューマノイドロコ操作の効果的な監視に有効であることを実証した。
Project Website: https://vision-lang-kinematics.github.io/
関連論文リスト
- GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors [113.71148915419246]
GRAILは3Dアセット、シミュレーター対応シーン、およびビデオファンデーションモデル(VFM)の先行データで構成され、物理的環境を再構築したりロボットを遠隔操作したりすることなく対話を合成するデジタル生成パイプラインである。
GRAILは、オブジェクト形状、カメラパラメータ、メートル法スケール、環境深度、ロボットが提案する文字がビデオ生成の前に知られ、再構成中に再利用される、完全に定義された3D構成から始まる。
我々は、回復した動作をヒューマノイドロボットに再ターゲティングし、補完的なタスク・ジェネラル・モルフォロジー・トラッカーを訓練する。
GRAILは、ピックアップ、オブジェクト操作、着座にまたがる2万以上のシーケンスを生成する
論文 参考訳(メタデータ) (2026-06-03T17:57:45Z) - EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents [85.77432303199176]
EmbodMocapは2つの動くiPhoneを使ったポータブルで安価なデータ収集パイプラインである。
私たちのキーとなるアイデアは、二重RGB-Dシーケンスを共同で校正し、人間とシーンの両方を再構築することです。
収集したデータに基づいて、我々は3つの具体的AIタスクを強化した: モノクラーヒューマン・シーン・リコンストラクション(モノクラーヒューマン・シーン・リコンストラクション)、メトリックスケールで世界空間に整合した人間とシーンを出力するフィードフォワードモデル、物理ベースのキャラクターアニメーション。
論文 参考訳(メタデータ) (2026-02-26T16:53:41Z) - Learning Humanoid End-Effector Control for Open-Vocabulary Visual Loco-Manipulation [14.013652439013692]
本稿では,ヒューマノイドロボットを用いたオブジェクトロコ操作のための新しいパラダイムHEROを提案する。
我々は、正確な残留認識EE追跡ポリシーを設計することで、これを実現する。
我々は、この正確なエンドエフェクタトラッカーを使用して、ロコ操作のためのモジュラーシステムを構築します。
論文 参考訳(メタデータ) (2026-02-18T18:55:02Z) - CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives [65.89192712575797]
本研究では,モノクロ映像から再現可能な人物の動きとシーン形状を復元するCRISPを紹介する。
我々の手法は、人中心のビデオベンチマークにおいて、モーショントラッキングの失敗率を55.2%から6.9%に下げる。
このことは、CRISPが物理的に有意な人間の動きと対話環境を大規模に生成する能力を示している。
論文 参考訳(メタデータ) (2025-12-16T18:59:50Z) - VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification [65.15340059997273]
VHOIは、ビデオにおける現実的な人間とオブジェクトの相互作用を作成するためのフレームワークである。
そこで本研究では,人体と物体の運動だけでなく,身体部分特異的な動特性も識別するために,色エンコーディングを用いた新しいHOI対応動作表現を提案する。
実験は、制御可能なHOIビデオ生成における最先端の結果を示す。
論文 参考訳(メタデータ) (2025-12-10T13:40:24Z) - UPTor: Unified 3D Human Pose Dynamics and Trajectory Prediction for Human-Robot Interaction [0.688204255655161]
本研究では,グローバル座標フレームにおける全体ポーズと軌道キーポイントの予測手法を提案する。
我々は、市販の3次元ポーズ推定モジュール、グラフアテンションネットワーク、コンパクトで非自己回帰的なトランスフォーマーを使用する。
従来の研究と比較して、我々のアプローチはコンパクトでリアルタイムであり、全てのデータセットにわたる人間のナビゲーション動作を予測する上で正確であることを示す。
論文 参考訳(メタデータ) (2025-05-20T19:57:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。