論文の概要: Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors
- arxiv url: http://arxiv.org/abs/2605.22272v2
- Date: Fri, 22 May 2026 04:19:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 14:44:53.777109
- Title: Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors
- Title(参考訳): imagine2Real: ビデオ生成プリミティブによるゼロショットヒューマノイドオブジェクトインタラクションを目指して
- Abstract要約: 高忠実度3Dデータの不足により,全体Humanoid-Object Interaction (HOI) がボトルネックとなる。
本研究では,ゼロショットHOIフレームワークであるImagine2Realを提案する。
- 参考スコア(独自算出の注目度): 51.096845970243855
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Whole-body Humanoid-Object Interaction (HOI) is bottlenecked by the scarcity of high-fidelity 3D data. While video generative priors offer a promising alternative, existing methods suffer from \textit{Representation Misalignment} due to their reliance on geometric priors (e.g., explicit CAD models), and \textit{Retargeting Complexity} arising from intensive morphing and morphological mismatch. We propose Imagine2Real, a zero-shot HOI framework for flexible, geometry-free interaction. To resolve misalignment, we formulate robot and object motions as unified 4D point trajectories. To overcome retargeting complexity, our Keypoints Tracker tracks only sparse critical points (base, hands, and object), entirely bypassing the error-amplifying retargeting process. To maintain natural gaits despite these sparse signals, we utilize the latent space of a Behavior Foundation Model (BFM) as the tracker's search domain. Using a progressive training strategy, Imagine2Real learns robust behaviors with simple tracking rewards, enabling zero-shot physical deployment within a motion capture(mocap) system.
- Abstract(参考訳): 高忠実度3Dデータの不足により,全体Humanoid-Object Interaction (HOI) がボトルネックとなる。
ビデオ生成の先行は有望な代替手段を提供するが、既存の手法は、幾何学的先行(例えば、明示的なCADモデル)と、集中的なモルヒネや形態的ミスマッチから生じる‘textit{Retargeting Complexity’に依存するため、 'textit{Representation Misalignment' に苦しむ。
本研究では,ゼロショットHOIフレームワークであるImagine2Realを提案する。
誤認識を解決するため,ロボットと物体の動きを統合された4次元点軌道として定式化する。
再ターゲティングの複雑さを克服するために、Keypoints Trackerは、エラーを増幅する再ターゲティングプロセスを完全にバイパスする、わずかなクリティカルポイント(ベース、ハンド、オブジェクト)のみをトラックします。
これらの疎い信号にもかかわらず、自然視線を維持するために、トラッカーの探索領域として振舞い基礎モデル(BFM)の潜在空間を利用する。
プログレッシブトレーニング戦略を使用して、Imagine2Realは単純なトラッキング報酬で堅牢な動作を学び、モーションキャプチャ(mocap)システム内でゼロショットの物理的なデプロイメントを可能にする。
関連論文リスト
- RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation [15.618446008590409]
RelAfford6は複雑な調音オブジェクトのためのトレーニング不要のフレームワークである。
本システムでは,一次相互作用部分を物理的アンカーにリンクする意味的トポロジを推定する。
我々は満足度問題として下流実行を解析的に定式化する。
論文 参考訳(メタデータ) (2026-06-25T13:42:26Z) - GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors [113.71148915419246]
GRAILは3Dアセット、シミュレーター対応シーン、およびビデオファンデーションモデル(VFM)の先行データで構成され、物理的環境を再構築したりロボットを遠隔操作したりすることなく対話を合成するデジタル生成パイプラインである。
GRAILは、オブジェクト形状、カメラパラメータ、メートル法スケール、環境深度、ロボットが提案する文字がビデオ生成の前に知られ、再構成中に再利用される、完全に定義された3D構成から始まる。
我々は、回復した動作をヒューマノイドロボットに再ターゲティングし、補完的なタスク・ジェネラル・モルフォロジー・トラッカーを訓練する。
GRAILは、ピックアップ、オブジェクト操作、着座にまたがる2万以上のシーケンスを生成する
論文 参考訳(メタデータ) (2026-06-03T17:57:45Z) - MaMi-HOI: Harmonizing Global Kinematics and Local Geometry for Human-Object Interaction Generation [14.056276184323321]
MaMi-HOIはtextbfMacro レベルの流動性をtextbf Micro レベルの空間精度で再現する。
実験により、MaMi-HOIは自然運動と正確な接触を同時に達成できることが確認された。
論文 参考訳(メタデータ) (2026-05-07T06:52:14Z) - Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints [87.13154261503168]
モーションコントロール可能なビデオ生成は、仮想現実と組み込みAIにおけるエゴセントリックなアプリケーションに不可欠である。
既存の手法は、しばしば3D一貫性のきめ細かい手話を実現するのに苦労する。
単一の参照フレームからエゴセントリックなビデオを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-12T10:02:23Z) - AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation [45.753757870577196]
本稿では,対話学習のためのエージェント生成にパラダイムを転換する,堅牢なフレームワークAGILEを紹介する。
我々はAGILEがグローバルな幾何学的精度でベースラインを上回り、先行技術が頻繁に崩壊する挑戦的なシーケンスに対して、例外的な堅牢性を証明していることを示す。
論文 参考訳(メタデータ) (2026-02-04T15:42:58Z) - RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming [79.81527946524098]
RoamScene3Dはセマンティックガイダンスと空間生成のギャップを埋める新しいフレームワークである。
我々は、オブジェクト関係を符号化するシーングラフを構築するために、視覚言語モデル(VLM)を用いる。
静的な2Dプリミティブの制約を軽減するため、合成パノラマデータセットに微調整されたモーションインジェクトインペインティングモデルを導入する。
論文 参考訳(メタデータ) (2026-01-27T10:10:55Z) - Street Gaussians without 3D Object Tracker [84.89933388445185]
既存のほとんどの方法は、オブジェクトポーズの労働集約的な手動ラベリングに依存している。
本研究では,3次元オブジェクト融合戦略における2次元ディープトラッカーの関連性を利用して,安定なオブジェクト追跡モジュールを提案する。
我々は、軌道誤差を自律的に補正し、見逃した検出を回復する暗黙の特徴空間に、モーションラーニング戦略を導入することで、避けられないトラッキングエラーに対処する。
論文 参考訳(メタデータ) (2024-12-07T05:49:42Z) - ROAM: Robust and Object-Aware Motion Generation Using Neural Pose
Descriptors [73.26004792375556]
本稿では,3次元オブジェクト認識キャラクタ合成における新しいシーンオブジェクトへのロバストさと一般化が,参照オブジェクトを1つも持たないモーションモデルをトレーニングすることで実現可能であることを示す。
我々は、オブジェクト専用のデータセットに基づいて訓練された暗黙的な特徴表現を活用し、オブジェクトの周りのSE(3)-同変記述体フィールドをエンコードする。
本研究では,3次元仮想キャラクタの動作と相互作用の質,および未知のオブジェクトを持つシナリオに対するロバスト性を大幅に向上することを示す。
論文 参考訳(メタデータ) (2023-08-24T17:59:51Z) - Visibility Aware Human-Object Interaction Tracking from Single RGB
Camera [40.817960406002506]
本稿では,1台のRGBカメラからフレーム間の3次元人・物・接触・相対変換を追跡する新しい手法を提案する。
我々は、SMPLをビデオシーケンスに予め適合させて得られたフレームごとのSMPLモデル推定に基づいて、人間と物体の脳野再構成を行う。
可視フレームからの人間と物体の動きは、隠蔽された物体を推測するための貴重な情報を提供する。
論文 参考訳(メタデータ) (2023-03-29T06:23:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。