論文の概要: C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video
- arxiv url: http://arxiv.org/abs/2608.07045v1
- Date: Fri, 07 Aug 2026 09:54:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.457683
- Title: C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video
- Title(参考訳): C2Dex:単眼ビデオからのデキサスマニピュレーションのためのコンタクトレスリコンストラクションとリターゲティング
- Authors: Jie Ren, Zhehao Jiang, Yinhong Yang, Haorui Jia, Han Jiang, Ben Li, Yao Yao, Cheng Lin, Qiu Shen, Zhenshan Bing, Xiao-Xiao Long, Xun Cao,
- Abstract要約: C2Dexは、共有インタラクションを中心に構築されたビデオからデクサラスまでの操作フレームワークである。
標準対象空間におけるノイズの多いフレームワイズ観測によって回収される安定した物体側の接触。
C2Dexは57.78%と26.67%というエンドツーエンドの成功率を達成した。
- 参考スコア(独自算出の注目度): 47.458936125974226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-quality demonstrations for dexterous robot manipulation are costly and difficult to collect, whereas monocular human videos provide a scalable source of diverse manipulation behaviors. However, transferring such demonstrations to dexterous robots remains challenging: monocular hand-object interaction (HOI) reconstruction often produces temporally unstable contacts and physically implausible interactions, while conventional retargeting methods struggle to preserve task-relevant contacts and local interaction geometry across different hand embodiments. We present C2Dex, a video-to-dexterous-manipulation framework built around a shared interaction representation: stable object-side contacts recovered by aggregating noisy frame-wise observations in the canonical object space. These stable contacts serve a dual role: as trajectory-level constraints that guide reconstruction toward temporally coherent and physically plausible human HOI trajectories, and as explicit transfer targets for the dexterous hand, where Laplacian interaction optimization preserves the local hand-object geometry across embodiments and residual reinforcement learning refines the trajectory in simulation. Experiments on DexYCB and TACO show that C2Dex achieves end-to-end trajectory success rates of 57.78% and 26.67%, respectively, substantially outperforming the strongest baselines (17.78% and 10.00%) under identical evaluation criteria. Real-robot replay experiments further demonstrate physical feasibility across diverse contact-rich manipulation tasks. Project page: https://k-jie.github.io/C2Dex/
- Abstract(参考訳): 器用なロボット操作のための高品質なデモは高価で収集が難しいが、モノラルな人間のビデオは多様な操作行動のスケーラブルなソースを提供する。
モノクラーハンドオブジェクト・インタラクション(HOI)再構成は、時間的に不安定な接触や物理的に不確実な相互作用を生じることが多いが、従来のリターゲティング手法は、タスク関連接触の保存や、異なるハンドエボディメント間の局所的相互作用の幾何に苦慮している。
C2Dexは、共有相互作用表現を基盤として構築されたビデオ・デキスタラス・マニピュレーション・フレームワークである。
これらの安定接触は、時間的コヒーレントかつ物理的に安定なヒトHOI軌道への再構成を導く軌道レベルの制約として、またラプラシアン相互作用最適化がエンボディメントをまたいだ局所的な手オブジェクト形状を保ち、残留強化学習がシミュレーションにおいて軌跡を洗練させるような、遠位手への明示的な移動目標として、二重の役割を果たす。
DexYCBとTACOの実験では、C2Dexはそれぞれ57.78%と26.67%の終端軌道の成功率を達成し、同じ評価基準の下では最強のベースライン(17.78%と10.00%)を上回っている。
リアルロボットのリプレイ実験は、様々なコンタクトリッチな操作タスクにおける物理的な実現可能性をさらに示している。
プロジェクトページ: https://k-jie.github.io/C2Dex/
関連論文リスト
- Towards Human-level Dexterous Teleoperation [62.77371751776912]
人レベルのデキスタラス遠隔操作は、動的手動物体接触による物体の動きを正確に制御する必要がある。
我々は,操作者の意図を学習された低レベルのコンタクト実行にマッピングするハンドオブジェクト・コトラッキング・コントローラであるTeleDexterを紹介した。
我々はTeleDexterを、物体の向きを変える7つの難易度遠隔操作タスクと、両手にわたる長距離ツールを用いて評価した。
論文 参考訳(メタデータ) (2026-07-13T12:36:47Z) - Hand-centric Human-to-Robot Trajectory Transfer from Video Demonstrations via Open-World Contact Localization [28.23926683554352]
EmphHOWTransferは、人間のデモを接触認識、分類情報、多様なロボット軌道に蒸留する手中心のフレームワークである。
emphHOWTransferは、時間的に一貫した3次元手の動きを回復し、観察された手と物体の相互作用の手がかりを解析することで、時間的接触間隔を局所化する。
実験によると、emphHOWTransferは86%の精度で正確な接触位置決めと高品質なロボットの動きを可能にする。
論文 参考訳(メタデータ) (2026-06-09T11:53:29Z) - SECOND-Grasp: Semantic Contact-guided Dexterous Grasping [60.1519218638742]
Second-Grasp (Semantic Contact-guided Dexterous Grasping) は、ロボットハンドが意味論的推論に基づいて把握戦略を調整できる統合されたフレームワークである。
我々のアプローチは、目に見えるカテゴリーと目に見えないカテゴリの両方で成功率を上げるために、一貫してベースラインを上回ります。
論文 参考訳(メタデータ) (2026-05-13T07:37:00Z) - SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance [49.69016078147708]
密接な相互作用シナリオにおける人間の行動の正確な再構築は、拡張現実における現実的な仮想インタラクションの実現に不可欠である。
本稿では,これらの問題に効果的に対処するための意味的および幾何学的手がかりを統合する拡散ベースのフレームワークであるSocialMirrorを提案する。
SocialMirrorはインタラクティブなヒューマンメッシュを再構築する上で,最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-04-15T07:41:52Z) - FAR-Dex: Few-shot Data Augmentation and Adaptive Residual Policy Refinement for Dexterous Manipulation [9.630733148732475]
本稿では,FAR-Dexを提案する。FAR-Dexは,少数ショットデータ拡張と適応的残差補正を統合した階層型フレームワークで,デキスタラスタスクにおける堅牢かつ高精度なハンドハンドコーディネーションを実現する。
シミュレーションと実世界の両方の実験では、FAR-Dexはデータ品質を13.4%改善し、タスク成功率は最先端の手法よりも7%向上した。
さらに、実世界のタスクにおいて80%以上の成功を達成し、強力な位置一般化を伴うきめ細かい操作を可能にする。
論文 参考訳(メタデータ) (2026-03-11T06:10:03Z) - Structural Action Transformer for 3D Dexterous Manipulation [80.07649565189035]
クロス・エボディメント・スキル・トランスファーは、ハイDoFロボットハンドの課題である。
既存の手法は、しばしば2次元の観測と時間中心の行動表現に依存し、3次元の空間的関係を捉えるのに苦労する。
本稿では、構造中心の視点を導入することで、このパラダイムに挑戦する新しい3Dデクスタラスな操作ポリシーを提案する。
論文 参考訳(メタデータ) (2026-03-04T11:38:12Z) - MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction [54.36564144414704]
MeshMimicは、3Dシーンの再構築とインテリジェンスを組み込んだ革新的なフレームワークで、ヒューマノイドロボットがビデオから直接「モーション・テライン」インタラクションを学習できるようにする。
現状の3次元視覚モデルを活用することで、我々のフレームワークは、人間の軌跡と基礎となる地形や物体の3次元幾何学の両方を正確にセグメント化し再構築する。
論文 参考訳(メタデータ) (2026-02-17T17:09:45Z) - AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation [45.753757870577196]
本稿では,対話学習のためのエージェント生成にパラダイムを転換する,堅牢なフレームワークAGILEを紹介する。
我々はAGILEがグローバルな幾何学的精度でベースラインを上回り、先行技術が頻繁に崩壊する挑戦的なシーケンスに対して、例外的な堅牢性を証明していることを示す。
論文 参考訳(メタデータ) (2026-02-04T15:42:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。