論文の概要: AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning
- arxiv url: http://arxiv.org/abs/2607.08857v1
- Date: Thu, 09 Jul 2026 18:27:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.414569
- Title: AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning
- Title(参考訳): AgenticFocus: Dexterous Humanoid Learningのための人間のFPVビデオからのオブジェクト保存型混合現実感合成
- Authors: Iaroslav Kolomiets, Miguel Altamirano Cabrera, Artem Lykov, Jeffrin Sam, Dmitrii Iarchuk, Yara Mahmoud, Daniia Zinniatullina, Mikhail Konenkov, Dzmitry Tsetserukou,
- Abstract要約: 我々はAgenticFocusを紹介した。AgenticFocusは、通常の1対1の映像をロボット訓練可能なデモに変換する複合現実感合成パイプラインである。
得られたデータセットペアは、同期されたロボットアクションと状態による視覚的な観察に焦点を当てた。
AgenticFocus は -5.18 対 -5.56 と -6.05 のスコアで、クロスエボディメントベースラインよりも軌道誤差とスムーズな手首の動きを実現している。
- 参考スコア(独自算出の注目度): 2.0979009566413946
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Human egocentric video is a scalable supervision source for humanoid policy learning, but current pipelines struggle with hand-object occlusion, oversimplified motion, or specialized capture hardware. We introduce AgenticFocus, a Mixed Reality synthesis pipeline that converts ordinary first-person-view human videos into robot-trainable demonstrations by restoring occluded object geometry, reconstructing full-hand motion, and retargeting it to a humanoid embodiment through camera-relative alignment and layered compositing. The resulting dataset pairs focused visual observations with synchronized robot actions and states. AgenticFocus achieves lower trajectory error and smoother wrist motion than cross-embodiment baselines, with SPARC scores of -5.18 versus -5.56 and -6.05.
- Abstract(参考訳): 人間中心のビデオは、ヒューマノイドのポリシー学習のためのスケーラブルな監視源だが、現在のパイプラインは、手動の閉塞、過度に単純化されたモーション、あるいは特殊なキャプチャハードウェアに苦戦している。
我々はAgenticFocusを紹介した。AgenticFocusは、通常の1対1の人間映像を、隠蔽された物体の形状を復元し、全手動作を再構築し、カメラ相対アライメントと層状合成によりヒューマノイドの体現物に再ターゲットすることで、ロボット訓練可能なデモに変換する。
得られたデータセットペアは、同期されたロボットアクションと状態による視覚的な観察に焦点を当てた。
AgenticFocusのSPARCスコアは-5.18対-5.56対6.05である。
関連論文リスト
- Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments [32.61025334275917]
ヒト・アス・ヒューマノイド(Humanoid as-Humanoid)は、ヒトからヒトへのハイDoFヒューマノイドの監視フレームワークである。
大規模な人間のデモンストレーションを、対象のヒューマノイドに対する実行可能な観察-アクション監視に変換する。
Humanoidは、データ収集分析において、ヒューマノイド遠隔操作よりも4.8--7.2倍の生のデモンストレーション言語ゲインが得られる。
論文 参考訳(メタデータ) (2026-06-30T17:44:16Z) - VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes [71.14444761145435]
知覚に基づくヒューマノイド・ロコ・マニピュレーションは、自我中心の観察とタスク・インストラクションを全身の動きに結びつける必要がある。
既存のデータソースがこれを完全に提供するものはありません。
このボトルネックに対処するために、再構成シーンで視覚・言語・運動学を総合的に指導する手法を提案する。
論文 参考訳(メタデータ) (2026-06-29T17:59:55Z) - GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors [113.71148915419246]
GRAILは3Dアセット、シミュレーター対応シーン、およびビデオファンデーションモデル(VFM)の先行データで構成され、物理的環境を再構築したりロボットを遠隔操作したりすることなく対話を合成するデジタル生成パイプラインである。
GRAILは、オブジェクト形状、カメラパラメータ、メートル法スケール、環境深度、ロボットが提案する文字がビデオ生成の前に知られ、再構成中に再利用される、完全に定義された3D構成から始まる。
我々は、回復した動作をヒューマノイドロボットに再ターゲティングし、補完的なタスク・ジェネラル・モルフォロジー・トラッカーを訓練する。
GRAILは、ピックアップ、オブジェクト操作、着座にまたがる2万以上のシーケンスを生成する
論文 参考訳(メタデータ) (2026-06-03T17:57:45Z) - Real2Sim in HOI: Toward Physically Plausible HOI Reconstruction from Monocular Videos [26.750787853601413]
HOI再建は、人間と物体の追跡に止まるのではなく、動きをコヒーレントな相互作用にする関係を回復すべきである。
我々は,4D HOIアニメーションを室内モノクロビデオから再構成するためのフレームワークである$textbfHA-HOI$を紹介した。
我々の研究は、一般的なモノクラーHOIビデオを、ヒューマノイドオブジェクトの動作のためのスケーラブルなデモに変換するための一歩を踏み出した。
論文 参考訳(メタデータ) (2026-05-14T06:56:57Z) - MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction [54.36564144414704]
MeshMimicは、3Dシーンの再構築とインテリジェンスを組み込んだ革新的なフレームワークで、ヒューマノイドロボットがビデオから直接「モーション・テライン」インタラクションを学習できるようにする。
現状の3次元視覚モデルを活用することで、我々のフレームワークは、人間の軌跡と基礎となる地形や物体の3次元幾何学の両方を正確にセグメント化し再構築する。
論文 参考訳(メタデータ) (2026-02-17T17:09:45Z) - Mitty: Diffusion-based Human-to-Robot Video Generation [57.494785199352975]
我々は,Human2Robotビデオ生成のためのビデオインコンテクスト学習を可能にする拡散変換器であるMittyを提案する。
事前訓練されたビデオ拡散モデルに基づいて構築されたMittyは、強い視覚的時間的事前情報を利用して、人間のデモをアクションラベルや中間抽象化なしでロボット実行ビデオに変換する。
Human2RobotとEPIC-Kitchensの実験によると、Mittyは最先端の結果、目に見えない環境への強力な一般化、人間の観察からスケーラブルなロボット学習のための新たな洞察を提供する。
論文 参考訳(メタデータ) (2025-12-19T05:52:15Z) - CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives [65.89192712575797]
本研究では,モノクロ映像から再現可能な人物の動きとシーン形状を復元するCRISPを紹介する。
我々の手法は、人中心のビデオベンチマークにおいて、モーショントラッキングの失敗率を55.2%から6.9%に下げる。
このことは、CRISPが物理的に有意な人間の動きと対話環境を大規模に生成する能力を示している。
論文 参考訳(メタデータ) (2025-12-16T18:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。