論文の概要: RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation
- arxiv url: http://arxiv.org/abs/2608.03387v2
- Date: Wed, 05 Aug 2026 07:43:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.254827
- Title: RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation
- Title(参考訳): RoboReact: 汎用的な全身操作のためのエゴセントリックビデオからのエージェントスキル蒸留
- Authors: Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu,
- Abstract要約: 本稿では,1つの自我中心のRGB-D観測から全身のヒューマノイド操作スキルを自動的に合成するフレームワークであるRoboReactを紹介する。
RoboReactは人間の操作ビデオを生成し、深度対応の3D再構成を通じて幾何学的相互作用を抽出し、手動物体の相互作用を保ちながら、それらを高DoFのヒューマノイドプラットフォームに再ターゲットする。
実際のヒューマノイドロボットの実験では、RoboReactはさまざまなオブジェクト構成をまたがって一般化し、遠隔操作や人間によるデモンストレーションを必要とせず、実行障害から堅牢に回復する。
- 参考スコア(独自算出の注目度): 18.992624318431417
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Humanoid robots have the potential to perform dexterous manipulation in human environments, yet acquiring diverse and generalizable skills remains costly due to expensive hardware data collection and labor-intensive annotation. Recent advances in video generative models provide a promising opportunity to synthesize rich manipulation experiences from visual observations, but transferring such imagined behaviors into executable whole-body humanoid skills remains largely unexplored. In this work, we present RoboReact, a framework that automatically synthesizes whole-body humanoid manipulation skills from a single egocentric RGB-D observation. RoboReact generates human manipulation videos, extracts geometry-preserving interaction keyframes through depth-aware 3D reconstruction, and retargets them to high-DoF humanoid platforms while preserving hand-object interaction geometry. To bridge the gap between imagined plans and physical execution, RoboReact performs online object-centric re-grounding and leverages a vision-language model-guided refinement loop to adapt skills under geometric mismatch and execution deviations. The refined skills are executed through a whole-body controller, enabling coordinated whole-body manipulation and dexterous interaction. Experiments on real humanoid robots demonstrate that RoboReact generalizes across diverse object configurations and robustly recovers from execution disturbances without requiring teleoperation or human demonstrations. These results highlight the potential of combining generative models, vision-language reasoning, and closed-loop control for scalable humanoid skill acquisition.
- Abstract(参考訳): ヒューマノイドロボットは、人間の環境で巧妙な操作を行う可能性があるが、高価なハードウェアデータ収集と労働集約アノテーションのために、多種多様な一般的なスキルを習得することはコストがかかる。
映像生成モデルの最近の進歩は、視覚的な観察からリッチな操作体験を合成する有望な機会を提供するが、そのような想像された振る舞いを実行可能な全身ヒューマノイドスキルに転送することは、ほとんど探索されていない。
本研究では,1つの自我中心のRGB-D観測から全身のヒューマノイド操作スキルを自動的に合成するフレームワークであるRoboReactを紹介する。
RoboReactは、人間の操作ビデオを生成し、深度対応の3D再構成を通じてジオメトリ保存のキーフレームを抽出し、手動オブジェクトのインタラクションジオメトリを保持しながら、それらをハイDoFのヒューマノイドプラットフォームに再ターゲットする。
想像された計画と物理的実行のギャップを埋めるために、RoboReactはオンラインのオブジェクト中心のリグラウンドを実行し、幾何学的ミスマッチと実行逸脱の下でスキルを適応するために視覚言語モデル誘導の洗練ループを活用する。
洗練されたスキルは、全身コントローラを介して実行され、調整された全身操作と器用な相互作用を可能にする。
実際のヒューマノイドロボットの実験では、RoboReactはさまざまなオブジェクト構成をまたがって一般化し、遠隔操作や人間によるデモンストレーションを必要とせず、実行障害から堅牢に回復する。
これらの結果は、スケーラブルなヒューマノイドスキル獲得のための生成モデル、視覚言語推論、クローズドループ制御の組み合わせの可能性を強調している。
関連論文リスト
- Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning [17.90707618632327]
我々は、人間のビデオから再利用可能なオブジェクト中心のインタラクションを学習するためのフレームワークであるHuman2Anyを紹介する。
我々は,FrankaテーブルトップとRBY-1ヒューマノイド移動ロボットの実際の実験を含む,さまざまな操作設定のHuman2Anyを検証する。
論文 参考訳(メタデータ) (2026-06-27T08:45:27Z) - EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning [10.780924973366737]
EgoInfinityは、ロボットの獲得と学習のためのWebスケールデータ生成を可能にする、汎用的な4Dハンドオブジェクトインタラクションデータエンジンである。
EgoInfinity(エゴインフィニティ)は、知覚、セグメンテーション、再構築、相互認識の洗練、そして従来の計算不可能なビデオ対アクション問題を自動化するための、モジュール式エンジンである。
論文 参考訳(メタデータ) (2026-06-16T00:44:16Z) - EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration [67.13034606664333]
EgoHumanoidは、エゴセントリックな人間のデモを使って視覚言語アクションポリシーを共同訓練する最初のフレームワークである。
スケーラブルな人的データ収集のためのポータブルシステムを開発した。
論文 参考訳(メタデータ) (2026-02-10T18:59:03Z) - HumanX: Toward Agile and Generalizable Humanoid Interaction Skills from Human Videos [74.43500240121476]
我々はHumanXについて紹介する。HumanXは人間の動画を、ヒューマノイドのための汎用的で現実的なインタラクションスキルにコンパイルするフルスタックのフレームワークである。
HumanXは、従来の方法より8倍高い一般化成功を達成する。
論文 参考訳(メタデータ) (2026-02-02T18:53:01Z) - From Generated Human Videos to Physically Plausible Robot Trajectories [103.28274349461607]
ビデオ生成モデルは、人間のアクションを新しい文脈で合成する能力が急速に向上している。
この可能性を実現するために、ヒューマノイドはどうやってゼロショットで生成されたビデオから人間の行動を実行することができるのか?
この課題は、生成されたビデオがしばしばうるさいので、実際のビデオと比べて直接の模倣を困難にする形態的歪みを示すためである。
我々は,3次元キーポイントに条件付き物理対応強化学習政策であるGenMimicを提案し,対称性の正則化とキーポイント重み付きトラッキング報酬を訓練した。
論文 参考訳(メタデータ) (2025-12-04T18:56:03Z) - VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation [53.63540587160549]
VidBotは、WildのモノクルなRGBのみの人間ビデオから学習した3Dアベイランスを使って、ゼロショットロボット操作を可能にするフレームワークである。
VidBotは、人間の日常的なビデオを利用してロボットの学習をよりスケーラブルにする。
論文 参考訳(メタデータ) (2025-03-10T10:04:58Z) - Human-Humanoid Robots Cross-Embodiment Behavior-Skill Transfer Using Decomposed Adversarial Learning from Demonstration [9.42179962375058]
本稿では,デジタル人間モデルを共通プロトタイプとして使用することにより,データのボトルネックを低減するための転送可能なフレームワークを提案する。
このモデルは、人間による実演から、敵対的な模倣を通して行動プリミティブを学習し、複雑なロボット構造を機能的な構成要素に分解する。
本フレームワークは,多種多様な構成のヒューマノイドロボット5体を用いて検証した。
論文 参考訳(メタデータ) (2024-12-19T18:41:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。