論文の概要: Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning
- arxiv url: http://arxiv.org/abs/2606.28813v1
- Date: Sat, 27 Jun 2026 08:45:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.697171
- Title: Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning
- Title(参考訳): Human2Any:制約を考慮した構成計画による人間とロボットの移動
- Authors: Shuo Cheng, Chuye Zhang, Alfred Cueva, Caelan Garrett, Ajay Mandlekar, Danfei Xu,
- Abstract要約: 我々は、人間のビデオから再利用可能なオブジェクト中心のインタラクションを学習するためのフレームワークであるHuman2Anyを紹介する。
我々は,FrankaテーブルトップとRBY-1ヒューマノイド移動ロボットの実際の実験を含む,さまざまな操作設定のHuman2Anyを検証する。
- 参考スコア(独自算出の注目度): 17.90707618632327
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Human videos are a scalable source of supervision for robot manipulation, as they are abundant and naturally capture rich object interactions. However, transferring human demonstrations to robots remains challenging due to embodiment mismatch, scene variation, and robot-specific feasibility constraints. We present Human2Any, a framework for learning reusable object-centric interaction priors from human videos without requiring real-world robot demonstrations in the target task contexts. Human2Any represents manipulation through object-object interaction motion, capturing task-relevant scene changes while abstracting away embodiment-specific details. It composes learned interaction priors with robot-side feasibility reasoning and motion planning, allowing the same human-derived knowledge to adapt to different embodiments, scene geometries, and task contexts. We validate Human2Any across diverse manipulation settings, including real-world experiments on a Franka tabletop setup and an RBY-1 humanoid mobile robot, demonstrating robust interaction-centric manipulation without real-world robot training data. Project website: https://human2any.github.io/.
- Abstract(参考訳): 人間のビデオは、ロボット操作のためのスケーラブルな監視源であり、それらは豊富で、リッチなオブジェクトインタラクションを自然に捉えている。
しかし,人間のデモをロボットに転送することは,身体的ミスマッチやシーンの変動,ロボット固有の実現可能性の制約などにより,依然として困難である。
我々は、人間のビデオから再利用可能なオブジェクト中心のインタラクションを学習するためのフレームワークであるHuman2Anyを、現実のロボットデモをタスクコンテキストに必要とせずに提示する。
Human2Anyは、オブジェクトとオブジェクトのインタラクション動作による操作を表現し、エンボディメント固有の詳細を抽象化しながら、タスク関連シーンの変化をキャプチャする。
それは、ロボット側の実現可能性推論と運動計画との学習された相互作用の先行を構成し、同じ人間由来の知識が異なる実施形態、シーンジオメトリー、タスクコンテキストに適応できるようにする。
我々は,FrankaテーブルトップセットアップとRBY-1ヒューマノイド移動ロボットを用いた実世界実験を含む,さまざまな操作設定のHuman2Anyを検証する。
プロジェクトウェブサイト:https://human2any.github.io/.com
関連論文リスト
- LUCID: Learning Embodiment-Agnostic Intent Models from Unstructured Human Videos for Scalable Dexterous Robot Skill Acquisition [11.86733592383987]
LUCIDは、構造化されていない人間のビデオからタスク意図を学ぶフレームワークである。
大規模な並列シミュレーションでロボットの制御を学習する。
実世界の5つの操作課題におけるLUCIDの評価を行った。
論文 参考訳(メタデータ) (2026-06-10T03:49:01Z) - H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos [58.006918399913665]
本稿では,通常の人間と物体のインタラクションビデオからモーション一貫性のあるロボット操作ビデオに変換するビデオ間翻訳フレームワークを提案する。
私たちのアプローチでは、ロボットビデオのセットのみをトレーニングするために、ペアの人間ロボットビデオは必要とせず、システムを拡張しやすくしています。
テスト時にも同じプロセスを人間のビデオに適用し、人間の行動を模倣する高品質なロボットビデオを生成する。
論文 参考訳(メタデータ) (2025-12-10T07:59:45Z) - UniSkill: Imitating Human Videos via Cross-Embodiment Skill Representations [28.33464371298504]
UniSkillは、ラベルなしで大規模なクロスボデーメントビデオデータから、エンボディディメントに依存しないスキル表現を学ぶフレームワークである。
シミュレーションと実環境の両方における実験により、我々のクロス・エボディメントのスキルは、ビデオのプロンプトが見えない場合でも、ロボットが適切な行動を選択するのに成功していることがわかった。
論文 参考訳(メタデータ) (2025-05-13T17:59:22Z) - Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot Manipulation [65.46610405509338]
我々は、ゼロショットロボット操作を可能にする汎用的な目標条件ポリシーを学習することを目指している。
私たちのフレームワークであるTrack2Actは、ゴールに基づいて将来のタイムステップで画像内のポイントがどのように動くかを予測する。
学習したトラック予測を残留ポリシーと組み合わせることで,多種多様な汎用ロボット操作が可能となることを示す。
論文 参考訳(メタデータ) (2024-05-02T17:56:55Z) - Learning Video-Conditioned Policies for Unseen Manipulation Tasks [83.2240629060453]
ビデオ条件付きポリシー学習は、以前は目に見えないタスクの人間のデモをロボット操作スキルにマッピングする。
我々は,現在のシーン観察と対象課題のビデオから適切なアクションを生成するためのポリシーを学習する。
われわれは,多タスクロボット操作環境の課題と,技術面における性能の面から,そのアプローチを検証した。
論文 参考訳(メタデータ) (2023-05-10T16:25:42Z) - Zero-Shot Robot Manipulation from Passive Human Videos [59.193076151832145]
我々は,人間の映像からエージェント非依存の行動表現を抽出するフレームワークを開発した。
我々の枠組みは、人間の手の動きを予測することに基づいている。
トレーニングされたモデルゼロショットを物理ロボット操作タスクにデプロイする。
論文 参考訳(メタデータ) (2023-02-03T21:39:52Z) - Learning Reward Functions for Robotic Manipulation by Observing Humans [92.30657414416527]
我々は、ロボット操作ポリシーのタスク非依存報酬関数を学習するために、幅広い操作タスクを解く人間のラベル付きビデオを使用する。
学習された報酬は、タイムコントラストの目的を用いて学習した埋め込み空間におけるゴールまでの距離に基づいている。
論文 参考訳(メタデータ) (2022-11-16T16:26:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。