論文の概要: Touch2Robot: Robot Touch in the Human Demonstration Loop
- arxiv url: http://arxiv.org/abs/2609.24660v2
- Date: Tue, 22 Sep 2026 05:14:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.004084
- Title: Touch2Robot: Robot Touch in the Human Demonstration Loop
- Title(参考訳): Touch2Robot:人間のデモループのロボットタッチ
- Abstract要約: Touch2Robotは、人間が対象のロボットがオブジェクトにどのように接触するかを確認しながら、デモを収集できるフレームワークだ。
我々は人間の手の動き、触覚手袋の測定、人間の操作時の物体の動きを捉える。
学習した動作を、人間の観測や物体形状をロボットの手の配置にマッピングする、統合されたリアルタイム再ターゲッターに蒸留する。
- 参考スコア(独自算出の注目度): 4.894188027885703
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Human demonstrations offer a scalable way to collect manipulation data, but their contacts may be unstable or infeasible when transferred to a robot hand. Collecting demonstrations directly on the target robot avoids this mismatch but substantially increases the cost of data collection. To address this trade-off, we present Touch2Robot, a framework that lets humans collect demonstrations while seeing how the target robot hand would contact the object. We capture human hand motion, tactile-glove measurements, and object motion during human manipulation. These recordings guide object-specific RL policies to reproduce the demonstrated object motion while favoring contacts consistent with the recorded human touch. We distill the learned behaviors into a unified real-time retargeter that maps incoming human observations and object geometry to robot hand configurations. During collection, the predicted robot configuration is synchronized with the tracked object pose in simulation to reconstruct robot-object contacts, which are visualized to help the demonstrator adapt subsequent interactions to the target hand. Across four real-world tasks, Touch2Robot improves average real-robot replay completion from 37.9% to 72.1% over visual-only feedback, while reducing the collection time per replay-successful demonstration from 58.6s to 18.2s. Reconstructed target-hand contacts achieve 44.2% F1 against real-robot tactile measurements, and policies trained on Touch2Robot demonstrations improve downstream Diffusion Policy performance by 29.1 percentage points over visual-only feedback. These results show that bringing robot touch into the human demonstration loop improves both the quality and efficiency of scalable dexterous data collection. Project webpage: https://Touch2Robot.github.io/.
- Abstract(参考訳): 人間のデモは、操作データを収集するスケーラブルな方法を提供するが、ロボットの手に移すと、接触が不安定または無効になる可能性がある。
対象ロボットに直接デモを収集することは、このミスマッチを避けるが、データ収集のコストを大幅に増加させる。
このトレードオフに対処するため、我々はTouch2Robotを紹介した。これは人間が対象のロボットがオブジェクトにどのように接触するかを確認しながら、デモを収集できるフレームワークだ。
我々は人間の手の動き、触覚手袋の測定、人間の操作時の物体の動きを捉える。
これらの記録は、記録された人間のタッチと整合した接触を好みながら、オブジェクト固有のRLポリシーをガイドし、実証されたオブジェクトの動きを再現する。
学習した動作を、人間の観測や物体形状をロボットの手の配置にマッピングする、統合されたリアルタイム再ターゲッターに蒸留する。
収集中、予測されたロボット構成は、追跡されたオブジェクトのポーズと同期し、ロボットオブジェクトの接触を再構築する。
現実の4つのタスクの中で、Touch2Robotは視覚のみのフィードバックよりも平均的なリアルタイムロボットのリプレイ完了を37.9%から72.1%に改善した。
再建されたターゲットハンドコンタクトは、実際のロボット触覚測定に対して44.2%のF1を達成し、Touch2Robotのデモで訓練されたポリシーは、視覚のみのフィードバックよりも29.1ポイントダウンストリーム拡散ポリシーのパフォーマンスを改善する。
これらの結果から,人間のデモループにロボットタッチを組み込むことで,スケーラブルなデクスタラスデータ収集の品質と効率が向上することが示された。
プロジェクトWebページ: https://Touch2Robot.github.io/.com
関連論文リスト
- Skel-WAM: A Hand-Skeleton-Conditioned World Action Model for Human-to-Robot Manipulation Transfer [61.50662046794264]
Skel-WAMは,ハンドスケルトン・モーション・インタフェースの統一による差異をブリッジする世界アクション・モデルである。
主な洞察は、人間の動きとロボットの動きを共通のハンドトポロジーで調整し、シーン内の地面の動きを、明示的な手の動きをエンコードする2.5Dキーポイントと組み合わせることである。
ビデオとキーポイントの専門家は、Mixture-of-Transformersを通じて視覚と骨格のダイナミクスを共同で学習し、ロボット訓練されたアクションエキスパートはこれらの予測を実行可能なコントロールにマップする。
論文 参考訳(メタデータ) (2026-09-18T09:06:15Z) - DexTouch-WM: Learning Action-Conditioned Tactile World Models from Human Touch for Dexterous Robot Manipulation [41.81471936916666]
DexTouch-WMは、スケーラブルな人間の触覚から学習し、将来のRGB観測と両眼触覚のダイナミクスを共同で予測するアクション条件付き世界モデルである。
人間の手と器用なロボット手の両方に、センサレイアウトを共有化して、柔軟なピエゾ抵抗配列を配置する。
人間とロボットのタスクセットが不一致であるにもかかわらず、保持されたロボット領域の視覚的、幾何学的、接触予測の大幅な改善が観察された。
論文 参考訳(メタデータ) (2026-09-17T16:28:34Z) - Robot-Factored World Models via Robot Rendering [25.12876640584098]
アクション条件付きビデオワールドモデルは、初期観測と行動信号から将来の観測を予測する。
本研究では,ロボット特異的な2つの要素を世界モデル外へ移動させるロボット駆動世界モデルを提案する。
実験により, レンダリングインタフェースはベクトル条件付きベースラインより優れており, 未知のロボットエンボディメント推論に一般化されていることがわかった。
論文 参考訳(メタデータ) (2026-07-24T17:59:57Z) - Do as I Do: Dexterous Manipulation Data from Everyday Human Videos [69.98851738909168]
我々は,単眼のRGBビデオの再構成と,多指ロボットハンドへの再ターゲティングを行うDO AS I DOを提案する。
アルゴリズムは、これらの手動の相互作用の推定値を、現実世界で実行可能な一連のアクションに再ターゲティングする。
総合的に、DO AS I DOは、手動物体の相互作用を推定し、RGBビデオから巧妙な操作軌跡を抽出する手法のこれまでの状態よりも優れていた。
論文 参考訳(メタデータ) (2026-06-17T17:57:34Z) - RoboPaint: From Human Demonstration to Any Robot and Any View [9.083647729839688]
本研究では,人間による実演をロボットが実行可能な環境特化学習データに変換するためのリアルタイムデータ収集とデータ編集パイプラインを提案する。
そこで本研究では,10種類のオブジェクト操作タスクに対して,デキスハンドトラジェクトリの再ターゲットが84%の成功率を達成することを示す。
複雑なデクサラス操作のために,パフォーマンス損失を最小限に抑えた,スケーラブルで費用対効果の高い遠隔操作の代替手段を提供する。
論文 参考訳(メタデータ) (2026-02-05T05:45:12Z) - H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos [58.006918399913665]
本稿では,通常の人間と物体のインタラクションビデオからモーション一貫性のあるロボット操作ビデオに変換するビデオ間翻訳フレームワークを提案する。
私たちのアプローチでは、ロボットビデオのセットのみをトレーニングするために、ペアの人間ロボットビデオは必要とせず、システムを拡張しやすくしています。
テスト時にも同じプロセスを人間のビデオに適用し、人間の行動を模倣する高品質なロボットビデオを生成する。
論文 参考訳(メタデータ) (2025-12-10T07:59:45Z) - Dexterity from Smart Lenses: Multi-Fingered Robot Manipulation with In-the-Wild Human Demonstrations [52.29884993824894]
自然環境で日々のタスクを行う人間から、マルチフィンガーロボットポリシーを学ぶことは、ロボットコミュニティにとって長年の大きな目標だった。
AINAは、Aria Gen 2メガネを使用して、どこでも、どこでも、あらゆる環境で収集されたデータから、マルチフィンガーポリシーを学ぶことができる。
論文 参考訳(メタデータ) (2025-11-20T18:59:02Z) - Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers [36.497624484863785]
Vid2Robotは、人間のビデオで操作タスクを入力として表現し、ロボットアクションを生成する、エンドツーエンドのビデオ条件付きポリシーである。
我々のモデルは、ビデオから人間とロボットのアクションの統一表現を学習するために、プロンプトロボット軌道対の大規模なデータセットを用いて訓練されている。
実世界のロボット上でのVid2Robotの評価を行い、人間のプロンプトビデオを用いた場合、BC-Zよりも20%以上の改善が見られた。
論文 参考訳(メタデータ) (2024-03-19T17:47:37Z) - Giving Robots a Hand: Learning Generalizable Manipulation with
Eye-in-Hand Human Video Demonstrations [66.47064743686953]
眼内カメラは、視覚に基づくロボット操作において、より優れたサンプル効率と一般化を可能にすることを約束している。
一方、人間がタスクを行うビデオは、ロボット遠隔操作の専門知識を欠いているため、収集コストがずっと安い。
本研究では,広範にラベルのない人間ビデオによるロボット模倣データセットを拡張し,眼球運動ポリシーの一般化を大幅に促進する。
論文 参考訳(メタデータ) (2023-07-12T07:04:53Z) - Human Grasp Classification for Reactive Human-to-Robot Handovers [50.91803283297065]
本稿では,ロボットが人間に遭遇するロボットのハンドオーバに対するアプローチを提案する。
対象物をさまざまな手形やポーズで保持する典型的な方法をカバーする,人間の把握データセットを収集する。
本稿では,検出した把握位置と手の位置に応じて人手から対象物を取り出す計画実行手法を提案する。
論文 参考訳(メタデータ) (2020-03-12T19:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。