論文の概要: From Pixel to Poses: Object-centric Tool Manipulation Learning from Human Demonstrations
- arxiv url: http://arxiv.org/abs/2609.35375v1
- Date: Mon, 28 Sep 2026 15:12:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 06:01:57.766165
- Title: From Pixel to Poses: Object-centric Tool Manipulation Learning from Human Demonstrations
- Title(参考訳): PixelからPosesへ:人間のデモから学ぶオブジェクト中心のツールマニピュレーション
- Abstract要約: ロボット操作のスケールアップは、現実世界のロボットデータの不足によって主にボトルネックとなる。
我々はP2P-Tを紹介した。P2P-Tはデータ効率のよいオブジェクト中心のフレームワークで、人間のデモから直接ツールの使用を学習する。
タスク毎の微調整を最小限にすることで、我々のフレームワークは、実行パフォーマンスにおける過去の技術状況よりも73%改善します。
- 参考スコア(独自算出の注目度): 18.15737454418728
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling up robotic manipulation is primarily bottlenecked by the scarcity of real-world robot data. While recent approaches leverage human video demonstrations to mitigate this shortage, they remain computationally expensive and still rely on paired human-robot data for domain alignment. Although current state-of-the-arts excel at long-horizon tasks, they struggle with the delicate and precise control required for complex tool manipulation. To overcome these limitations, we introduce P2P-T, from Pixel to Poses for Tool Manipulation, a data-efficient, object-centric framework that learns tool use directly from human demonstrations. P2P-T bridges the cognitive and physical execution gap through a two-stage approach. First, pretraining an object-centric world model to extract stable pose priors; second, integrating these priors into an efficient, pose-aware low-level policy. By utilizing a robust automated data processing pipeline powered by modern foundation models, P2P-T completely bypasses the need for human-robot aligned data. This reduces overall training overhead drastically. With minimal per-task fine-tuning, our framework achieves a 73% improvement over the previous state of the art in execution performance on complex, real-world tool manipulation tasks that currently remain out of reach for standard large-scale pretrained models.
- Abstract(参考訳): ロボット操作のスケールアップは、現実世界のロボットデータの不足によって主にボトルネックとなる。
最近のアプローチでは、この不足を軽減するために人間のビデオデモを利用するが、計算コストは高く、ドメインアライメントのためにペアの人間ロボットデータに依存している。
現在の最先端技術は長距離作業では優れていますが、複雑なツール操作に必要な繊細で正確な制御に苦労しています。
これらの制限を克服するため、PixelからPoses for Tool ManipulationへのP2P-Tを導入しました。
P2P-Tは2段階のアプローチによって認知的および身体的実行ギャップを埋める。
第一に、オブジェクト中心の世界モデルを事前訓練して、安定したポーズ先を抽出し、第二に、これらの先行を効率的でポーズ対応の低レベルポリシーに統合する。
最新のファンデーションモデルを活用した堅牢な自動データ処理パイプラインを利用することで、P2P-Tは、人間-ロボット整列データの必要性を完全に回避する。
これにより、全体的なトレーニングオーバーヘッドが大幅に削減される。
タスク毎の微調整を最小限に抑えることで、当社のフレームワークは、従来の大規模事前訓練モデルでは手に入らない、複雑な実世界のツール操作タスクにおける実行時のパフォーマンスを73%向上させています。
関連論文リスト
- Improving Imitation Learning Efficiency for Manipulation through Geometric Prior Pretraining [21.64711515041526]
本研究では,各シーンが平面,物体,手のみを含む幾何学的視覚前訓練データセットを構築した。
実世界の3つのロボットの作業だけでなく、5つの操作タスクにわたる3つのシミュレーションロボットのACTを用いて、この幾何学的事前評価を行った。
論文 参考訳(メタデータ) (2026-09-11T11:19:06Z) - GazeVLA: Learning Human Intention for Robotic Manipulation [22.106797717672293]
エボディード・ファンデーション・モデルは、ロボット操作において大きなブレークスルーを達成したが、それでも大規模なロボットのデモンストレーションに大きく依存している。
人間の行動の根底にある意図は、このギャップを埋めるための強力な中間表現として役立つと我々は主張する。
本稿では,ロボット操作を容易にするための人間の意図を明示的に学習し,伝達する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-24T14:46:03Z) - Constraint-Preserving Data Generation for Visuomotor Policy Learning [46.576295441652405]
我々は、単一の専門家軌道を用いて、新しいオブジェクトジオメトリとポーズを含むロボットデモを生成する。
これら生成されたデモは、ゼロショットを現実世界に転送するクローズドループビジュモータポリシーのトレーニングに使用される。
論文 参考訳(メタデータ) (2025-08-05T22:20:02Z) - Tool-as-Interface: Learning Robot Policies from Observing Human Tool Use [20.644849892016122]
ツール使用に関する知識を人間からロボットに伝達するフレームワークを提案する。
さまざまなツール・ユース・タスクにまたがってフレームワークの有効性を実証する。
本手法は遠隔操作による拡散政策よりもタスク成功率を71%向上させる。
論文 参考訳(メタデータ) (2025-04-06T20:40:19Z) - A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning [67.72413262980272]
事前訓練された視覚モデル(PVM)は現代のロボティクスの基本であるが、その最適構成は定かではない。
セマンティック・ボトルネックを導入してオブジェクト中心の表現を誘導する手法であるSlotMIMを開発した。
提案手法は,画像認識,シーン理解,ロボット学習評価において,従来の作業よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-03-10T06:18:31Z) - Mitigating the Human-Robot Domain Discrepancy in Visual Pre-training for Robotic Manipulation [16.809190349155525]
そこで本研究では,容易に利用可能な人間ロボットのビデオデータを利用して,ドメインギャップを埋める新しい適応パラダイムを提案する。
提案手法では,人間とロボットのビデオのセマンティクスを整列させるために,人間ロボットのアライメント損失を用いて,事前学習したモデルをパラメータ効率よくロボット領域に適応させる。
論文 参考訳(メタデータ) (2024-06-20T11:57:46Z) - Transferring Foundation Models for Generalizable Robotic Manipulation [82.12754319808197]
インターネット規模の基盤モデルによって生成された言語推論セグメンテーションマスクを効果的に活用する新しいパラダイムを提案する。
提案手法は,オブジェクトのポーズを効果的かつ堅牢に知覚し,サンプル効率のよい一般化学習を可能にする。
デモは提出されたビデオで見ることができ、より包括的なデモはlink1またはlink2で見ることができます。
論文 参考訳(メタデータ) (2023-06-09T07:22:12Z) - A Framework for Efficient Robotic Manipulation [79.10407063260473]
単一のロボットアームがピクセルからスパースリワード操作ポリシーを学習できることを示します。
デモは10回しかなく、単一のロボットアームがピクセルからスパースリワード操作のポリシーを学習できることを示しています。
論文 参考訳(メタデータ) (2020-12-14T22:18:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。