論文の概要: Generalizable Robotic Insertion with World Models
- arxiv url: http://arxiv.org/abs/2609.28258v1
- Date: Wed, 23 Sep 2026 15:20:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.085794
- Title: Generalizable Robotic Insertion with World Models
- Title(参考訳): 世界モデルを用いた汎用ロボットインサーション
- Abstract要約: 本稿では、ロボットの受容情報と、手首に搭載されたカメラで捉えた生の視覚的観察とを組み合わせた世界モデルを用いた一般化可能な挿入のための枠組みを提案する。
我々のモデルベースアプローチは、最大90個の挿入タスクを幾何学的に多様な部分でトレーニングし、未知の幾何学的対象に対して56%のゼロショット成功を達成し、モデルフリーのベースラインでは7%に過ぎなかった。
我々の知る限り、これは完全にデータ駆動の方法で見えないオブジェクトを組み立てることのできる最初のシステムであり、スケーラブルで一般化可能なロボット組立システムへの重要な一歩である。
- 参考スコア(独自算出の注目度): 43.97018813455412
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robotic assembly in high-mixture settings requires adaptable systems that can handle diverse parts, yet current approaches typically rely on policies specialized to each insertion task. Although this can reach high success rates, it makes the process of deploying systems for new problems tedious and time consuming. We present a framework for generalizable insertion using world models that combine robot proprioceptive information with raw visual observations captured by a wrist-mounted camera. Our model-based approach trains a single world model on up to 90 insertion tasks with geometrically diverse parts, achieving 56% zero-shot success on unseen objects with unknown geometry compared to just 7% with a model-free baseline. Importantly, performance improves as more objects are included in the training dataset, demonstrating strong scalability. Lastly, finetuning the generalist model on held-out objects significantly enhances data-efficiency compared to training from scratch and, in some cases, achieves better asymptotic performance. To our knowledge, this is the first system capable of assembling unseen objects in an entirely data-driven manner, and thus represents a significant step toward scalable, generalizable robotic assembly systems.
- Abstract(参考訳): ハイミキシング環境でのロボットアセンブリは、様々な部分を扱うことができる適応可能なシステムを必要とするが、現在のアプローチは通常、挿入タスクごとに専門的なポリシーに依存している。
これは高い成功率に達する可能性があるが、新しい問題のためのシステムをデプロイするプロセスは面倒で時間を要する。
本稿では、ロボットの受容情報と、手首に搭載されたカメラで捉えた生の視覚的観察とを組み合わせた世界モデルを用いた一般化可能な挿入のための枠組みを提案する。
我々のモデルベースアプローチは、最大90個の挿入タスクを幾何学的に多様な部分でトレーニングし、未知の幾何学的対象に対して56%のゼロショット成功を達成し、モデルフリーのベースラインでは7%に過ぎなかった。
重要なのは、トレーニングデータセットにより多くのオブジェクトが含まれていることでパフォーマンスが向上し、強力なスケーラビリティが示されることだ。
最後に、ホールドアウトオブジェクト上のジェネラリストモデルを微調整することで、スクラッチからのトレーニングに比べてデータ効率が著しく向上し、場合によっては漸近的パフォーマンスが向上する。
我々の知る限り、これは完全にデータ駆動の方法で見えないオブジェクトを組み立てることのできる最初のシステムであり、スケーラブルで一般化可能なロボット組立システムへの重要な一歩である。
関連論文リスト
- AtomEgo: Exploring Ego-Robot Integration for Embodied Foundation Model Pretraining [7.286498840976614]
身体的基礎モデルは、ロボットのデモンストレーションの限られた規模と多様性に制約されている。
約2,659時間培養したコーパスで支援されたエゴロボットの協調訓練に関する系統的研究を行った。
論文 参考訳(メタデータ) (2026-09-18T08:11:39Z) - AFUN: Towards an Affordance Foundation Model for Functionality Understanding [12.890216832485647]
我々は,機能理解のための手頃な基礎モデルに向けたステップとして,我々のモデルを提示する。
我々は、異種ロボット、人間、シミュレーション、現実世界のスキャンデータを共有価格スキーマに変換する大規模な標準化データパイプラインを構築します。
私たちのモデルは、4つのベンチマークから8つのテストセットにまたがる大きなマージンで、すべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-06-01T17:50:16Z) - Attribute-Based Robotic Grasping with Data-Efficient Adaptation [19.683833436076313]
属性に基づくロボットグルーピングを学習するエンド・ツー・エンドのエンコーダ・デコーダネットワークを提案する。
提案手法は,未知のオブジェクトに対して,成功率を81%以上獲得する。
論文 参考訳(メタデータ) (2025-01-04T00:37:17Z) - Transferring Foundation Models for Generalizable Robotic Manipulation [82.12754319808197]
インターネット規模の基盤モデルによって生成された言語推論セグメンテーションマスクを効果的に活用する新しいパラダイムを提案する。
提案手法は,オブジェクトのポーズを効果的かつ堅牢に知覚し,サンプル効率のよい一般化学習を可能にする。
デモは提出されたビデオで見ることができ、より包括的なデモはlink1またはlink2で見ることができます。
論文 参考訳(メタデータ) (2023-06-09T07:22:12Z) - RT-1: Robotics Transformer for Real-World Control at Scale [98.09428483862165]
我々は,有望なスケーラブルなモデル特性を示す,ロボティクストランスフォーマーと呼ばれるモデルクラスを提示する。
実世界の課題を遂行する実ロボットの大規模データ収集に基づいて,様々なモデルクラスと,データサイズ,モデルサイズ,データの多様性の関数として一般化する能力について検証した。
論文 参考訳(メタデータ) (2022-12-13T18:55:15Z) - MetaGraspNet: A Large-Scale Benchmark Dataset for Vision-driven Robotic
Grasping via Physics-based Metaverse Synthesis [78.26022688167133]
本稿では,物理に基づくメタバース合成による視覚駆動型ロボットグルーピングのための大規模ベンチマークデータセットを提案する。
提案するデータセットには,10万の画像と25種類のオブジェクトが含まれている。
また,オブジェクト検出とセグメンテーション性能を評価するためのデータセットとともに,新しいレイアウト重み付け性能指標を提案する。
論文 参考訳(メタデータ) (2021-12-29T17:23:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。