論文の概要: ManiSkillFormer: Demonstration-Free Compositional Manipulation via Geometric Contracts and Agentic Skill Graph
- arxiv url: http://arxiv.org/abs/2609.16331v3
- Date: Tue, 22 Sep 2026 23:14:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.632244
- Title: ManiSkillFormer: Demonstration-Free Compositional Manipulation via Geometric Contracts and Agentic Skill Graph
- Title(参考訳): ManiSkillFormer:幾何学的契約とエージェントスキルグラフによるDemonstration-free compositional Manipulation
- Abstract要約: ManiSkillFormerは、デモフリーで作曲操作のためのフレームワークである。
契約は知覚モジュールを観察からタスク関連3次元幾何学へ誘導する。
デモフリーピック・アンド・プレイス(30インスタンス)におけるデュアルアームロボット上でのManiSkillFormerの評価を行った。
- 参考スコア(独自算出の注目度): 9.644269617314132
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adapting robotic manipulation to new objects and tasks often requires additional demonstrations or manual engineering. Reusable manipulation skills can reduce this effort, but adapting these skills to new scenes remains challenging. We present ManiSkillFormer, a framework for demonstration-free and compositional manipulation that connects perception and action through explicit geometric contracts. Building on reusable skill schemas, LLM agents generate contracts specifying the geometry primitives required by each skill, together with corresponding motion templates for semantic objects and task contexts. These contracts guide a perception module to ground task-relevant 3D geometry from observations, which is then used to instantiate reusable motion templates in a skill library. We evaluate ManiSkillFormer on a dual-arm robot across demonstration-free pick-and-place with 30 instances from 8 object categories, functional manipulation including unscrewing, pouring, pressing, and folding, and three long-horizon tasks. ManiSkillFormer achieves an average success rate of 88.97% for pick-and-place, 75.00% for functional manipulation, and completion rates of 50--80% across the long-horizon tasks, outperforming the evaluated baselines and two ablated pipelines. These results demonstrate the potential of explicit geometric contracts to support skill reuse and composition across objects and tasks without per-object policy fine-tuning or additional robot demonstrations. The project website is at https://patricia1019.github.io/ManiSkillFormer/.
- Abstract(参考訳): 新しい物体やタスクにロボット操作を適用するには、しばしば追加のデモンストレーションや手動のエンジニアリングが必要となる。
再利用可能な操作スキルはこの労力を減らすことができるが、これらのスキルを新しいシーンに適用することは依然として困難である。
マニスキルフォーマー(ManiSkillFormer)は、明示的な幾何学的契約を通じて知覚と動作を接続する、デモンストレーション不要で構成的な操作のためのフレームワークである。
再利用可能なスキルスキーマに基づいて、LLMエージェントは、各スキルに必要な幾何学的プリミティブを指定するコントラクトと、セマンティックオブジェクトとタスクコンテキストのための対応するモーションテンプレートを生成する。
これらの契約は、認識モジュールを観察からタスク関連3D形状に誘導し、その後、スキルライブラリで再利用可能なモーションテンプレートをインスタンス化する。
ManiSkillFormer は 8 つのオブジェクトカテゴリから 30 個のインスタンスを抽出し,非圧縮,注ぐ,押す,折り畳むなどの機能操作,そして3 つの長軸タスクからなる,デモ不要なピック・アンド・プレイスでのデュアルアームロボット上で評価を行った。
ManiSkillFormerは、ピック・アンド・プレイスの平均成功率は88.97%、ファンクション操作は75.00%、ロングホライゾンタスクは50-80%で、評価されたベースラインと2つの短縮パイプラインを上回っている。
これらの結果は、オブジェクトごとの細かい調整や追加のロボットデモを行うことなく、オブジェクトやタスク間のスキルの再利用と構成を支援するための明示的な幾何学的契約の可能性を示している。
プロジェクトのWebサイトはhttps://patricia1019.github.io/ManiSkillFormer/にある。
関連論文リスト
- GTA-2: A Multi-VLM Framework for Synthesizing Robot Manipulation Skills via Grounded Task Axes [14.740922941761491]
GTA-2(Gunded Task Axes v2)は、実行可能でタスクを起動する操作スキルを構築するモジュール型マルチVLMフレームワークである。
GTA-2は、各スキルをタスク関連キーポイントと軸、コントローラ構成、シーン依存パラメータからなるセマンティックサブタスクとして表現する。
この抽象化・ツー・グラウンド化により、タスク固有のロボットデモ、ポリシートレーニング、微調整なしでゼロショットスキル生成が可能になる。
論文 参考訳(メタデータ) (2026-09-09T07:04:35Z) - Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization [66.06331553787281]
テキスト内ビデオガイダンスに従うことで、見知らぬタスクを実行する因果的ビデオアクションモデルであるZero-WAMを提案する。
我々はまた、8.6Kタスクにまたがる74.2Kの人間ロボットICLペアのデータセットであるHumanGenを提示する。
RoboTwin 2.0シミュレーションの7つの目に見えないタスクにおいて、Zero-WAMは47.0%の平均的な成功率を達成する。
論文 参考訳(メタデータ) (2026-08-26T17:59:34Z) - SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning [99.49739831030388]
このインタフェースの設計は,オープンエンド空間推論のためのエージェントのキャパシティをいかに形作るかを検討する。
本研究では,アクションインタフェースとしてコードを採用する空間推論のためのトレーニングフリーフレームワークであるSpatialClawを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:59:36Z) - Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation [52.00134393320209]
Sparse2Actは、スパースポイントクラウドエンコーダの事前学習のための観測・動作アライメントフレームワークである。
マスク付きスパース3Dトークンは、観察と組み合わせたワークスペース運動の周囲のシーン特徴を整理するために訓練される。
LIBERO-10ベンチマークでは,500ステップの微調整を行い,平均86.9%の成功を達成した。
論文 参考訳(メタデータ) (2026-06-10T23:56:01Z) - Task Editing for Generalizable 3D Visuomotor Policy Learning [50.590696755853365]
3Dビジュモータポリシーは、深度マップと点雲が空間的推論のための豊富な幾何学的情報を提供するため、複雑なロボット操作に有望な方向を提供する。
既存の手法では、人間中心のデモにオブジェクト中心の変換を適用することで、データ効率を改善するためにデモ生成戦略が一般的である。
本稿では,タスク中心の編集の観点から多様な軌道を生成する新しいデモ生成フレームワークであるTask-Editを提案する。
論文 参考訳(メタデータ) (2026-06-05T07:54:49Z) - Concurrent Prehensile and Nonprehensile Manipulation: A Practical Approach to Multi-Stage Dexterous Tasks [23.52755440099898]
実世界のデキスタラスマルチタスク操作のためのサンプル効率の良いアプローチであるDexMultiを提案する。
モノリシックなポリシーを学習する代わりに、現在のオブジェクトの幾何学に基づくスキルを抽出する。
提案手法は,オブジェクトごとの3~4つの実演で平均66%の成功率を達成し,拡散政策ベースラインを2~3倍に向上させる。
論文 参考訳(メタデータ) (2026-03-12T08:25:21Z) - Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation [34.73582639920571]
AtomSkillは、新しいマルチタスク模倣学習フレームワークである。
構成可能なロボット操作のために構造化された原子スキルスペースを学習し活用する。
さまざまな操作タスクにまたがって、最先端のメソッドを一貫して上回る。
論文 参考訳(メタデータ) (2025-12-20T13:46:08Z) - Correspondence-Oriented Imitation Learning: Flexible Visuomotor Control with 3D Conditioning [11.847696426774732]
本研究では,3次元のフレキシブルなタスク表現を持つビジュモータ制御のための条件付きポリシー学習フレームワークであるImitation-Oriented Learning (COIL)を紹介する。
COILはタスク、オブジェクト、動作パターンをまたいで一般化し、疎密な仕様と密な仕様の両方の下での現実世界の操作タスクの従来の方法と比べて、優れた粒度を達成する。
論文 参考訳(メタデータ) (2025-12-05T18:50:17Z) - AnchorDP3: 3D Affordance Guided Sparse Diffusion Policy for Robotic Manipulation [8.603450327406879]
AnchorDP3は、デュアルアームロボット操作のための拡散ポリシーフレームワークである。
大規模で手続き的に生成されたシミュレーションデータに基づいて訓練される。
RoboTwinベンチマークの平均成功率は98.7%に達する。
論文 参考訳(メタデータ) (2025-06-24T03:03:26Z) - ManiPose: A Comprehensive Benchmark for Pose-aware Object Manipulation in Robotics [55.85916671269219]
本稿では,ポーズ変動操作タスクの研究を進めるための先駆的ベンチマークであるManiPoseを紹介する。
包括的データセットは、2936の現実世界のスキャンされた剛体オブジェクトと100の明瞭なオブジェクトに対して、幾何学的に一貫性があり、操作指向の6Dポーズラベルを備えている。
本ベンチマークは,ポーズ推定,ポーズ認識操作,実ロボットのスキル伝達における顕著な進歩を示す。
論文 参考訳(メタデータ) (2024-03-20T07:48:32Z) - Bottom-Up Skill Discovery from Unsegmented Demonstrations for
Long-Horizon Robot Manipulation [55.31301153979621]
我々は,実世界の長距離ロボット操作作業に,スキル発見による取り組みを行う。
未解決のデモンストレーションから再利用可能なスキルのライブラリを学ぶためのボトムアップアプローチを提案する。
提案手法は,多段階操作タスクにおける最先端の模倣学習手法よりも優れた性能を示した。
論文 参考訳(メタデータ) (2021-09-28T16:18:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。