論文の概要: ManiSkillFormer: Demonstration-Free Compositional Manipulation via Task-Conditioned Geometric Contracts
- arxiv url: http://arxiv.org/abs/2609.16331v1
- Date: Mon, 14 Sep 2026 20:45:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.238964
- Title: ManiSkillFormer: Demonstration-Free Compositional Manipulation via Task-Conditioned Geometric Contracts
- Title(参考訳): ManiSkillFormer: タスク定義幾何契約によるDemonstration-free compositional Manipulation
- Abstract要約: ManiSkillFormerは、デモ不要で構成的なロボット操作のための、ニューロシンボリックなフレームワークである。
ManiSkillFormerは、エンドツーエンドのビズモータポリシを学ぶ代わりに、タスク条件付き幾何学的コントラクトを導入し、知覚とアクションのインターフェースを明示的に構成する。
- 参考スコア(独自算出の注目度): 9.644269617314132
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present ManiSkillFormer, a neuro-symbolic framework for demonstration-free and compositional robotic manipulation. Instead of learning end-to-end visuomotor policies, ManiSkillFormer introduces task-conditioned geometric contracts that explicitly structure the interface between perception and action. Each manipulation skill declares the semantic geometric primitives required for execution, such as object keypoints and surface normals. Building on human-defined skill structures, LLM agents generate these contracts and corresponding motion templates for different objects and task contexts. These contracts guide the perception module to ground task-relevant 3D primitives from observations, which are then used to instantiate reusable motion templates stored in a skill library. We evaluate ManiSkillFormer on Galaxea R1-Lite dual-arm robot across three settings: zero-shot pick-and-place over 8 object categories with 30 different instances, functional manipulation tasks including unscrewing, pouring, pressing, and folding, and 3 long-horizon tasks. ManiSkillFormer achieves higher average success rates than the evaluated baselines and two ablated pipelines: 88.24% for demonstration-free pick-and-place, 75.00% average success on functional manipulation and 50--80% completion rates across the long-horizon tasks. These results show that our design enables composable and reusable manipulation across objects and tasks without per-object policy fine-tuning or additional robot demonstrations.
- Abstract(参考訳): ManiSkillFormerは、デモ不要で構成的なロボット操作のための、ニューロシンボリックなフレームワークである。
ManiSkillFormerは、エンドツーエンドのビズモータポリシを学ぶ代わりに、タスク条件付き幾何学的コントラクトを導入し、知覚とアクションのインターフェースを明示的に構成する。
各操作スキルは、オブジェクトキーポイントや表面正規化のような実行に必要な意味的幾何学的プリミティブを宣言する。
人間の定義したスキル構造に基づいて、LLMエージェントはこれらのコントラクトと、異なるオブジェクトとタスクコンテキストに対する対応するモーションテンプレートを生成する。
これらの契約は、認識モジュールを観察からタスク関連プリミティブに誘導し、スキルライブラリに格納された再利用可能なモーションテンプレートをインスタンス化する。
我々は、Galaxea R1-LiteデュアルアームロボットのManiSkillFormerを、3つの設定で評価した。
ManiSkillFormerは、評価されたベースラインと2つの短縮パイプラインよりも平均的な成功率を実現している: 88.24%はデモなしのピック・アンド・プレイスで、75.00%は機能操作で、50-80%は長時間のタスクで成功している。
これらの結果から,オブジェクトごとの細調整や追加のロボットデモを行うことなく,オブジェクトやタスク間で構成可能かつ再利用可能な操作を可能にすることが示唆された。
関連論文リスト
- GTA-2: A Multi-VLM Framework for Synthesizing Robot Manipulation Skills via Grounded Task Axes [14.740922941761491]
GTA-2(Gunded Task Axes v2)は、実行可能でタスクを起動する操作スキルを構築するモジュール型マルチVLMフレームワークである。
GTA-2は、各スキルをタスク関連キーポイントと軸、コントローラ構成、シーン依存パラメータからなるセマンティックサブタスクとして表現する。
この抽象化・ツー・グラウンド化により、タスク固有のロボットデモ、ポリシートレーニング、微調整なしでゼロショットスキル生成が可能になる。
論文 参考訳(メタデータ) (2026-09-09T07:04:35Z) - Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization [66.06331553787281]
テキスト内ビデオガイダンスに従うことで、見知らぬタスクを実行する因果的ビデオアクションモデルであるZero-WAMを提案する。
我々はまた、8.6Kタスクにまたがる74.2Kの人間ロボットICLペアのデータセットであるHumanGenを提示する。
RoboTwin 2.0シミュレーションの7つの目に見えないタスクにおいて、Zero-WAMは47.0%の平均的な成功率を達成する。
論文 参考訳(メタデータ) (2026-08-26T17:59:34Z) - SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning [99.49739831030388]
このインタフェースの設計は,オープンエンド空間推論のためのエージェントのキャパシティをいかに形作るかを検討する。
本研究では,アクションインタフェースとしてコードを採用する空間推論のためのトレーニングフリーフレームワークであるSpatialClawを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:59:36Z) - Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation [52.00134393320209]
Sparse2Actは、スパースポイントクラウドエンコーダの事前学習のための観測・動作アライメントフレームワークである。
マスク付きスパース3Dトークンは、観察と組み合わせたワークスペース運動の周囲のシーン特徴を整理するために訓練される。
LIBERO-10ベンチマークでは,500ステップの微調整を行い,平均86.9%の成功を達成した。
論文 参考訳(メタデータ) (2026-06-10T23:56:01Z) - Task Editing for Generalizable 3D Visuomotor Policy Learning [50.590696755853365]
3Dビジュモータポリシーは、深度マップと点雲が空間的推論のための豊富な幾何学的情報を提供するため、複雑なロボット操作に有望な方向を提供する。
既存の手法では、人間中心のデモにオブジェクト中心の変換を適用することで、データ効率を改善するためにデモ生成戦略が一般的である。
本稿では,タスク中心の編集の観点から多様な軌道を生成する新しいデモ生成フレームワークであるTask-Editを提案する。
論文 参考訳(メタデータ) (2026-06-05T07:54:49Z) - Concurrent Prehensile and Nonprehensile Manipulation: A Practical Approach to Multi-Stage Dexterous Tasks [23.52755440099898]
実世界のデキスタラスマルチタスク操作のためのサンプル効率の良いアプローチであるDexMultiを提案する。
モノリシックなポリシーを学習する代わりに、現在のオブジェクトの幾何学に基づくスキルを抽出する。
提案手法は,オブジェクトごとの3~4つの実演で平均66%の成功率を達成し,拡散政策ベースラインを2~3倍に向上させる。
論文 参考訳(メタデータ) (2026-03-12T08:25:21Z) - Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation [34.73582639920571]
AtomSkillは、新しいマルチタスク模倣学習フレームワークである。
構成可能なロボット操作のために構造化された原子スキルスペースを学習し活用する。
さまざまな操作タスクにまたがって、最先端のメソッドを一貫して上回る。
論文 参考訳(メタデータ) (2025-12-20T13:46:08Z) - Correspondence-Oriented Imitation Learning: Flexible Visuomotor Control with 3D Conditioning [11.847696426774732]
本研究では,3次元のフレキシブルなタスク表現を持つビジュモータ制御のための条件付きポリシー学習フレームワークであるImitation-Oriented Learning (COIL)を紹介する。
COILはタスク、オブジェクト、動作パターンをまたいで一般化し、疎密な仕様と密な仕様の両方の下での現実世界の操作タスクの従来の方法と比べて、優れた粒度を達成する。
論文 参考訳(メタデータ) (2025-12-05T18:50:17Z) - AnchorDP3: 3D Affordance Guided Sparse Diffusion Policy for Robotic Manipulation [8.603450327406879]
AnchorDP3は、デュアルアームロボット操作のための拡散ポリシーフレームワークである。
大規模で手続き的に生成されたシミュレーションデータに基づいて訓練される。
RoboTwinベンチマークの平均成功率は98.7%に達する。
論文 参考訳(メタデータ) (2025-06-24T03:03:26Z) - ManiPose: A Comprehensive Benchmark for Pose-aware Object Manipulation in Robotics [55.85916671269219]
本稿では,ポーズ変動操作タスクの研究を進めるための先駆的ベンチマークであるManiPoseを紹介する。
包括的データセットは、2936の現実世界のスキャンされた剛体オブジェクトと100の明瞭なオブジェクトに対して、幾何学的に一貫性があり、操作指向の6Dポーズラベルを備えている。
本ベンチマークは,ポーズ推定,ポーズ認識操作,実ロボットのスキル伝達における顕著な進歩を示す。
論文 参考訳(メタデータ) (2024-03-20T07:48:32Z) - Bottom-Up Skill Discovery from Unsegmented Demonstrations for
Long-Horizon Robot Manipulation [55.31301153979621]
我々は,実世界の長距離ロボット操作作業に,スキル発見による取り組みを行う。
未解決のデモンストレーションから再利用可能なスキルのライブラリを学ぶためのボトムアップアプローチを提案する。
提案手法は,多段階操作タスクにおける最先端の模倣学習手法よりも優れた性能を示した。
論文 参考訳(メタデータ) (2021-09-28T16:18:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。