論文の概要: CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations
- arxiv url: http://arxiv.org/abs/2606.31909v1
- Date: Tue, 30 Jun 2026 16:12:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.311439
- Title: CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations
- Title(参考訳): CoDex:Demonstrationsを使わずに構成的デクスター機能マニピュレーションを学習する
- Abstract要約: CoDexはCD-FOM操作戦略を自律的に発見するゼロデーモンレーションフレームワークである。
6つのCD-FOMタスクにまたがる16-DoFマルチフィンガーハンドを用いた7-DoFロボットアーム上でのCoDexの評価を行った。
- 参考スコア(独自算出の注目度): 3.155881912157066
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this work, we study Compositional Dexterous Functional Object Manipulation (CD-FOM): tasks such as aiming and actuating a spray bottle on a plant or a glue gun on wood, which require both actuating an object's internal mechanism and controlling its pose to apply the object's function to the environment. These tasks pose significant challenges for robots due to the demanding integration of semantic understanding of the object's function, actuation mode, and application area with intricate physical dexterity to manage grasp stability, movement trajectory, and actuation. We introduce CoDex, a zero-demonstration framework that autonomously discovers CD-FOM manipulation strategies. CoDex uses vision-language models (VLMs) to infer semantic constraints from the task and scene. These constraints guide analytic constrained optimization to generate a short list of functional grasp candidates that can be efficiently refined with reinforcement learning to generate full grasp-move-actuate policies transferable from simulation to the real world. We evaluate CoDex on a 7-DoF robot arm with a 16-DoF multi-fingered hand across six CD-FOM tasks involving previously unseen objects with internal mechanisms, including spray bottles, hot glue guns, air dusters, flashlights, and pepper grinders, and their application to unseen target objects, showcasing its ability to autonomously discover and execute complex, physically viable dexterous behaviors without human demonstrations. More information at https://robin-lab.cs.utexas.edu/CoDex/.
- Abstract(参考訳): 本研究は, 合成脱軸機能オブジェクト操作 (CD-FOM) について検討する: 植物にスプレーボトルを向けたり, 木に接着剤ガンを向けたり, 物体の内部機構を動作させることと, 物体の機能を環境に適用するためのポーズを制御すること。
これらのタスクは、ロボットが物体の機能、アクティベーションモード、動作領域のセマンティック理解を複雑に統合し、把握安定性、運動軌跡、アクティベーションを管理するために重要な課題となる。
我々はCD-FOM操作戦略を自律的に発見するゼロデモフレームワークであるCoDexを紹介する。
CoDexは視覚言語モデル(VLM)を使用して、タスクとシーンから意味的制約を推論する。
これらの制約は解析的制約付き最適化を導き、強化学習で効率よく洗練できる機能的把握候補の短いリストを生成し、シミュレーションから実世界へ転送可能なフルグリップ・モーブ・アクティベートポリシーを生成する。
我々は, スプレーボトル, ホットグルーガン, エアダスター, フラッシュライト, ペッパーグラインダーなどの内部機構を備えた6つのCD-FOMタスクに対して, 16-DoFマルチフィンガーハンドを用いた7-DoFロボットアーム上でCoDexを評価し, その対象物に対する適用性を実証した。
詳細はhttps://robin-lab.cs.utexas.edu/CoDex/を参照のこと。
関連論文リスト
- DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation [66.68529423691461]
DexVerseは、デクスタラスな操作のための大規模かつモジュール化されたベンチマークである。
我々は、19のタスクに対して拡散ポリシー、DP3、OpenVLA、および$_0.5$などの代表的手法をベンチマークする。
その結果、タスクの一般化と視覚運動の堅牢性において大きな課題が浮かび上がっている。
論文 参考訳(メタデータ) (2026-07-09T17:50:47Z) - Mana: Dexterous Manipulation of Articulated Tools [64.16038120159688]
Manaは、デクスタラス操作をアニメーション問題として再解釈する一般的なsim-to-realフレームワークである。
コンピュータアニメーションにインスパイアされたManaは、手続き的に生成されたグリップを操作軌道に変換する粗いパイプラインを使用している。
Manaは、握りと手操作の両方に対してゼロショットのsim-to-real転送を実現し、巧妙な調音ツール使用に対するスケーラブルなアプローチを実証している。
論文 参考訳(メタデータ) (2026-06-11T17:59:49Z) - VAIC: Vision-Guided Humanoid Agile Object Interaction Control via Decoupled Commands [56.029505206531155]
Vision Guided Agile Interaction Control (VAIC)は、現在のコントローラとヒューマノイドロボットのギャップを埋める統合フレームワークである。
まず、特権教師政策は、正確な物体運動学と正確な環境状態を用いて多様な相互作用スキルを習得する。
第二に、デプロイ可能な学生ポリシーは、全体追跡を複数の軸にまたがる速度目標に置き換えることで、これらの能力を蒸留する。
論文 参考訳(メタデータ) (2026-06-08T09:52:55Z) - Dex4D: Task-Agnostic Point Track Policy for Sim-to-Real Dexterous Manipulation [43.03275685788157]
本稿では,多様な実世界のタスクを実行するために柔軟に再構成可能な,巧妙な操作スキルを学習するためのフレームワークを提案する。
この"Anypose-to-Anypose"ポリシーを、さまざまなポーズ設定を持つ数千のオブジェクトにまたがるシミュレーションでトレーニングします。
デプロイ時に、このポリシーは微調整なしで、現実世界のタスクにゼロショットで転送できる。
論文 参考訳(メタデータ) (2026-02-17T18:59:31Z) - Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation [70.8381970762877]
VLM(Vision-Language Models)は、セマンティック推論とタスク計画において顕著な能力を示す。
本稿では,VLMに基づく推論を実行可能な解析概念を通じて基礎づける新しいフレームワークであるGRACEを紹介する。
G GRACEは高レベル命令理解と低レベルロボット制御の統一的で解釈可能なインターフェースを提供する。
論文 参考訳(メタデータ) (2025-10-09T09:08:33Z) - Dexplore: Scalable Neural Control for Dexterous Manipulation from Reference-Scoped Exploration [58.4036440289082]
ハンドオブジェクトモーションキャプチャ(MoCap)は、大規模でコンタクトに富んだデモと、器用なロボットスコープの約束を提供する。
Dexploreは、リポジトリとトラッキングを実行し、MoCapから直接ロボット制御ポリシーを学習する、統一された単一ループ最適化である。
論文 参考訳(メタデータ) (2025-09-11T17:59:07Z) - HOSIG: Full-Body Human-Object-Scene Interaction Generation with Hierarchical Scene Perception [57.37135310143126]
HO SIGは階層的なシーン認識を通じて全体インタラクションを合成するための新しいフレームワークである。
我々のフレームワークは、自己回帰生成による運動長の無制限化をサポートし、手動による介入を最小限に抑える。
この研究は、シーン認識ナビゲーションとデクスタラスオブジェクト操作の間に重要なギャップを埋める。
論文 参考訳(メタデータ) (2025-06-02T12:08:08Z) - FunGrasp: Functional Grasping for Diverse Dexterous Hands [8.316017819784603]
本稿では,FunGraspを紹介した。FunGraspは,各種ロボットハンドを機能的に把握するシステムである。
頑健なsim-to-real転送を実現するために,特権学習,システム識別,ドメインランダム化,重力補償など,いくつかの手法を用いる。
論文 参考訳(メタデータ) (2024-11-24T07:30:54Z) - Learning Granularity-Aware Affordances from Human-Object Interaction for Tool-Based Functional Dexterous Grasping [27.124273762587848]
オブジェクトの付加的な特徴は、エージェントとオブジェクト間の機能的な相互作用のブリッジとして機能する。
機能的空き地を特定するための粒度対応型空き地特徴抽出法を提案する。
握り動作の予測には手動物体間相互作用領域で高活性な粗粒度機能を用いる。
GAAF-Dexは、人間と物体の相互作用からグラニュラリティ・アウェア・アフォーダンスを学習する完全なフレームワークである。
論文 参考訳(メタデータ) (2024-06-30T07:42:57Z) - HYPERmotion: Learning Hybrid Behavior Planning for Autonomous Loco-manipulation [7.01404330241523]
HYPERmotionは、異なるシナリオのタスクに基づいて行動を学び、選択し、計画するフレームワークである。
強化学習と全身最適化を組み合わせることで,38関節の運動を生成する。
シミュレーションと実世界の実験では、学習した動きが新しいタスクに効率的に適応できることが示されている。
論文 参考訳(メタデータ) (2024-06-20T18:21:24Z) - VoxPoser: Composable 3D Value Maps for Robotic Manipulation with
Language Models [38.503337052122234]
大規模言語モデル(LLM)は、ロボット操作のために抽出できる豊富な行動可能な知識を持っていることが示されている。
我々は,オープンな命令セットとオープンなオブジェクトセットが与えられた様々な操作タスクに対して,ロボット軌道を合成することを目指している。
筆者らは,接触に富んだインタラクションを含むシーンのダイナミックスモデルを効率的に学習することで,提案フレームワークがオンライン体験の恩恵を享受できることを実証する。
論文 参考訳(メタデータ) (2023-07-12T07:40:48Z) - V-MAO: Generative Modeling for Multi-Arm Manipulation of Articulated
Objects [51.79035249464852]
本稿では,音声による物体のマルチアーム操作を学習するためのフレームワークを提案する。
本フレームワークは,各ロボットアームの剛部上の接触点分布を学習する変動生成モデルを含む。
論文 参考訳(メタデータ) (2021-11-07T02:31:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。