論文の概要: Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2607.15880v1
- Date: Fri, 17 Jul 2026 11:50:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.842386
- Title: Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation
- Title(参考訳): ロボットマニピュレーションの一般化のためのダイナミクスを考慮したメタイミテーション
- Authors: Zhenduo Shang, Xiyao Liu, Bohan Li, Xudong Wang, Teng Ren, Lianqing Liu, Zhi Han,
- Abstract要約: 本稿では,ロボットのデモンストレーションからスキルを学ぶためのフレームワークを提案する。
メタラーニングを統合して共有スキルスペースを構築することで、DAMIは新しいタスクに迅速に適応するためのエージェントを提供する。
我々の手法は、目に見えるタスクの直接推論と目に見えないタスクへの適応に関して、最先端のベースラインより優れています。
- 参考スコア(独自算出の注目度): 17.382238044141783
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Imitation Learning aims to learn skills from extensive observations and demonstrations for robots, so it suffers from data scarcity and environment generalization. The existing methods predominantly focus on imitation from in-domain tasks and consequently struggle with generalization to unseen tasks. To bridge this generalization gap, we propose the \textbf{D}ynamics-\textbf{A}ware \textbf{M}eta-\textbf{I}mitation (DAMI) framework. By integrating meta-learning to construct a shared skill space, DAMI equips agents for rapid adaptation to novel tasks. We introduce the Visual-Motor Trajectory (VMT) module to capture complex spatio-temporal dynamics within the task latent space. Furthermore, we propose the Unpaired Unified Task (U2T) block to fuse unstructured multimodal observations. To coordinate these representations, we integrate a Task-Conditioned Feature Modulation (TCFM) mechanism customized for modulating low-level 3D features. By capturing intrinsic dynamics from a random complete reference demonstration, our framework learns the underlying task logic rather than memorizing static cues, ensuring effective generalization. Extensive experiments in both simulation and real-world settings demonstrate that our approach outperforms state-of-the-art baselines regarding direct inference on seen tasks and adaptation to unseen tasks via few-shot fine-tuning.
- Abstract(参考訳): Imitation Learningは、ロボットの広範な観察とデモンストレーションからスキルを学ぶことを目的としており、データの不足と環境の一般化に悩まされている。
既存の手法は主にドメイン内のタスクの模倣に焦点を合わせ、その結果、目に見えないタスクへの一般化に苦労する。
この一般化のギャップを埋めるために、我々は、dAMI (DAMI) フレームワークとして \textbf{D}ynamics-\textbf{A}ware \textbf{M}eta-\textbf{I}mitation (DAMI) を提案する。
メタラーニングを統合して共有スキルスペースを構築することで、DAMIは新しいタスクに迅速に適応するためのエージェントを提供する。
タスク潜在空間内の複雑な時空間ダイナミクスを捉えるために,Visual-Motor Trajectory (VMT) モジュールを導入する。
さらに,非構造化マルチモーダル観測を融合するUnpaired Unified Task (U2T)ブロックを提案する。
これらの表現をコーディネートするために,低レベル3D特徴量調整用にカスタマイズされたTCFM(Task-Conditioned Feature Modulation)機構を統合する。
ランダムな完全参照デモから固有ダイナミクスをキャプチャすることで、静的なキューを記憶するのではなく、基礎となるタスクロジックを学習し、効率的な一般化を確実にする。
シミュレーションと実世界の両方の環境での大規模な実験により、我々のアプローチは、目に見えるタスクの直接推論と、数ショットの微調整による見えないタスクへの適応に関して、最先端のベースラインよりも優れていることが示された。
関連論文リスト
- Bridging Semantics and Kinematics: A Modular Framework for Zero-Shot Robotic Manipulation [0.6927055673104934]
このアーキテクチャは、視覚行動パイプラインを視覚認識、意味解釈、タスク実行の3段階に分解することで、高レベルの推論と低レベルの運動学のギャップを埋める。
このフレームワークは、制約のないオープンワールドシーケンシャルな操作と密接なリレーショナルな空間的推論という、2つのゼロショット実験装置で評価される。
論文 参考訳(メタデータ) (2026-06-22T11:01:56Z) - AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding [55.535374902204296]
AffordanceVLAは、タスク指向の中間表現として構造化された価格予測を導入する統一フレームワークである。
AffordanceVLAは様々な操作シナリオで高いパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-04T13:28:51Z) - Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation [70.8381970762877]
VLM(Vision-Language Models)は、セマンティック推論とタスク計画において顕著な能力を示す。
本稿では,VLMに基づく推論を実行可能な解析概念を通じて基礎づける新しいフレームワークであるGRACEを紹介する。
G GRACEは高レベル命令理解と低レベルロボット制御の統一的で解釈可能なインターフェースを提供する。
論文 参考訳(メタデータ) (2025-10-09T09:08:33Z) - Bridge Thinking and Acting: Unleashing Physical Potential of VLM with Generalizable Action Expert [60.88976842557026]
VLM(Vision-Language Models)は、優れた計画と推論能力を示している。
最近の二重系アプローチは「思考」と「行動」を分離しようとする
一般化可能なアクションエキスパートを中心としたフレームワークを紹介します。
論文 参考訳(メタデータ) (2025-10-04T18:33:27Z) - Foundation Model for Skeleton-Based Human Action Understanding [56.89025287217221]
本稿では,統一骨格に基づくDense Representation Learningフレームワークを提案する。
USDRLはトランスフォーマーベースのDense Spatio-Temporal (DSTE)、Multi-Grained Feature Deorrelation (MG-FD)、Multi-Perspective Consistency Training (MPCT)で構成されている。
論文 参考訳(メタデータ) (2025-08-18T02:42:16Z) - Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial-Ground Robotic System [8.88014241557266]
不均一なマルチロボットシステムは、協調的なハイブリッド協調を必要とする複雑なタスクにおいて大きな可能性を示す。
静的またはタスク固有のモデルに依存する既存のメソッドは、様々なタスクや動的環境にまたがる一般化性に欠けることが多い。
本稿では,大規模言語モデル (LLM) と微調整型視覚言語モデル (VLM) を統合した階層型マルチモーダルフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-05T13:27:41Z) - Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features [59.892436892964376]
本稿では,視覚に基づく制御ポリシを用いて,ロバストな閉ループ性能を実現するために必要な最小限のデータ要件とアーキテクチャ適応について検討する。
この知見はFlex (Fly lexically) で合成され, 凍結パッチワイド特徴抽出器として, 事前学習された視覚言語モデル (VLM) を用いたフレームワークである。
本研究では,本手法の有効性を,行動クローンによる訓練を実世界のシーンに応用した,四重項フライ・トゥ・ターゲットタスクに適用した。
論文 参考訳(メタデータ) (2024-10-16T19:59:31Z) - Breaking Down the Task: A Unit-Grained Hybrid Training Framework for
Vision and Language Decision Making [19.87916700767421]
視覚言語意思決定(VLDM)は、難しいマルチモーダルタスクである。
環境の観点からは、タスクエピソードはきめ細かいテキストユニットに分けることができる。
本研究では,環境中を活発に探索し,露光バイアスを低減できる新しいハイブリッド学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-07-16T11:54:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。