論文の概要: CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning
- arxiv url: http://arxiv.org/abs/2606.08169v1
- Date: Sat, 06 Jun 2026 13:33:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.890993
- Title: CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning
- Title(参考訳): CLASP:タスクパラメータ学習を用いた言語駆動型ロボットのスキル選択と構成
- Authors: Markus Knauer, Valentin Gieraths, Tai Mai, Samuel Bustamante, Alin Albu-Schäffer, Freek Stulp, João Silvério,
- Abstract要約: VLA(Vision-Language-action)やVLM(Vision-Language Model)といった基礎モデルは、直感的な対話チャネルを提供するが、広範なデータを必要とする。
この作業は、タスクパラメータ化されたカーネル化運動プリミティブ(TP-KMP)と事前訓練されたVLMを組み合わせるモジュールアーキテクチャを通じて、このギャップを埋める。
学習中、スキルは2から5の審美的なデモンストレーションから取得され、VLMは各スキルのパラメータと前提条件を記述するスキルスキーマを生成する。
実行中、VLMはコマンドを解釈してスキルを選択し、パラメータバインディングを推論し、coを通して新しい振る舞いを生成する。
- 参考スコア(独自算出の注目度): 9.66356526923778
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Enabling robots to understand and execute tasks from natural language commands while maintaining data efficiency remains challenging. Foundation models such as vision-language-action (VLA) and vision-language models (VLMs) provide intuitive interaction channels but require extensive data; task-parameterized imitation learning achieves data efficiency but lacks natural language grounding. This work bridges this gap through a modular architecture combining task-parameterized kernelized movement primitives (TP-KMPs) with pretrained VLMs. During learning, skills are acquired from 2 to 5 kinesthetic demonstrations, and the VLM generates skill schemas describing each skill's parameters and preconditions. During execution, the VLM interprets commands to select skills, reason about parameter bindings, and create novel behaviors through covariance-weighted composition. When no skill or composition suffices, the system identifies capability gaps and requests targeted demonstrations, all without fine-tuning. Validation on a 7-DoF manipulator shows success rates of 73.3%-100% in scenarios requiring skill selection, composition, and active learning.
- Abstract(参考訳): データ効率を維持しながら、自然言語コマンドからタスクを理解し実行するためのロボットの開発は、依然として難しい。
視覚言語アクション(VLA)や視覚言語モデル(VLM)といった基礎モデルは直感的な対話チャネルを提供するが、広範なデータを必要とする。
この作業は、タスクパラメータ化されたカーネル化移動プリミティブ(TP-KMP)と事前訓練されたVLMを組み合わせるモジュールアーキテクチャを通じて、このギャップを埋める。
学習中、スキルは2から5の審美的なデモンストレーションから取得され、VLMは各スキルのパラメータと前提条件を記述するスキルスキーマを生成する。
実行中、VLMはコマンドを解釈し、スキルの選択、パラメータバインディングの推論、共分散重み付けによる新しい振る舞いを生成する。
スキルや構成が十分でない場合、システムは機能ギャップを識別し、ターゲットとするデモを、すべて微調整なしで要求する。
7-DoFマニピュレータのバリデーションは、スキルの選択、構成、アクティブラーニングを必要とするシナリオにおいて、73.3%-100%の成功率を示している。
関連論文リスト
- Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data [93.7685703383343]
視覚言語モデル(VLM)は強力な汎用推論器であるが、ロボット制御ポリシーに変換することは驚くほど難しい。
このギャップは、適切な中間データで徐々にブリッジできると我々は主張する。
本研究では,タスク関連アウト・オブ・ディストリビューションETCデータと少量のアクションデータとを混合することにより,新しい視覚言語条件に一般化できることを示す。
論文 参考訳(メタデータ) (2026-06-07T08:57:51Z) - Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention [0.0]
大規模言語ビジョンモデル(LVLM)は、テキストと視覚のモダリティ間の理解を可能にすることで、AIに革命をもたらした。
これらのモデルは、画像キャプション、視覚的質問応答、モーダル検索といったタスクに優れています。
本稿では,拡張された弾性重み統合とパラメータ効率のよい微調整技術を組み合わせたLVLMの総合的連続学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T22:05:30Z) - Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations [76.79742393097358]
Vision-Language Action (VLA)モデルは、視覚言語モデル(VLM)をロボット工学に拡張することを約束している。
既存の微調整手法には特異性がなく、タスクの視覚的、言語的、物理的特性に関わらず、同じパラメータセットを適用する。
神経科学における機能的特異性に触発されて、与えられたタスクに特有のスパースモデル表現を微調整することがより効果的である、という仮説を立てる。
論文 参考訳(メタデータ) (2025-11-27T18:50:21Z) - SPECI: Skill Prompts based Hierarchical Continual Imitation Learning for Robot Manipulation [3.1997825444285457]
動的非構造環境における現実世界のロボット操作は、進化するオブジェクト、シーン、タスクに対して生涯の適応性を必要とする。
伝統的な模倣学習は、生涯適応に不適な静的な訓練パラダイムに依存している。
我々は,ロボット操作のための新しいエンドツーエンドの階層型CILポリシーアーキテクチャである,スキル・プロンプトに基づく階層型連続模倣学習(SPECI)を提案する。
論文 参考訳(メタデータ) (2025-04-22T03:30:38Z) - GROVE: A Generalized Reward for Learning Open-Vocabulary Physical Skill [25.686589649523587]
シミュレーションエージェントのオープンボキャブラリ物理スキルを学ぶことは、人工知能において重要な課題である。
我々は,手動工学やタスク固有の実演を使わずに,オープン語彙の物理スキル学習を可能にする汎用的な報酬フレームワークであるGROVEを紹介する。
シミュレーションと自然画像の領域ギャップを埋めるために,エージェントのポーズを直接意味的特徴空間に投影する軽量マッパーPose2CLIPを開発した。
論文 参考訳(メタデータ) (2025-04-05T14:44:47Z) - LLaRA: Supercharging Robot Learning Data for Vision-Language Policy [56.505551117094534]
我々はLLaRA: Large Language and Robotics Assistantを紹介した。
まず、既存の行動クローニングデータセットからロボットのための会話スタイルの指導データを生成する自動パイプラインを提案する。
このようなデータセットを限定的に微調整したVLMは、ロボット制御において有意義な行動決定を導出できることを示す。
論文 参考訳(メタデータ) (2024-06-28T17:59:12Z) - SkillDiffuser: Interpretable Hierarchical Planning via Skill Abstractions in Diffusion-Based Task Execution [75.2573501625811]
拡散モデルは、ロボット軌道計画の強力な可能性を示している。
高レベルの命令からコヒーレントな軌道を生成することは依然として困難である。
エンド・ツー・エンドの階層的計画フレームワークであるSkillDiffuserを提案する。
論文 参考訳(メタデータ) (2023-12-18T18:16:52Z) - Interactive Planning Using Large Language Models for Partially
Observable Robotics Tasks [54.60571399091711]
大きな言語モデル(LLM)は、オープン語彙タスクを実行するロボットエージェントを作成することで、驚くべき成果を上げている。
LLMを用いた部分的に観測可能なタスクのための対話型計画手法を提案する。
論文 参考訳(メタデータ) (2023-12-11T22:54:44Z) - Skill-based Multi-objective Reinforcement Learning of Industrial Robot
Tasks with Planning and Knowledge Integration [0.4949816699298335]
本稿では,タスクレベルの計画と,スキルベースシステムにおけるシナリオ固有のパラメータの学習を併用する手法を提案する。
2つの異なる接触豊富なタスクのスキルパラメータを学習することで、アプローチの有効性と汎用性を実証する。
論文 参考訳(メタデータ) (2022-03-18T16:03:27Z) - HyperPELT: Unified Parameter-Efficient Language Model Tuning for Both
Language and Vision-and-Language Tasks [38.43269863509866]
パラメータ効率のよい微調整をいかに行うかは、素早い移動学習と展開においてかなり重要になっている。
我々は、純粋言語とV&Lタスクの両方で効果的に機能する新しいパラメータ効率変換学習フレームワークを設計する。
提案フレームワークは,マルチタスク学習におけるトレーニング可能なパラメータを少なくし,最先端の手法に比べて優れた性能と伝達能力を実現している。
論文 参考訳(メタデータ) (2022-03-08T06:51:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。