論文の概要: Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning
- arxiv url: http://arxiv.org/abs/2607.04591v1
- Date: Mon, 06 Jul 2026 01:38:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.9868
- Title: Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning
- Title(参考訳): ビジュアライゼーション・ランゲージ・アクション学習のための単純-複雑構造実証
- Authors: Xinchuan Qiu, Yi Yu,
- Abstract要約: VLA(Vision-Language-Action)モデルは、ロボット操作において強力な能力を示している。
実証組織を模倣学習の基本的かつ見過ごされている側面として認識する。
両腕ロボットプラットフォームを用いたVLA学習のための簡易・複雑構造型実演収集戦略を提案する。
- 参考スコア(独自算出の注目度): 9.340058165047717
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have demonstrated strong capabilities in robotic manipulation by integrating visual perception, language understanding, and robot action generation. Existing research has primarily focused on improving model architectures, training strategies, and dataset scale, while little attention has been paid to how demonstrations are collected and organized. We identify demonstration organization as a fundamental yet overlooked aspect of imitation learning, as it directly affects policy learning efficiency, training stability, and policy generalization. To address this gap, we propose a simple-to-complex structured demonstration collection strategy for VLA learning using a dual-arm robotic platform. Our approach systematically organizes data through three general principles: (i) decomposing complex manipulation tasks into progressively learnable sub-skills, (ii) standardizing the interaction environment to reduce unnecessary variability, and (iii) organizing demonstrations according to progressively increasing task complexity. This structured design enables VLA models to first acquire fundamental manipulation skills before learning increasingly complex task compositions, facilitating more effective learning of long-horizon manipulation tasks. We evaluate the proposed strategy on two representative robotic manipulation tasks: block grasping and sorting, and towel folding. Experimental results show consistent improvements in task success rate and training stability compared with the baseline method of directly collecting end-to-end complete task trajectories. These findings highlight demonstration organization as a previously underexplored but important factor in VLA learning and provide practical insights into efficient skill acquisition, scalable dataset construction, and long-horizon robotic manipulation.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、視覚知覚、言語理解、ロボット行動生成を統合することで、ロボット操作において強力な能力を示している。
既存の研究は主にモデルアーキテクチャ、トレーニング戦略、データセットスケールの改善に重点を置いている。
我々は、実証組織を、政策学習効率、訓練安定、政策一般化に直接影響するため、模倣学習の基本的な見過ごされがちな側面として認識する。
このギャップに対処するため、両腕ロボットプラットフォームを用いたVLA学習のための簡易で複雑な構造化されたデモコレクション戦略を提案する。
私たちのアプローチは,3つの原則を通じてデータを体系的に整理する。
(i)複雑な操作タスクを段階的に学習可能なサブスキルに分解すること。
二 不要な変動を抑えるための相互作用環境の標準化及び
三 段々複雑化する課題に応じてデモを組織すること。
この構造設計により、VLAモデルは、より複雑なタスク構成を学習する前に、まず基本的な操作スキルを習得し、長い水平操作タスクをより効果的に学習することができる。
本研究は,ブロックの把握とソート,タオルの折り畳みという2つのロボット操作タスクにおいて提案した戦略を評価する。
実験結果から,タスク成功率とトレーニング安定性は,エンド・ツー・エンドのタスク・トラジェクトリを直接収集するベースライン法と比較して一貫した改善が見られた。
これらの知見は、VLA学習において、これまで未熟だが重要な要素として実証組織を強調し、効率的なスキル獲得、スケーラブルなデータセット構築、長期のロボット操作に関する実践的な洞察を提供する。
関連論文リスト
- AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding [55.535374902204296]
AffordanceVLAは、タスク指向の中間表現として構造化された価格予測を導入する統一フレームワークである。
AffordanceVLAは様々な操作シナリオで高いパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-04T13:28:51Z) - Build on Priors: Vision--Language--Guided Neuro-Symbolic Imitation Learning for Data-Efficient Real-World Robot Manipulation [4.118262876469644]
本稿では,象徴的計画領域とデータ効率制御ポリシを自律的に構築する,スケーラブルなニューロシンボリック・フレームワークを提案する。
本手法は,実演をスキルに分割し,視覚言語モデル(VLM)を用いてスキルを分類する。
既知のコントローラは、シーン内の他のオブジェクトに1つのデモを投影することで、実世界のデータ拡張に活用することができる。
論文 参考訳(メタデータ) (2026-04-04T15:17:59Z) - CRAFT: Adapting VLA Models to Contact-rich Manipulation via Force-aware Curriculum Fine-tuning [46.57805525532354]
Vision-Language-Actionモデルは一般的な命令を実行できるが、コンタクトリッチな操作タスクに苦労する。
CRAFTは、初期訓練中に視覚と言語埋め込みを調節する力覚カリキュラムの微調整フレームワークである。
CRAFTはタスクの成功を継続的に改善し、未確認のオブジェクトや新しいタスクのバリエーションに一般化し、多様なVLAアーキテクチャに効果的に適応することを示す。
論文 参考訳(メタデータ) (2026-02-13T02:28:21Z) - Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives [101.22313265304979]
近年のビジョン,言語,マルチモーダル学習の進歩は,ロボット基礎モデルの進歩を加速させている。
本研究は,ロボットの操作をアルゴリズムの観点から検討する。
我々は、近年の学習に基づくアプローチを、高レベルの計画と低レベルの制御の統一的な抽象化の中に整理する。
論文 参考訳(メタデータ) (2025-12-28T16:05:38Z) - VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models [9.376810354990079]
VLA-OSは,様々なタスク計画パラダイムを備えた統一型VLAアーキテクチャシリーズである。
様々な対象カテゴリ(剛体・変形可能)、視覚的モーダル性(2D・3D)、環境(シミュレーション・実世界)、エンドエフェクター(グリッパー・デキスタスハンド)の総合的な実験スイートを設計する。
論文 参考訳(メタデータ) (2025-06-21T03:07:48Z) - Few-Shot Vision-Language Action-Incremental Policy Learning [55.07841353049953]
トランスフォーマーに基づくロボット操作手法は,多視点空間表現と言語命令を用いてロボットの運動軌跡を学習する。
既存のメソッドには、いくつかのデモだけで新しいタスクを継続的に学習する能力がない。
我々はこれらの問題に対処するタスク-prOmpt graPh evolutIon poliCy (TOPIC) を開発した。
論文 参考訳(メタデータ) (2025-04-22T01:30:47Z) - Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features [59.892436892964376]
本稿では,視覚に基づく制御ポリシを用いて,ロバストな閉ループ性能を実現するために必要な最小限のデータ要件とアーキテクチャ適応について検討する。
この知見はFlex (Fly lexically) で合成され, 凍結パッチワイド特徴抽出器として, 事前学習された視覚言語モデル (VLM) を用いたフレームワークである。
本研究では,本手法の有効性を,行動クローンによる訓練を実世界のシーンに応用した,四重項フライ・トゥ・ターゲットタスクに適用した。
論文 参考訳(メタデータ) (2024-10-16T19:59:31Z) - Exploring CausalWorld: Enhancing robotic manipulation via knowledge transfer and curriculum learning [6.683222869973898]
本研究では,指間の複雑な動きと協調を必要とする,学習に基づく三指ロボットアーム操作タスクについて検討する。
強化学習を利用することで、エージェントに熟練した操作に必要なスキルを習得するよう訓練する。
微調整とカリキュラム学習という2つの知識伝達戦略を,ソフトアクター・クリティカルなアーキテクチャで活用した。
論文 参考訳(メタデータ) (2024-03-25T23:19:19Z) - Visual Adversarial Imitation Learning using Variational Models [60.69745540036375]
逆関数仕様は、深い強化学習を通しての学習行動にとって大きな障害であり続けている。
望ましい行動の視覚的なデモンストレーションは、エージェントを教えるためのより簡単で自然な方法を示すことが多い。
変動モデルに基づく対向的模倣学習アルゴリズムを開発した。
論文 参考訳(メタデータ) (2021-07-16T00:15:18Z) - Automated Relational Meta-learning [95.02216511235191]
本稿では,クロスタスク関係を自動的に抽出し,メタ知識グラフを構築する自動リレーショナルメタ学習フレームワークを提案する。
我々は,2次元玩具の回帰と少数ショット画像分類に関する広範な実験を行い,ARMLが最先端のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2020-01-03T07:02:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。