論文の概要: Towards Human-like Physical Intelligence: Lifelong Vision-Language-Action Learning for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2607.14852v2
- Date: Tue, 21 Jul 2026 06:49:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.223596
- Title: Towards Human-like Physical Intelligence: Lifelong Vision-Language-Action Learning for Robotic Manipulation
- Title(参考訳): 人間ライクな物理知能を目指して--ロボットマニピュレーションのための生涯視覚・言語・アクション学習
- Abstract要約: 本稿では,ロボット操作のための生涯学習フレームワークであるVision-Language-Actionを提案する。
LifelongVLAは、低コストなロボット展開を実現しながら、可塑性と安定性のトレードオフを緩和する。
実験では、LifelongVLAが既存のベースラインより優れており、効率的なスキル拡張、学習された操作動作の堅牢な保持、実世界の展開に対する再トレーニングへの依存の低減が示されている。
- 参考スコア(独自算出の注目度): 35.68934129750219
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Similar to the natural capabilities of humans to sequentially learn new tasks, robots with Vision-Language-Action (VLA) models should possess lifelong learning ability to learn a new task when deployed in open-world environments. However, most recently proposed lifelong learning models aim to effectively learn the current task (plasticity) or maintain high accuracy on previous tasks (stability), while the plasticity-stability trade-off remains largely unsolved in robotic manipulation models. To address this fundamental challenge, we propose a cache-efficient lifelong Vision-Language-Action learning framework for robotic manipulation (i.e., LifelongVLA), which alleviates the plasticity-stability trade-off with a dual-timescale adaptation mechanism while achieving low-cost robotic deployment with a cache-efficient replay strategy. More concretely, we propose a dual-timescale LoRA gating module to decompose VLA adaptation into two lightweight pathways: a short-term adapter for plasticity and a long-term adapter for stable consolidation. These pathways are integrated via a task-aware gate, enabling explicit control of the plasticity-stability trade-off. In the skill replay phase, a cache-efficient stochastic replay strategy is proposed to preserve more balanced retention signals without full-trajectory storage. Finally, experiments show that LifelongVLA outperforms existing baselines, demonstrating efficient skill expansion, robust retention of learned manipulation behaviors, and reduced reliance on retraining for real-world deployment on an xArm robot.
- Abstract(参考訳): 人間が新しいタスクを順次学習する自然の能力と同様に、ビジョンランゲージ・アクション(VLA)モデルを持つロボットは、オープンワールド環境にデプロイされた時に新しいタスクを学習する生涯の学習能力を持つべきである。
しかし、最近提案された生涯学習モデルは、現在のタスク(塑性)を効果的に学習したり、以前のタスク(安定性)を高精度に維持することを目的としている。
この根本的な課題に対処するため,ロボット操作のためのキャッシュ効率の長いビジョン・ランゲージ・アクション学習フレームワーク(LifelongVLA)を提案する。
より具体的には、VLA適応を2つの軽量経路(可塑性用短期アダプタと安定固化用長期アダプタ)に分解するデュアルタイムスケールLORAゲーティングモジュールを提案する。
これらの経路はタスク対応ゲートを介して統合され、可塑性-安定性トレードオフの明示的な制御を可能にする。
スキル・リプレイ・フェーズでは, キャッシュ効率のよい確率的リプレイ・ストラテジーが提案される。
最後に、LifelongVLAは既存のベースラインよりも優れており、効率的なスキル拡張、学習された操作動作の堅牢な保持、xArmロボットの実際の展開への再トレーニングへの依存の低減が示されている。
関連論文リスト
- HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning [15.872908522637957]
本稿では,VLA(Vision-Language-Action)モデルのための,プラグイン・アンド・プレイファインチューニングパイプラインを提案する。
VLA生成したアクションを統一インターフェースとして概念化し、残留ポリシーをトレーニングする。
オンラインのRLトレーニングを1.5時間以内に行うと、実際のロボットの平均成功率は95%を超えます。
論文 参考訳(メタデータ) (2026-06-22T05:07:08Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning [61.38273866396522]
ビジョン・ランゲージ・アクションモデルが汎用ロボット学習の強力なパラダイムとして登場した。
現在の手法は、シミュレーションや物理世界の展開に挑戦するには相変わらず適していない。
本稿では,VLA フレームワークのテスト時間強化学習について紹介する。
論文 参考訳(メタデータ) (2026-01-11T01:51:30Z) - EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models [57.75717492488268]
VLA(Vision-Language-Action)モデルは、大きな言語モデルを活用することで高度なロボット操作を行う。
Supervised Finetuning (SFT) では、タスク毎の数百のデモ、厳格に軌跡を記憶すること、デプロイメント条件がトレーニングから逸脱したときに適応できないことなどが求められている。
EVOLVE-VLA(EVOLVE-VLA)は、VLAが最小またはゼロのタスク固有のデモで環境相互作用を通じて継続的に適応できるテストタイムトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-12-16T18:26:38Z) - Towards Accessible Physical AI: LoRA-Based Fine-Tuning of VLA Models for Real-World Robot Control [0.0]
本稿では,VLAモデルを低コストなロボット操作システムに適用するための,効率的な微調整手法と実世界の展開分析について述べる。
本稿では,LoRA(Lo-Rank Adaptation)と量子化技術を用いた資源効率の高い微調整手法を提案する。
本手法は,事前学習したVLAモデルを,限られた実演データを持つ新しいロボット体に適応させる上で重要な課題に対処する。
論文 参考訳(メタデータ) (2025-12-11T16:25:30Z) - Action Flow Matching for Continual Robot Learning [54.10050120844738]
ロボット工学における継続的な学習は、変化する環境やタスクに常に適応できるシステムを求める。
本稿では,オンラインロボット力学モデルアライメントのためのフローマッチングを利用した生成フレームワークを提案する。
ロボットは,不整合モデルで探索するのではなく,行動自体を変換することで,より効率的に情報収集を行う。
論文 参考訳(メタデータ) (2025-04-25T16:26:15Z) - Transferable Latent-to-Latent Locomotion Policy for Efficient and Versatile Motion Control of Diverse Legged Robots [9.837559106057814]
Pretrain-and-finetuneパラダイムは、新しいロボットエンティティやタスクに効率的に適応するための、有望なアプローチを提供する。
本稿では,タスク固有の観察エンコーダやアクションデコーダとともに,移動可能な潜時移動ポリシーを事前訓練する潜時学習フレームワークを提案する。
提案手法は広範囲なシミュレーションと実世界の実験により検証され、事前学習された潜伏移動政策が、効率を向上した新しいロボットエンティティやタスクに効果的に一般化できることが実証された。
論文 参考訳(メタデータ) (2025-03-22T03:01:25Z) - Robotic Control via Embodied Chain-of-Thought Reasoning [86.6680905262442]
学習したロボット制御ポリシーの鍵となる制限は、トレーニングデータの外部で一般化できないことである。
視覚言語行動モデル(VLA)に関する最近の研究は、大規模なインターネット事前学習型視覚言語モデルを使用することで、その堅牢性と一般化能力を大幅に向上させることができることを示した。
ロボットの動作を予測する前に、VLAに対して、計画、サブタスク、動作、視覚的接地機能について複数の推論を行うために、VLAに対してEmbodied Chain-of-Thought Reasoning (ECoT)を導入する。
論文 参考訳(メタデータ) (2024-07-11T17:31:01Z) - LGR2: Language Guided Reward Relabeling for Accelerating Hierarchical Reinforcement Learning [23.878883576384002]
大規模言語モデル(LLM)は論理的推論、文脈内学習、コード生成において顕著な能力を示している。
LGR2 は LLM を利用して高次ポリシーのための言語誘導報酬関数を生成する新しい HRL フレームワークである。
スパース環境における試料効率をさらに高めるため, 目標条件付き後視体験レザベリングを統合した。
論文 参考訳(メタデータ) (2024-06-09T18:40:24Z) - Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for
Autonomous Real-World Reinforcement Learning [58.3994826169858]
ロボット強化学習のためのリセット不要な微調整システムであるRoboFuMEを紹介する。
我々の洞察は、オフラインの強化学習技術を利用して、事前訓練されたポリシーの効率的なオンライン微調整を確保することである。
提案手法では,既存のロボットデータセットからのデータを組み込んで,目標タスクを3時間以内の自律現実体験で改善することができる。
論文 参考訳(メタデータ) (2023-10-23T17:50:08Z) - Towards Robust Continual Learning with Bayesian Adaptive Moment Regularization [51.34904967046097]
継続的な学習は、モデルが以前に学習した情報を忘れてしまう破滅的な忘れ込みの課題を克服しようとする。
本稿では,パラメータ成長の制約を緩和し,破滅的な忘れを減らし,新しい事前手法を提案する。
以上の結果から, BAdamは, 単頭クラスインクリメンタル実験に挑戦する先行手法に対して, 最先端の性能を達成できることが示唆された。
論文 参考訳(メタデータ) (2023-09-15T17:10:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。