論文の概要: Co-VLA: Consensus-based Federated Training for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2609.19923v2
- Date: Mon, 21 Sep 2026 16:23:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.108065
- Title: Co-VLA: Consensus-based Federated Training for Vision-Language-Action Models
- Title(参考訳): Co-VLA:ビジョン・ランゲージ・アクションモデルのための合意に基づくフェデレーショントレーニング
- Abstract要約: 視覚言語アクションモデル(VLA)は、汎用ロボット学習において有望なパラダイムとして登場した。
本稿では,連合型VLAトレーニングにおいて,ALMM(Alternating Direction Method of Multipliers)を用いたコンセンサス最適化を適用したCo-VLAを提案する。
このアルゴリズムは,定位適応型と等級適応型の両方のアダプタを用いて,フルモデルトレーニングとパラメータ効率の微調整の両方をサポートすることを示す。
- 参考スコア(独自算出の注目度): 15.09812270727849
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action models (VLAs) have emerged as a promising paradigm for general-purpose robot learning, with performance improving as models and datasets scale. Scaling robot data collection, however, remains challenging because data are naturally distributed across robots, tasks, and locations, making centralization costly or impractical. Federated learning offers a way to train on decentralized robot data, but applying it to VLAs requires accounting for heterogeneous robot client data distributions. We present Co-VLA, which applies consensus optimization using the Alternating Direction Method of Multipliers~(ADMM) to federated VLA training. We show that the same algorithm supports both full-model training and parameter-efficient fine-tuning with both fixed-rank and rank-adaptive adapters. The name Co-VLA reflects both consensus and collaboration: clients with different local robot datasets collaboratively train a shared model without sharing their data. Our experiments demonstrate that Co-VLA achieves performance comparable to centralized training in both full-model training and parameter-efficient fine-tuning settings. The project website and videos of our real-world experiments are available at https://embodiedvision.github.io/co-vla/.
- Abstract(参考訳): ビジョン言語アクションモデル(VLA)は、汎用ロボット学習において有望なパラダイムとして登場し、モデルやデータセットのスケールによってパフォーマンスが向上している。
しかし、ロボットのデータ収集のスケーリングは、データが自然にロボット、タスク、ロケーションに分散しているため、コストがかかるか実用的でないため、依然として難しい。
フェデレーション学習は、分散化されたロボットデータをトレーニングする手段を提供するが、それをVLAに適用するには、異種ロボットクライアントデータの分散を考慮しなければならない。
本稿では,連合型VLAトレーニングにおいて,交互方向乗算器~(ADMM)を用いたコンセンサス最適化を適用したCo-VLAを提案する。
このアルゴリズムは,定位適応型と等級適応型の両方のアダプタを用いて,フルモデルトレーニングとパラメータ効率の微調整の両方をサポートすることを示す。
Co-VLAという名前は、コンセンサスとコラボレーションの両方を反映している。さまざまなローカルロボットデータセットを持つクライアントは、データを共有せずに、共同で共有モデルをトレーニングする。
実験により,Co-VLAは,全モデルトレーニングとパラメータ効率のよい微調整設定の両方において,集中トレーニングに匹敵する性能を達成できることを示した。
プロジェクトのWebサイトと実世界の実験のビデオはhttps://embodiedvision.github.io/co-vla/.com/で公開されている。
関連論文リスト
- FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied Intelligence [21.911710953682256]
$mathrmFluxVLA$はオープンで構成駆動のプラットフォームで、不均一なエンボディされたコンポーネントをデータからデプロイのワークフローに変換する。
$mathrmFluxVLA$は、データセット、ビジュアル言語および世界モデル、アクションヘッド、報酬または有利な学習、分散トレーニング、シミュレーション評価、最適化推論、ロボットオペレータのインターフェースを標準化する。
論文 参考訳(メタデータ) (2026-09-15T13:59:09Z) - Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models [120.24139942108405]
ロボットデータのスケーリングは、一般のVision-Language-Action(VLA)モデルを構築する上で重要である。
固定されたロボットデータ予算の下では、継続した事前訓練は限られた軌道を伝達可能な視覚行動知識に変換する必要がある。
本稿では,VLA指向のVLMバックボーンであるVLActを提案する。
論文 参考訳(メタデータ) (2026-08-27T17:59:40Z) - Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data [93.7685703383343]
視覚言語モデル(VLM)は強力な汎用推論器であるが、ロボット制御ポリシーに変換することは驚くほど難しい。
このギャップは、適切な中間データで徐々にブリッジできると我々は主張する。
本研究では,タスク関連アウト・オブ・ディストリビューションETCデータと少量のアクションデータとを混合することにより,新しい視覚言語条件に一般化できることを示す。
論文 参考訳(メタデータ) (2026-06-07T08:57:51Z) - Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization [65.37179698521766]
VLA(Vision-Language-Action)モデルは、ジェネラリストロボットの制御を強く約束する。
標準的な「スケールデータ」レシピがロボット工学に翻訳されるかどうかはまだ不明だ。
本稿では,多様なロボットを対象とした事前学習のためのコアトレーニング選択を再考する,VLAスケーリングの体系的かつ制御された研究を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:25:43Z) - X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model [62.21943953611646]
Vision-Language-Actionモデルは、多様なロボットプラットフォームにわたる効果的なトレーニングに依存している。
最小限のパラメータを付加したソフトプロンプト手法を提案する。
0.9Bのインスタンス化-X-VLA-0.9Bは,ベンチマークの全体にわたってSOTA性能を同時に達成することを示す。
論文 参考訳(メタデータ) (2025-10-11T16:20:17Z) - SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics [37.82471658370026]
視覚言語モデル(VLM)は、豊富な視覚的および言語的知識を符号化した大規模マルチモーダルデータセットで事前訓練された。
SmolVLAは、トレーニングと推論の両方のコストを大幅に削減する、小さく、効率的で、コミュニティ主導のVLAである。
論文 参考訳(メタデータ) (2025-06-02T16:30:19Z) - TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies [95.30717188630432]
VLAモデルの行動予測のための時空間認識を容易にするために,視覚的トレースプロンプトを導入する。
我々は,これまでに収集した150Kロボット操作トラジェクトリのデータセットに基づいてOpenVLAを微調整し,新しいTraceVLAモデルを開発した。
4B Phi-3-Vision に基づくコンパクトな VLA モデルを提案する。
論文 参考訳(メタデータ) (2024-12-13T18:40:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。