論文の概要: An Empirical Study and Open Testbed for Federated Fine-Tuning of Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2609.22973v1
- Date: Sat, 19 Sep 2026 11:51:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 17:18:43.320113
- Title: An Empirical Study and Open Testbed for Federated Fine-Tuning of Vision-Language-Action Models
- Title(参考訳): ビジョン・ランゲージ・アクションモデルのフェデレーションファインチューニングのための実証的研究とオープンテストベッド
- Abstract要約: フェデレーション学習は、共有ポリシを学ぶことによって、分散デモンストレーションを活用するための有望なアプローチである。
我々は,3つの近代事前訓練型VLA政策のファインチューニングに関する体系的研究を行った。
ヘテロジニアスデータを一元的に微調整する能力など,連合型VLA学習の機会を強調した。
- 参考スコア(独自算出の注目度): 28.169731994129123
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adapting a pretrained Vision-Language-Action (VLA) model to a new robot, environment, or task requires demonstrations that are collected locally and often discarded. Federated learning is a promising approach to exploiting such distributed demonstrations by learning a shared policy. However, whether it can adapt large pretrained VLAs remains an open question, and a lack of reproducible benchmarks for pretrained VLAs and reusable training frameworks makes existing results difficult to compare. In this paper, we conduct a systematic study of federated fine-tuning of three modern pretrained VLA policies on the 40 simulated tasks of the LIBERO manipulation benchmark, and on six real-world tasks in two real-robot experiments, with demonstrations collected across two and three sites, respectively. Our study analyzes the key choices in this setting, spanning multiple federated parameter scopes, three aggregation algorithms, and evaluation under distribution shift. Based on the study, we derive a series of lessons, including the dominance of the federated scope over the choice of aggregation algorithm and the difficulty of matching centralized fine-tuning on physical robots, where cross-site heterogeneity is stronger than simulation captures. We also highlight opportunities for federated VLA learning, such as the ability to match centralized fine-tuning on heterogeneous data, to remain at least as robust as centralized fine-tuning under distribution shift, and to personalize, with each client federating part of the policy and keeping the rest local, which helps where the policy's pretraining is weak but leaves no usable global model. We open-source \decentvla{}, the model- and runtime-agnostic testbed behind the study, to facilitate future research and fair comparisons in federated VLA learning.
- Abstract(参考訳): 事前訓練されたビジョン・ランゲージ・アクション(VLA)モデルを新しいロボット、環境、タスクに適用するには、ローカルに収集され、しばしば破棄されるデモが必要である。
フェデレーテッド・ラーニング(Federated Learning)は、共有ポリシを学ぶことによって、このような分散デモンストレーションを活用するための有望なアプローチである。
しかし、大規模な事前学習VLAを適応できるかどうかは未解決の問題であり、事前学習VLAと再利用可能なトレーニングフレームワークのための再現可能なベンチマークが欠如しているため、既存の結果の比較は困難である。
本稿では, LIBERO操作ベンチマークの40のシミュレーションタスクと, 2つの実ロボット実験における6つの実世界のタスクに対して, それぞれ2つのサイトと3つのサイトをまたいだデモを行い, 最新のVLAポリシーのファインタニングを体系的に実施する。
本研究は,複数のフェデレーションパラメータの範囲,3つの集約アルゴリズム,分散シフトによる評価など,この設定における重要な選択について分析する。
本研究は、集約アルゴリズムの選択に対するフェデレーションスコープの優位性や、クロスサイト不均一性がシミュレーションキャプチャよりも強い物理ロボットの集中的な微調整の難しさなど、一連の教訓を導出した。
また、不均一なデータに対する集中的な微調整と一致し、分散シフトの下では集中的な微調整と同程度の堅牢さを維持し、各クライアントが政策の一部を連携し、残りをローカルに保ちながら、政策の事前訓練が弱いが使用可能なグローバルモデルを残しているような、連合VLA学習の機会も強調する。
この研究の背後にあるモデルおよびランタイムに依存しないテストベッドである \decentvla{} をオープンソースとして公開し、フェデレーション付きVLA学習における将来の研究と公正な比較を容易にする。
関連論文リスト
- Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization [65.37179698521766]
VLA(Vision-Language-Action)モデルは、ジェネラリストロボットの制御を強く約束する。
標準的な「スケールデータ」レシピがロボット工学に翻訳されるかどうかはまだ不明だ。
本稿では,多様なロボットを対象とした事前学習のためのコアトレーニング選択を再考する,VLAスケーリングの体系的かつ制御された研究を提案する。
論文 参考訳(メタデータ) (2026-02-10T12:25:43Z) - A Tale of Two Experts: Cooperative Learning for Source-Free Unsupervised Domain Adaptation [59.88864205383671]
Source-Free Unsupervised Domain Adaptation (SFUDA)は、ソースデータにアクセスすることなく、ターゲットドメインにソース学習モデルを適用するという現実的な課題に対処する。
既存のSFUDA手法は、ソースモデルの予測のみを利用するか、大きなマルチモーダルモデルを微調整する。
本稿では、補完的な洞察と対象データの潜在構造を利用するためのエキスパート協調学習(EXCL)を提案する。
論文 参考訳(メタデータ) (2025-09-26T11:39:50Z) - PromptSync: Bridging Domain Gaps in Vision-Language Models through Class-Aware Prototype Alignment and Discrimination [14.50214193838818]
CLIPのようなビジョン言語(V-L)モデルのゼロショット一般化は、広く採用されている。
従来の手法では、テスト時のプロンプトチューニングを使用して、モデルを目に見えない領域に適応させたが、不均衡なクラス分布の問題を見落としていた。
本研究では,テストサンプルとフィルタ付き拡張ビューで得られた平均クラス確率によって重み付けされたクラス認識型プロトタイプアライメントを採用する。
論文 参考訳(メタデータ) (2024-04-11T07:26:00Z) - Tackling Computational Heterogeneity in FL: A Few Theoretical Insights [68.8204255655161]
我々は、計算異種データの形式化と処理を可能にする新しい集約フレームワークを導入し、分析する。
提案するアグリゲーションアルゴリズムは理論的および実験的予測から広範囲に解析される。
論文 参考訳(メタデータ) (2023-07-12T16:28:21Z) - Federated Self-Supervised Contrastive Learning via Ensemble Similarity
Distillation [42.05438626702343]
本稿では,未ラベルのクライアントデータによる良好な表現空間の学習の実現可能性について検討する。
本稿では,アーキテクチャに依存しないローカルトレーニングとコミュニケーション効率のよいグローバルアグリゲーションをサポートする,自己指導型コントラスト学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-09-29T02:13:22Z) - Edge-assisted Democratized Learning Towards Federated Analytics [67.44078999945722]
本稿では,エッジ支援型民主化学習機構であるEdge-DemLearnの階層的学習構造を示す。
また、Edge-DemLearnを柔軟なモデルトレーニングメカニズムとして検証し、リージョンに分散制御と集約の方法論を構築する。
論文 参考訳(メタデータ) (2020-12-01T11:46:03Z) - Universal Source-Free Domain Adaptation [57.37520645827318]
ドメイン適応のための新しい2段階学習プロセスを提案する。
Procurementの段階では、今後のカテゴリギャップやドメインシフトに関する事前知識を前提とせず、将来的なソースフリーデプロイメントのためのモデルの提供を目標としています。
Deploymentの段階では、幅広いカテゴリギャップをまたいで動作可能な統一適応アルゴリズムを設計することを目的としている。
論文 参考訳(メタデータ) (2020-04-09T07:26:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。