論文の概要: Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT
- arxiv url: http://arxiv.org/abs/2605.08879v1
- Date: Sat, 09 May 2026 10:59:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 15:02:09.084816
- Title: Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT
- Title(参考訳): 流動整流VLAの保守型SFTによる基礎的機能維持
- Abstract要約: ConSFT(Reserve Supervised Fine-Tuning)は、壊滅的な忘れを軽減しつつ、ターゲット分布に適応する最適化目標である。
LIBERO と RoboTwin ベンチマークの ConSFT を最先端のフローマッチング VLA で評価した。
- 参考スコア(独自算出の注目度): 12.18095306054314
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unconstrained fine-tuning of flow-matching Vision-Language-Action (VLA) models drives dense parameter overwrites, degrading pre-trained capabilities. We present Conservative Supervised Fine-Tuning (ConSFT), an optimization objective that adapts to target distributions while mitigating catastrophic forgetting, requiring zero prior data or architectural overhead. By dynamically scaling learning signals based on model confidence, ConSFT suppresses excessive gradients from low-confidence samples to prevent disproportionate parameter updates, thereby bounding the intrinsic parameter disruption risk. Inspired by reinforcement learning's trust-region clipping, this formulation establishes a progressive learning dynamic to secure target convergence and prior capability retention, maintaining sparse parameter updates without relying on the parallel reference networks required by explicit regularization. We evaluate ConSFT on the LIBERO and RoboTwin benchmarks across state-of-the-art flow-matching VLAs ($π_0$, $π_{0.5}$, and GR00T-N1.6-3B). The method outperforms vanilla SFT in capability retention by an average absolute margin of over 20\%, matching the efficacy of data-heavy Experience Replay in a prior-data-free regime. Real-world robotic deployments confirm that ConSFT precludes spatial overfitting during downstream adaptation, preserving pre-trained physical skills while acquiring sequential target tasks.
- Abstract(参考訳): フローマッチング型ビジョン・ランゲージ・アクション(VLA)モデルの制約のない微調整は、高密度なパラメータオーバライトを駆動し、事前訓練された能力を劣化させる。
本研究では,大惨な忘れを省き,事前データやアーキテクチャ上のオーバーヘッドをゼロにしながら,目標分布に適応する最適化目標である保守的監視細調整(ConSFT)を提案する。
モデル信頼度に基づく学習信号を動的にスケーリングすることにより、ConSFTは低信頼サンプルからの過度の勾配を抑え、不均質なパラメータ更新を防止し、本質的なパラメータ乱れリスクを拘束する。
強化学習の信頼領域クリッピングにインスパイアされたこの定式化は、目標収束と事前能力保持を確保するための進歩的な学習力学を確立し、明示的な正規化によって要求される並列参照ネットワークに頼ることなく、スパースパラメータの更新を維持する。
LIBEROとRoboTwinベンチマークのConSFTを最先端のフローマッチングVLA(π_0$, $π_{0.5}$, GR00T-N1.6-3B)で評価した。
この方法はバニラSFTの能力保持率を平均20 %以上の絶対限界で上回り、データ量の多いエクスペリエンス・リプレイの有効性を事前データフリーなシステムで比較する。
現実のロボットの展開は、ConSFTが下流への適応中に空間的過適合を防ぎ、訓練済みの物理的なスキルを保ちながら、シーケンシャルな目標タスクを取得することを確認している。
関連論文リスト
- FedSQ: Optimized Weight Averaging via Fixed Gating [1.2058208023553034]
フェデレーション学習は、生データを共有することなく、組織間で協調的なトレーニングを可能にする。
本稿では、DualCopyに基づくトランスファードニューラルフェデレーションであるFedSQ(Federated Structure-Quantitative Learning)を提案する。
ゲーティングの固定は、学習を不均一な分割下での凝集を安定化するアフィン内部の精製に還元する。
論文 参考訳(メタデータ) (2026-04-03T11:54:23Z) - FOZO: Forward-Only Zeroth-Order Prompt Optimization for Test-Time Adaptation [9.28697795097814]
ディープラーニングモデルが現実のデータ分散シフトを処理するために、テスト時間適応は不可欠である。
バックプロパゲーションベースのメソッドは、ローエンドのデプロイメントデバイスには適していない。
本稿では,TTAの新規かつ実用的なバックプロパゲーションフリーパラダイムであるフォワード・オン・ゼロ階最適化(FOZO)を提案する。
論文 参考訳(メタデータ) (2026-03-05T02:12:48Z) - TS-Memory: Plug-and-Play Memory for Time Series Foundation Models [63.21390142212087]
Time Series Foundation Models (TSFM) は大規模な事前訓練を通じて強力なゼロショット予測を実現する。
パラメトリック適応は破滅的な忘れを招き、非パラメトリック検索は予測を改善するが、データストア検索によってレイテンシが高くなる。
本稿では, TSFM を拡張した軽量メモリアダプタ TS-Memory としてParametric Memory Distillation を提案し,実装する。
論文 参考訳(メタデータ) (2026-02-12T04:16:19Z) - Trust-Region Adaptive Policy Optimization [82.09255251747818]
後学習法は,大規模言語モデル(LLM)の複雑な推論能力の向上に重要な役割を果たしている。
トレーニングインスタンス毎に,Fun-Tuning(SFT)とReinforcement Learning(RL)をインターリーブするフレームワークであるTRAPOを紹介する。
5つの数学的推論ベンチマークの実験は、TRAPOが標準SFT、RL、SFT-then-RLパイプラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-19T14:37:07Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Harnessing Optimization Dynamics for Curvature-Informed Model Merging [17.42364575754576]
教師付き微調整では、複数の機能ベースのSFTチェックポイントを1つのモデルに統合する必要がある。
我々は、最適化トラジェクトリ・アウェア(OTA)マージと高速フィッシャーグラフティング(FFG)を導入する。
OTA+FFGは、強力な重量空間ベースラインよりもマージモデルの品質を改善し、負の転送を低減し、スパーシティレベルにわたって堅牢である。
論文 参考訳(メタデータ) (2025-09-14T08:59:53Z) - Adaptive Deadline and Batch Layered Synchronized Federated Learning [66.93447103966439]
フェデレートラーニング(FL)は、データプライバシを保持しながら、分散エッジデバイス間で協調的なモデルトレーニングを可能にする。
我々は,レイヤワイドアグリゲーションのために,ラウンド単位の期限とユーザ固有のバッチサイズを共同で最適化する新しいフレームワークADEL-FLを提案する。
論文 参考訳(メタデータ) (2025-05-29T19:59:18Z) - Towards Continual Learning Desiderata via HSIC-Bottleneck
Orthogonalization and Equiangular Embedding [55.107555305760954]
本稿では,レイヤワイドパラメータのオーバーライトや決定境界の歪みに起因する,概念的にシンプルで効果的な手法を提案する。
提案手法は,ゼロの指数バッファと1.02倍の差が絶対的に優れていても,競争精度が向上する。
論文 参考訳(メタデータ) (2024-01-17T09:01:29Z) - Over-the-Air Federated Learning with Privacy Protection via Correlated
Additive Perturbations [57.20885629270732]
我々は、複数のユーザ/エージェントからエッジサーバへの勾配更新をOtA(Over-the-Air)で送信することで、無線フェデレーション学習のプライバシー面を考察する。
従来の摂動に基づく手法は、トレーニングの精度を犠牲にしてプライバシー保護を提供する。
本研究では,エッジサーバにおけるプライバシリークの最小化とモデル精度の低下を目標とする。
論文 参考訳(メタデータ) (2022-10-05T13:13:35Z) - Robust Learning via Persistency of Excitation [4.674053902991301]
勾配勾配勾配を用いたネットワークトレーニングは力学系パラメータ推定問題と等価であることを示す。
極値理論を用いて対応するリプシッツ定数を推定する効率的な手法を提案する。
我々の手法は、様々な最先端の対数訓練モデルにおいて、対数精度を0.1%から0.3%に普遍的に向上させる。
論文 参考訳(メタデータ) (2021-06-03T18:49:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。