論文の概要: Not All Layers Need Tuning: Diagnosing and Directing Adaptation in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2609.18084v2
- Date: Thu, 17 Sep 2026 02:52:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.627079
- Title: Not All Layers Need Tuning: Diagnosing and Directing Adaptation in Vision-Language-Action Models
- Title(参考訳): 調整が必要なすべての層:視覚・言語・アクションモデルにおける診断と適応
- Abstract要約: 新しいデプロイメント環境のためのVision-Language-Action(VLA)モデルを微調整するのはコストがかかるが、ほとんどの手法は各リージョンに均一なキャパシティアダプタを適用する。
本稿では,5つのアーキテクチャ上のVLAについて検討する。
領域ごとの適応コストを領域分離微調整における正規化パラメータ偏差として測定すると,適応スペクトルが明らかになる。
- 参考スコア(独自算出の注目度): 5.8750879903776125
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-tuning a Vision-Language-Action (VLA) model for a new deployment environment is expensive, yet most methods apply uniform-capacity adapters to every network region as if every region requires equal adjustment. This paper tests that assumption on five architecturally diverse VLAs (OpenVLA-OFT, $π_0$, SmolVLA, DTP, Octo; 93M-7B parameters). Measuring per-region adaptation cost as normalized parameter displacement under region-isolated fine-tuning reveals an adaptation spectrum in which appearance shifts concentrate cost in the vision encoder, instruction shifts in the language backbone, and novel-object shifts in the vision encoder together with the action head, across all five architectures. To exploit this structure, we introduce a pipeline that observes, diagnoses, allocates, and adapts. From ten unlabeled target observations and without fine-tuning, the diagnostic estimates per-region cost by combining reference-free gradient and Monte Carlo Dropout signals with a Centered Kernel Alignment score against a cached source reference; the allocator converts the estimates into variable-rank LoRA adapters under a parameter budget and freezes well-calibrated regions; and standard LoRA fine-tuning trains the resulting adapters. The diagnostic ranks regions within each deployment at a median Spearman of 0.91, and the allocation matches or exceeds uniform LoRA at every budget we tested on LIBERO and CALVIN. On a physical xArm-7, the pipeline matches full fine-tuning under an instruction-wording shift with 0.04% of its trainable parameters, and on five held-out scenes evaluated without retraining it leads every baseline, with 11-23 successes of 30 rollouts against 8-18 for the strongest parameter-efficient baseline at equal or larger budgets and 2-11 for full fine-tuning. These results suggest that adaptation cost in VLAs is structured enough to measure before fine-tuning begins.
- Abstract(参考訳): 新しいデプロイメント環境のためのVLA(Vision-Language-Action)モデルを微調整するのは高価であるが、ほとんどの手法では、各領域が等調整を必要とするかのように、すべてのネットワーク領域に均一なキャパシティアダプタを適用する。
本稿では,5つのアーキテクチャ的に多様なVLA(OpenVLA-OFT,$π_0$,SmolVLA,DTP,Octo,93M-7Bパラメータ)を仮定する。
領域別適応コストを領域別細調整における正規化パラメータ偏差として測定すると、視覚エンコーダの外観シフトが集中する適応スペクトル、言語バックボーンの命令シフト、および視覚エンコーダとアクションヘッドの新規オブジェクトシフトが5つのアーキテクチャすべてにわたって現れる。
この構造を利用するために、我々は、観察、診断、割り当て、適応を行うパイプラインを導入します。
10個の未ラベルの目標観測と微調整から、基準自由勾配とモンテカルロ・ドロップアウト信号とキャッシュされたソース基準に対する中央カーネルアライメントスコアを組み合わせることで、領域ごとの診断コストを推定し、アロケータはパラメータ予算の下で可変ランクのLoRAアダプタに変換し、よく校正された領域を凍結し、標準のLoRA微調整は、結果として得られるアダプタを訓練する。
診断は、各デプロイメント内のリージョンを0.91のSpearmanでランク付けし、割り当ては、LIBEROとCALVINでテストしたすべての予算において、均一なLoRAと一致または超えます。
物理的 xArm-7 では、パイプラインはトレーニング可能なパラメータの 0.04% の命令ワードシフトの下で完全な微調整をしており、トレーニングせずに評価された5つの保留シーンでは、すべてのベースラインをリードし、同じ以上の予算で最も高いパラメータ効率のベースラインに対して 8-18 に対して 11-23 回ロールアウトし、フル微調整では 2-11 回を成功させた。
これらの結果から,VLAの適応コストは微調整開始前の測定に十分な構造であることが示唆された。
関連論文リスト
- Curvature-Aware Radius Shrinkage for Adaptive Nearest Neighbor Classification [52.452902154360565]
CARSANNは、局所的な幾何学的複雑さに応じて各地区の空間的支持を適応する幾何学駆動のフレームワークである。
70以上の実世界のOpenMLデータセットの実験は、CARSANNが標準の$k$-NNで一貫して改善されていることを示している。
論文 参考訳(メタデータ) (2026-08-27T19:19:07Z) - Conditional Evaluation of Language Models with Cheap Auxiliary Signals [7.275460635772361]
ゴールドレーベルだけで条件付きパフォーマンスプロファイルを推定するのは高価である。
LACE(Local Augmented Control-Variate Evaluation)は,条件付きLCM評価のための半教師付き推定器である。
実験により,MATH-500,ScienceQA,MMLU,WinoGrande,HellaSwag,TruthfulQA,GSM8K,ARCの性能評価を行った。
論文 参考訳(メタデータ) (2026-08-17T07:44:22Z) - The Intruder Threshold: A Spectral Law for LoRA Fine-Tuning [3.860898721527665]
LoRAファインチューニングは、破滅的な忘れを誘う侵入者次元を生み出すことができる。
観測されたスペクトルの層ごとに層が現れると予測される理論は存在しない。
完全な微調整は、すべてのレイヤのしきい値よりはるかに低いアップデートを分散させる。
Norm-matchedの介入は、更新の規模ではなく、しきい値の交差する層が忘れを伴っていることを確認します。
論文 参考訳(メタデータ) (2026-07-26T15:17:41Z) - Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study [48.83701310501069]
本稿では, 一つのレシピがヘテロジニアスなアーキテクチャプールに十分であるか, 最適ペアリングが構造的に多様なモデルによって異なるかを検討する。
我々は,CEL(Cross-Entropy),NLL(Negative Log-Likelihood),および最近導入された遺伝学的に進化したNGL損失を,LEMURヘテロジニアス・アーキテクチャー・プールの6つの画像分類データセット上に提示したベースモデル間で比較検討した。
我々の結果は、単一のペアリングが普遍的に最適でないことを確認した。AdamやAdamWとのクロスエントロピーは、最も堅牢な選択である。
論文 参考訳(メタデータ) (2026-06-18T20:51:42Z) - ARC-STAR: Auditable Post-Hoc Correction for PDE Foundation Models [47.9430487327673]
ARC-STARは修正を3段階にまとめる: グローバルな修正器は広い解法バイアスを除去し、ブロックワイドな局所精錬器はポストグロバル残差を浄化し、展開時にはラベルフリースコアは計算予算の下でハイリスクなブロックに精算する。
ARC-STARは、全ての細胞で生ポセイドンよりも少なくとも36倍の速度ロールアウト誤差を減少させる唯一の方法である。
論文 参考訳(メタデータ) (2026-05-21T09:26:16Z) - Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation [50.23374353859762]
多様な単発デモを収集することで「最大限のカバレッジ」を達成できる。
我々は、この現象を包括的-密度トレードオフとして定式化する。
Anchor-Centric Adaptation (ACA) は、2段階のフレームワークで、まずコアアンカーでの繰り返しデモを通じてポリシースケルトンを安定化し、次に教師力によるエラーマイニングと制約付き残差更新を通じて高リスク境界までカバー範囲を広げる。
論文 参考訳(メタデータ) (2026-05-08T07:35:24Z) - Sensitivity-Positional Co-Localization in GQA Transformers [0.0]
グループクエリアテンション変換器における基本構造問題について検討する。
タスクの正確性に最も敏感なレイヤは、位置エンコーディング適応が最大のレバレッジを持つレイヤと一致しているか?
LSLORAは,新しい正当性差分隠れ状態メートル法により同定された層へのLoRA適応を制限し,GARFAは対象層に8個の学習可能なKVヘッドスカラー乗算器を付加する。
論文 参考訳(メタデータ) (2026-04-09T03:41:33Z) - Adaptive Capacity Allocation for Vision Language Action Fine-tuning [30.782665306687992]
視覚言語アクションモデル(VLA)は、物理AIにますます使われているが、未確認環境に事前訓練されたVLAモデルをデプロイするには、まだ適応が必要である。
固定ランク更新を入力および層単位のキャパシティに置き換えるランク適応微調整法であるLoRA-SPを提案する。
目に見えないAgileX PiPERのアームで収集された4つの実ロボット操作タスクでは、LoRA-SPはトレーニング可能なパラメータがはるかに少ない完全な微調整にマッチするか、超える。
論文 参考訳(メタデータ) (2026-03-08T01:33:01Z) - Calibrated Adaptation: Bayesian Stiefel Manifold Priors for Reliable Parameter-Efficient Fine-Tuning [6.908972852063454]
ベイズ的PEFTフレームワークであるStiefel-Bayes Adapters (SBA) を導入し、Stiefel 多様体 $St$ 上の正規直交適応因子よりも先に Matrix Langevin を配置する。
そこで,SBA は LoRA と DoRA に匹敵するタスク性能を達成し,予測誤差を 18 ~ 34% 削減した。
我々の結果は、不確実性を正しい幾何学的構造の上に置くことは、単にアダプタにベイズ処理を加えることよりも重要であることを証明している。
論文 参考訳(メタデータ) (2026-02-19T20:17:54Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs [56.93583799109029]
GrAInSは推論時ステアリングのアプローチで、言語のみのモデルと視覚言語の両方のモデルとタスクで動作する。
推論中、GrAInSはトークンレベルの属性信号によって誘導されるトランスフォーマー層で隠されたアクティベーションを隠蔽し、アクティベーションを正規化し、表現スケールを保存する。
微調整と既存のステアリングベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2025-07-24T02:34:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。