論文の概要: Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation
- arxiv url: http://arxiv.org/abs/2606.31382v1
- Date: Tue, 30 Jun 2026 09:10:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.151857
- Title: Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation
- Title(参考訳): 視覚・言語・アクションモデルにおけるパラメータ冗長性の再検討:VLM-to-VLA適応からの考察
- Abstract要約: Vision-Language-Action(VLA)モデルは、事前訓練されたVision-Language Models(VLM)の強力な表現を統合することで、インボディードインテリジェンスにおいて大きな進歩を遂げた。
現在のパラダイムでは、結果として生じるパフォーマンス劣化を必然的に扱い、効率を回復するために微調整や低ランクの修正に頼っていることが多い。
本稿では、VLAプルーニングが性能回復を効果的にする必要がある場合や、このパラダイムが臨界パラメータの無差別プルーニングを隠蔽している場合、除去されたパラメータが真に冗長であるかどうかを問う。
- 参考スコア(独自算出の注目度): 22.888302230938848
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models have made significant strides in embodied intelligence by integrating the powerful representations of pre-trained Vision-Language Models (VLMs). However, the massive parameter scale of VLAs imposes a heavy computational burden, and these models exhibit extreme sensitivity to parameter pruning. Current paradigms often treat the resulting performance degradation as inevitable, relying on fine-tuning or low-rank corrections to recover efficacy. We challenge this convention by questioning whether the removed parameters are truly redundant if VLA pruning necessitates performance recovery to be effective, or if this paradigm masks the indiscriminate pruning of critical parameters. We revisit parameter redundancy through the lens of VLM-to-VLA adaptation, first quantifying the spatial distribution of parameter divergence during adaptation to reveal structured patterns across different modules. Subsequently, we introduce controlled pruning as a diagnostic probe: by comparing the direct impact of removing different parameter subsets on VLA performance without any fine-tuning, we establish a causal link between adaptation-induced divergence signals and functional contributions. Based on the discovered modular heterogeneities, we design a multi-module joint pruning scheme. Evaluations on the LIBERO benchmark demonstrate that our approach reduces the parameters of OpenVLA and $π_{0.5}$ by 12\%--30\% while maintaining approximately 90\% of the original performance without any post-pruning recovery. In contrast, existing parameter pruning criteria result in total performance collapse when evaluated under the same recovery-free constraints. Our study reveals the parameter evolution mechanism in VLA adaptation and provides a new path for deploying efficient, robust robotic policies in resource-constrained environments.
- Abstract(参考訳): Vision-Language-Action(VLA)モデルは、事前訓練されたVision-Language Models(VLM)の強力な表現を統合することで、インテリジェンスを具現化した。
しかしながら、VLAの大規模パラメータスケールは計算負荷を重くし、これらのモデルはパラメータのプルーニングに対して極度に敏感である。
現在のパラダイムは、結果として生じるパフォーマンス劣化を必然的に扱い、効率を回復するために微調整や低ランクの修正に依存している。
本稿では、VLAプルーニングが性能回復を効果的にする必要がある場合や、このパラダイムが臨界パラメータの無差別プルーニングを隠蔽している場合、除去されたパラメータが真に冗長であるかどうかを問う。
VLM-to-VLA適応のレンズを通してパラメータ冗長性を再検討し、適応中のパラメータ分散の空間分布を定量化し、異なるモジュールにまたがる構造パターンを明らかにする。
次に,制御プルーニングを診断プローブとして導入し,パラメータの異なるサブセットの除去がVLA性能に与える影響を微調整なしで直接比較することにより,適応誘導発散信号と機能的コントリビューションの因果関係を確立する。
発見されたモジュラー不均一性に基づいて,多モジュール共同プルーニング方式を設計する。
LIBERO ベンチマークによる評価結果から,提案手法はOpenVLA と $π_{0.5} のパラメータを 12 %--30 % 削減し,元の性能の約 90 % を後処理の回復なしに維持することを示した。
対照的に、既存のパラメータのプルーニング基準は、同じリカバリ制約の下で評価された場合、全体のパフォーマンスが低下する。
本研究は, VLA適応におけるパラメータ進化機構を明らかにし, 資源制約環境において, 効率的で堅牢なロボットポリシーを展開するための新たな経路を提供する。
関連論文リスト
- Evolution-Aware MSA Reasoning for Subsampling via Factor Graphs [55.715754117956514]
複数のシーケンスアライメントは、明示的な進化コンテキストを持つタンパク質言語モデルを提供する。
MSAサブサンプリングは限定的なトークン予算では避けられない。
本稿では,因子グラフ推論を用いて固定予算MSAサブセットを推定するAP-REASONERを提案する。
論文 参考訳(メタデータ) (2026-07-24T13:55:21Z) - Instance-Adaptive Parametrization for Amortized Variational Inference [3.219880761967806]
インスタンス適応型変分オートエンコーダ(IA-VAE)を提案する。
IA-VAE(IA-VAE)は、ハイパーネットワークが共有エンコーダの入力依存変調を生成するアモータイズされた変分推論フレームワークである。
真の後部が知られている合成データの実験では、IA-VAEはより正確な後部近似をもたらし、償却ギャップを減少させる。
論文 参考訳(メタデータ) (2026-04-08T08:11:38Z) - Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation [55.74376789006731]
視覚的インストラクションデータに対するSFT(Supervised Fine-tuning)は、しばしば視覚言語モデル(VLM)の知覚能力を向上し、推論性能を低下させる。
この劣化が深度表現の障害的アクセスと関係しているかどうかを考察し、固定された深度集合でさえ推論を著しく復元することを示した。
IADAは、クロスディープな入力適応性、モダリティを意識し、低ランクのボトルネックを通じて効率的にパラメータ化できる軽量なメカニズムである。
論文 参考訳(メタデータ) (2026-03-27T11:47:39Z) - Adaptive Linear Path Model-Based Diffusion [52.84663832658799]
リニアパスモデルベース拡散(LP-MBD)を導入し、分散保存スケジュールをフローマッチング線形確率パスに置き換える。
また,適応型LP-MBD(ALP-MBD)を提案し,タスクの複雑さや環境条件に応じて拡散ステップやノイズレベルを調整する。
論文 参考訳(メタデータ) (2026-02-02T21:33:03Z) - High-Rank Structured Modulation for Parameter-Efficient Fine-Tuning [57.85676271833619]
低ランク適応 (LoRA) は、全パラメータの微調整をシミュレートするために低ランク更新法を用いる。
textbfStructured textbfMOdulation textbfAdapterは、より高いランクを維持しながらトレーニング可能なパラメータを少なくする。
論文 参考訳(メタデータ) (2026-01-12T13:06:17Z) - Virtual Parameter Sharpening: Dynamic Low-Rank Perturbations for Inference-Time Reasoning Enhancement [0.0]
動的でアクティベーション条件の低い低ランク摂動で冷凍変圧器の線形層を拡大する仮想シャープニング(VPS)について紹介する。
本稿では, 完全アルゴリズムの枠組みを提示し, その数学的基礎を解析し, アクティベーション条件付き計算が大規模言語モデルにおける推論能力を向上するメカニズムについて議論する。
論文 参考訳(メタデータ) (2025-12-02T16:54:22Z) - Fine-tuning LLMs with variational Bayesian last layer for high-dimensional Bayesian optimization [4.12346015436419]
高い評価コストを伴うブラックボックス最適化問題は、サンプル効率でブラックボックス最適化問題を解く必要がある。
本稿では,高次元の入力変数から目的関数へのマッピングをモデル化するニューラルネットワークに基づくサロゲートを提案する。
提案した(ENS-)LoRA-VBLL手法の様々な高次元ベンチマークおよび実世界の分子最適化タスクにおける性能を実証する。
論文 参考訳(メタデータ) (2025-10-01T21:28:50Z) - Continual Adaptation: Environment-Conditional Parameter Generation for Object Detection in Dynamic Scenarios [54.58186816693791]
環境は時間と空間によって常に変化し、クローズドセットの仮定に基づいて訓練された物体検出器にとって重要な課題となる。
そこで本研究では,微調整過程をパラメータ生成に変換する機構を提案する。
特に,2経路LoRAベースのドメイン認識アダプタを最初に設計し,特徴をドメイン不変およびドメイン固有コンポーネントに分解する。
論文 参考訳(メタデータ) (2025-06-30T17:14:12Z) - Model Hemorrhage and the Robustness Limits of Large Language Models [119.46442117681147]
大規模言語モデル(LLM)は、自然言語処理タスク全体で強力なパフォーマンスを示すが、デプロイメント用に修正された場合、大幅なパフォーマンス低下を経験する。
この現象をモデル出血(パラメータ変更とアーキテクチャ変更によるパフォーマンス低下)と定義する。
論文 参考訳(メタデータ) (2025-03-31T10:16:03Z) - ALoRE: Efficient Visual Adaptation via Aggregating Low Rank Experts [71.91042186338163]
ALoREは、Kroneckerによって構築された超複素パラメータ化空間をAggregate Low Rank Expertsに再利用する新しいPETL法である。
巧妙な設計のおかげで、ALoREは無視できる余分なパラメータを保持し、凍ったバックボーンに強制的にマージできる。
論文 参考訳(メタデータ) (2024-12-11T12:31:30Z) - Diffusion Model-based Parameter Estimation in Dynamic Power Systems [2.190363465029132]
この研究は、そのような限界に対処する新しいパラメータ推定フレームワーク、JCDI(Joint Diffusion Model Inverse Problemsolvr)を導入する。
複合負荷モデルパラメータ化という電力系統の課題に対して、JCDIは単一条件モデルと比較してパラメータ推定誤差を58.6%削減する。
また、様々な電気的欠陥の下でシステムの動的応答を正確に再現し、根の平均二乗誤差は4*10(-3)以下である。
論文 参考訳(メタデータ) (2024-11-15T18:53:08Z) - Low-Rank Representations Meets Deep Unfolding: A Generalized and
Interpretable Network for Hyperspectral Anomaly Detection [41.50904949744355]
現在のハイパースペクトル異常検出(HAD)ベンチマークデータセットは、低解像度、単純なバックグラウンド、検出データの小さなサイズに悩まされている。
これらの要因は、ロバスト性の観点からよく知られた低ランク表現(LRR)モデルの性能も制限する。
我々は、複雑なシナリオにおけるHADアルゴリズムの堅牢性を改善するために、新しいHADベンチマークデータセットであるAIR-HADを構築した。
論文 参考訳(メタデータ) (2024-02-23T14:15:58Z) - Winning Prize Comes from Losing Tickets: Improve Invariant Learning by
Exploring Variant Parameters for Out-of-Distribution Generalization [76.27711056914168]
Out-of-Distribution (OOD) 一般化は、分散固有の特徴に適合することなく、様々な環境によく適応する堅牢なモデルを学ぶことを目的としている。
LTH(Lottery Ticket hypothesis)に基づく最近の研究は、学習目標を最小化し、タスクに重要なパラメータのいくつかを見つけることでこの問題に対処している。
Invariant Learning (EVIL) における変数探索手法を提案する。
論文 参考訳(メタデータ) (2023-10-25T06:10:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。