論文の概要: On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2607.10172v1
- Date: Sat, 11 Jul 2026 07:30:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.329459
- Title: On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation
- Title(参考訳): 産業用ロボットマニピュレーションにおけるビジョン・ランゲージ・アクションモデルにおけるLoRAファインチューニングの有効性について
- Abstract要約: 産業用ハードウェアのビジョンランゲージ・アクション(VLA)モデルでは、ギャップを埋めるために微調整が必要である。
Full Fine-Tuning (FFT)は、最大可塑性を提供するが、データセンターグレードのGPUを必要とする。
フローマッチングVLAである$_0$のローランド適応(LoRA)を4つの精度アセンブリタスクで評価した。
- 参考スコア(独自算出の注目度): 0.28675177318965045
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deploying billion-parameter Vision-Language-Action (VLA) models on industrial hardware requires fine-tuning to bridge the embodiment gap. Full Fine-Tuning (FFT) provides maximal plasticity but requires data centre-grade GPUs. We present a systematic study of Low-Rank Adaptation (LoRA) for $π_0$, a flow-matching VLA, evaluated on four precision assembly tasks with a UR5e robotic manipulator. Across a sweep of LoRA ranks (r=8 to 256), allocation strategies, and component-freezing ablations, we find no statistically significant advantage of FFT over certain LoRA configurations. Performance saturates at r=32, and uniform allocation across the Vision-Language-Model (VLM) backbone and action expert proves sufficient. Freezing the VLM or restricting the vision encoder to LoRA significantly degrades performance, indicating that embodiment adaptation requires both semantic and visual plasticity. These results suggest that LoRA at r=32 with full vision encoder fine-tuning is a practical approach, reducing static peak VRAM from 36.2 to 10.8 GiB (parameters and optimizer states, activation memory excluded) without detectable performance loss.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルを産業用ハードウェアに展開するには、エンボディメントギャップを埋めるために微調整が必要である。
Full Fine-Tuning (FFT)は、最大可塑性を提供するが、データセンターグレードのGPUを必要とする。
UR5eロボットマニピュレータを用いた4つの精密組立タスクにおいて,フローマッチングVLAであるπ_0$に対するローランド適応(LoRA)の系統的研究を行った。
LoRAのランク(r=8〜256)、アロケーション戦略、コンポーネントフリー化エイブレーションの全体にわたって、一部のLoRA構成に対するFFTの統計的に有意な優位性は見つからない。
r=32で性能が飽和し、Vision-Language-Model (VLM)のバックボーンとアクションエキスパートの均一な割り当てが十分である。
VLMを凍結したり、視覚エンコーダをLoRAに制限したりすると、性能が著しく低下する。
これらの結果は、フルビジョンエンコーダによる32のLoRAが実用的なアプローチであることを示し、静的ピークVRAMを36.2から10.8 GiB(パラメータとオプティマイザ状態、アクティベーションメモリを除外)に減らし、性能損失を検出できなくなることを示唆している。
関連論文リスト
- Adaptive Capacity Allocation for Vision Language Action Fine-tuning [30.782665306687992]
視覚言語アクションモデル(VLA)は、物理AIにますます使われているが、未確認環境に事前訓練されたVLAモデルをデプロイするには、まだ適応が必要である。
固定ランク更新を入力および層単位のキャパシティに置き換えるランク適応微調整法であるLoRA-SPを提案する。
目に見えないAgileX PiPERのアームで収集された4つの実ロボット操作タスクでは、LoRA-SPはトレーニング可能なパラメータがはるかに少ない完全な微調整にマッチするか、超える。
論文 参考訳(メタデータ) (2026-03-08T01:33:01Z) - Parameter-Efficient Fine-Tuning for HAR: Integrating LoRA and QLoRA into Transformer Models [0.2939891130492345]
低ランク適応(LoRA)と量子化LoRA(Quantized LoRA)は、人間の活動認識のためのフルモデル微調整に代わるスケーラブルな代替手段として検討されている。
LoRAは限られた監督下でも堅牢な性能を維持している。
QLoRAは、量子化によって凍結重量のメモリフットプリントを削減することで、これらの利点を拡張している。
論文 参考訳(メタデータ) (2025-12-19T14:12:43Z) - Contrastive Representation Regularization for Vision-Language-Action Models [64.10170453130324]
本稿では,ビジョン・ランゲージ・アクション(VLA)モデルの表現正規化であるロボット状態認識コントラスト損失(RS-CL)を紹介する。
特に、RS-CLは、状態間の相対的な距離をソフト・インスペクションとして使用することにより、ロボットの受容状態とより密に表現する。
実験の結果,RS-CLは最先端VLAモデルの操作性能を大幅に向上することが示された。
論文 参考訳(メタデータ) (2025-10-02T06:41:22Z) - EfficientLLM: Efficiency in Large Language Models [64.3537131208038]
大規模言語モデル(LLM)は大きな進歩を導いてきたが、その増加とコンテキストウィンドウは計算、エネルギー、金銭的コストを禁止している。
本稿では,新しいベンチマークであるEfficientLLMを紹介する。
論文 参考訳(メタデータ) (2025-05-20T02:27:08Z) - Adaptive Parameter-Efficient Federated Fine-Tuning on Heterogeneous Devices [24.725928966071212]
Federated Fine-tuning (FedFT) は、事前訓練された言語モデルを分散的に微調整するために提案されている。
LEGENDと呼ばれる新しいLoRAベースのFedFTフレームワークを提案する。
我々は,LoRA深度とランク分布の結合関係を解析し,不均一デバイスに対する効率的なLoRA構成アルゴリズムを設計する。
論文 参考訳(メタデータ) (2024-12-28T04:00:42Z) - DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution [114.61347672265076]
実世界のロボットのためのMLLMの開発は、ロボットプラットフォームで利用可能な計算能力とメモリ容量が典型的に限られているため、難しい。
活性化MLLMのサイズを自動的に調整するロボットビジョンランゲージ・アクション・モデル(DeeR)の動的早期実行フレームワークを提案する。
DeeR は LLM の計算コストを 5.2-6.5x に削減し、GPU のメモリを 2-6x に削減した。
論文 参考訳(メタデータ) (2024-11-04T18:26:08Z) - LoRA Done RITE: Robust Invariant Transformation Equilibration for LoRA Optimization [78.93425154518705]
低ランク適応 (LoRA) は、メモリ要求を低減し、LLMのパラメータ効率の高い微調整法である。
本稿では,LoRA最適化のための適応行列プレコンディショニング手法であるLoRA-RITEを紹介する。
論文 参考訳(メタデータ) (2024-10-27T22:57:12Z) - Less is More: Extreme Gradient Boost Rank-1 Adaption for Efficient Finetuning of LLMs [75.11449420928139]
微調整型大規模言語モデル(LLM)は、訓練済みモデルを下流タスクに適応させる上で重要な技術となっている。
Low-Rank Adaptation (LoRA) は有望な解決法として登場したが、低ランク適応の実用性能と理論的最適性の間にはギャップがある。
本稿では,このギャップを埋める新しいフレームワークであるeXtreme Gradient Boosting LoRAを提案する。
論文 参考訳(メタデータ) (2024-10-25T17:07:13Z) - Flat-LoRA: Low-Rank Adaptation over a Flat Loss Landscape [52.98187034726091]
フルパラメータ空間の平坦領域に位置する低ランク適応を同定することを目的としたFlat-LoRAを提案する。
また、Flat-LoRAはドメイン内とドメイン外の両方の一般化を改善していることを示す。
論文 参考訳(メタデータ) (2024-09-22T11:24:10Z) - LoRA Land: 310 Fine-tuned LLMs that Rival GPT-4, A Technical Report [3.304521604464247]
ローランク適応(ローランク適応、LoRA)は、最も広く採用されている手法の一つである。
大規模言語モデル(LLM)の効率的な微細チューニング(PEFT)
本研究の目的は,LoRAで微調整されたLLMを実世界の応用に適用し,学習の可能性を評価することである。
論文 参考訳(メタデータ) (2024-04-29T04:01:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。