論文の概要: VLA-ZO: Fast Zeroth-Order Adaptation for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2610.06271v1
- Date: Mon, 05 Oct 2026 13:05:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 09:38:04.877074
- Title: VLA-ZO: Fast Zeroth-Order Adaptation for Vision-Language-Action Models
- Title(参考訳): VLA-ZO:視覚・言語・アクションモデルのための高速ゼロ階適応
- Abstract要約: 本稿では、視覚言語アクション(VLA)モデルの構造を利用する高速なZO適応のためのフレームワークであるVLA-ZOを提案する。
LIBEROカメラビューポイントシフトでは、VLA-ZOは、ベースラインZOに対して25.59$times$が$q=16$、32.54$times$が$q=64$となる。
これらの結果から,ZOをより高速にすることで,より大きなクエリ予算の実現が可能になることが示唆された。
- 参考スコア(独自算出の注目度): 13.746788974402888
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adapting vision-language-action (VLA) models to deployment-time distribution shifts is important for reliable robotic operation, but conventional first-order adaptation can exceed the memory budget of inference-oriented deployment platforms. Zeroth-order (ZO) optimization offers a forward-only alternative with inference-level memory, but accurate gradient estimation requires many perturbation queries, making naive ZO prohibitively slow for large VLA models. We present VLA-ZO, a framework for fast ZO adaptation that exploits the structure of VLA computation. By confining adaptation to the action side, VLA-ZO keeps the expensive vision-language prefix frozen and reuses its conditioning states across perturbation queries and optimizer steps, while schedule-aware prefetching hides state-transfer overhead. On LIBERO camera-viewpoint shifts, VLA-ZO reduces end-to-end adaptation time by 25.59$\times$ at $q=16$ and 32.54$\times$ at $q=64$ relative to baseline ZO, while improving average task success from 48.27% without adaptation to 58.17% and 63.58%, respectively. These results show that making ZO faster can make larger query budgets practical, providing a promising path toward resource-efficient VLA adaptation on deployment platforms.
- Abstract(参考訳): 視覚言語行動(VLA)モデルをデプロイメント時分布シフトに適応させることは、信頼性の高いロボット操作において重要であるが、従来のファーストオーダー適応は推論指向デプロイメントプラットフォームのメモリ予算を超える可能性がある。
Zeroth-order (ZO) 最適化は、推論レベルのメモリで前方のみの代替を提供するが、正確な勾配推定には多くの摂動クエリを必要とするため、大きなVLAモデルではZOが極めて遅い。
本稿では,VLA計算の構造を利用した高速ZO適応フレームワークであるVLA-ZOを提案する。
アクション側に適応することで、VLA-ZOは高価な視覚言語プレフィックスを凍結させ、摂動クエリとオプティマイザステップにまたがってコンディショニング状態を再利用する。
LIBEROカメラビューポイントシフトでは、VLA-ZOは、ベースラインZOと比較して、エンドツーエンド適応時間を25.59$\times$が$q=16$で32.54$\times$が$q=64$で、平均タスク成功率は58.17%と63.58%に改善している。
これらの結果から,ZOをより高速にすることで,より大きなクエリ予算の実現が可能になることが示唆された。
関連論文リスト
- AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models [1.0323063834827415]
AdaVLAは、高速かつ高精度なフローマッチングベースのビジョン・ランゲージ・アクションモデルのための、オンラインでトレーニング不要な適応フレームワークである。
本手法は, それぞれ$_0.5$とX-VLAで1.87times$と$2.24times$の高速化を実現し, 成功率の低下を無視できることを示す。
論文 参考訳(メタデータ) (2026-08-29T11:44:18Z) - ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models [46.57405778313275]
VLAモデル(Vision-Language-Action Model)は、汎用的なロボット制御のための強力なパラダイムである。
ElegantVLAは、モデル内動的計算スケジューリングによってVLAモデルを高速化するプラグイン位相適応推論フレームワークである。
GR00TとCogACTの実験は最大2.55倍と3.77倍のスピードアップを実現し、6つの現実世界のGR00TタスクではElegantVLAは計算を2.18倍に削減し、制御周波数を13.8Hzから26.3Hzに引き上げた。
論文 参考訳(メタデータ) (2026-05-28T06:33:05Z) - A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation [30.881585159777714]
視覚言語アクション(VLA)モデルは、自然言語による知覚と制御において例外的な性能を示した。
VLAモデルの高い計算コストは、大きな効率上の課題をもたらす。
本稿では,VLAステージ間で非同期並列化が可能なVLAを実現することを提案する。
論文 参考訳(メタデータ) (2026-03-30T15:23:27Z) - Cost-Efficient Multimodal LLM Inference via Cross-Tier GPU Heterogeneity [0.0]
MLLM(Multimodal large language model)推論は、ハードウェア要求に反する2つのフェーズに分けられる。
標準変圧器KVキャッシングの下では、モダリティ境界はデバイス間転送を最小化する。
We build HeteroServe, a phase-aware runtime with modality-level partitioning and cross-tier scheduling。
論文 参考訳(メタデータ) (2026-03-13T06:42:35Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z) - Small Aid, Big Leap: Efficient Test-Time Adaptation for Vision-Language Models with AdaptNet [5.977269026037707]
テスト時適応(TTA)は、推論中に視覚言語モデル(VLM)の一般化能力を高める重要な手法として登場した。
本稿では,より軽量で学習しやすいAdaptNetを活用して,効率よくスケーラブルなモデル適応を実現する,新しいアダプタベースのTTAフレームワークであるSAILを紹介する。
論文 参考訳(メタデータ) (2025-06-03T09:16:51Z) - VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models [84.84277196012907]
VLsI: Verbalized Layers-to-Interactions, a new VLM family in 2B and 7B model size。
GPT-4Vよりも優れた性能向上(2Bは11.0%、7Bは17.4%)を達成した。
論文 参考訳(メタデータ) (2024-12-02T18:58:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。