論文の概要: Ω-QVLA: Robust Quantization for Vision-Language-Action Models via Composite Rotation and Per-step Scaling
- arxiv url: http://arxiv.org/abs/2605.28803v1
- Date: Wed, 27 May 2026 17:55:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:56.261114
- Title: Ω-QVLA: Robust Quantization for Vision-Language-Action Models via Composite Rotation and Per-step Scaling
- Title(参考訳): Ω-QVLA:複合回転とステップごとのスケーリングによる視覚・言語・アクションモデルに対するロバスト量子化
- Authors: Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu,
- Abstract要約: Omega-QVLAは、Vision-Language-Action(VLA)モデルのためのトレーニング不要のポストトレーニング量子化フレームワークである。
言語バックボーンと拡散アクションヘッド全体を均一なW4A4精度に圧縮し、混合精度の割り当てを必要としない。
LIBEROでは、Omega-QVLA が Pi 0.5 と GR00T N1.5 を 98.0% と 87.8% のタスク成功率で W4A4 に圧縮し、FP16 参照の 97.1% と 87.0% をマッチングまたは超過し、静的メモリのフットプリントを 71.3% 削減した。
- 参考スコア(独自算出の注目度): 17.355916557144994
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language-Action (VLA) models unify perception, reasoning, and control within a single policy, yet their multi-billion-parameter backbones and diffusion-based action heads make on-device deployment prohibitively expensive. Prior quantization efforts offer only partial solutions, compressing the LLM backbone while leaving the DiT action head at full precision, or resorting to mixed-precision schemes, driven by the belief that uniformly quantizing the action head is inherently unstable. We challenge this assumption with Omega-QVLA, the first training-free post-training quantization framework that compresses both the language backbone and the entire diffusion action head of a VLA model to a uniform W4A4 precision, eliminating the need for mixed-precision allocation. Omega-QVLA combines a composite SVD-Hadamard rotation that equalizes per-channel weight energy while diffusing residual activation outliers with per-step DiT activation scaling quantization that absorbs dynamic-range drift across denoising steps. On LIBERO, Omega-QVLA compresses Pi 0.5 and GR00T N1.5 to W4A4 with 98.0% and 87.8% task success rates, matching or exceeding their FP16 references of 97.1% and 87.0%, while reducing the static memory footprint by 71.3%. Real-world manipulation experiments further confirm smooth, accurate manipulation where prior methods fail. Code is available at https://github.com/UCMP13753/Omega-QVLA.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、単一のポリシー内で認識、推論、制御を統一するが、そのマルチビリオンパラメータのバックボーンと拡散に基づくアクションヘッドは、デバイス上でのデプロイメントを違法に高価にする。
先行量子化の取り組みは部分解のみを提供し、DiTアクションヘッドを完全精度で残しながらLLMバックボーンを圧縮する、あるいはアクションヘッドの均一な量子化が本質的に不安定であるという信念によって駆動される混合精度スキームに頼る。
我々は,この仮定を,言語バックボーンとVLAモデルの拡散動作ヘッド全体を均一なW4A4精度に圧縮し,混合精度の割り当てを不要とする,最初のトレーニング不要なポストトレーニング量子化フレームワークであるOmega-QVLAに挑戦する。
Omega-QVLAは、チャネル単位の重量エネルギーを等しくする合成SVD-アダマール回転と、ステップ単位のDiT活性化スケール量子化を混合し、デノナイジングステップをまたいだダイナミックレンジドリフトを吸収する。
LIBEROでは、Omega-QVLA が Pi 0.5 と GR00T N1.5 を 98.0% と 87.8% のタスク成功率で W4A4 に圧縮し、FP16 参照の 97.1% と 87.0% をマッチングまたは超過し、静的メモリのフットプリントを 71.3% 削減した。
実世界の操作実験は、以前の手法が失敗した場合のスムーズで正確な操作をさらに確認する。
コードはhttps://github.com/UCMP13753/Omega-QVLAで公開されている。
関連論文リスト
- MGVQ: Synergizing Multi-dimensional Sensitivity-Aware and Gradient-Hessian Fusion for Vector Quantization [14.071776510862824]
本研究は,多次元感性知覚と勾配ヘッセン核融合を統合した新しいベクトル量子化フレームワークMGVQを提案する。
2ビット量子化設定では、MGVQは既存の先進的なポストトレーニング量子化手法を大幅に上回り、4.9ポイントの最大精度向上を達成する。
提案手法は, 安定かつ効率的な超低ビットVLM量子化を実現し, 資源制限環境におけるマルチモーダル大規模モデルの実用的展開を大幅に促進する。
論文 参考訳(メタデータ) (2026-05-20T06:11:25Z) - BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs [10.07268309735318]
大規模言語モデル(LLM)は、NLPに大きな進歩をもたらしたが、そのかなりのメモリと計算要求は、まだ実用的なデプロイメントを妨げている。
我々は,1ビットの重み量子化を達成しつつ,高精度な学習後量子化フレームワークであるBWLAを提案する。
Qwen3-32Bでは、BWLAは6ビットアクティベーションでWikitext2の難易度11.92に達し、5つのゼロショットタスクを70%以上改善し、3.26倍の推論速度を提供する。
論文 参考訳(メタデータ) (2026-05-01T05:42:57Z) - AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models [60.04879435087352]
視覚言語アクション(VLA)ポリシーは、単一の統一空間内でアクションを生成する。
本稿では,VLAの動作モデリングを軌跡アンカーと残留精細化に分解する階層的フレームワークであるAnchorRefineを提案する。
LIBERO、CALVIN、および実ロボットタスクの実験では、AnchorRefineは回帰ベースと拡散ベースの両方のVLAバックボーンを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-20T04:25:24Z) - A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - RUQuant: Towards Refining Uniform Quantization for Large Language Models [17.258420059228808]
ポストトレーニング量子化(PTQ)は、再トレーニングを必要とせずにモデルを圧縮することで、実用的なソリューションとして登場した。
既存の方法は、アクティベーション分布の非一様性により、かなりの精度の劣化に悩まされることが多い。
本研究では,ロイド-マックス最適条件に基づく理論的な観点から,活性化量子化問題を再考する。
論文 参考訳(メタデータ) (2026-04-05T08:04:39Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization [29.21308068128823]
具体化制御に特化して設計された最初のアクション中心量子化フレームワークであるQVLAを紹介する。
我々の研究は、ロボット工学におけるビジョン・ランゲージ・アクションモデルを圧縮するための、新しい原則の基盤を確立する。
論文 参考訳(メタデータ) (2026-02-03T17:43:45Z) - First-Order Error Matters: Accurate Compensation for Quantized Large Language Models [32.69069234109942]
後学習量子化(PTQ)は、大規模言語モデル(LLM)の圧縮に効率的なアプローチを提供する
既存の補償に基づくウェイトキャリブレーション法は、しばしば量子化誤差をモデル化するために2階テイラー展開に依存する。
本稿では,量子化誤差補償を改善するために,一階勾配項を明示的に組み込んだ新しいPTQ手法であるFOEMを提案する。
論文 参考訳(メタデータ) (2025-07-15T06:18:46Z) - SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models [63.118592279833656]
後学習量子化(PTQ)は,大規模言語モデル(LLM)の圧縮に有効な手法である
本稿では,SliM-LLMを提案する。SliM-LLMは,グループ単位でビット幅を割り当てるサリエンス駆動の混合精度量子化フレームワークである。
実験により、SliM-LLMは低ビット幅の様々なLLMにおいて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-05-23T16:21:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。