論文の概要: QuantWAMs: Calibrating at the Right Granularity for World Action Models
- arxiv url: http://arxiv.org/abs/2607.28405v1
- Date: Thu, 30 Jul 2026 15:54:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.64542
- Title: QuantWAMs: Calibrating at the Right Granularity for World Action Models
- Title(参考訳): QuantWAMs: 世界アクションモデルのための正しい粒度でのキャリブレーション
- Authors: Jiacheng Zhou, Jinfan Lv, Ruixuan Li, Longtai Zhang, Yan Wang, Wenqiang Zhang, Lizhe Qi,
- Abstract要約: World Action Modelsは、将来の観測とアクションを共同で予測するが、反復的なデノゲーションとクローズドループの実行は、デプロイメントにコストがかかる。
我々は,量子化決定をモデル構造,ロールアウト分布,タスク目標によって定義されたキャリブレーションコンテキストと整合するPTQフレームワークQuantWAMを提案する。
我々は,RoboTwin 2.0,LIBERO,AgiBot G2を用いた実ロボット操作において,Fast-WAMおよびLingBot-VA上のQuantWAMを評価した。
- 参考スコア(独自算出の注目度): 34.540026172139406
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World Action Models (WAMs) jointly predict future observations and actions, but their iterative denoising and closed-loop execution make efficient deployment costly. Existing post-training quantization (PTQ) methods are poorly suited to WAMs because they rely on open-loop objectives, homogeneous model assumptions, and calibration distributions that do not reflect deployment. We present QuantWAMs, a PTQ framework that aligns quantization decisions with the calibration context defined by model structure, rollout distribution, and task objective. QuantWAMs introduces three strategies: shared-basis outlier calibration, which pools activation evidence only across coordinate-compatible modules; co-training-objective saliency, which computes empirical-Fisher scores from the joint video--action gradient and assigns weight precision at a calibration-stable layer granularity; and fixed-intervention rollout auditing, which revises denoising-step protection schedules using reachable closed-loop states without changing the precision budget. We evaluate QuantWAMs on Fast-WAM and LingBot-VA across RoboTwin 2.0, LIBERO, and real-robot manipulation with an AgiBot G2. Under a W4A4-dominant setting, the reported simulation means differ from FP16 by 0.2--0.7 percentage points. Real-robot trials further establish deployment feasibility on three manipulation tasks. For the targeted video and action blocks, QuantWAMs reduces peak weight-and-activation memory to about 29\% of FP16 and provides 1.4--1.6$\times$ block-level speedups.
- Abstract(参考訳): 世界行動モデル(WAM)は、将来の観測と行動を共同で予測するが、反復的なデノベーションとクローズドループの実行は、効率的なデプロイメントにコストがかかる。
既存のトレーニング後の量子化法(PTQ)は、オープンループの目的、均質なモデル仮定、デプロイメントを反映しないキャリブレーション分布に依存するため、WAMにはあまり適していない。
我々は,量子化決定をモデル構造,ロールアウト分布,タスク目標によって定義されたキャリブレーションコンテキストと整合するPTQフレームワークQuantWAMを提案する。
QuantWAMsは、座標互換モジュール間でのみアクティベーションエビデンスをプールする共有ベイス・アウトリー・キャリブレーション、共同ビデオアクション勾配から経験的フィッシャースコアを計算し、キャリブレーション安定層粒度で重量精度を割り当てるコトレーニング・オブジェクティブ・サリエンシ、精度を変更せずに到達可能なクローズドループ状態を使用してデノベーション・ステップ保護スケジュールを変更する固定インターベンション・ロールアウト監査の3つの戦略を導入している。
我々は,RoboTwin 2.0,LIBERO,AgiBot G2を用いた実ロボット操作において,Fast-WAMおよびLingBot-VA上のQuantWAMを評価した。
W4A4支配下では、報告されたシミュレーション手段はFP16と0.2-0.7ポイント異なる。
リアルロボットの試行は、3つの操作タスクの展開可能性をさらに確立する。
対象とするビデオブロックとアクションブロックに対して、QuantWAMsはピークウェイト・アンド・アクティベーションメモリをFP16の約29\%に削減し、1.4-1.6$\times$ブロックレベルのスピードアップを提供する。
関連論文リスト
- Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models [2.1485350418225244]
Mix-QVLAは、VLAモデルのためのタスクエビデンス対応の混合精度PTQフレームワークである。
境界活性化から正規化勾配重み付きタスクエビデンスマップを計算する。
決定を支持する証拠の強さと割り当ての両方の変化を捉えます。
論文 参考訳(メタデータ) (2026-06-17T20:08:14Z) - GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets [28.100700446484595]
混合精度量子化は、大規模言語モデルの高精度トレードオフを改善する。
GAMMAは,モジュール単位の精度の選好を,学習後のパイプライン内で完全に学習するフレームワークである。
論文 参考訳(メタデータ) (2026-05-18T14:30:58Z) - Accelerating Quantum Materials Characterization: Hybrid Active Learning for Autonomous Spin Wave Spectroscopy [0.0]
自律三軸スピン波分光のためのハイブリッド-物理インフォームドフレームワークTAS-AIを提案する。
ブラインドリコンストラクションベンチマークでは、ランダムサンプリング、粗いグリッド、ガウス過程マッパーといったモデルに依存しない手法が、物理情報プランニングよりも信頼性が高く、測定の少ないグローバルエラーしきい値に達する。
TAS-AIは10測定未満で決定的なAIC由来のエビデンス比(>100)に達する一方、モーションアウェアのスケジューリングは固定された測定予算でウォールタイム時間を32%削減する。
論文 参考訳(メタデータ) (2026-04-26T17:54:40Z) - AnchorRefine: Synergy-Manipulation Based on Trajectory Anchor and Residual Refinement for Vision-Language-Action Models [60.04879435087352]
視覚言語アクション(VLA)ポリシーは、単一の統一空間内でアクションを生成する。
本稿では,VLAの動作モデリングを軌跡アンカーと残留精細化に分解する階層的フレームワークであるAnchorRefineを提案する。
LIBERO、CALVIN、および実ロボットタスクの実験では、AnchorRefineは回帰ベースと拡散ベースの両方のVLAバックボーンを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-20T04:25:24Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - IMPQ: Interaction-Aware Layerwise Mixed Precision Quantization for LLMs [4.655407920049974]
混合精度量子化は説得力のある解であるが、従来の方法では平均精度が4ビット以下に低下する。
本稿では,これらの制約に対処する2つのイノベーションを提案する。
まず,混合精度量子化問題を階層間の協調ゲームとして構成し,Shapley-based Progressive Quantization Estimation (SPQE)を導入する。
次に、これらのShapley推定値を2次最適化形式に変換する対話型混合精度量子化(IMPQ)を提案する。
論文 参考訳(メタデータ) (2025-09-18T21:59:40Z) - Mix-QSAM: Mixed-Precision Quantization of the Segment Anything Model [0.0]
Mix-QSAMはSegment Anything Model(SAM)のためのPTQフレームワークである。
モデル出力に対する各レイヤの寄与を定量化するために,Kulback-Leibler (KL) 偏差を用いて導出したレイヤ単位の重要度スコアを導入する。
また、隣接層間の依存関係を捉えるために、因果的相互情報に基づく新しい計量である層間相乗法を導入する。
論文 参考訳(メタデータ) (2025-05-08T00:08:31Z) - SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models [74.40683913645731]
Zero-shot Multi-label Recognition (MLR) with Vision-Language Models (VLMs) は、トレーニングデータ、モデルチューニング、アーキテクチャの変更なしに重要な課題に直面している。
我々の研究は、VLMをブラックボックスとして扱い、トレーニングデータや地上の真実を使わずにスコアを活用する新しいソリューションを提案する。
これらのプロンプトスコアの分析により、VLMバイアスとAND'/OR信号の曖昧さが明らかになり、特に、最高スコアは2番目に高いスコアに比べて驚くほど低い。
論文 参考訳(メタデータ) (2025-02-24T07:15:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。