論文の概要: WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA
- arxiv url: http://arxiv.org/abs/2608.01035v1
- Date: Sun, 02 Aug 2026 06:45:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.069284
- Title: WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA
- Title(参考訳): WAM-Diff2:高効率自律運転VLAのための階層型AR-拡散蒸留
- Authors: Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu,
- Abstract要約: VLA(Vision-Language-Action)モデルは、エンドツーエンドの自動運転の顕著なパラダイムとして登場した。
それらは、シーケンシャルな自己回帰的復号から生じる高い計算遅延と露出バイアスによって制約される。
WAM-Diff2は3段階階層戦略を利用したマルチタスク離散拡散VLAフレームワークである。
- 参考スコア(独自算出の注目度): 27.102605117827398
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have emerged as a prominent paradigm for end-to-end autonomous driving; however, their efficient deployment is severely constrained by high computational latency and exposure bias arising from sequential autoregressive decoding. Conversely, while specialized diffusion policies enable low-latency, parallel execution, training them from scratch typically yields narrow, single-task architectures that lack holistic visual-linguistic reasoning. Successfully transforming pre-trained autoregressive generalists into parallel diffusion models could combine multi-task cognitive intelligence with execution efficiency, yet this transition presents a formidable architectural challenge due to mismatched attention patterns (causal versus bidirectional) and divergent optimization objectives. To bridge this divide, we introduce WAM-Diff2, a multi-task discrete diffusion VLA framework powered by a three-stage hierarchical distillation strategy. By structuring the architectural shift through progressive block-wise adaptation, block-wise distillation, and model-wise cross-scale distillation, WAM-Diff2 preserves the underlying semantic foundations of the base model while accelerating inference. Extensive evaluations across driving understanding, perception, and planning benchmarks demonstrate that WAM-Diff2 effectively mitigates exposure bias and achieves performance parity with autoregressive baselines. Crucially, the autoregressive-to-diffusion transition yields a 2.8x decoding speedup, which scales to an ultimate 15.1x acceleration when combined with system-level optimizations including FlashInfer and CUDA Graphs.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、エンドツーエンドの自動運転において顕著なパラダイムとして登場したが、その効率的なデプロイメントは、シーケンシャルな自己回帰復号から生じる高い計算遅延と露出バイアスによって厳しく制約されている。
逆に、特殊拡散ポリシーは低レイテンシ、並列実行を可能にするが、スクラッチからそれらを訓練することは、一般的に、全体論的視覚言語学的推論を欠く狭い単一タスクアーキテクチャをもたらす。
訓練済みの自己回帰的一般論を並列拡散モデルに変換することに成功すれば、マルチタスク認知知能と実行効率を組み合わせることができる。
この分割を橋渡しするために,3段階の階層的蒸留戦略を利用したマルチタスク離散拡散VLAフレームワークであるWAM-Diff2を導入する。
WAM-Diff2は、プログレッシブブロックワイド適応、ブロックワイド蒸留、モデルワイドクロススケール蒸留を通じてアーキテクチャシフトを構造化することにより、推論を加速しながらベースモデルの基盤となるセマンティック基盤を保存する。
運転理解、知覚、計画ベンチマークにわたる広範囲な評価は、WAM-Diff2が露光バイアスを効果的に軽減し、自己回帰ベースラインと性能の同等性を達成していることを示している。
重要なことに、自動回帰拡散遷移は2.8倍のデコードスピードアップをもたらし、FlashInferやCUDA Graphsといったシステムレベルの最適化と組み合わせると、究極の15.1倍の高速化にスケールする。
関連論文リスト
- BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning [41.5997751218601]
BlockVLAは、事前訓練されたARバックボーンを効率的な離散拡散ポリシーに適合させるフレームワークである。
LIBERO と SimplerEnv のベンチマークを広範囲に評価する。
本モデルでは, トレーニング効率が向上し, 成功率がベースラインよりもかなり高速に収束する。
論文 参考訳(メタデータ) (2026-05-13T11:37:51Z) - USV: Unified Sparsification for Accelerating Video Diffusion Models [11.011602744993942]
ビデオ拡散モデルのための統一スパシフィケーションは、エンドツーエンドのトレーニング可能なフレームワークである。
モデルの内部計算とサンプリングプロセスの両方でスパーシフィケーションをオーケストレーションする。
最大83.3%のスピードアップと22.7%のエンドツーエンドの加速を実現し、高い視力を維持している。
論文 参考訳(メタデータ) (2025-12-05T14:40:06Z) - FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization [61.10456021136654]
本稿では,効率的で汎用的なロボット学習のための統合フレームワークであるFASTerを紹介する。
FASTerVQは、アクションチャンクをシングルチャネルイメージとしてエンコードし、高い圧縮比を維持しながら、グローバルな時間的依存関係をキャプチャする。
FASTerVLAはブロックワイドの自動回帰デコーディングと軽量アクションエキスパートを備えたトークンライザ上に構築されており、推論の高速化とタスクパフォーマンスの向上を実現している。
論文 参考訳(メタデータ) (2025-12-04T16:21:38Z) - Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model [62.889356203346985]
本稿では,モダリティ競合を処理する世界モデル拡張VLAフレームワークである Dual-STream diffusion (DUST) を提案する。
DUSTは標準のVLAベースラインと暗黙のワールドモデリングメソッドよりも最大6%向上する。
Franka Research 3による実世界のタスクでは、DUSTは成功率のベースラインを13%上回っている。
論文 参考訳(メタデータ) (2025-10-31T16:32:12Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z) - EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models [21.42353501209045]
VLA(Vision-Language-Action)モデルは、エンボディインテリジェンスに対する変換ポテンシャルを示すが、高い計算とメモリ要求によって著しく妨げられる。
本稿では,構造化およびトレーニング不要な推論促進フレームワークであるEfficientVLAを紹介する。
提案手法を標準VLAモデルであるCogACTに適用し,予測速度を1.93倍に向上し,FLOPを28.9%に削減し,SIMPLERベンチマークでは0.6%の成功率の低下に留まった。
論文 参考訳(メタデータ) (2025-06-11T18:34:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。