論文の概要: MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving
- arxiv url: http://arxiv.org/abs/2606.27660v2
- Date: Wed, 01 Jul 2026 13:33:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.051282
- Title: MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving
- Title(参考訳): MVPruner: 自律運転における多視点ビジョンランゲージモデルの高速化のための動的トークンプルーニング
- Authors: Nan Yang, Zhanwen Liu, Linfeng Zhang, Shangyu Xie, Yang Wang, Wenzhuo Zhou, Xiangmo Zhao,
- Abstract要約: VLM(Vision-Language Models)は、自律運転における一般化と解釈性を改善する。
既存のトークンプルーニング手法では、固定プルーニングレートアロケーションと静的重要度を用いる。
本稿では,2段階適応型トークンプルーニング手法であるMVPrunerを提案する。
- 参考スコア(独自算出の注目度): 32.02133342612463
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language Models (VLMs) improve generalization and interpretability in autonomous driving but suffer from efficiency issues due to long visual token sequences, particularly in standard multi-view settings. Existing token pruning methods employ fixed pruning rate allocation and static importance metrics, ignoring dynamic inter-view importance differences and the evolving information importance during inference. Our analysis reveals that multi-view VLMs inherently encode task-related view priors in deeper layers and exhibit dynamic information requirements. Motivated by these findings, we propose MVPruner, a two-stage adaptive token pruning method that aligns pruning behavior with the model's dynamic information requirements. The first stage allocates pruning budgets based on the information diversity of each view, and retains tokens with consistent contribution across stages, ensuring semantic representational capacity. The second stage allocates budgets and selects tokens guided by instruction text to guarantee task alignment. Experimental results on four benchmarks demonstrate the superior performance of our method. For example, DriveMM equipped with MVPruner achieves 87.3% reduction in FLOPs, 4.97* speedup in prefilling phase while retaining 98.5% accuracy on DriveLM benchmark.
- Abstract(参考訳): VLM(Vision-Language Models)は、自律運転における一般化と解釈性を改善するが、特に標準的なマルチビュー設定において、長い視覚トークンシーケンスによる効率上の問題に悩まされる。
既存のトークンプルーニング手法では、固定プルーニング率と静的重要度を用いて、動的ビュー間の重要度差や推論時の情報重要度を無視する。
本分析により,マルチビューVLMは,タスク関連ビューをより深い層にエンコードし,動的情報要求を示す。
これらの知見に触発されたMVPrunerは、2段階の適応型トークンプルーニング手法であり、プルーニング動作とモデルの動的情報要求とを整合させる。
第1段階では、各ビューの情報多様性に基づいてプルーニング予算を割り当て、ステージ間で一貫したコントリビューションを持つトークンを保持し、セマンティックな表現能力を確保する。
第2段階は予算を割り当て、タスクアライメントを保証するために命令テキストでガイドされたトークンを選択する。
4つのベンチマークによる実験結果から,本手法の優れた性能が示された。
例えば、MVPrunerを搭載したDriveMMは、FLOPsの87.3%の削減、プレフィルフェーズの4.97*の高速化を実現し、DriveLMベンチマークでは98.5%の精度を維持している。
関連論文リスト
- AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference [7.243327337529763]
Vision-Language Models (VLM) は、比較的少数のテキストトークンとともに、画像ごとに数千のビジュアルトークンを処理する。
本稿では,前処理前の視覚トークンにアグレッシブプルーニングを適用したAsymVLMを提案する。
実験の結果,AsymVLMは最先端手法のうち,最大54%のFLOPを節約できることがわかった。
論文 参考訳(メタデータ) (2026-05-28T07:49:45Z) - ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models [14.841746872486333]
本稿では,VLAモデルの効率的なToken AdaptationフレームワークであるETA-VLAを提案する。
ETA-VLAは最先端のベースラインに匹敵する運転性能が得られることを示す。
提案手法は, 85%の視覚トークンを抽出し, FLOPを61%削減するが, NAVSIM v2ベンチマークでは元の精度の94%を維持している。
論文 参考訳(メタデータ) (2026-03-26T06:53:42Z) - Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models [75.27089289058613]
textbfTIES(textbfTau-guided textbfInter-layer textbfEfficient textbfSelection)は、層間トークンランキングの整合性によって導かれる動的フレームワークである。
CogACT + SIMPLERベンチマークでは、TIESは平均成功率を6%改善し、トークン使用率を78%削減した。
論文 参考訳(メタデータ) (2026-03-26T02:13:03Z) - Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning [82.39668822222386]
ビジョントークンプルーニングは、効率的なビジョン言語モデル(VLM)のための効果的なアクセラレーション手法であることが証明された。
空間的整合性を維持しつつ,効率的な特徴集約を実現するための2段階のトークンプルーニングフレームワークである$textNwa$を提案する。
実験によると、textNwa$は複数のVQAベンチマーク(94%から95%)でSOTAのパフォーマンスを達成し、視覚的グラウンドタスク(7%から47%)を大幅に改善している。
論文 参考訳(メタデータ) (2026-02-03T00:51:03Z) - D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning [49.16227597771663]
D2Prunerは、デバイアスされた重要性と構造的なプルーニングメカニズムを組み合わせたフレームワークである。
FLOPを74.2%削減し、元の性能の99.2%を維持した。
既存の手法に比べて63.53%も改善されている。
論文 参考訳(メタデータ) (2025-12-22T14:42:31Z) - AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance [7.594255363909475]
視覚言語モデル(VLM)は、視覚的質問応答(VQA)のような多モーダル推論タスクにおいて印象的な性能を達成した。
プリフィル段階で処理される多数の視覚トークンのために、それらの推論コストは依然として大きな課題である。
既存のプルーニング手法は、しばしばアテンションパターンや静的テキストプロンプトガイダンスを直接使用することに依存し、推論時に発生する動的内部信号の活用に失敗する。
InVLMにおける適応型視覚トークンプルーニングのためのプラグイン・アンド・プレイフレームワークであるAdaptInferを提案する。
論文 参考訳(メタデータ) (2025-08-08T07:27:26Z) - TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving [10.439455144126617]
TinyDriveは、シナリオ駆動におけるマルチビューVQAのための軽量なVLMである。
本モデルは,マルチスケールビジョンエンコーダとトークンとシーケンスの二重レベル優先順位付け機構を含む2つの重要なコンポーネントから構成される。
TinyDriveは、私たちのカスタムキュレートされたVQAデータセットで最初に評価され、その後、パブリックなDriveLMベンチマークでテストされます。
論文 参考訳(メタデータ) (2025-05-21T14:19:24Z) - Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation [109.5893580175657]
近年,MLLMの開発における標準的な実践は,視覚エンコーダの機能をLLMに供給し,自然言語による指導を施すことである。
このアプローチは、しばしばモデルが言語理解に傾き、データに存在するリッチな視覚知覚信号を損なう。
本稿では,視覚知識をエキスパートビジョンエンコーダからLLMの隠れ表現に注入する最初のアプローチであるVisPer-LMを提案する。
論文 参考訳(メタデータ) (2024-12-12T18:55:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。