論文の概要: When and What to Prune? Stage-Aware Visual Token Pruning for Efficient VLA
- arxiv url: http://arxiv.org/abs/2610.05273v1
- Date: Sun, 04 Oct 2026 14:47:27 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:42:55.577471
- Title: When and What to Prune? Stage-Aware Visual Token Pruning for Efficient VLA
- Title(参考訳): プルーネの時期と時期 : 効率的なVLAのためのステージ認識型視覚トーケンプルーニング
- Abstract要約: 視覚・言語・アクションの効率的な推論のためのトレーニング不要なビジュアルトークン解析フレームワークであるSAPruneを提案する。
実験の結果、SAPruneは87.5%の視覚トークンを持ち、最大1.718xの推論スピードアップを達成した。
- 参考スコア(独自算出の注目度): 8.932929342867125
- License:
- Abstract: Visual token pruning is an effective way to accelerate vision-language models and is especially useful for vision-language-action (VLA) inference, where many visual tokens must be processed before predicting robot actions. Existing pruning methods usually estimate which tokens can be pruned based on attention scores or feature diversity, retaining tokens that are either highly attended or visually different from others. However, most of them use fixed pruning schedules, such as pruning once at a preset layer or pruning at uniformly spaced layers. Such schedules can be risky for VLA models, because the model may not know which visual regions matter for the action in early layers. Tokens that look unimportant at first may become useful after the model combines visual observations with the language instruction. In this work, we propose SAPrune, a training-free visual token pruning framework for efficient VLA inference. Instead of pruning at fixed layers, SAPrune uses a small calibration set to observe how action-to-visual attention changes across layers, and chooses pruning layers only after the attention pattern becomes more reliable. At each selected layer, SAPrune applies a dual-path pruning rule: one path protects strongly attended visual tokens from pruning, while the other prevents useful surrounding context from being discarded. Experiments on LIBERO, SIMPLER, and real-world robotic tasks show that SAPrune prunes 87.5% of visual tokens and achieves up to 1.718x inference speedup while maintaining competitive task success rates.
- Abstract(参考訳): 視覚トークンプルーニングは視覚言語モデルを加速する有効な方法であり、ロボットアクションを予測する前に多くの視覚トークンを処理しなければならない視覚言語(VLA)推論に特に有用である。
既存のプルーニング手法は通常、注目スコアや特徴多様性に基づいてどのトークンをプルーニングできるかを見積もる。
しかし、そのほとんどは固定されたプルーニングスケジュールを使用しており、例えばプレセットされた層で一度プルーニングしたり、一様間隔の層でプルーニングを行ったりしている。
このようなスケジュールは、初期のレイヤでどの視覚領域が重要かわからないため、VLAモデルにとって危険である可能性がある。
モデルが視覚的観察と言語指導を組み合わせることで、当初は重要でないように見えるトークンが有用になる可能性がある。
本研究では,効率的なVLA推論のためのトレーニング不要なビジュアルトークン解析フレームワークであるSAPruneを提案する。
固定されたレイヤをプルーニングする代わりに、SAPruneは小さなキャリブレーションセットを使用して、レイヤ間のアクション・ツー・ビジュアルなアテンションがどのように変化するかを観察し、アテンション・パターンがより信頼できるものになると、プルーニング・レイヤを選択する。
選択されたレイヤごとに、SAPruneはデュアルパスプルーニングルールを適用している。一方のパスは、強い出席する視覚トークンをプルーニングから保護し、もう一方のパスは、有用な周囲のコンテキストが破棄されるのを防ぐ。
LIBERO、SIMPLER、現実世界のロボットタスクの実験では、SAPruneは87.5%の視覚トークンを産み出し、最大1.718倍の推論スピードアップを達成し、競争的なタスクの成功率を維持している。
関連論文リスト
- SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models [25.951841702056544]
MLLM(Multimodal large language model)は、長い視覚トークンシーケンスを処理する際に、かなりの計算オーバーヘッドを発生させる。
SinkPrunerは、効率的なMLLM推論のためのトレーニング不要なビジュアルトークンプルーニングフレームワークである。
SinkPrunerは、ハイノーム冗長性をフィルタし、注意シンクと注意分散を緩和するビジュアルサニタイザと、テキストクエリにセマンティックに整合したトークンを保持するテキスト誘導プルーナーの2つの主要なモジュールで、粗い粒度の設計に従う。
論文 参考訳(メタデータ) (2026-09-01T09:52:10Z) - Not All Attention Heads Contribute to Critical Visual Token Selection: Head-Aware Pruning Matters More [10.64705408079015]
VLM(Vision-Language Models)は、さまざまな視覚シナリオにまたがって素晴らしいパフォーマンスを示している。
VLM推論効率を改善するために、典型的な視覚トークンプルーニング手法はトークンの重要性を推定する。
トレーニング不要なプログレッシブ・プログレッシブ・トークン・プルーニング・フレームワークであるProViPを提案する。
論文 参考訳(メタデータ) (2026-08-26T03:27:14Z) - Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models [52.78477729846771]
本稿では,COAST(Contrastive Adaptive Semantic Token Pruning)について紹介する。
COASTはトークン予算をまたいだ強力なプルーニングベースラインを一貫して上回り、複数のLVLMファミリをまたいだ一般化を実現している。
論文 参考訳(メタデータ) (2026-05-10T09:07:04Z) - SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass [20.7003663809766]
視覚トークンプルーニングは、視覚言語モデルの計算コストを削減するための有望なアプローチである。
我々は、選択されていない視覚トークンを保存し、その後のプルーニングステージに転送する、バイパスと呼ばれる新しいプルーニングパラダイムを導入する。
このパラダイムに基づいて,強力な視覚トークン選択機能を備えたモデル固有の層でプルーニングを行う,単純かつトレーニング不要なSwiftVLMを提案する。
論文 参考訳(メタデータ) (2026-02-03T05:42:51Z) - All You Need Are Random Visual Tokens? Demystifying Token Pruning in VLLMs [43.80391827200227]
ディープレイヤでは、既存のトレーニングフリープルーニング手法はランダムプルーニングに勝る。
ビジュアルトークンは、ネットワーク深度の増加に伴い、徐々にサリエンスを失う。
深層層での単純なランダムプルーニングは性能と効率のバランスを効果的に表す。
論文 参考訳(メタデータ) (2025-12-08T14:16:01Z) - Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention [50.97683288777336]
MLLM(Multimodal Large Language Models)は、巨大な視覚トークンに依存するため、計算オーバーヘッドがかなり大きい。
近年の研究では、この問題を緩和するためにトークンプルーニングが検討されている。
本稿では,効率的な推論のためのビジュアルトークン・プルーニング・フレームワークであるHoloVを提案する。
論文 参考訳(メタデータ) (2025-10-03T11:33:40Z) - PoRe: Position-Reweighted Visual Token Pruning for Vision Language Models [12.189644988996022]
本稿では,視覚的トークンプルーニングにおける遅延バイアスを軽減するための,極めて単純かつ効果的なアプローチを提案する。
画像内の空間的位置に応じて視覚的トークンの注意点を調節する簡単なリウェイト機構を提案する。
提案手法は,既存のビジュアルトークンプルーニングフレームワークにシームレスに組み込むことができるプラグイン・アンド・プレイソリューションである。
論文 参考訳(メタデータ) (2025-08-25T08:56:32Z) - VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization [70.98122339799218]
LMM(Large Multimodal Models)は、多数の視覚トークンを微粒な視覚情報に活用することにより、視覚言語タスクに優れる。
推論中の視覚トークンを減らすことを目的とした以前の研究は、一般的に、視覚のみのトークンや視覚言語トークンの注意スコアから得られた重要マップを利用して、1つまたは複数のプルーニング段階にわたってトークンをプルーンする。
重要地図導出プロセスとリサイクル機構を備えたプログレッシブプルーニングモジュールを導入したトークンプルーニングフレームワークであるVFlowOptを提案する。
実験により、VFlowOptは、同等のパフォーマンスを維持しながら、90%のビジュアルトークンをプルークでき、KVキャッシュメモリが89%削減され、3.8になった。
論文 参考訳(メタデータ) (2025-08-07T09:47:21Z) - A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models [94.49953824684853]
人間の認知に触発された動的刈り取りフレームワークGlimpsePruneを導入する。
データ駆動の 'glimpse' を受け取り、応答生成の前に単一のフォワードパスで無関係な視覚トークンをプルーンする。
強化されたGlimpsePrune+は、同様に高いプルーニング率を維持しながら、ベースライン性能の110%を達成する。
論文 参考訳(メタデータ) (2025-08-03T02:15:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。