論文の概要: Who Speaks for the Pruned? Visual Token Pruning as Coverage Optimization
- arxiv url: http://arxiv.org/abs/2609.03158v1
- Date: Wed, 02 Sep 2026 20:51:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.858243
- Title: Who Speaks for the Pruned? Visual Token Pruning as Coverage Optimization
- Title(参考訳): プルーニングは誰が話すのか? カバレッジ最適化としてのビジュアルトーンプルーニング
- Authors: Qingchan Zhu, Weihang You, Hanqi Jiang, Changdi Yang, Tianming Liu, Geng Yuan,
- Abstract要約: 視覚トークンプルーニングは視覚言語モデル(VLM)の推論コストを削減する
トークンが削除された後、生き残ったオリジナルのトークンがターゲットのVLMに対してそれを表現しているかという、補完的な需要側質問を問うトレーニングフリープルーナーであるCoverPrunerを提案する。
CoverPrunerはRepresentational Coverage Maximization (RCM) としてプルーニングを定式化し、クエリ重み付き要求を伴う完全なビジュアルトークンを網羅する。
- 参考スコア(独自算出の注目度): 16.62921026631372
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual token pruning reduces the inference cost of vision-language models (VLMs), but most methods only ask which tokens to keep. This retained-token view can keep redundant high-scoring tokens while leaving discarded evidence without a close representative. We propose CoverPruner, a training-free pruner that asks the complementary demand-side question: after a token is removed, which surviving original token represents it for the target VLM? CoverPruner formulates pruning as Representational Coverage Maximization (RCM), covering the full projected visual-token set with query-weighted demand. It instantiates RCM with projector-space coverage and a lightweight first-layer attention probe. Across multiple VLM architectures and compression rates, CoverPruner achieves the best average accuracy among all compared methods, with the largest gains usually appearing under aggressive compression.
- Abstract(参考訳): 視覚トークンプルーニングは視覚言語モデル(VLM)の推論コストを削減しますが、ほとんどのメソッドはどのトークンを保持するかのみを要求します。
この保持トークンビューは、密接な代表者なしで捨てられた証拠を残しながら、冗長なハイスコアトークンを保持することができる。
トークンが削除された後、生き残ったオリジナルのトークンがターゲットのVLMに対してそれを表現しているかという、補完的な需要側質問を問うトレーニングフリープルーナーであるCoverPrunerを提案する。
CoverPrunerはRepresentational Coverage Maximization (RCM) としてプルーニングを定式化し、クエリ重み付き要求を伴う完全なビジュアルトークンを網羅する。
RCMをプロジェクター空間のカバレッジと軽量な第1層アテンションプローブでインスタンス化する。
複数のVLMアーキテクチャと圧縮速度にまたがって、CoverPrunerは比較したすべてのメソッドの中で最高の平均精度を達成し、最も大きなゲインは通常、攻撃的な圧縮の下で現れる。
関連論文リスト
- LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference [63.932718076408584]
LASTは、エッジクラウド協調MLLM推論におけるクエリ依存のビジュアルトークンプルーニングのための、トレーニング不要のフレームワークである。
完全な精度の95.4%を維持し、視覚トークンの12.5%しか保持せず、エッジ側の選択オーバーヘッドは低く、クラウド側の計算は少ない。
論文 参考訳(メタデータ) (2026-07-30T09:59:25Z) - PIO-FVLM: Rethinking Training-Free Visual Token Reduction for VLM Acceleration from an Inference-Objective Perspective [59.24570811503256]
本稿では,視覚モデル(VLM)における冗長な視覚トークンを減らし,推論を高速化するPIO-FVLMを提案する。
提案されているPIO-FVLMは、トレーニングフリーで、FlashAttentionと互換性があり、実用的なアプリケーションやデプロイメントに親しみやすい。
LLaVA-Next-7Bでは、PIO-FVLMは視覚トークンの11.1%しか保持していないが、オリジナルのパフォーマンスの97.2%を維持している。
論文 参考訳(メタデータ) (2026-02-04T15:33:10Z) - SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs [59.415473779171315]
textbfSaliency-textbfCoverage textbfOriented token textbfPruning for textbfEfficient MLLMs。
論文 参考訳(メタデータ) (2025-10-28T09:29:37Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z) - SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference [45.11612407862277]
視覚言語モデル (VLM) では、視覚トークンはテキストトークンと比較して情報量が多すぎるにもかかわらず、計算オーバーヘッドがかなり大きい。
本稿では、余分なパラメータや微調整コストを不要とするSparseVLMと呼ばれるテキスト誘導型トレーニングフリートークン最適化機構を提案する。
論文 参考訳(メタデータ) (2024-10-06T09:18:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。