論文の概要: ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs
- arxiv url: http://arxiv.org/abs/2609.34558v1
- Date: Mon, 28 Sep 2026 08:14:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 12:28:58.250126
- Title: ACPruner: Visual Token Pruning as Biased Attention Coverage Maximization in LVLMs
- Title(参考訳): ACPruner: LVLMにおけるバイアスアテンションカバレッジ最大化としての視覚的トーケンプルーニング
- Abstract要約: ACPrunerは、効率的なLVLM推論のためのトレーニング不要なビジュアルトークンプルーニングフレームワークである。
ACPrunerは、エンド・ツー・エンドの推論スピードアップを実現しながら、パフォーマンスを継続的に維持する。
- 参考スコア(独自算出の注目度): 61.39113360313417
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Vision-Language Models (LVLMs) face significant computational inefficiencies caused by the large number of visual tokens. Existing visual token pruning methods mainly focus on either retaining individually important tokens or selecting mutually diverse ones. In this work, we revisit visual token pruning from a coverage perspective and formulate it as a biased attention coverage maximization problem. The key idea is to select a compact token subset whose encoder-side outgoing attention can jointly cover the image while assigning higher coverage priority to more informative regions. From this perspective, we propose ACPruner, a training-free visual token pruning framework for efficient LVLM inference. ACPruner first estimates token importance by combining intra-modal saliency and inter-modal relevance, then derives token-wise coverage from attention patterns within the vision encoder, and finally performs greedy selection to maximize the proposed coverage objective. Extensive experiments across multiple LVLM backbones, including LLaVA-1.5-7B/13B, LLaVA-NeXT-7B/13B, Qwen2.5-VL-7B, and LLaVA-OneVision-7B, show that ACPruner consistently achieves strong performance retention while delivering substantial end-to-end inference speedups.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は、多数の視覚トークンによって引き起こされる計算の非効率性に直面する。
既存の視覚トークンプルーニング手法は主に、個々の重要なトークンを保持するか、相互に多様なトークンを選択することに焦点を当てている。
本研究では,視覚的トークンプルーニングをカバレッジの観点から再検討し,それを偏りのある注目カバレッジの最大化問題として定式化する。
鍵となるアイデアは、エンコーダ側からの注目が、より高いカバレッジ優先度をより多くの情報領域に割り当てながら、共同で画像をカバーできるコンパクトなトークンサブセットを選択することである。
この観点から,効率的なLVLM推論のためのトレーニング不要なビジュアルトークンプルーニングフレームワークであるACPrunerを提案する。
ACPrunerはまず、モダル内サリエンシとモダル間の関連性を組み合わせてトークンの重要性を推定し、次に、視覚エンコーダ内の注意パターンからトークンワイドカバレッジを導出し、最後に、提案されたカバレッジ目標を最大化するために欲求選択を行う。
LLaVA-1.5-7B/13B、LLaVA-NeXT-7B/13B、Qwen2.5-VL-7B、LLaVA-OneVision-7Bなど、複数のLVLMバックボーンにわたる大規模な実験により、ACPrunerは、エンド・ツー・エンドの推論スピードアップを確実に達成しつつ、強い性能維持を実現していることが示された。
関連論文リスト
- LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models [8.039490357019801]
VLM(Vision-Language Models)は近年,視覚的理解と推論において顕著な能力を示した。
また、長い視覚的シーケンス入力による計算負荷も大きい。
近年の研究では、重要でない視覚トークンを抽出し、計算量を大幅に削減することでこの問題に対処している。
論文 参考訳(メタデータ) (2026-04-27T01:56:59Z) - ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference [26.71949723961501]
本稿では,新しいトレーニングフリーなKVキャッシュ対応プルーニングレシピであるASAPを提案する。
ダイナミックな双方向ソフトアテンションマスクを利用することで、アテンションシフトを緩和する。
また、トークンセット内の高い意味的冗長性は性能を低下させると仮定する。
論文 参考訳(メタデータ) (2026-03-15T18:51:31Z) - STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference [3.9464481148889354]
我々は,グローバルな視点からトークンプルーニングにアプローチする,トレーニングフリーのプラグアンドプレイフレームワークSTAR(Stage-wise Attention-guided token Reduction)を提案する。
単一ポイントでプルーニングする代わりに、STARは視覚的自己注意に基づく早期プルーニングで冗長な低レベル特徴を除去し、タスク非関連トークンを捨てるために、クロスモーダルな注意でガイドされる後期プルーニングという2つの相補的な段階において注意誘導還元を行う。
論文 参考訳(メタデータ) (2025-05-18T10:44:45Z) - TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model [56.43860351559185]
高速かつ低メモリの textbfVLM に対する推論時間最適化を備えた textbfToken textbfPruning の互換性である textbfTopV を導入する。
我々のフレームワークは、各ソースの視覚的トークンの重要性を測定するために、視覚的なコスト関数を組み込んでおり、低重要トークンの効果的なプルーニングを可能にしている。
論文 参考訳(メタデータ) (2025-03-24T01:47:26Z) - A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs [65.00970402080351]
大規模視覚言語モデル(VLM)を加速するための有望なアプローチは、特定のレイヤからの注意マップのような部分的な情報を使用してトークンの重要性を評価し、重要度を低く抑えることである。
i) 重要な視覚的トークンを正確に識別するには,部分的注意情報は不十分であり,特に低トークン保持率において,最適なパフォーマンスをもたらす。 (ii) 全層に集約された注目マップのようなグローバルな注意情報は,より効果的に重要なトークンを保存し,攻撃的プルーニングの下で同等のパフォーマンスを維持する。 (iii) 小さなVLMから集約されたグローバルな注意マップは,大きなVLMとよく似ている。
論文 参考訳(メタデータ) (2024-12-04T13:56:44Z) - FoPru: Focal Pruning for Efficient Large Vision-Language Models [11.36025001578531]
本稿では、視覚エンコーダから導出される注目に基づくトークンの重要度に基づいて、視覚トークンを抽出する訓練不要なFocal Pruning(FoPru)を提案する。
提案手法は,高い精度を維持しつつ多数の冗長トークンを抽出し,推論効率を大幅に向上させる。
論文 参考訳(メタデータ) (2024-11-21T14:22:38Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。