論文の概要: SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2609.01004v1
- Date: Tue, 01 Sep 2026 09:52:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.544233
- Title: SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models
- Title(参考訳): SinkPruner: マルチモーダルな大規模言語モデルのためのシンクフリービジュアルトーケンプルーニング
- Authors: Shiyu Li, Zi-Yuan Hu, Shijia Huang, Yanyang Li, Yiwu Zhong, Liwei Wang,
- Abstract要約: MLLM(Multimodal large language model)は、長い視覚トークンシーケンスを処理する際に、かなりの計算オーバーヘッドを発生させる。
SinkPrunerは、効率的なMLLM推論のためのトレーニング不要なビジュアルトークンプルーニングフレームワークである。
SinkPrunerは、ハイノーム冗長性をフィルタし、注意シンクと注意分散を緩和するビジュアルサニタイザと、テキストクエリにセマンティックに整合したトークンを保持するテキスト誘導プルーナーの2つの主要なモジュールで、粗い粒度の設計に従う。
- 参考スコア(独自算出の注目度): 25.951841702056544
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite their strong multimodal understanding ability, multimodal large language models (MLLMs) incur substantial computational overhead when processing long visual token sequences. To reduce inference costs, recent studies have explored visual token pruning through vision-centric or text-guided strategies. However, these methods often overlook high-norm outlier tokens, i.e., tokens with abnormally large feature norms, leading to suboptimal pruning decisions. In this work, we show that such high-norm outlier tokens are highly redundant in both feature and spatial dimensions, yet are often mistakenly preserved as informative cues by existing methods. Motivated by this observation, we propose SinkPruner, a training-free visual token pruning framework for efficient MLLM inference. SinkPruner follows a coarse-to-fine design with two key modules: a visual sanitizer that filters high-norm redundancies and alleviates attention sink and attention dispersion, and a text-guided pruner that further retains tokens semantically aligned with the text query. Extensive experiments on twelve image-language and four video-language benchmarks demonstrate the effectiveness, efficiency, and generalizability of our framework. Notably, SinkPruner preserves 96.5% (91.8%) of the original performance of LLaVA-1.5 (Qwen2.5-VL) under an 89% token reduction. Experiments further indicate that our visual sanitizer exhibits promising transferability in enhancing the performance of existing pruning methods. Our code is available at https://github.com/LaVi-Lab/SinkPruner.
- Abstract(参考訳): 強力なマルチモーダル理解能力にもかかわらず、多モーダル大規模言語モデル(MLLM)は長い視覚トークンシーケンスを処理する際にかなりの計算オーバーヘッドを発生させる。
推論コストを低減するため、近年の研究では視覚中心またはテキスト誘導戦略による視覚トークンプルーニングについて検討している。
しかしながら、これらの手法は、しばしば高ノルムな外れ値トークン、すなわち異常に大きな特徴ノルムを持つトークンを見落とし、準最適プルーニング決定に繋がる。
本研究では,このような高ノルムな外れ値トークンは特徴量と空間次元の両方において非常に冗長であるが,既存の手法によって情報的手がかりとして誤って保存されることがしばしばあることを示す。
そこで本研究では,MLLMの効率的な推論のためのトレーニング不要なビジュアルトークン解析フレームワークであるSinkPrunerを提案する。
SinkPrunerは、ハイノーム冗長性をフィルタし、注意シンクと注意分散を緩和するビジュアルサニタイザと、テキストクエリにセマンティックに整合したトークンを保持するテキスト誘導プルーナーの2つの主要なモジュールで、粗い粒度の設計に従う。
12の画像言語と4つのビデオ言語ベンチマークに関する大規模な実験は、我々のフレームワークの有効性、効率、一般化性を示している。
特にSinkPrunerは、LLaVA-1.5(Qwen2.5-VL)のオリジナルの性能の96.5%(91.8%)を89%のトークン還元で保存している。
さらに,我々の視覚浄化装置は,既存の刈り取り法の性能向上に有望な伝達性を示すことを示す。
私たちのコードはhttps://github.com/LaVi-Lab/SinkPruner.comから入手可能です。
関連論文リスト
- Visual Token Compression Enhances Robustness of MLLMs [54.28558472087342]
視覚的トークンプルーニングがマルチモーダル大言語モデル(MLLM)のロバスト性を高めることを初めて示す。
我々は,ロバスト・プルーニング層におけるOOD視覚トークンを削減し,ジェイルブレイクや幻覚に対するモデルロバスト性を高めることを目指している。
本手法は,ジェイルブレイク攻撃の防御において平均13.29%の改善を達成し,幻覚の緩和において一貫して競争力を発揮し,MMEなどの一般データセット上での強い結果を維持する。
論文 参考訳(メタデータ) (2026-07-21T15:52:30Z) - All You Need Are Random Visual Tokens? Demystifying Token Pruning in VLLMs [43.80391827200227]
ディープレイヤでは、既存のトレーニングフリープルーニング手法はランダムプルーニングに勝る。
ビジュアルトークンは、ネットワーク深度の増加に伴い、徐々にサリエンスを失う。
深層層での単純なランダムプルーニングは性能と効率のバランスを効果的に表す。
論文 参考訳(メタデータ) (2025-12-08T14:16:01Z) - Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention [50.97683288777336]
MLLM(Multimodal Large Language Models)は、巨大な視覚トークンに依存するため、計算オーバーヘッドがかなり大きい。
近年の研究では、この問題を緩和するためにトークンプルーニングが検討されている。
本稿では,効率的な推論のためのビジュアルトークン・プルーニング・フレームワークであるHoloVを提案する。
論文 参考訳(メタデータ) (2025-10-03T11:33:40Z) - TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models [4.779482139419908]
テキストトークンと意味的に視覚トークンを除去する相互情報に基づくトークンプルーニング戦略を導入する。
LLaVA-15-7BやLLaVA-7Bといったモデルでは,テキストトークンを88.9%削減しながら高い性能を維持している。
論文 参考訳(メタデータ) (2025-08-30T02:43:50Z) - Rethinking Visual Token Reduction in LVLMs under Cross-modal Misalignment [38.04426918886084]
視覚言語モデル(LVLM)は、視覚入力をパッチレベルのトークンの密度の高いシーケンスとしてエンコードし、微細なセマンティクスをキャプチャする。
これまでは、大型言語モデル(LLM)の前か中のいずれかで、視覚トークンの削減を検討してきた。
トレーニングフリーで視覚のみのプルーニングフレームワークであるVisionDropを導入し、モーダル内(視覚から視覚への)注目に基づいて情報的視覚トークンを選択する。
論文 参考訳(メタデータ) (2025-06-27T14:55:40Z) - VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models [57.2662376527586]
VScanは2段階のビジュアルトークン削減フレームワークである。
1)グローバルスキャンとローカルスキャンを視覚的エンコーディング中にマージすることで,(2)言語モデルの中間層にプルーニングを導入する。
VScanはプリフィルの2.91$times$スピードアップとFLOPの10$times$ダウンを実現し、オリジナルのパフォーマンスの95.4%を維持した。
論文 参考訳(メタデータ) (2025-05-28T17:59:08Z) - ToDRE: Visual Token Pruning via Diversity and Task Awareness for Efficient Large Vision-Language Models [59.47738955960352]
ToDREは、2段階でトレーニング不要なトークン圧縮フレームワークである。
トークンの多様性とトークン-タスク関連性に基づいてトークンをプルーニングすることで、優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-05-24T15:47:49Z) - What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph [15.364317811275344]
本稿では,G-Prune と呼ばれる学習自由な視覚トークンプルーニングのためのグラフベースの手法を提案する。
G-Pruneは視覚トークンをノードとみなし、それらの意味的類似性に基づいて接続を構築する。
実験結果から,G-Pruneは粗いタスクと微粒なタスクの両方で高い性能を維持しながら,計算オーバーヘッドを大幅に削減できることがわかった。
論文 参考訳(メタデータ) (2025-01-04T12:14:42Z) - Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs [34.3615740255575]
大規模視覚言語モデル(LVLM)は一般的に、テキストのトークンよりもはるかに多くの視覚トークンを含んでいる。
LVLMにおけるより効果的なトークンプルーニングに視覚的手がかりを利用するプラグイン・アンド・プレイ方式であるVisPrunerを提案する。
その結果, VisPruner は LLaVA-1.5-7B の FLOP を 91% 削減し, 推論遅延を 75% 削減できることを示した。
論文 参考訳(メタデータ) (2024-12-02T18:57:40Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。