論文の概要: S$^2$Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2609.01224v1
- Date: Tue, 01 Sep 2026 13:26:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.683534
- Title: S$^2$Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language Models
- Title(参考訳): S$^2$Prune:マルチモーダル大言語モデルのための空間的構造化ビジュアルトーンプルーニング
- Authors: Yuanyuan Jia, Shunpu Tang, Qianqian Yang,
- Abstract要約: ビジュアルトークンプルーニングは、視覚トークンのサブセットだけを保持することで、マルチモーダルな大規模言語モデル(MLLM)の推論オーバーヘッドを低減する。
S$2$Pruneは,局所像構造にトークン密度を適応させながら空間被覆を保存する訓練不要プルーニング手法である。
- 参考スコア(独自算出の注目度): 5.680072178589744
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual token pruning reduces the inference overhead of multimodal large language models (MLLMs) by retaining only a subset of visual tokens. Existing methods usually select tokens based on importance or redundancy. However, we observe that these criteria produce stable spatial biases across inputs and do not always outperform simple Uniform Grid sampling, highlighting the value of broad spatial coverage. Motivated by this, we propose S$^2$Prune, a training-free pruning method that preserves spatial coverage while adapting token density to local image structure. We first divide the image into regions and assign at least one token to each region to preserve coverage. The remaining token budget is then distributed according to Laplacian variation, giving more tokens to regions with richer structure. We then use Early Representation Change (ERC), computed from the first decoder block, to select representative tokens within each region. We evaluate S$^2$Prune across diverse settings and two MLLM architectures. On Qwen2.5-VL-7B-Instruct, it achieves the highest average accuracy among the evaluated training-free pruning methods. With only 32 of the original 576 visual tokens, it still retains 79.3% of the full-model performance. Code is available at https://github.com/yuanyuanjia71-spec/S2Prune.
- Abstract(参考訳): ビジュアルトークンプルーニングは、視覚トークンのサブセットだけを保持することで、マルチモーダルな大規模言語モデル(MLLM)の推論オーバーヘッドを低減する。
既存のメソッドは通常、重要性や冗長性に基づいてトークンを選択する。
しかし,これらの基準は入力全体にわたって安定な空間バイアスを生じさせ,広帯域の空間カバレッジの価値を強調しながら,単純な一様グリッドサンプリングを常に上回っているわけではない。
そこで我々はS$^2$Pruneを提案する。これは局所像構造にトークン密度を適応させながら空間被覆を保存する訓練不要プルーニング手法である。
まずイメージをリージョンに分割し、各リージョンに少なくとも1つのトークンを割り当ててカバレッジを保存します。
残りのトークン予算はラプラシアン変分に従って分配され、よりリッチな構造を持つ領域により多くのトークンを与える。
次に、最初のデコーダブロックから計算したEarly Representation Change(ERC)を使用して、各リージョン内の代表トークンを選択します。
我々はS$^2$Pruneを多様な設定と2つのMLLMアーキテクチャで評価した。
Qwen2.5-VL-7B-Instructでは,トレーニングフリープルーニング法の中で最も高い平均精度を達成している。
オリジナルの576の視覚トークンのうち32個しか持たないが、それでも79.3%のフルモデル性能を維持している。
コードはhttps://github.com/yuanyuanjia71-spec/S2Pruneで入手できる。
関連論文リスト
- HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment [76.68875424389057]
既存の手法では、すべての頭部に一様にテキストから視覚への注意を平均化することで、各視覚トークンをスコアリングする。
頭が不一致で 平均的に支配され 背景のトークンを増幅し きめ細かな手がかりを 吐き出す
本稿では,各頭部のプロンプトと画像領域の整合性を評価する指標であるPAQ(Prompt-Grounded Attention Quality)を提案する。
論文 参考訳(メタデータ) (2026-08-24T23:55:36Z) - CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport [50.2610873651284]
既存のトークンプルーニング法は、分散を最大化するために類似のトークンを捨て、多様性に基づいた選択に依存している。
3D環境では、この手法は典型的なプロトタイプトークンを落として、アウトリーチを優先することが多い。
本稿では,3次元VLMトークンプルーニングのパラダイムシフトを提案する。
論文 参考訳(メタデータ) (2026-08-13T13:29:15Z) - ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs [16.523460406504604]
ReDiPrune(ReDiPrune)は、視覚条件のプロジェクタに適用される、トレーニング不要のトークンプルーニング手法である。
視覚エンコーダ出力から直接情報トークンを選択し、きめ細かい空間的および意味的な手がかりを保存する。
4つのビデオと5つの画像ベンチマークの精度と効率のトレードオフを一貫して改善する。
論文 参考訳(メタデータ) (2026-03-25T18:01:19Z) - IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning [27.75049214892312]
LVLM(Large Vision-Language Models)は、複数のタスクにまたがる優れたパフォーマンスを実現する。
しかし、重要な課題は、高解像度の視覚入力を処理する際に、その禁止的な推論コストである。
IVCトークンと意味論的に関連するフォアグラウンドトークンの両方を保持するトレーニングフリーで、プロンプト対応のプルーニング戦略である textbfIVC-Prune を提案する。
論文 参考訳(メタデータ) (2026-02-03T03:39:31Z) - GridPrune: From "Where to Look" to "What to Select" in Visual Token Pruning for MLLMs [2.9869094956508495]
MLLM(Multimodal large language model)は、様々な視覚言語タスクにおいて顕著な機能を示す。
MLLMの効率を高めるための重要な技術として、視覚トークンプルーニングが登場している。
そこで本研究では,グローバルなTop-Kメカニズムを,GridPruneに置き換える手法を提案する。
論文 参考訳(メタデータ) (2025-11-13T08:35:39Z) - SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs [59.415473779171315]
textbfSaliency-textbfCoverage textbfOriented token textbfPruning for textbfEfficient MLLMs。
論文 参考訳(メタデータ) (2025-10-28T09:29:37Z) - Tokenize Anything via Prompting [65.93061853439512]
我々は,任意のものを同時にセグメンテーションし,認識し,キャプションすることができる統一的,迅速なモデルを提案する。
我々は、50億のパラメータを持つ事前学習されたCLIPモデルから、巨大なセグメンテーションマスク、eg、SA-1Bマスク、セマンティックプリミティブを持つ一般化可能なモデルをトレーニングする。
我々は,このモデルが汎用領域コンテキストを符号化できる汎用領域レベルの画像トークン化器であると考えている。
論文 参考訳(メタデータ) (2023-12-14T17:01:02Z) - Improving Robustness and Generality of NLP Models Using Disentangled
Representations [62.08794500431367]
スーパービジョンニューラルネットワークはまず入力$x$を単一の表現$z$にマップし、次に出力ラベル$y$にマッピングする。
本研究では,非交叉表現学習の観点から,NLPモデルの堅牢性と汎用性を改善する手法を提案する。
提案した基準でトレーニングしたモデルは、広範囲の教師付き学習タスクにおいて、より堅牢性とドメイン適応性を向上することを示す。
論文 参考訳(メタデータ) (2020-09-21T02:48:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。