論文の概要: How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
- arxiv url: http://arxiv.org/abs/2605.16359v1
- Date: Sat, 09 May 2026 13:13:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 23:51:08.289847
- Title: How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
- Title(参考訳): マルチモーダル言語モデルに必要なビジュアルトークンはいくつあるか?
- Authors: YiJie Huang, Yiqun Zhang, Zhuoyue Jia, Xiaocui Yang, Junzhao Huang, Zihan Wang, Shi Feng, Daling Wang, Yifei Zhang, Yongkang Liu,
- Abstract要約: 視覚的トークンプルーニングのためのトレーニング不要ルータF3Aを提案する。
ライトウェイトなクェリコンディショニングキューを構築し、凍結したスパースセンサーヘッドを通してトークンと照合する。
厳密なエビデンスローカライゼーション、地域改良、カバー範囲保存競争、未発見領域の回復を通じて、固定された視覚トークン予算を割り当てている。
- 参考スコア(独自算出の注目度): 35.028071915491104
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models improve perception by feeding increasingly long visual token sequences into language backbones, but the resulting inference cost raises a basic scaling question: as multimodal models grow, how many visual tokens are actually needed, and how should they be allocated under a fixed visual token budget? Existing training-free pruning methods typically answer this with one-shot proxies such as decoder attention, visual similarity, or conditional diversity. We argue that visual token pruning is better viewed as task-conditioned evidence search, especially under aggressive compression and across model scales. We propose F^3A, a training-free router for visual token pruning that operates before the language model consumes image tokens. F^3A builds lightweight question-conditioned cues, matches them to visual-grid tokens through frozen sparse sensing heads, and allocates a fixed vision token budget via coarse evidence localization, local refinement, coverage-preserving competition, and recovery of under-covered regions. It requires no model training, no extra LLM forward pass and preserves the original multimodal prompting and decoding pipeline.
- Abstract(参考訳): 視覚言語モデルは、ますます長い視覚トークンシーケンスを言語バックボーンに供給することによって知覚を改善するが、結果として生じる推論コストは、基本的なスケーリングの問題を引き起こす。
既存のトレーニングフリープルーニング手法では、デコーダの注意、視覚的類似性、条件付き多様性などの一発プロキシでこれを答えるのが一般的である。
視覚的トークンプルーニングは、特に積極的圧縮やモデルスケールでのタスク条件付きエビデンスサーチとして、より優れていると論じる。
F^3Aは,言語モデルが画像トークンを消費する前に動作する,視覚的トークン解析のための訓練不要ルータである。
F^3Aは、軽量な質問条件付きキューを構築し、凍結したスパースセンシングヘッドを介して視覚的にグリッドされたトークンとマッチングし、粗いエビデンスローカライゼーション、局所的な洗練、カバレッジ保護競争、未発見領域の回復を通じて固定された視覚トークン予算を割り当てる。
モデルトレーニングもLLMフォワードパスも不要で、オリジナルのマルチモーダルプロンプトとデコードパイプラインを保存できる。
関連論文リスト
- See the Text: From Tokenization to Visual Reading [63.10220471118435]
SeeTokはテキストを画像(ビジュアルテキスト)としてレンダリングし、事前訓練されたマルチモーダル計算を利用して解釈する。
3つの異なる言語タスクの中で、SeeeTokはサブワードトークンをマッチまたはオーバーし、トークンを4.43倍少なくし、FLOPを70.5%削減する。
SeeTokは、象徴的なトークン化から人間のような視覚的な読み方へとシフトし、より自然で認知的にインスパイアされた言語モデルへと一歩前進する。
論文 参考訳(メタデータ) (2025-10-21T17:34:48Z) - PoRe: Position-Reweighted Visual Token Pruning for Vision Language Models [12.189644988996022]
本稿では,視覚的トークンプルーニングにおける遅延バイアスを軽減するための,極めて単純かつ効果的なアプローチを提案する。
画像内の空間的位置に応じて視覚的トークンの注意点を調節する簡単なリウェイト機構を提案する。
提案手法は,既存のビジュアルトークンプルーニングフレームワークにシームレスに組み込むことができるプラグイン・アンド・プレイソリューションである。
論文 参考訳(メタデータ) (2025-08-25T08:56:32Z) - CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models [75.88232735646018]
LVLM(Large Vision-Language Models)は、画像やビデオから抽出されたテキストトークンとビジョントークンからなるマルチモーダル入力を処理する。
既存の手法は冗長な視覚トークンを創りだそうとしており、視覚表現のかなりの冗長性を明らかにしている。
我々は,LVLMで処理される前に冗長な視覚トークンを予測・削除するために,Plug-and-Play Pruning Module (PPM) を用いるレイヤワイズなコンテキスト対応型視覚トークンプルーニング手法であるCoViPALを提案する。
論文 参考訳(メタデータ) (2025-08-24T07:47:00Z) - ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models [73.34709921061928]
マルチモーダル大言語モデル(MLLM)に視覚的プロンプトを注入する学習自由手法を提案する。
我々は,エネルギー関数に基づいて学習可能な潜伏変数を最適化し,注目マップにおける参照領域の強度を高める。
提案手法は,参照能力のMLLMへの統合に有望な方向を与え,ボックス,マスク,スクリブル,ポイントによる参照を支援する。
論文 参考訳(メタデータ) (2024-07-31T11:40:29Z) - LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models [35.88374542519597]
大規模マルチモーダルモデル(LMM)は、視覚エンコーダと大きな言語モデルとを接続することで、視覚的推論能力を示す。
近年のLMMには、高解像度の画像やビデオなど、より複雑な視覚入力が組み込まれており、視覚トークンの数が大幅に増加する。
我々は,LMMの性能を損なうことなく,視覚トークンの数を著しく削減する適応型視覚トークン削減戦略であるPruMergeを提案する。
論文 参考訳(メタデータ) (2024-03-22T17:59:52Z) - SA$^2$VP: Spatially Aligned-and-Adapted Visual Prompt [59.280491260635266]
視覚的プロンプトチューニングの方法は、NLPから派生した逐次モデリングパラダイムに従う。
マイモデルモデルは、画像トークンマップに等しい大きさ(またはスケールした)の2次元プロンプトトークンマップを学習する。
我々のモデルは、個々の画像トークンをきめ細かな方法でプロンプトすることができる。
論文 参考訳(メタデータ) (2023-12-16T08:23:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。