論文の概要: SPIDER: Multi-Layer Semantic Token Pruning and Adaptive Sub-Layer Skipping in Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2609.34977v1
- Date: Mon, 28 Sep 2026 11:54:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 18:09:27.078769
- Title: SPIDER: Multi-Layer Semantic Token Pruning and Adaptive Sub-Layer Skipping in Multimodal Large Language Models
- Title(参考訳): SPIDER:マルチモーダル大言語モデルにおける多層セマンティックトケプルーニングと適応サブ層スキッピング
- Abstract要約: マルチレイヤのアンダーラインtextbfSemanticビジュアルトークン underlinetextbfPrununderlinetextbfIng と aunderlinetextbfDaptive sub-layunderlinetextbfER スキップ機構を統合したトレーニングフリーフレームワーク textbfSPIDER を提案する。
- 参考スコア(独自算出の注目度): 108.54713532551811
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models face significant efficiency challenges that stem from two distinct yet coupled sources: data redundancy and computational redundancy. While most methods focus on data redundancy by pruning visual tokens from the output of the visual encoder or computing redundancy in LLM decoders using blockwise importance, the finer-grained inter-layer representation shifts and the distribution differences within the layers themselves have not been fully explored. In this work, we comprehensively investigate this dual-level inefficiency. We posit that intermediate layer tokens from vision encoders should be considered for effective visual token pruning, as semantic focus shifts across layers, with middle-layer tokens capturing more detailed object-centric information that deeper layers may abstract away. Furthermore, we reveal the differential contributions of Attention and FFNs across distinct LLM decoder layers. Building upon these discoveries, we propose \textbf{SPIDER}, a training-free framework that integrates multi-layer \underline{\textbf{S}}emantic visual token \underline{\textbf{P}}run\underline{\textbf{I}}ng with an a\underline{\textbf{D}}aptive sub-lay\underline{\textbf{ER}} skipping mechanism. Experimental evaluations demonstrate that SPIDER consistently maintains strong performance across various MLLM architectures and reduction ratios. For instance, on LLaVA-NeXT-7B, SPIDER reduces FLOPs by $79\%$ while maintaining 96$\%$ of the baseline performance.
- Abstract(参考訳): マルチモーダル大規模言語モデルは、データ冗長性と計算冗長性の2つの異なるソースから派生した重要な効率上の課題に直面している。
LLMデコーダにおける視覚的エンコーダの出力から視覚的トークンを抽出したり,あるいは計算冗長性をブロックワイドで重視する手法が多いが,層間表現の微粒化や層内分布の差異は十分に検討されていない。
本研究では,この二重レベル非効率性を包括的に検討する。
視覚エンコーダからの中間層トークンは、より深い層が抽象化できるより詳細なオブジェクト中心の情報を取得する中層トークンによって、レイヤ間のセマンティックフォーカスシフトとして、効果的な視覚トークンプルーニングのために考慮すべきであると仮定する。
さらに,異なるLCMデコーダ層にまたがるアテンションとFFNの差分寄与を明らかにする。
これらの発見に基づいて,マルチレイヤの \underline{\textbf{S}}emantic visual token \underline{\textbf{P}}run\underline{\textbf{I}}ng と a\underline{\textbf{D}}aptive sub-lay\underline{\textbf{ER}} スキップ機構を統合したトレーニングフリーフレームワークである \textbf{SPIDER} を提案する。
実験により、SPIDERは様々なMLLMアーキテクチャと縮小比の強い性能を維持していることが示された。
例えば、LLaVA-NeXT-7Bでは、SPIDERは、ベースライン性能の96$\%を保ちながら、FLOPsを79\%$に削減する。
関連論文リスト
- Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs [89.7106332677868]
意味進化から空間的相互作用を分離する学習自由推論パラダイムであるVisual-Skipを提案する。
V-Skipは、ブロックワイドの空間性を達成するために、冗長な視覚的注意を効果的に回避し、様々なMLLM間で94.16%から100.31%のパフォーマンス維持を維持している。
論文 参考訳(メタデータ) (2026-06-07T08:32:13Z) - Q Cache: Visual Attention is Valuable in Less than Half of Decode Layers for Multimodal Large Language Model [21.206033754351786]
マルチモーダル大言語モデル(MLLM)は、視覚トークンの拡散に起因する外乱推論コストに悩まされている。
既存のアプローチでは、トークンの最適化に重点を置いており、さまざまなトークンプルーニング技術を活用して、非極端なビジュアルトークンを排除している。
同様の注意パターンの層間共有を可能にする効果的な注意機構であるLazy Attentionを提案する。
論文 参考訳(メタデータ) (2026-02-02T10:08:00Z) - ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction [55.21514454560188]
統一マルチモーダルモデルでは、視覚の粒度モデル(VLM)と拡散モデルを組み合わせることで、視覚生成を著しく改善する。
既存の手法は、表現の差が大きいため、十分な相互作用と柔軟な実装のバランスをとるのに苦労する。
我々は,textbfParallel方式でVLMの変形層から特徴を抽出し,包括的情報インタラクションを実現するtextbfParaUniを提案する。
論文 参考訳(メタデータ) (2025-12-05T04:41:57Z) - A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models [85.30893355216486]
我々は,異なるdMLLMアーキテクチャとタスクを用いて,視覚的トークン冗長性がどのように進化するかを検討する。
本研究により, 視覚的冗長性は, 長時間のタスクを処理しながら, オフスクラッチdMLLMでのみ現れることが明らかとなった。
層スキッピングはAR-to-diffusion dMLLMの加速に有効であるのに対し、プログレッシブプルーニングやレイトステッププルーニングはストクラッチdMLLMよりも効果的である。
論文 参考訳(メタデータ) (2025-11-19T04:13:36Z) - $\mathcal{V}isi\mathcal{P}runer$: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs [26.779915891040236]
我々は,LLaVA-v1.5 7B上での視線関連注意計算の最大99%,FLOPの最大53.9%を削減できるトレーニングフリープルーニングフレームワークであるemphVisiPrunerを提案する。
さらに、モデルアーキテクチャと本質的なレイヤワイド処理ダイナミクスを整合させることにより、効率的なMLLMのトレーニングのための実用的なガイドラインを提供する。
論文 参考訳(メタデータ) (2025-10-20T06:40:17Z) - D$^2$HScore: Reasoning-Aware Hallucination Detection via Semantic Breadth and Depth Analysis in LLMs [15.665202830841046]
この研究は、モデルアーキテクチャと生成ダイナミクスの観点から幻覚検出を再考する。
textbfD$2$HScore (Dispersion and Drift-based Hallucination Score) を提案する。
5つのオープンソースのLanguage Modelと5つの広く使用されているベンチマークの実験は、D$2$HScoreが既存のトレーニング不要のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-09-15T04:28:38Z) - METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models [92.37117312251755]
プログレッシブプルーニングフレームワークであるMulti-Encoder collaboraTivE tOken pRuning (METEOR)を提案する。
マルチビジョン符号化では,各エンコーダ内の冗長トークンをランク誘導型協調トークン代入戦略により破棄する。
マルチビジョン融合では、異なるエンコーダの視覚的特徴を組み合わせながら、コラボレーティブプルーニングによるクロスエンコーダ冗長性を低減させる。
論文 参考訳(メタデータ) (2025-07-28T13:50:53Z) - LISA: A Layer-wise Integration and Suppression Approach for Hallucination Mitigation in Multimodal Large Language Models [8.122679857175315]
MLLM(Multimodal Large Language Models)は、視覚言語タスクにおいて優れているが、オブジェクト幻覚の傾向が強い。
階層的変調と多層融合による生成一貫性を向上させるtextbfLISA を提案する。
実験によると、LISAは$mathrmCHAIR_I$で最大53.6%の幻覚を減少させ、POPE F1を4.5%改善する。
論文 参考訳(メタデータ) (2025-07-25T09:48:23Z) - RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs [38.34856927170692]
MLLM(Multimodal Large Language Model)の学習用フレームワークを提案する。
Probe-Activated Dynamic FFNとHollow Attentionで構成されており、ビジュアルトークンの計算の調整可能な削減を可能にする。
実験では、デコーダのみのMLLMに特有の、実質的で、構造化され、クラスタ化された冗長性を示す。
論文 参考訳(メタデータ) (2025-01-31T11:09:16Z) - Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference [59.91176945361035]
高速推論のためにMLLMを高速化するプラグイン・アンド・プレイモジュールであるVisual Tokens Withdrawal (VTW)を紹介した。
VTWは、あるレイヤで視覚トークンを戦略的に取り除き、テキストトークンだけがその後のレイヤに関与できるようにする。
提案手法は,マルチモーダルタスクにおいて,性能を維持しながら計算オーバーヘッドを40%以上削減できる。
論文 参考訳(メタデータ) (2024-05-09T14:38:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。