論文の概要: Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2607.28341v1
- Date: Thu, 30 Jul 2026 15:07:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.619233
- Title: Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models
- Title(参考訳): マルチモーダル大規模言語モデルにおける学習自由化のためのトークン傾向のキャプチャ
- Abstract要約: 本稿では,局所スナップショット決定から時間軌道モデリング問題へのプルーニングを高める新しいフレームワークであるTrend-Aware Pruningを提案する。
これにより、"ラトブルーミング"トークンを選択的に再活性化する動的修正機構が実現される。
- 参考スコア(独自算出の注目度): 86.02826269126308
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While visual token pruning is essential for efficient Multimodal Large Language Models (MLLMs), existing training-free methods suffer from a critical limitation: they rely on static, instantaneous heuristics to perform irreversible filtering. This approach ignores the hierarchical nature of MLLMs, where token importance often evolves dynamically rather than remaining fixed across layers. Consequently, tokens essential for deep-layer reasoning are often prematurely discarded by shallow-layer estimates. To address this, we propose Trend-aware Pruning, a novel framework that elevates pruning from a local snapshot decision to a temporal trajectory modeling problem. Instead of relying on isolated scores, our method captures the momentum of attention flow. This enables a dynamic rectification mechanism that selectively reactivates "late-blooming" tokens, those initially undervalued but exhibiting rising semantic importance, thereby preventing the loss of critical visual cues. Extensive experiments demonstrate that our approach achieves a superior efficiency-performance trade-off across diverse multimodal tasks. Notably, it reduces visual tokens by over 77.8%, retaining only approximately 23 tokens in the final layer while maintaining competitive performance, offering a robust and reversible solution for high-efficiency multimodal inference.
- Abstract(参考訳): ビジュアルトークンのプルーニングは、効率的なマルチモーダル大言語モデル(MLLM)にとって不可欠であるが、既存のトレーニングフリーメソッドは、非可逆的なフィルタリングを実行するために静的で即時的なヒューリスティックに依存している。
このアプローチはMLLMの階層的な性質を無視しており、トークンの重要度は層間で固定されるのではなく、動的に進化することが多い。
したがって、深層推論に不可欠なトークンは、しばしば浅層推定によって早期に破棄される。
そこで我々は,局所的なスナップショット決定から時間軌道モデリング問題へのプルーニングを高める新しいフレームワークであるTrend-Aware Pruningを提案する。
分離されたスコアに頼る代わりに,本手法は注目フローのモーメントを捉える。
これにより、"ラトブルーミング"トークンを選択的に再活性化する動的修正機構が実現される。
大規模な実験により,本手法は多様なマルチモーダルタスクにまたがる優れた効率・性能トレードオフを実現することが示された。
特に、視覚トークンを77.8%以上削減し、競合性能を維持しながら最終層に約23個のトークンしか保持せず、高効率なマルチモーダル推論のための堅牢で可逆的なソリューションを提供する。
関連論文リスト
- One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs [18.48496973561215]
LVLM(Large Vision-Language Models)は様々なマルチモーダルタスクにまたがって大きな成功を収めているが、その実際の展開は長い視覚トークンから生じる計算負担によって制約されている。
本稿では,従来の静的トークンプルーニングパラダイムから切り離された新しいフレームワークであるAdaptive Layer-wise Visual Token Selection (ALVTS)を提案する。
89%のトークン圧縮比で、ALVTSはオリジナルのモデルの96.7%の精度を維持しており、LVLM推論の効率と精度のトレードオフが優れている。
論文 参考訳(メタデータ) (2026-06-12T08:58:58Z) - Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs [89.7106332677868]
意味進化から空間的相互作用を分離する学習自由推論パラダイムであるVisual-Skipを提案する。
V-Skipは、ブロックワイドの空間性を達成するために、冗長な視覚的注意を効果的に回避し、様々なMLLM間で94.16%から100.31%のパフォーマンス維持を維持している。
論文 参考訳(メタデータ) (2026-06-07T08:32:13Z) - A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning [49.61652671596548]
「多像幻覚推論」では、前頭と時頭クエリ間の大規模なパフォーマンス低下は、真に理解するのではなく、表面的なショートカットへの依存を示す。
これを軽減するために、我々は、チェーンステップへの詳細な推論と決定的な判断に基づく、時間的連鎖構築という新しいデータセットを開発する。
実験により,本手法は精度を向上するだけでなく,70%以上から6.53%まで,前向きのパフォーマンスギャップも改善することが示された。
論文 参考訳(メタデータ) (2026-04-12T07:48:44Z) - SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass [20.7003663809766]
視覚トークンプルーニングは、視覚言語モデルの計算コストを削減するための有望なアプローチである。
我々は、選択されていない視覚トークンを保存し、その後のプルーニングステージに転送する、バイパスと呼ばれる新しいプルーニングパラダイムを導入する。
このパラダイムに基づいて,強力な視覚トークン選択機能を備えたモデル固有の層でプルーニングを行う,単純かつトレーニング不要なSwiftVLMを提案する。
論文 参考訳(メタデータ) (2026-02-03T05:42:51Z) - Forest Before Trees: Latent Superposition for Efficient Visual Reasoning [61.29300723302152]
レーザーは動的ウィンドウアライメント学習(DWAL)を通して視覚的推論を再構成する新しいパラダイムである
レーザーは遅延推論法で最先端のパフォーマンスを達成し、強いベースラインのモネを平均5.03%上回る。
論文 参考訳(メタデータ) (2026-01-11T08:30:49Z) - Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models [16.540220733551823]
VLM(Large Vision-Language Models)は、強力なマルチモーダル推論を実現するが、冗長な視覚トークンから重い推論コストを発生させる。
注意に基づく手法は、しばしばレイヤやヘッド間で不安定な生の注意スコアに依存する。
簡単な直感に基づいて構築されたトレーニング不要のフレームワークとして,我々の提案する。
論文 参考訳(メタデータ) (2025-09-29T14:20:05Z) - GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models [5.025353943896242]
GreedyPruneは、セマンティックサリエンシと視覚的多様性を最適化するために設計された、トレーニング不要のビジュアルトークンプルーニングアルゴリズムである。
GreedyPruneは様々なマルチモーダルタスクやモデルにまたがって最先端の精度を実現し、エンドツーエンドの推論遅延を大幅に低減することを示す。
論文 参考訳(メタデータ) (2025-06-16T07:21:11Z) - Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation [85.82112629564942]
本稿では,離散トークンのモデリングをシンプルに保ちながら,連続トークンの強力な表現能力を維持するTokenBridgeを提案する。
本稿では,各特徴次元を独立に離散化し,軽量な自己回帰予測機構と組み合わせた次元ワイド量子化戦略を提案する。
提案手法は,標準的なカテゴリー予測を用いて,連続的手法と同等に再現および生成品質を実現する。
論文 参考訳(メタデータ) (2025-03-20T17:59:59Z) - PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection [68.8373788348678]
ビジュアルインストラクションチューニングは、事前訓練されたマルチモーダル大言語モデルに人間の指示に従うように適応する。
PRISMは、効率的な視覚的命令選択のための最初のトレーニング不要のフレームワークである。
データ選択とモデルチューニングのエンドツーエンドの時間を従来のパイプラインの30%に短縮する。
論文 参考訳(メタデータ) (2025-02-17T18:43:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。