論文の概要: TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
- arxiv url: http://arxiv.org/abs/2606.27161v1
- Date: Thu, 25 Jun 2026 15:29:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.334394
- Title: TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference
- Title(参考訳): TOPS: 効率的なMLLM推論のためのToken Optimal Preservation Setの構成による第1原理のビジュアルトーケンプルーニング
- Authors: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang,
- Abstract要約: マルチモーダル大言語モデル(MLLM)は強力なマルチモーダル推論機能を実現しているが、その効率は多数の視覚トークンによって制限されている。
Visual token pruningは自然なソリューションを提供するが、既存のメソッドは不完全である。
各種MLLMに適用可能なトレーニングフリーでモデルに依存しないプルーニングモジュールTOPSを提案する。
- 参考スコア(独自算出の注目度): 54.41143483594129
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) have achieved strong multimodal reasoning capabilities, but their efficiency is limited by the large number of visual tokens, which introduces substantial computational overhead. Visual token pruning offers a natural solution, yet existing methods are imperfect: attention-based criteria tend to retain redundant tokens, while diversity-based criteria are often agnostic to user instructions. Even methods that combine multiple criteria still lack a principled formulation of the intrinsic objective of token pruning. In this paper, we revisit visual token pruning from a first-principles perspective and formulate it as constructing Token Optimal Preservation Sets. Through a top-down information-theoretic analysis, we identify three fundamental principles for effective token selection: Task Relevance, Information Coverage, and Semantic Diversity. Based on these principles, we propose TOPS, a training-free and model-agnostic pruning module that can be applied to various MLLMs. Extensive experiments on 7 MLLM backbones and 14 benchmarks demonstrate that TOPS outperforms prior methods under diverse pruning settings. Notably, on LLaVA-NeXT, TOPS removes 77.8% of visual tokens while preserving 100.0% and 100.6% performance on its 7B and 13B models, respectively, suggesting that pruning redundant visual tokens can sometimes mitigate hallucination and inspire future lightweight MLLM design.
- Abstract(参考訳): マルチモーダル大言語モデル (MLLM) は強力なマルチモーダル推論機能を実現しているが、その効率は大量の視覚トークンによって制限されており、計算オーバーヘッドがかなり大きい。
注意ベースの基準は冗長なトークンを保持する傾向があり、多様性ベースの基準はユーザ指示に従わないことが多い。
複数の基準を組み合わせた方法でさえも、トークンプルーニングの本質的な目的の原則的な定式化を欠いている。
本稿では,第1原理の観点から視覚的トークンプルーニングを再考し,これをトークン保存セットの構築として定式化する。
トップダウン情報理論分析により,効果的なトークン選択の基本的な原則として,タスク関連性,情報カバレッジ,セマンティック多様性の3つを同定する。
これらの原則に基づいて,各種MLLMに適用可能なトレーニングフリーでモデルに依存しないプルーニングモジュールTOPSを提案する。
7つのMLLMバックボーンと14のベンチマークに関する大規模な実験は、TOPSが様々なプルーニング設定下で先行メソッドより優れていることを示した。
特に、LLaVA-NeXTでは、TOPSは77.8%の視覚トークンを除去し、それぞれ7Bモデルと13Bモデルで100.0%と100.6%のパフォーマンスを維持している。
関連論文リスト
- Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs [7.371189496638082]
本稿では,カラムサブセット選択問題としてトークンプルーニングを再構成する部分空間再構成手法であるSPAREを紹介する。
SPAREはタスクに強い利得を伴い、常に最先端のパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-17T04:45:10Z) - QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models [18.353831760548267]
MLLM(Multimodal Large Language Models)は、強力な推論能力を示しているが、その高い計算とメモリコストは、リソース制約された設定でのデプロイメントを妨げる。
ポストトレーニング量子化(PTQ)とビジョントークンプルーニングは標準的な圧縮技術であるが、通常は独立した最適化として扱われる。
本稿では,これらの2つの手法が強く結合していることを示し,PTQ最適化MLLMに対して意味に基づくトークンプルーニングを適用することにより,数値安定性に重要なアクティベーションアウトレーヤを廃止し,低ビット状態における量子化誤差を悪化させることができることを示す。
量子化対応型視覚トークンプルーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-03T07:32:07Z) - Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs [51.60575965819268]
本稿では,この相互依存を明示的にモデル化するToken-Reweighting(ToR)戦略を提案する。
ToRは複数のマルチモーダル推論ベンチマークで一貫したパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-03-26T06:25:27Z) - IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs [11.254129271889035]
視覚トークンのプルーニングはMLLM推論を加速させる重要な手法として登場した。
IDPrunerは最先端のパフォーマンスを実現し、様々なアーキテクチャやタスクにまたがる優れた一般化を実現している。
論文 参考訳(メタデータ) (2026-02-10T11:20:24Z) - ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models [7.7352936204066]
本稿では,タスク関連性と情報多様性のバランスとして,視覚トークンプルーニングをモデル化する新しいゼロショット手法を提案する。
本手法は,精度の低下を最小限に抑えて,最先端技術に適合または超越した性能を実現する。
これらのゲインには、GPUメモリフットプリントの大幅な削減と推論レイテンシが伴っている。
論文 参考訳(メタデータ) (2025-10-20T06:18:47Z) - FrugalPrompt: Reducing Contextual Overhead in Large Language Models via Token Attribution [3.4666771782038652]
大規模言語モデル(LLM)は、その恒星の性能の大部分を入力コンテキストの拡大に負っているが、そのような冗長性は金銭的コスト、炭素フットプリント、推論時間の遅延を膨らませている。
本稿では,LLMのための新しいプロンプト圧縮フレームワークであるFrugalPromptを紹介する。
我々は,4つのNLPタスク(感性分析,コモンセンスQA,要約,数学的推論)にまたがるアプローチを評価する。
論文 参考訳(メタデータ) (2025-10-18T10:22:13Z) - VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization [70.98122339799218]
LMM(Large Multimodal Models)は、多数の視覚トークンを微粒な視覚情報に活用することにより、視覚言語タスクに優れる。
推論中の視覚トークンを減らすことを目的とした以前の研究は、一般的に、視覚のみのトークンや視覚言語トークンの注意スコアから得られた重要マップを利用して、1つまたは複数のプルーニング段階にわたってトークンをプルーンする。
重要地図導出プロセスとリサイクル機構を備えたプログレッシブプルーニングモジュールを導入したトークンプルーニングフレームワークであるVFlowOptを提案する。
実験により、VFlowOptは、同等のパフォーマンスを維持しながら、90%のビジュアルトークンをプルークでき、KVキャッシュメモリが89%削減され、3.8になった。
論文 参考訳(メタデータ) (2025-08-07T09:47:21Z) - The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models [69.798277882245]
大規模言語モデルの推論効率を向上させるために,Unsupervised Prefix Fine-Tuning (UPFT)を導入した。
UPFTはラベル付きデータや徹底的なサンプリングの必要性を取り除く。
実験の結果,UPFTは教師付き手法の性能と一致していることがわかった。
論文 参考訳(メタデータ) (2025-03-04T18:56:03Z) - Enhancing Item Tokenization for Generative Recommendation through Self-Improvement [67.94240423434944]
生成レコメンデーションシステムは大規模言語モデル(LLM)によって駆動される
現在のアイテムトークン化手法には、テキスト記述、数値文字列、離散トークンのシーケンスの使用が含まれる。
自己改善アイテムトークン化手法を提案し,LLMがトレーニングプロセス中に独自のアイテムトークン化を洗練できるようにする。
論文 参考訳(メタデータ) (2024-12-22T21:56:15Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。