論文の概要: VPRune: Efficient Training-free Pre-LLM Visual Token Pruning
- arxiv url: http://arxiv.org/abs/2609.24485v2
- Date: Tue, 22 Sep 2026 02:08:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.995976
- Title: VPRune: Efficient Training-free Pre-LLM Visual Token Pruning
- Title(参考訳): VPRune: 効率的なトレーニング不要のプリLLMビジュアルトーケンプルーニング
- Abstract要約: VPRuneは、視覚のみの多様性の選択、類似性の誘導されたトークンのリサイクル、位置保存修復からなる、トレーニングフリーのLLMプルーニングフレームワークである。
複数の視覚言語ベンチマークにおけるFastVLM-1.5Bの実験は、VPRuneが高い精度の圧縮トレードオフを達成することを示した。
- 参考スコア(独自算出の注目度): 1.001355398440049
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual token pruning is a promising approach to reducing the inference cost of large vision-language models (LVLMs), yet aggressive token reduction often causes substantial performance degradation. We identify three key factors behind this degradation: text-guided selection bias, information loss from discarded tokens, and positional distortion caused by sequence compaction. Based on these observations, we propose \textbf{VPRune}, a training-free pre-LLM pruning framework consisting of visual-only diversity selection, similarity-guided token recycling, and position-preserving restoration. Experiments on FastVLM-1.5B across multiple vision-language benchmarks demonstrate that VPRune achieves a favorable accuracy--compression trade-off, with particularly pronounced advantages under aggressive compression. Furthermore, evaluations on edge-device show that VPRune effectively reduces end-to-end inference latency while maintaining superior task performance, demonstrating its practicality for resource-constrained LVLM deployment.
- Abstract(参考訳): 視覚トークンプルーニングは、大規模視覚言語モデル(LVLM)の推論コストを削減するための有望なアプローチである。
この劣化の原因は,テキスト誘導選択バイアス,捨てられたトークンからの情報損失,シーケンスのコンパクト化による位置歪みの3つである。
これらの観測に基づいて,視覚のみの多様性選択,類似性誘導トークンのリサイクル,位置保存修復からなるトレーニング不要のプレLLMプルーニングフレームワークである「textbf{VPRune}」を提案する。
複数の視覚言語ベンチマークにおけるFastVLM-1.5Bの実験は、VPRuneが高い精度の圧縮トレードオフを達成することを示した。
さらに、エッジデバイス上での評価では、VPRuneはタスク性能を向上しつつ、エンドツーエンドの推論遅延を効果的に低減し、リソース制約付きLVLMデプロイメントの実用性を実証している。
関連論文リスト
- Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs [26.936352183867854]
CaReは,1)多方向摂動下で安定なモデル側の影響を持つアンカーを識別する摂動ロバストアンカリング,2)未選択トークンから信頼性の高い校正信号を抽出しアンカーに注入する信頼性ゲートトケンの2つの相互補完モジュールから構成される。
視覚トークンの94.4%をプルーニングする一方で、本手法は元のフルトーケン性能の96.4%を保持し、未使用バニラモデルと比較して最大2.30倍高速なエンドツーエンド推論速度を実現する。
論文 参考訳(メタデータ) (2026-07-30T05:36:29Z) - ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs [77.57757084153083]
本稿では,効率的なMLLMを実現するために,Rectified Attention を用いたエントロピー誘導型ビジュアルトークン解析フレームワーク ERA を提案する。
ERAはDEP(Dual-view Entropy Pruning)、BTR(Bias-Aware Tokencycle)、LAR(Logit-Reserving Attention Rectification)の3つの重要な構成要素から構成される。
論文 参考訳(メタデータ) (2026-06-30T17:20:29Z) - Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs [7.371189496638082]
本稿では,カラムサブセット選択問題としてトークンプルーニングを再構成する部分空間再構成手法であるSPAREを紹介する。
SPAREはタスクに強い利得を伴い、常に最先端のパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-17T04:45:10Z) - Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models [52.78477729846771]
本稿では,COAST(Contrastive Adaptive Semantic Token Pruning)について紹介する。
COASTはトークン予算をまたいだ強力なプルーニングベースラインを一貫して上回り、複数のLVLMファミリをまたいだ一般化を実現している。
論文 参考訳(メタデータ) (2026-05-10T09:07:04Z) - RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models [24.3914653184824]
LVLM(Large Vision-Language Models)は、言語デコーダによって処理される膨大な数の視覚トークンによって、推論の禁止コストに悩まされる。
既存のプルーニング法は、視覚トークンの可逆的な除去が、事前訓練されたフルトケン状態から逸脱した隠れ状態の分布シフトを引き起こすため、大きな性能劣化を引き起こすことが多い。
本稿では,累積的視覚トークンプルーニングと遅延修復機構を統合した一貫性表現プルーナを提案する。
論文 参考訳(メタデータ) (2026-04-04T13:31:45Z) - ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models [59.94664910790462]
ResPruneは、大規模な視覚言語モデルのためのトレーニング不要のビジュアルトークンプルーニングフレームワークである。
視覚トークンのコンパクトだが情報に富むサブセットを選択する。
これは、計算、メモリ消費、推論遅延を効果的に削減する。
論文 参考訳(メタデータ) (2026-03-22T07:44:45Z) - SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass [20.7003663809766]
視覚トークンプルーニングは、視覚言語モデルの計算コストを削減するための有望なアプローチである。
我々は、選択されていない視覚トークンを保存し、その後のプルーニングステージに転送する、バイパスと呼ばれる新しいプルーニングパラダイムを導入する。
このパラダイムに基づいて,強力な視覚トークン選択機能を備えたモデル固有の層でプルーニングを行う,単純かつトレーニング不要なSwiftVLMを提案する。
論文 参考訳(メタデータ) (2026-02-03T05:42:51Z) - A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models [94.49953824684853]
人間の認知に触発された動的刈り取りフレームワークGlimpsePruneを導入する。
データ駆動の 'glimpse' を受け取り、応答生成の前に単一のフォワードパスで無関係な視覚トークンをプルーンする。
強化されたGlimpsePrune+は、同様に高いプルーニング率を維持しながら、ベースライン性能の110%を達成する。
論文 参考訳(メタデータ) (2025-08-03T02:15:43Z) - Does Acceleration Cause Hidden Instability in Vision Language Models? Uncovering Instance-Level Divergence Through a Large-Scale Empirical Study [44.170933007736984]
VLM(Vision-Language Models)は、実用的展開において強力だが計算集約的な手法である。
現在のアクセラレーション評価は主に、重要な問題を見越して、パフォーマンスの最小限のパフォーマンス劣化を目標としています。
これは、AIベースの疾患診断のように、特定の既知の状況に対して常に正しい回答が最重要である、安定性中心の産業アプリケーションにとって不可欠である。
論文 参考訳(メタデータ) (2025-03-09T22:16:48Z) - Reducing Predictive Feature Suppression in Resource-Constrained
Contrastive Image-Caption Retrieval [65.33981533521207]
我々は、リソース制約のあるICR手法における予測的特徴抑圧を減らすアプローチを提案する:潜在目標デコーディング(LTD)
LTDは、汎用文エンコーダの潜時空間で入力キャプションを再構成し、画像及びキャプションエンコーダが予測的特徴を抑制するのを防止する。
実験の結果,入力空間における入力キャプションの再構成とは異なり,LTDはリコール@k,r精度,nDCGスコアを高くすることで,予測的特徴抑制を低減できることがわかった。
論文 参考訳(メタデータ) (2022-04-28T09:55:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。