論文の概要: Multi-Image Visual Token Pruning in Large Visual Language Models
- arxiv url: http://arxiv.org/abs/2608.26806v2
- Date: Tue, 01 Sep 2026 07:05:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.521959
- Title: Multi-Image Visual Token Pruning in Large Visual Language Models
- Title(参考訳): 大規模視覚言語モデルにおけるマルチイメージ視覚トーケンプルーニング
- Authors: Rongyang Zhang, Chengqiang Lu, Cong Li, Hongchao Gu, Tingjia Shen, Xuyang Zhi, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Hao Wang, Enhong Chen,
- Abstract要約: 本稿では,多種多様な視覚言語モデル(LVLM)に適用可能な,トレーニングフリーで適応型ビジュアルトーケンプルーニング(AVTP)フレームワークを提案する。
種々のLVLMにおける視覚的注意分布の実験的解析に基づいて,プルーニング層を戦略的に決定する。
AVTPの有効性とロバスト性を示すため,様々なLVLMに対して広範囲にわたる実験を行った。
- 参考スコア(独自算出の注目度): 54.54306404596005
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the growing demand for processing multiple image sequences in real-world applications, various visual token pruning methods have emerged to mitigate the computational and context length constraints faced by Large Vision Language Models (LVLMs). However, most existing pruning approaches rely on static strategies that struggle to adapt across different architectural LVLMs and multi-image scenarios, and are additionally constrained by their dependence on attention computations that are incompatible with efficient techniques like FlashAttention. To address these limitations, we propose a training-free, Adaptive Visual Token Pruning (AVTP) framework, applicable to diverse LVLM architectures. We strategically determine pruning layers based on empirical analysis of visual attention distributions across various LVLMs, and implement adaptive pruning ratios in multi-image contexts where images of higher importance retain proportionally more tokens. We conduct extensive experiments across different LVLMs to demonstrate the effectiveness and robustness of AVTP. Specifically, Qwen3VL-8B achieves 2 times inference speedup while maintaining 96.1\% of its original accuracy on multiple multi-image benchmarks, InternVL3.5-8B retains 94.1\% accuracy, and LLaVA-OV-7B even exceeds its original baseline performance. Our code is available at \href{https://github.com/zry13/AVTP}{this link}.
- Abstract(参考訳): 実世界のアプリケーションで複数の画像シーケンスを処理する必要性が高まっているため、LVLM(Large Vision Language Models)が直面する計算およびコンテキスト長制約を軽減するために、様々な視覚トークンプルーニング法が出現している。
しかし、既存のプルーニングアプローチのほとんどは、異なるアーキテクチャのLVLMやマルチイメージシナリオに適応するのに苦労する静的戦略に依存しており、また、FlashAttentionのような効率的な手法と互換性のない注意計算に依存しているため、さらに制限されている。
これらの制約に対処するために,多様なLVLMアーキテクチャに適用可能な,トレーニングフリーで適応型ビジュアルトーケン・プルーニング(AVTP)フレームワークを提案する。
我々は,様々なLVLMにおける視覚的注意分布の実験的解析に基づいてプルーニング層を戦略的に決定し,より重要度の高い画像が比例的により多くのトークンを保持するマルチイメージコンテキストにおいて適応プルーニング比を実装した。
AVTPの有効性とロバスト性を示すため,様々なLVLMに対して広範囲にわたる実験を行った。
具体的には、Qwen3VL-8Bは、複数のマルチイメージベンチマークで元の精度の96.1\%を維持し、InternVL3.5-8Bは94.1\%の精度を維持し、LLaVA-OV-7Bは元のベースライン性能を超えている。
私たちのコードは \href{https://github.com/zry13/AVTP}{this link} で利用可能です。
関連論文リスト
- IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs [11.254129271889035]
視覚トークンのプルーニングはMLLM推論を加速させる重要な手法として登場した。
IDPrunerは最先端のパフォーマンスを実現し、様々なアーキテクチャやタスクにまたがる優れた一般化を実現している。
論文 参考訳(メタデータ) (2026-02-10T11:20:24Z) - ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution [71.69364653858447]
既存のMLLM(Multimodal Large Language Models)は、画像入力によって導入された視覚トークンの追加により、推論コストが増大する。
本研究では,異なる数の視覚トークンを用いて,様々な複雑度の画像を表現可能な,新しい学習アルゴリズムであるVisual Consistency Learning (ViCO)を提案する。
実験の結果,モデルの知覚,推論,OCR能力を維持しつつ,視覚トークンの数を最大50%削減できることがわかった。
論文 参考訳(メタデータ) (2025-10-14T17:58:10Z) - Vision-Free Retrieval: Rethinking Multimodal Search with Textual Scene Descriptions [81.33113485830711]
視覚言語モデルに対して,視覚のない単一エンコーダ検索パイプラインを導入する。
VLLM生成した構造化画像記述の助けを借りてテキストからテキストへ移行する。
提案手法は,複数検索および構成性ベンチマークにおいて,最先端のゼロショット性能を実現する。
論文 参考訳(メタデータ) (2025-09-23T16:22:27Z) - CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models [75.88232735646018]
LVLM(Large Vision-Language Models)は、画像やビデオから抽出されたテキストトークンとビジョントークンからなるマルチモーダル入力を処理する。
既存の手法は冗長な視覚トークンを創りだそうとしており、視覚表現のかなりの冗長性を明らかにしている。
我々は,LVLMで処理される前に冗長な視覚トークンを予測・削除するために,Plug-and-Play Pruning Module (PPM) を用いるレイヤワイズなコンテキスト対応型視覚トークンプルーニング手法であるCoViPALを提案する。
論文 参考訳(メタデータ) (2025-08-24T07:47:00Z) - Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization [30.73986620551153]
LVLM(Large Vision-Language Models)は、イメージを数千のトークンにエンコードすることで、マルチモーダルタスク全体で素晴らしいパフォーマンスを示している。
従来のアプローチでは、トークンのプルーニングによって画像トークンの数を減らそうとしていた。
本稿では,視覚トークンをプルーニングするためのプラグイン・アンド・プレイ方式であるBa balanced Token Pruning (BTP)を提案する。
論文 参考訳(メタデータ) (2025-05-28T07:00:50Z) - AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning [19.68349294206012]
大規模言語モデル(LLM)は、画像やビデオなどの視覚的データの強力な理解を示すマルチモーダルLLMの作成を可能にする。
多様な効率要件を満たすマルチモーダルLCMの学習自由適応推論法を提案する。
論文 参考訳(メタデータ) (2024-12-04T11:47:57Z) - Perceiver-VL: Efficient Vision-and-Language Modeling with Iterative
Latent Attention [100.81495948184649]
本稿では,長いビデオやテキストなどの高次元マルチモーダル入力を効率的に処理する視覚・言語フレームワークPerceiver-VLを提案する。
我々のフレームワークは、多くの最先端のトランスフォーマーベースモデルで使用される自己注意の二次的な複雑さとは対照的に、線形複雑性でスケールする。
論文 参考訳(メタデータ) (2022-11-21T18:22:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。