論文の概要: STAR-Pro: Stage-Wise Token Adaptive Reduction with Progressive Refinement for Efficient Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.05916v1
- Date: Sat, 05 Sep 2026 06:18:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.167693
- Title: STAR-Pro: Stage-Wise Token Adaptive Reduction with Progressive Refinement for Efficient Large Vision-Language Models
- Title(参考訳): STAR-Pro:高能率ビジョンランゲージモデルのためのプログレッシブリファインメントによるステージワイズトークン適応化
- Abstract要約: 大規模視覚言語モデル(LVLM)は強力なマルチモーダル理解を実現するが、処理する数百から数千の視覚トークンは計算オーバーヘッドを課す。
視覚的トークンプルーニングの2つの相補的解析を行う。
視覚的トークンプルーニングのためのトレーニング不要な2段階フレームワークSTAR-Proを提案する。
- 参考スコア(独自算出の注目度): 54.273344678561024
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large vision-language models (LVLMs) achieve strong multimodal understanding, but the hundreds to thousands of visual tokens they process impose substantial computational overhead, motivating training-free visual token pruning. In this work, we conduct two complementary analyses of visual token pruning. First, we measure the feature-space coverage of tokens retained before cross-modal fusion and find that aggressive pruning discards substantial visual information. Second, we track text-to-visual attention across decoder layers and find that the visual tokens considered important change substantially with depth, making one-shot pruning decisions unreliable. Together, these findings show that effective pruning should preserve broad visual coverage before fusion and progressively refine the retained tokens as cross-modal evidence evolves during fusion. We therefore propose STAR-Pro (STage-Wise Adaptive Token Reduction with Progressive Refinement), a training-free two-stage framework. Its Adaptive Stage applies pivoted QR to construct an over-budget feature-coverage candidate pool, while its Progressive Stage uses evolving text-to-visual attention at selected decoder layers to prune a nested survivor set under a target layer-average token budget. Extensive experiments across seven LVLMs spanning multiple architectures and 18 image and video benchmarks demonstrate the effectiveness of STAR-Pro under aggressive pruning. On LLaVA-Video-7B, STAR-Pro reduces visual tokens by 90.5%, retains 92.7% of baseline performance, and achieves a $2.24\times$ measured inference speedup. Code is available at https://github.com/EasonAI-5589/starpro.
- Abstract(参考訳): 大規模視覚言語モデル(LVLM)は、強力なマルチモーダル理解を実現するが、処理される数百から数千の視覚トークンは、かなりの計算オーバーヘッドを伴い、トレーニング不要な視覚トークンのプルーニングを動機付けている。
本研究では,視覚的トークンプルーニングの2つの相補的解析を行う。
まず,クロスモーダル融合前のトークンの特徴空間カバレッジを測定し,アグレッシブプルーニングが実質的な視覚情報を捨てることを見出した。
第二に、デコーダ層をまたいでテキストと視覚の注意をトラッキングし、視覚トークンが奥行きに大きく変化していると判断し、ワンショットプルーニングの判断が信頼性を損なうことを発見した。
これらの結果から,有効プルーニングは融合前に広範囲の視覚的カバレッジを保ち,融合中に相互に作用する証拠が進化するにつれて,留置トークンを徐々に洗練していくことが示唆された。
そこで本研究では,STAR-Pro(Stage-Wise Adaptive Token Reduction with Progressive Refinement)を提案する。
またAdaptive Stageでは、選択したデコーダ層でテキストから視覚への注意を進化させ、ターゲット層平均トークン予算の下でネストされたサバイバルセットをプルークする。
複数のアーキテクチャにまたがる7つのLVLMと18のイメージおよびビデオベンチマークにわたる大規模な実験は、攻撃的なプルーニング下でのSTAR-Proの有効性を実証している。
LLaVA-Video-7Bでは、STAR-Proは視覚トークンを90.5%削減し、92.7%のベースライン性能を維持し、2.24\times$測定推論スピードアップを達成する。
コードはhttps://github.com/EasonAI-5589/starproで入手できる。
関連論文リスト
- PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference [15.233755808671871]
既存の視覚トークンプルーニング法には2つの基本的な制限がある。
ほとんどのアプローチは、ビジョン後エンコーダのみを動作させ、視覚符号化フェーズのかなりの遅延は、最適化されないままである。
視覚エンコーダと大規模言語モデルの両方を高速化するフレームワークである PACE を提案する。
論文 参考訳(メタデータ) (2026-08-27T14:52:09Z) - PIO-FVLM: Rethinking Training-Free Visual Token Reduction for VLM Acceleration from an Inference-Objective Perspective [59.24570811503256]
本稿では,視覚モデル(VLM)における冗長な視覚トークンを減らし,推論を高速化するPIO-FVLMを提案する。
提案されているPIO-FVLMは、トレーニングフリーで、FlashAttentionと互換性があり、実用的なアプリケーションやデプロイメントに親しみやすい。
LLaVA-Next-7Bでは、PIO-FVLMは視覚トークンの11.1%しか保持していないが、オリジナルのパフォーマンスの97.2%を維持している。
論文 参考訳(メタデータ) (2026-02-04T15:33:10Z) - Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning [82.39668822222386]
ビジョントークンプルーニングは、効率的なビジョン言語モデル(VLM)のための効果的なアクセラレーション手法であることが証明された。
空間的整合性を維持しつつ,効率的な特徴集約を実現するための2段階のトークンプルーニングフレームワークである$textNwa$を提案する。
実験によると、textNwa$は複数のVQAベンチマーク(94%から95%)でSOTAのパフォーマンスを達成し、視覚的グラウンドタスク(7%から47%)を大幅に改善している。
論文 参考訳(メタデータ) (2026-02-03T00:51:03Z) - All You Need Are Random Visual Tokens? Demystifying Token Pruning in VLLMs [43.80391827200227]
ディープレイヤでは、既存のトレーニングフリープルーニング手法はランダムプルーニングに勝る。
ビジュアルトークンは、ネットワーク深度の増加に伴い、徐々にサリエンスを失う。
深層層での単純なランダムプルーニングは性能と効率のバランスを効果的に表す。
論文 参考訳(メタデータ) (2025-12-08T14:16:01Z) - HIVTP: A Training-Free Method to Improve VLMs Efficiency via Hierarchical Visual Token Pruning Using Middle-Layer-Based Importance Score [14.857585045577165]
HIVTPは、VLM(Vision-Language Models)推論効率を改善するためのトレーニング不要の手法である。
本稿では,グローバルかつ局所的に重要な視覚トークンを保持するための階層的視覚トークンプルーニング手法を提案する。
HIVTPは, LLaVA-v1.5-7BとLLaVA-Next-7BのTTFTを最大50.0%, 55.1%削減できることを示した。
論文 参考訳(メタデータ) (2025-09-28T05:53:39Z) - CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models [75.88232735646018]
LVLM(Large Vision-Language Models)は、画像やビデオから抽出されたテキストトークンとビジョントークンからなるマルチモーダル入力を処理する。
既存の手法は冗長な視覚トークンを創りだそうとしており、視覚表現のかなりの冗長性を明らかにしている。
我々は,LVLMで処理される前に冗長な視覚トークンを予測・削除するために,Plug-and-Play Pruning Module (PPM) を用いるレイヤワイズなコンテキスト対応型視覚トークンプルーニング手法であるCoViPALを提案する。
論文 参考訳(メタデータ) (2025-08-24T07:47:00Z) - Rethinking Visual Token Reduction in LVLMs under Cross-modal Misalignment [38.04426918886084]
視覚言語モデル(LVLM)は、視覚入力をパッチレベルのトークンの密度の高いシーケンスとしてエンコードし、微細なセマンティクスをキャプチャする。
これまでは、大型言語モデル(LLM)の前か中のいずれかで、視覚トークンの削減を検討してきた。
トレーニングフリーで視覚のみのプルーニングフレームワークであるVisionDropを導入し、モーダル内(視覚から視覚への)注目に基づいて情報的視覚トークンを選択する。
論文 参考訳(メタデータ) (2025-06-27T14:55:40Z) - VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models [57.2662376527586]
VScanは2段階のビジュアルトークン削減フレームワークである。
1)グローバルスキャンとローカルスキャンを視覚的エンコーディング中にマージすることで,(2)言語モデルの中間層にプルーニングを導入する。
VScanはプリフィルの2.91$times$スピードアップとFLOPの10$times$ダウンを実現し、オリジナルのパフォーマンスの95.4%を維持した。
論文 参考訳(メタデータ) (2025-05-28T17:59:08Z) - ToDRE: Visual Token Pruning via Diversity and Task Awareness for Efficient Large Vision-Language Models [59.47738955960352]
ToDREは、2段階でトレーニング不要なトークン圧縮フレームワークである。
トークンの多様性とトークン-タスク関連性に基づいてトークンをプルーニングすることで、優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-05-24T15:47:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。