論文の概要: DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.04496v1
- Date: Wed, 05 Aug 2026 06:32:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.756543
- Title: DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models
- Title(参考訳): DIVE:効率的な視覚言語モデルのための動的反復的視覚エビデンス構築
- Authors: Chen Zhong, Xiao An, Zijie Wang, Jiepan Li, Guangyi Yang, Wei He,
- Abstract要約: 視覚言語モデルの視覚入力は、しばしばテキストよりもかなり長いトークンシーケンスに符号化される。
近年の手法では、トークンの重要度を判定し、低スコアのトークンを1回のパスでプルーニングすることで、このボトルネックに対処している。
この知見に触発されたDIVEは、動的エビデンス構築として視覚障害者のプルーニングをリキャストする、トレーニング不要のフレームワークである。
- 参考スコア(独自算出の注目度): 13.866355425347384
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual inputs in vision-language models (VLMs) are often encoded into substantially longer token sequences than text, making visual tokens a major bottleneck for efficient inference. Abundant recent methods address this bottleneck by scoring token importance and pruning low-scoring tokens in a single pass. However, one-shot scoring is insufficient because a token's prompt-relevant usefulness depends on the evidence already retained. Motivated by this insight, we introduce DIVE (Dynamic Iterative Visual Evidence Construction), a training-free framework that recasts visual-token pruning as dynamic evidence construction. DIVE repeatedly selects the remaining token with the highest residual-conditioned score, updates the visual and prompt residuals to discount the evidence already explained, and re-evaluates the remaining tokens. This select-update-re-evaluate process builds a retained set of complementary, prompt-relevant evidence. Experiments across eight image-understanding benchmarks show that DIVE consistently preserves performance across token budgets. With an 88.9% reduction in visual tokens, DIVE retains 98.2% of the uncompressed model's average performance. Code is available at https://github.com/Zhong-Chenchen/DIVE.git.
- Abstract(参考訳): 視覚言語モデル(VLM)の視覚入力は、しばしばテキストよりもかなり長いトークンシーケンスに符号化される。
異常な最近の手法では、トークンの重要度を判定し、1回のパスで低スコアのトークンをプルーニングすることで、このボトルネックに対処している。
しかし、トークンの急進的な有用性は、既に保持されている証拠に依存するため、ワンショットスコアは不十分である。
この知見に触発されたDIVE(Dynamic Iterative Visual Evidence Construction, 動的反復的視覚エビデンス構築)は, 動的エビデンス構築として視覚的なプルーニングをリキャストするトレーニング不要のフレームワークである。
DIVEは、残ったトークンを最も高い残響スコアで繰り返し選択し、視覚的およびプロンプト的残響を更新して、既に説明されている証拠を割引し、残りのトークンを再評価する。
この選択更新-再評価プロセスは、相補的で急激な証拠の維持されたセットを構築する。
8つの画像理解ベンチマークでの実験では、DIVEはトークンの予算をまたいだパフォーマンスを一貫して維持している。
88.9%の減少率で、DIVEは圧縮されていないモデルの平均性能の98.2%を維持している。
コードはhttps://github.com/Zhong-Chenchen/DIVE.git.comで入手できる。
関連論文リスト
- TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models [6.132992639292891]
VLM(Vision-Language Models)は、様々なタスクにまたがる印象的な機能を示しているが、その計算コストはモデルに供給される多数の視覚トークンに支配されている。
本稿では,VLMの適応的視覚トークン削減のためのプラグイン・アンド・プレイフレームワークであるTORINOを紹介する。
論文 参考訳(メタデータ) (2026-07-06T01:43:09Z) - Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models [56.11961584000622]
MLLM(Multimodal large language model)は、しばしば細粒度の視覚的推論において失敗する。
質問条件付き視覚的エビデンス浄化フレームワークであるLatEnt Noise maSk (Lens)を提案する。
視覚トークンが現在の質問をサポートし、復号時にそれらを保存するレンズスコア。
論文 参考訳(メタデータ) (2026-06-29T11:44:09Z) - OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning [24.164883144694656]
OccamTokenは、絶対トークンランキングを登録された相対的エビデンステストに置き換える、トレーニング不要のフレームワークである。
我々はOccamTokenが、追加のトレーニングなしで精度と効率のトレードオフを継続的に改善していることを示します。
論文 参考訳(メタデータ) (2026-05-28T09:20:47Z) - Focus-Scan-Refine: From Human Visual Perception to Efficient Visual Token Pruning [78.75062483648243]
視覚言語モデル(VLM)は、しばしば大量の視覚トークンを生成し、推論遅延とメモリフットプリントを大幅に増加させる。
視覚的質問に対して人間がどのように答えるかを模倣する,人間にインスパイアされたプラグアンドプレイプルーニングフレームワークであるFSRを提案する。
FSRは、既存の最先端プルーニング法よりも精度と効率のトレードオフを一貫して改善する。
論文 参考訳(メタデータ) (2026-02-05T16:02:48Z) - TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models [4.779482139419908]
テキストトークンと意味的に視覚トークンを除去する相互情報に基づくトークンプルーニング戦略を導入する。
LLaVA-15-7BやLLaVA-7Bといったモデルでは,テキストトークンを88.9%削減しながら高い性能を維持している。
論文 参考訳(メタデータ) (2025-08-30T02:43:50Z) - VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models [57.2662376527586]
VScanは2段階のビジュアルトークン削減フレームワークである。
1)グローバルスキャンとローカルスキャンを視覚的エンコーディング中にマージすることで,(2)言語モデルの中間層にプルーニングを導入する。
VScanはプリフィルの2.91$times$スピードアップとFLOPの10$times$ダウンを実現し、オリジナルのパフォーマンスの95.4%を維持した。
論文 参考訳(メタデータ) (2025-05-28T17:59:08Z) - ToDRE: Visual Token Pruning via Diversity and Task Awareness for Efficient Large Vision-Language Models [59.47738955960352]
ToDREは、2段階でトレーニング不要なトークン圧縮フレームワークである。
トークンの多様性とトークン-タスク関連性に基づいてトークンをプルーニングすることで、優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-05-24T15:47:49Z) - Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers [32.167072183575925]
本稿では,より小さなレジスタトークン集合に要約することで,視覚トークンの数を削減できる手法を提案する。
ビクターは4%未満の精度低下を示し、トレーニング時間を43%削減し、推論スループットを3.3倍に向上させる。
論文 参考訳(メタデータ) (2024-10-17T22:45:13Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。