論文の概要: AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning
- arxiv url: http://arxiv.org/abs/2607.07033v1
- Date: Wed, 08 Jul 2026 06:07:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.299754
- Title: AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning
- Title(参考訳): AnchorPrune: 視覚的トーケンプルーニングにおけるコンテキスト拡張の関連性
- Abstract要約: 大規模な視覚言語モデルは、高解像度の入力が数千の視覚トークンをもたらすため、かなりの推論コストを発生させる。
トレーニング不要のフレームワークであるAnchorPruneを紹介します。
LLaVA-NeXT-7Bでは、AnchorPruneは2,880個の視覚トークンのうち160個しか使用せず、97.6%のフルトーケン性能を維持している。
- 参考スコア(独自算出の注目度): 8.862195491555575
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large vision-language models incur substantial inference costs because high-resolution inputs introduce thousands of visual tokens, many of which are redundant for a given query. Existing pruning methods often combine query relevance and token diversity, yet these objectives can conflict under aggressive compression: relevance-driven selection may overconcentrate the budget on correlated local evidence, while diversity-driven selection may suppress indispensable tokens or retain distinct but uninformative regions. We introduce AnchorPrune, a training-free framework that first constructs a protected relevance anchor and then expands it with complementary visual context. AnchorPrune adaptively determines the anchor size from the novelty profile of relevance-ranked tokens, preserving a compact set of query-critical evidence, and allocates the remaining budget through importance-weighted novelty to recover informative, non-redundant context relative to the anchor. This ordered design prevents contextual expansion from displacing indispensable query cues while improving overall visual coverage. AnchorPrune is lightweight, architecture-aware, and requires neither retraining nor model modification. Across image and video vision-language models and benchmarks, it consistently improves the accuracy-efficiency trade-off over training-free baselines, particularly under severe compression. On LLaVA-NeXT-7B, AnchorPrune preserves 97.6% of full-token performance using only 160 of 2,880 visual tokens. These results establish relevance-anchored contextual expansion as an effective principle for efficient multimodal inference. Code is available at https://github.com/MULTI-cau/AnchorPrune.
- Abstract(参考訳): 大規模な視覚言語モデルは、高解像度の入力が数千の視覚トークンを導入し、その多くが与えられたクエリに対して冗長であるため、かなりの推論コストを発生させる。
既存のプルーニング法はクエリ関連性とトークンの多様性を組み合わせることが多いが、これらの目的は積極的な圧縮の下で矛盾することがある。
AnchorPruneはトレーニング不要のフレームワークで、最初に保護された関連アンカーを構築し、補完的な視覚的コンテキストで拡張します。
AnchorPruneは、関連するトークンの新規性プロファイルからアンカーサイズを適応的に決定し、クエリクリティカルな証拠のコンパクトなセットを保存し、重要度の高いノベルティを通じて残りの予算を割り当て、アンカーに対する情報的で非冗長なコンテキストを回復する。
この順序づけられた設計は、全体的な視覚的カバレッジを改善しながら、コンテキスト拡張が不必要なクエリキューを分解するのを防ぐ。
AnchorPruneは軽量でアーキテクチャ対応で、再トレーニングもモデル修正も必要ありません。
画像およびビデオビジョン言語モデルとベンチマーク全体にわたって、トレーニング不要のベースライン、特に厳しい圧縮下での精度と効率のトレードオフを一貫して改善する。
LLaVA-NeXT-7Bでは、AnchorPruneは2,880個の視覚トークンのうち160個しか使用せず、97.6%のフルトーケン性能を維持している。
これらの結果は、効率の良いマルチモーダル推論のための効果的な原理として、関連性アンコレッドな文脈展開を確立する。
コードはhttps://github.com/MULTI-cau/AnchorPrune.comで入手できる。
関連論文リスト
- StackTok: Accelerating VLMs Inference with Budget-Adaptive Visual Token Selection [17.809800994999225]
StackTokはトレーニング不要のセレクタで、クエリ関連を客観的かつ視覚的なカバレッジとして扱い、予算の校正サポートとして扱う。
試験されたすべてのモデルにおいて、トレーニング不要のセレクタの中では、第1位である。
高解像度のLLaVA-NeXT-7Bでは、95.26%のフルトーケン性能を保ち、2,880 (5.6%) の視覚トークンしか持たない。
論文 参考訳(メタデータ) (2026-09-15T08:35:57Z) - Centering before Pruning: Lightweight Geometry Correction for Diversity-Based Visual Token Pruning in LVLMs [7.371189496638082]
生の視覚トークン間の類似性は、正の範囲に強く集中しており、非冗長トークンを識別する能力を制限する。
中心コサイン類似度を用いてサブセットの多様性を測定するtextbfCentered Geometry textbfPruner (Cen-Prune)を提案する。
Cen-Pruneは、既存の多様性ベースのプルーナー全体のパフォーマンスを堅牢に改善する。
論文 参考訳(メタデータ) (2026-08-31T05:13:29Z) - Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning [16.79729969987944]
本研究では,構造化圧縮問題としてプルーニングを再構成するフレームワークであるEntropy-Aware Dense Pruning (EADP)を提案する。
EADPはまず統計エントロピーを利用してテキストノイズの定量化とフィルタリングを行う。
論文 参考訳(メタデータ) (2026-07-02T17:50:57Z) - Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs [7.371189496638082]
本稿では,カラムサブセット選択問題としてトークンプルーニングを再構成する部分空間再構成手法であるSPAREを紹介する。
SPAREはタスクに強い利得を伴い、常に最先端のパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-17T04:45:10Z) - PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding [88.17174909130188]
LVLM(Large Vision-Language Models)は、視覚的な入力を高密度なトークンシーケンスにマッピングし、推論に二次的な計算ボトルネックを与える。
特徴抽出の労力を動的に分配する視覚トークン化アーキテクチャであるPARCELを紹介する。
PARCELは、既存のマトリシカベースラインを「一度にトレーニングし、どこにでもデプロイする」パラダイムを保ちながら、視覚障害者の予算で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-28T15:57:31Z) - Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models [52.78477729846771]
本稿では,COAST(Contrastive Adaptive Semantic Token Pruning)について紹介する。
COASTはトークン予算をまたいだ強力なプルーニングベースラインを一貫して上回り、複数のLVLMファミリをまたいだ一般化を実現している。
論文 参考訳(メタデータ) (2026-05-10T09:07:04Z) - D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning [49.16227597771663]
D2Prunerは、デバイアスされた重要性と構造的なプルーニングメカニズムを組み合わせたフレームワークである。
FLOPを74.2%削減し、元の性能の99.2%を維持した。
既存の手法に比べて63.53%も改善されている。
論文 参考訳(メタデータ) (2025-12-22T14:42:31Z) - Training-free Context-adaptive Attention for Efficient Long Context Modeling [57.703159205740185]
トレーニングフリーコンテキスト適応注意(TCA-Attention)は、学習不要なスパースアテンション機構であり、効率的な長文推論のための情報トークンのみに選択的に参画する。
TCA-Attentionは2.8$times$のスピードアップを実現し、128Kのコンテキスト長でKVキャッシュを61%削減し、フルアテンションに匹敵するパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-12-10T01:54:57Z) - ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models [7.7352936204066]
本稿では,タスク関連性と情報多様性のバランスとして,視覚トークンプルーニングをモデル化する新しいゼロショット手法を提案する。
本手法は,精度の低下を最小限に抑えて,最先端技術に適合または超越した性能を実現する。
これらのゲインには、GPUメモリフットプリントの大幅な削減と推論レイテンシが伴っている。
論文 参考訳(メタデータ) (2025-10-20T06:18:47Z) - TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models [4.779482139419908]
テキストトークンと意味的に視覚トークンを除去する相互情報に基づくトークンプルーニング戦略を導入する。
LLaVA-15-7BやLLaVA-7Bといったモデルでは,テキストトークンを88.9%削減しながら高い性能を維持している。
論文 参考訳(メタデータ) (2025-08-30T02:43:50Z) - Reinforcing Video Reasoning with Focused Thinking [65.85683941058916]
本稿では,集中的思考と深い報酬の粒度で視覚的推論を強化する新しいフレームワークであるTW-GRPOを提案する。
具体的には,高情報密度のトークンを優先するトークン重み付け機構を用いる。
また,シングルチョイスからマルチチョイスQAタスクにシフトすることで,RLトレーニングを再構築する。
論文 参考訳(メタデータ) (2025-05-30T15:42:19Z) - TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model [56.43860351559185]
高速かつ低メモリの textbfVLM に対する推論時間最適化を備えた textbfToken textbfPruning の互換性である textbfTopV を導入する。
我々のフレームワークは、各ソースの視覚的トークンの重要性を測定するために、視覚的なコスト関数を組み込んでおり、低重要トークンの効果的なプルーニングを可能にしている。
論文 参考訳(メタデータ) (2025-03-24T01:47:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。