論文の概要: From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers
- arxiv url: http://arxiv.org/abs/2609.00667v1
- Date: Tue, 01 Sep 2026 03:45:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.27428
- Title: From Saliency to Discriminability: Rank-Preserving Visual Token Pruning for VLM Rerankers
- Title(参考訳): 衛生性から差別性へ:VLMリランカのためのランク保存型視覚トーケンプルーニング
- Authors: Siyi Liu, Hanjun Yang, Chenchen Zhang, Xiaorong Zhu, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Junfu Pu, Yongqi Zhang,
- Abstract要約: 既存のプルーニング手法では,注目度によってトークンを保持できるが,サラーニング方式はランキング貢献と体系的に一致していないことを示す。
本稿では,正規化注意エントロピーを用いたトレーニングフリーフレームワークであるRaDiCalを提案する。
FLOPを39--45%削減し、2つのVLMアーキテクチャでデータセット固有の修正なしに1.28--1.45$times$のスピードアップを提供する。
- 参考スコア(独自算出の注目度): 16.546400103214715
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large vision-language models used as listwise rerankers must jointly process visual tokens from tens of candidates per query, making token pruning essential for practical deployment. Existing pruning methods retain tokens by attention saliency, yet we show that saliency is systematically misaligned with ranking contribution: visually prominent tokens often capture order-neutral patterns shared across candidates. This mismatch is layer-dependent: saliency becomes informative only where attention is concentrated, and normalized attention entropy diagnoses the reliability shift (Pearson r=0.87). We propose RaDiCal (Rank-Discriminative Calibration), a training-free framework that uses normalized attention entropy to decide when saliency can be trusted, fusing it with an attention-free rank-discriminative prior and selecting pruning layers from the same trust landscape. Across three retrieval benchmarks and multiple VLM architectures, RaDiCal matches Dense MRR@10 on Flickr30K and surpasses it on MSCOCO at a 20% token budget, ranks first among all pruning methods on FashionIQ, and holds within 1.2 pp on Flickr30K and MSCOCO at 10% retention. It cuts FLOPs by 39--45% and delivers 1.28--1.45$\times$ measured speedups across two VLM architectures without dataset-specific retuning.
- Abstract(参考訳): リストワイズリランカとして使用される大規模な視覚言語モデルは、クエリ毎に数十の候補から視覚トークンを共同で処理する必要がある。
既存のプルーニング手法では、注意力によってトークンを保持できるが、サリエンシは、ランキングの貢献と体系的に一致していない。
このミスマッチは層依存性であり、注意が集中している場合にのみ塩分濃度が情報化され、正常化された注意エントロピーが信頼性シフトを診断する(Pearson r=0.87)。
Rank-Discriminative Calibrationは、正規化された注意エントロピーを用いて、サラリティーをいつ信頼できるかを判断する学習自由フレームワークである。
3つのベンチマークと複数のVLMアーキテクチャの中で、RaDiCalはFlickr30KのDense MRR@10と一致し、20%のトークン予算でMSCOCOを上回り、FashionIQのすべてのプルーニングメソッドの中で第1位となり、Flickr30KとMSCOCOでは1.2pp以内の保持率で保持されている。
FLOPを39--45%削減し、1.28--1.45$\times$の速度アップを2つのVLMアーキテクチャで実現している。
関連論文リスト
- HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment [76.68875424389057]
既存の手法では、すべての頭部に一様にテキストから視覚への注意を平均化することで、各視覚トークンをスコアリングする。
頭が不一致で 平均的に支配され 背景のトークンを増幅し きめ細かな手がかりを 吐き出す
本稿では,各頭部のプロンプトと画像領域の整合性を評価する指標であるPAQ(Prompt-Grounded Attention Quality)を提案する。
論文 参考訳(メタデータ) (2026-08-24T23:55:36Z) - OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning [24.164883144694656]
OccamTokenは、絶対トークンランキングを登録された相対的エビデンステストに置き換える、トレーニング不要のフレームワークである。
我々はOccamTokenが、追加のトレーニングなしで精度と効率のトレードオフを継続的に改善していることを示します。
論文 参考訳(メタデータ) (2026-05-28T09:20:47Z) - Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models [73.07332521794093]
トケンプルーニングは、大規模ビジョンランゲージモデルの計算オーバーヘッドを大幅に削減する効果的な手法として登場した。
視覚エンコーダ内でのタスク認識トークンのプルーニングを正確に行うためのデカップリング型類似性認識型プルーニング手法であるDeSAPを提案する。
DeSAPはSOTA法を精度と効率の両方で一貫して上回っている。
論文 参考訳(メタデータ) (2026-04-13T09:44:52Z) - When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models [0.0]
ハイブリッドリカレントアテンションアーキテクチャにおけるルーティングパラドックスを同定する。
コンテンツベースのルーティングは、ルーティングが避けるように設計されたペアワイズな計算を必要とすることを示す。
論文 参考訳(メタデータ) (2026-03-22T01:04:57Z) - vAttention: Verified Sparse Attention [100.98210818821688]
vAttentionは、ユーザが指定した$(epsilon, delta)$の近似精度保証(thus, confirmed)を備えた実用的なスパースアテンションメカニズムである。
vAttentionはデータセット間のスパースアテンションの質を大幅に改善することを示す。
モデルの品質を損なうことなく高速なデコードを実現するために、推論シナリオにデプロイすることができる。
論文 参考訳(メタデータ) (2025-10-07T08:46:08Z) - HiPrune: Training-Free Visual Token Pruning via Hierarchical Attention in Vision-Language Models [6.306822764683807]
HiPruneは、ビジョンエンコーダのためのトレーニング不要でモデルに依存しないトークンプルーニングフレームワークである。
視覚エンコーダ内の階層的アテンション構造を利用する。
33.3%のトークンで99.3%のタスク精度を維持し、11.1%のトークンで99.5%の精度を維持している。
論文 参考訳(メタデータ) (2025-08-01T11:48:11Z) - CLIPure: Purification in Latent Space via CLIP for Adversarially Robust Zero-Shot Classification [65.46685389276443]
画像とテキストプロンプトをマッチングすることでゼロショット分類を行うことができる、視覚言語で事前訓練されたエンコーダモデルであるCLIPについて検討する。
次に, 共分散精製プロセス間のKL分散として精製リスクを定式化する。
画像の潜伏ベクトルの確率をモデル化するCLI-Diffと、画像の埋め込みとaの写真とのコサイン類似度をモデル化するCLI-Cosの2つのバリエーションを提案する。
論文 参考訳(メタデータ) (2025-02-25T13:09:34Z) - S2-Attention: Hardware-Aware Context Sharding Among Attention Heads [49.1454481007861]
スパースアテンションは、コンテキスト内のトークンのサブセットに選択的に出席する。
スパース・アテンションが今日の大規模言語モデルでモデルの品質を維持することができるかどうかは不明だ。
本稿では,Sparsely-Sharded(S2) attention, a Triton library that provide kernel optimization for sparse attention for sparse attention to customizable per-head and per-context-range levels。
論文 参考訳(メタデータ) (2024-07-25T00:27:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。