論文の概要: Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
- arxiv url: http://arxiv.org/abs/2607.04605v2
- Date: Mon, 13 Jul 2026 07:13:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.255863
- Title: Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
- Title(参考訳): すべての視覚トークンは等しく重要か? 視覚言語検索のためのトーケンマージのオブジェクト証拠保存
- Abstract要約: SaMerはオブジェクト認識トークンのマージフレームワークである。
イメージサイドのポストプロジェクタトークンを$K$の代表セントロイドに圧縮し、元の遅延インタフェースを保存する。
画像側のトークンの93%以上を削除し、ColPaliストレージを16.09times$に削減し、Flickr30KとMSCOCOのR@1を改善した。
- 参考スコア(独自算出の注目度): 18.32957235386939
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-vector vision-language retrieval preserves fine-grained visual evidence through maximum-similarity late interaction, but dense image-side tokens make storage and scoring expensive. Existing token compression methods reduce this cost, yet they can remove or collapse object- and region-level evidence that future query tokens may need to select. We propose SaMer, an object-aware token merging framework that compresses image-side post-projector tokens into $K$ representative centroids while preserving the original late-interaction interface. SaMer uses object annotations only during training as a merge prior to discourage cross-instance mixing, requires no ground-truth bounding boxes or detectors at inference time, and adapts only the shared projection layer with frozen vision and language backbones. With $K=64$, SaMer removes more than 93% of image-side tokens and reduces ColPali storage by $16.09\times$, while improving R@1 on Flickr30K and MSCOCO. These gains arise because object-aware merging preserves query-selectable object evidence that pruning or feature-only pooling can remove or collapse. SaMer also outperforms compression baselines and shows stronger phrase-level grounding, suggesting that efficient multi-vector retrieval depends not only on reducing token count, but on preserving the evidence future query tokens need to select.
- Abstract(参考訳): 多ベクトル視覚言語検索は、最大相似遅延相互作用によるきめ細かい視覚的証拠を保存するが、高密度の画像側トークンは記憶と得点を高くする。
既存のトークン圧縮メソッドは、このコストを削減するが、将来のクエリトークンを選択する必要があるというオブジェクトとリージョンレベルの証拠を排除または破棄することができる。
本稿では,オブジェクト認識型トークンマージフレームワークであるSaMerを提案する。このフレームワークは,プロジェクタ後トークンを,オリジナルの遅延操作インターフェースを保ちながら,$K$の代表セントロイドに圧縮する。
SaMerはトレーニング中にのみオブジェクトアノテーションをマージとして使用し、クロスインスタンスの混合を回避し、推論時に接地トルース境界ボックスや検出器を必要とせず、凍結した視覚と言語バックボーンを備えた共有プロジェクション層のみを適用する。
SaMerは$K=64$で、画像側のトークンの93%以上を削除し、ColPaliストレージを16.09\times$に削減し、Flickr30KとMSCOCOのR@1を改善した。
これらの利益は、オブジェクト認識のマージがクエリ選択可能なオブジェクトエビデンスを保持し、プルーニングやフィーチャーオンリーのプーリングが取り除いたり、崩壊したりする可能性があるためである。
SaMerはまた、圧縮ベースラインを上回り、より強力なフレーズレベルのグラウンド化を示し、効率的なマルチベクタ検索はトークン数を減らすだけでなく、将来のクエリトークンが選択すべきエビデンスを保存することに依存することを示唆している。
関連論文リスト
- TRACE: Trajectory-robust Admission with Evidence Ordering for Efficient GUI Agents [54.88208747581851]
トレーニング不要のビジュアルトークンプルーニングは、このコストを削減することができるが、キャッシュ再利用には基本的な制約が伴う。
我々は,emphtextbfTrajectory-textbfrobust textbfAdmission と textbfCoverage-aware textbfEvidence ordering のためのトレーニング不要フレームワーク textbfmethod を提案する。
論文 参考訳(メタデータ) (2026-09-09T15:12:48Z) - LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference [63.932718076408584]
LASTは、エッジクラウド協調MLLM推論におけるクエリ依存のビジュアルトークンプルーニングのための、トレーニング不要のフレームワークである。
完全な精度の95.4%を維持し、視覚トークンの12.5%しか保持せず、エッジ側の選択オーバーヘッドは低く、クラウド側の計算は少ない。
論文 参考訳(メタデータ) (2026-07-30T09:59:25Z) - PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding [88.17174909130188]
LVLM(Large Vision-Language Models)は、視覚的な入力を高密度なトークンシーケンスにマッピングし、推論に二次的な計算ボトルネックを与える。
特徴抽出の労力を動的に分配する視覚トークン化アーキテクチャであるPARCELを紹介する。
PARCELは、既存のマトリシカベースラインを「一度にトレーニングし、どこにでもデプロイする」パラダイムを保ちながら、視覚障害者の予算で一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-28T15:57:31Z) - Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models [52.78477729846771]
本稿では,COAST(Contrastive Adaptive Semantic Token Pruning)について紹介する。
COASTはトークン予算をまたいだ強力なプルーニングベースラインを一貫して上回り、複数のLVLMファミリをまたいだ一般化を実現している。
論文 参考訳(メタデータ) (2026-05-10T09:07:04Z) - AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation [56.21301367698041]
AnchorSegを導入し、画像トークン上での条件生成の構造化として、推論セグメンテーションを再構成する。
我々は、アンカークエリがローカライズ信号を決定する画像トークン上の因子分布として空間条件をモデル化する。
Token-Mask Cycle Consistency (TMCC)を提案する。
論文 参考訳(メタデータ) (2026-04-20T17:49:22Z) - Towards Implicit Aggregation: Robust Image Representation for Place Recognition in the Transformer Era [60.09990228573728]
いくつかの学習可能なアグリゲーショントークンを導入し、特定のトランスフォーマーブロックの前にパッチトークンにプリコンパイルする。
これらのトークンはすべて、固有の自己認識機構を通じて、共同で処理され、世界規模で相互作用する。
提案手法は,複数のVPRデータセットにおける最先端の手法よりも効率が高く,MSLSチャレンジリーダーボードで1位にランクインする。
論文 参考訳(メタデータ) (2025-11-08T14:35:11Z) - Word Salad Chopper: Reasoning Models Waste A Ton Of Decoding Budget On Useless Repetitions, Self-Knowingly [26.720439200130375]
大規模な推論モデル(LRM)は高コストの出力トークンによってボトルネックとなることが多い。
これらのトークンの大部分は,“ワードサラダ(word salad)”と呼ばれる,無駄な自己繰り返しであることを示す。
論文 参考訳(メタデータ) (2025-11-01T12:46:12Z) - SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs [59.415473779171315]
textbfSaliency-textbfCoverage textbfOriented token textbfPruning for textbfEfficient MLLMs。
論文 参考訳(メタデータ) (2025-10-28T09:29:37Z) - TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models [4.779482139419908]
テキストトークンと意味的に視覚トークンを除去する相互情報に基づくトークンプルーニング戦略を導入する。
LLaVA-15-7BやLLaVA-7Bといったモデルでは,テキストトークンを88.9%削減しながら高い性能を維持している。
論文 参考訳(メタデータ) (2025-08-30T02:43:50Z) - ToSA: Token Merging with Spatial Awareness [20.85218319861827]
ToSAは、意味的および空間的認識を組み合わせ、トークンマージプロセスを導く新しいトークンマージ手法である。
ToSAは、視覚的および具体的質問応答に関する複数のベンチマークで、以前のトークンマージ手法よりも優れている。
論文 参考訳(メタデータ) (2025-06-24T23:58:20Z) - Reasoning to Attend: Try to Understand How <SEG> Token Works [44.33848900059659]
我々は、$texttSEG>$トークンが、画像とテキストのペア内のセマンティックな類似性に寄与していることを示す。
本稿では,高活性点の誘導の下で,LMMの高強度な$textbfREA$soning機能を実現するREADを提案する。
論文 参考訳(メタデータ) (2024-12-23T17:44:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。