論文の概要: Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference
- arxiv url: http://arxiv.org/abs/2607.15563v1
- Date: Fri, 17 Jul 2026 02:13:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.735653
- Title: Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference
- Title(参考訳): すべてのトークンは視覚的位置認識に必要か? : 効率的な推論のためのトークン削減に関する実証的研究
- Authors: Tong Jin, Yunpeng Liu, Shuyu Hu, Qinghua Zhang, Ruize Han, Song Wang, Feng Lu,
- Abstract要約: 効率的な視覚的位置認識のためのトークン削減のための最初の体系的ベンチマークを示す。
本ベンチマークでは, 代表的トークン・プルーニング, トークン・マージング, ハイブリッド・プルーニング・マージング手法を総合的に評価する。
我々の研究は、トークン効率の良いVPRと効率的なビジュアル検索システムに関する今後の研究のための総合的な基盤を確立する。
- 参考スコア(独自算出の注目度): 27.84020098999677
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent visual place recognition (VPR) methods based on vision transformers, particularly foundation models, have achieved remarkable recognition performance. However, these models process all visual tokens throughout the entire network, resulting in substantial computational overhead, which hinders their deployment in real-time and resource-constrained scenarios. A natural question thus arises: are all visual tokens necessary for VPR? To answer this question, we present the first systematic benchmark of token reduction for efficient visual place recognition. Our benchmark comprehensively evaluates representative token pruning, token merging, and hybrid pruning-merging methods across multiple state-of-the-art VPR models and diverse benchmark datasets covering urban, suburban, and natural environments. We further investigate token reduction from multiple perspectives, including recognition performance under different reduction configurations, computational complexity, inference speed, qualitative visualization, and deployment efficiency on edge devices. Through extensive experiments and in-depth analysis, our benchmark reveals multiple important characteristics of token reduction in VPR and provides several practical insights into the trade-offs between accuracy and inference efficiency. For example, token reduction can reduce computational cost by up to 29\% and improve throughput by up to 44\%, while incurring less than 1\% degradation in recognition accuracy. Overall, this work establishes a comprehensive foundation for future research on token-efficient VPR and efficient visual retrieval systems. Our codes and models will be available at https://github.com/Tong-Jin01/TokenReduction4VPR
- Abstract(参考訳): 視覚変換器,特に基礎モデルに基づく最近の視覚的位置認識(VPR)法は,目覚しい認識性能を実現している。
しかし、これらのモデルはネットワーク全体にわたってすべてのビジュアルトークンを処理するため、計算上のオーバーヘッドが大きくなり、リアルタイムおよびリソース制約のあるシナリオへのデプロイメントを妨げます。
すべての視覚トークンはVPRに必要か?
そこで本研究では,効率的な視覚的位置認識のためのトークン削減のための最初の体系的ベンチマークを提案する。
本ベンチマークでは, 都市, 郊外, 自然環境を対象とした多種多様なベンチマークデータセットを用いて, 複数の最先端VPRモデルに対する代表的トークンプルーニング, トークンマージング, ハイブリッドプルーニングマージング手法を総合的に評価した。
さらに、異なる還元構成下での認識性能、計算複雑性、推論速度、定性的可視化、エッジデバイス上でのデプロイメント効率など、さまざまな観点からトークンの削減について検討する。
広範囲な実験と詳細な分析により,VPRにおけるトークン還元の複数の重要な特徴を明らかにし,精度と推論効率のトレードオフに関する実践的な知見を提供する。
例えば、トークンの削減は計算コストを最大29 %削減し、スループットを最大44 %改善すると同時に、認識精度が 1 % 未満に低下する。
全体として、この研究はトークン効率の良いVPRと効率的なビジュアル検索システムの研究のための総合的な基盤を確立している。
私たちのコードとモデルはhttps://github.com/Tong-Jin01/TokenReduction4VPRで公開されます。
関連論文リスト
- ApET: Approximation-Error Guided Token Compression for Efficient VLMs [16.4657793751671]
本稿では,近似エラーガイド付きToken圧縮フレームワークであるApETを紹介する。
ApETは、画像理解タスクのオリジナルパフォーマンスの95.2%を保持し、ビデオ理解タスクの100.4%を達成している。
ApETは無注意設計のため、FlashAttentionとシームレスに統合され、さらなる推論を可能にし、VLMのデプロイをより実用的なものにしている。
論文 参考訳(メタデータ) (2026-02-23T14:15:37Z) - Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning [82.39668822222386]
ビジョントークンプルーニングは、効率的なビジョン言語モデル(VLM)のための効果的なアクセラレーション手法であることが証明された。
空間的整合性を維持しつつ,効率的な特徴集約を実現するための2段階のトークンプルーニングフレームワークである$textNwa$を提案する。
実験によると、textNwa$は複数のVQAベンチマーク(94%から95%)でSOTAのパフォーマンスを達成し、視覚的グラウンドタスク(7%から47%)を大幅に改善している。
論文 参考訳(メタデータ) (2026-02-03T00:51:03Z) - ToDRE: Visual Token Pruning via Diversity and Task Awareness for Efficient Large Vision-Language Models [59.47738955960352]
ToDREは、2段階でトレーニング不要なトークン圧縮フレームワークである。
トークンの多様性とトークン-タスク関連性に基づいてトークンをプルーニングすることで、優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-05-24T15:47:49Z) - TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model [56.43860351559185]
高速かつ低メモリの textbfVLM に対する推論時間最適化を備えた textbfToken textbfPruning の互換性である textbfTopV を導入する。
我々のフレームワークは、各ソースの視覚的トークンの重要性を測定するために、視覚的なコスト関数を組み込んでおり、低重要トークンの効果的なプルーニングを可能にしている。
論文 参考訳(メタデータ) (2025-03-24T01:47:26Z) - When Less is Enough: Adaptive Token Reduction for Efficient Image Representation [2.2120851074630177]
より価値の低い特徴を、より価値の高いものから再構築できるという考えに基づいて、特徴ユーティリティを決定する新しい方法を提案する。
我々は、オートエンコーダとGumbel-Softmax選択機構を統合することで、この概念を実装した。
本結果は,適応的かつ効率的なマルチモーダルプルーニングに向けた有望な方向を示すものである。
論文 参考訳(メタデータ) (2025-03-20T19:17:08Z) - Once for Both: Single Stage of Importance and Sparsity Search for Vision Transformer Compression [63.23578860867408]
重要度評価と疎度評価を1段階にまとめる方法について検討する。
重要度と疎度の両方を同時に評価するコスト効率の高いOFBを提案する。
実験により、OFBは最先端のサーチベースおよびプルーニングベース手法よりも優れた圧縮性能が得られることが示された。
論文 参考訳(メタデータ) (2024-03-23T13:22:36Z) - Revisiting Token Pruning for Object Detection and Instance Segmentation [25.3324628669201]
オブジェクトとインスタンスのセグメンテーションの推論を高速化するトークンプルーニングについて検討する。
従来のトークンプルーニング法と比較して,ボックス・マスクともに1.5mAPから0.3mAPに低下した。
論文 参考訳(メタデータ) (2023-06-12T11:55:33Z) - StructVPR: Distill Structural Knowledge with Weighting Samples for
Visual Place Recognition [49.58170209388029]
視覚的位置認識(VPR)は通常、特定の画像検索問題と見なされる。
我々は、RGBグローバル機能における構造的知識を高めるために、VPRのための新しいトレーニングアーキテクチャであるStructVPRを提案する。
計算コストを低く保ちながら最先端の性能を実現する。
論文 参考訳(メタデータ) (2022-12-02T02:52:01Z) - Adaptive Sparse ViT: Towards Learnable Adaptive Token Pruning by Fully
Exploiting Self-Attention [36.90363317158731]
最小限のコストで適応的なスパーストークンプルーニングフレームワークを提案する。
提案手法では,DeiT-Sのスループットを50%向上し,トップ1の精度は0.2%低下した。
論文 参考訳(メタデータ) (2022-09-28T03:07:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。