論文の概要: ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
- arxiv url: http://arxiv.org/abs/2607.28627v1
- Date: Thu, 30 Jul 2026 17:59:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.719693
- Title: ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
- Title(参考訳): ReToken:ビジュアル検索のためのビジョンランゲージモデルを改善する方法
- Authors: Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem,
- Abstract要約: 本稿では、明示的な検索対象として訓練された単一の学習可能な埋め込みであるReTokenを紹介する。
プリフィルされたビジュアルKVキャッシュからクエリ関連視覚トークンのスパースセットを選択する。
画像とビデオのベンチマークで一貫した利得が得られる。
- 参考スコア(独自算出の注目度): 40.909736671240616
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long visual context poses a challenge for vision-language models: performance degrades as the number of distractors grows, and processing all tokens at once is computationally infeasible under GPU memory constraints. We present ReToken, a single learnable embedding trained as an explicit retrieval target that selects a sparse set of query-relevant visual tokens from a pre-filled visual KV cache. Trained on only a small image-QA dataset, ReToken yields consistent gains across image and video benchmarks: on Visual Haystacks it improves Qwen3VL-8B by 13.4 points and InternVL3.5 by 12.4 points (>20% relative), and on LVBench it transfers zero-shot to long video for an 8.0-point gain with Qwen3VL-8B. Thanks to its lightweight design, both training and long-video inference fit on a single H100. Code is available at: https://github.com/avaxiao/ReToken
- Abstract(参考訳): パフォーマンスは、イントラクタの数が増えるにつれて低下し、すべてのトークンを一度に処理することは、GPUメモリの制約下では計算不可能である。
本稿では,事前充填されたビジュアルKVキャッシュからクエリ関連視覚トークンのスパースセットを選択する,明示的な検索ターゲットとして訓練された単一の学習可能な埋め込みであるReTokenを提案する。
Visual Haystacksでは、Qwen3VL-8Bを13.4ポイント改善し、InternVL3.5を12.4ポイント(>20%)改善し、LVBenchでは、Qwen3VL-8Bで8.0ポイント向上するために、ゼロショットをロングビデオに転送する。
軽量なデザインのおかげで、トレーニングもロングビデオ推論も1つのH100に収まる。
コードは、https://github.com/avaxiao/ReTokenで入手できる。
関連論文リスト
- T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability [10.51971591757392]
T-REN(テキスト整列領域ネットワーク)は、視覚データをテキスト整列領域レベル表現(または領域トークン)のコンパクトなセットにマッピングする効率的なエンコーダである。
T-RENは、凍結したビジョンバックボーン上に追加された軽量ネットワークを通じてこれを達成し、各セマンティック領域内のパッチレベルの表現をリージョントークンにプールし、リージョンレベルのテキストアノテーションと整合させるように訓練する。
論文 参考訳(メタデータ) (2026-04-20T17:57:02Z) - UniTok: A Unified Tokenizer for Visual Generation and Understanding [63.23796622553615]
視覚生成および理解モデルは通常、画像を処理するために異なるトークン化器に依存する。
我々は、新しいマルチコードブック量子化機構を備えた統一トークン化システムUniTokを紹介する。
最終的なパフォーマンスに関しては、UniTokはImageNetで0.38 rFIDと78.6%のゼロショット精度で新記録を樹立した。
論文 参考訳(メタデータ) (2025-02-27T17:47:01Z) - ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs [28.42651794004883]
ViCToR (VisualQA via Token Reconstruction) と呼ばれる視覚的理解段階を導入する。
ViCToRは学習可能なビジュアルトークンプールを使用し、ハンガリーマッチングアルゴリズムを使用して、視覚トークン置換のための意味的に関連するトークンを選択する。
LLaNeXT-8Bを10.4%改善し、MMStar、SEED$I$、RealWorldベンチマークで7.2%改善した。
論文 参考訳(メタデータ) (2024-10-18T09:44:25Z) - Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers [32.167072183575925]
本稿では,より小さなレジスタトークン集合に要約することで,視覚トークンの数を削減できる手法を提案する。
ビクターは4%未満の精度低下を示し、トレーニング時間を43%削減し、推論スループットを3.3倍に向上させる。
論文 参考訳(メタデータ) (2024-10-17T22:45:13Z) - Matryoshka Query Transformer for Large Vision-Language Models [103.84600181927884]
我々は,Materyoshka Query Transformer (MQT)を導入し,推論中に画像をmビジュアルトークンにエンコードする。
単一のモデルを一度トレーニングし、フレキシブルかつ劇的に、推論時の視覚トークンの数を削減します。
MQT-LLAVAは,LLaVAの固定576の代わりに最大256トークンを用いて,11ベンチマークでLLaVA-1.5のパフォーマンスと一致した。
論文 参考訳(メタデータ) (2024-05-29T17:39:42Z) - Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens [66.81787301096415]
Vista-LLaMAは、すべての視覚トークンと任意の言語トークンとの一貫性のある距離を維持する新しいフレームワークである。
本稿では,現在の映像フレームを前フレームの助けを借りて,言語空間のトークンに投影する逐次視覚プロジェクタを提案する。
論文 参考訳(メタデータ) (2023-12-12T09:47:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。