論文の概要: VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2608.30705v1
- Date: Mon, 31 Aug 2026 12:43:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.392856
- Title: VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs
- Title(参考訳): VisLens:マルチモーダルLLMのための単一パス解釈可能なビジュアル検索
- Authors: Jingyi He, Sanghwan Kim, Zeynep Akata,
- Abstract要約: 我々は,ロジットレンズ上に構築されたビジュアル検索手法であるemphVisLens (Visual Focus via Logit Lens)を提案する。
VisLensは以前のベースラインにマッチまたは超過し、相当なレイテンシのアドバンテージを提供する。
- 参考スコア(独自算出の注目度): 50.62479086957651
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (MLLMs) struggle with fine-grained Visual Search, the task of locating small or rare objects in high-resolution images. Existing remedies fall into two families: (1) Training-free methods based on attention or confidence scores are accurate but slow, since they require multiple MLLM queries per example. (2) Reinforcement Learning (RL) trained tool-use models are faster at inference but opaque, since their tool calls remain uncontrollable and hard to interpret. To overcome this, we propose \emph{VisLens} (Visual Focus via Logit Lens), a Visual Search method built on the logit lens, which decodes the semantics held in a hidden state by projecting it through the LLM head. VisLens further uses a lightweight tuned-lens that maps early hidden states into the final hidden state space, so visual tokens can be read out from early layers. These tokens are matched to target words in the query to generate a crop of the relevant region, which is fed back in alongside the original image to produce the final answer. The whole process, from decoding to the final answer, completes in a single forward pass without repeated queries. VisLens matches or exceeds prior baselines while delivering a substantial latency advantage, running $8.5$--$9.9\times$ faster than Thyme and up to $22.2\times$ faster than training-free multi-pass search methods.
- Abstract(参考訳): MLLM(Multimodal large language model)は、高解像度画像中の小さなオブジェクトや稀なオブジェクトを見つけるタスクである、きめ細かいビジュアルサーチに苦しむ。
既存の治療法は,(1)注意力や信頼度に基づくトレーニングフリーの手法は,複数のMLLMクエリを必要とするため,正確だが遅い。
2)Reinforcement Learning (RL) 訓練されたツール使用モデルは推論が速いが,ツールコールが制御不能であり,解釈が難しいため不透明である。
この問題を解決するために,ロジットレンズ上に構築されたビジュアル検索手法である \emph{VisLens} (Visual Focus via Logit Lens) を提案する。
VisLensはさらに、初期の隠れた状態を最終的な隠れた状態空間にマッピングする、ライトウェイトなチューニングレンズを使用している。
これらのトークンは、クエリ内のターゲットワードにマッチして、関連する領域の作物を生成し、元のイメージと一緒に送り返されて最終回答を生成する。
復号化から最終解まで、プロセス全体が1回のフォワードパスで完了します。
VisLensは、Tymeより8.5$--9.9\times$、トレーニング不要のマルチパス検索よりも22.2\times$を高速に実行しながら、以前のベースラインにマッチまたは超過する。
関連論文リスト
- Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models [56.11961584000622]
MLLM(Multimodal large language model)は、しばしば細粒度の視覚的推論において失敗する。
質問条件付き視覚的エビデンス浄化フレームワークであるLatEnt Noise maSk (Lens)を提案する。
視覚トークンが現在の質問をサポートし、復号時にそれらを保存するレンズスコア。
論文 参考訳(メタデータ) (2026-06-29T11:44:09Z) - What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models [9.530137749236617]
マルチモーダル大言語モデル(MLLM)は、言語モデルの埋め込み空間に視覚トークンを投影する。
本稿では,新しい探索ツールである $textLenEmbeds$ を特徴とする2次元解析フレームワークについて紹介する。
視覚トークンは一貫してシンク、デッド、生きたカテゴリに分けられる。
論文 参考訳(メタデータ) (2026-02-28T07:13:36Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z) - ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming [14.937905258757635]
$textbfST3$は、再トレーニングせずにMLLM推論を高速化するように設計されたフレームワークである。
$textbfST3$は、既存のトレーニング済みMLLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2024-12-28T10:17:29Z) - AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning [19.68349294206012]
大規模言語モデル(LLM)は、画像やビデオなどの視覚的データの強力な理解を示すマルチモーダルLLMの作成を可能にする。
多様な効率要件を満たすマルチモーダルLCMの学習自由適応推論法を提案する。
論文 参考訳(メタデータ) (2024-12-04T11:47:57Z) - Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings [66.04061083611863]
既存のMultimoal Large Language Models (MLLM) における視覚トークンの過剰使用は、しばしば明らかな冗長性を示し、非常に高価な計算をもたらす。
DyVTE(Dynamic visual-token exit)と呼ばれるMLLMの効率を改善するための簡易かつ効果的な手法を提案する。
DyVTEは軽量なハイパーネットワークを使用して、テキストトークンの状態を認識し、特定のレイヤの後にすべてのビジュアルトークンを削除する。
論文 参考訳(メタデータ) (2024-11-29T11:24:23Z) - NoteLLM-2: Multimodal Large Representation Models for Recommendation [71.87790090964734]
大規模言語モデル(LLM)は、テキスト理解や埋め込みタスクにおいて、例外的な習熟度を示している。
マルチモーダル表現のポテンシャル、特にアイテムツーイテム(I2I)レコメンデーションについては、未解明のままである。
本稿では,既存のLLMと視覚エンコーダの統合をカスタマイズし,効率的なマルチモーダル表現を実現するエンド・ツー・エンドのファインチューニング手法を提案する。
論文 参考訳(メタデータ) (2024-05-27T03:24:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。