論文の概要: TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.04593v1
- Date: Mon, 06 Jul 2026 01:43:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.988149
- Title: TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models
- Title(参考訳): 鳥野:視覚・言語モデルにおける解釈可能な概念オーバーラップによるトークン削減
- Abstract要約: VLM(Vision-Language Models)は、様々なタスクにまたがる印象的な機能を示しているが、その計算コストはモデルに供給される多数の視覚トークンに支配されている。
本稿では,VLMの適応的視覚トークン削減のためのプラグイン・アンド・プレイフレームワークであるTORINOを紹介する。
- 参考スコア(独自算出の注目度): 6.132992639292891
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) have demonstrated impressive capabilities across different tasks, but their computational cost is dominated by the large number of visual tokens fed to the language model. Existing token reduction methods rely on attention-based scores or pairwise similarity, without an explicit semantic representation of each token. We introduce TORINO (TOken Reduction via Interpretable coNcept Overlap), a plug-and-play framework for adaptive visual token reduction in VLMs that requires no fine-tuning of the underlying model. TORINO leverages Sparse Autoencoders (SAEs) to project visual tokens into an interpretable latent space where token relationships can be analyzed through shared concept activations. Specifically, we define concept overlap as the degree of agreement between active SAE latents and use it to group tokens that share semantic content. Reduction within each group is then performed by either pruning or merging, providing a unified framework that preserves semantically important visual information while removing redundancy. Unlike fixed-budget approaches, TORINO dynamically adapts the reduction rate to input complexity, allowing different images to retain different numbers of tokens. Experiments across multiple vision-language benchmarks show that TORINO achieves favorable efficiency-accuracy trade-offs, reducing the number of visual tokens with minimal performance loss.
- Abstract(参考訳): 視覚言語モデル(VLM)は様々なタスクにまたがる印象的な機能を示しているが、その計算コストは言語モデルに供給される多数の視覚トークンに支配されている。
既存のトークン削減手法は、各トークンの明示的な意味表現なしで、注意に基づくスコアやペアワイズな類似性に依存している。
本稿では,VLM における適応型視覚トークン削減のためのプラグイン・アンド・プレイフレームワークである TORINO (Token Reduction via Interpretable coNcept Overlap) を紹介する。
TORINOはスパースオートエンコーダ(SAE)を利用して、視覚トークンを解釈可能な潜在空間に投影する。
具体的には、概念重なりをアクティブなSAEラテント間の一致度として定義し、セマンティックコンテンツを共有するトークンをグループ化する。
次に、各グループ内の縮小はプルーニングまたはマージによって実行され、冗長性を取り除きながら意味的に重要な視覚情報を保存する統一されたフレームワークを提供する。
固定予算アプローチとは異なり、TORINOは動的に減少率を入力複雑性に適応させ、異なる画像に異なる数のトークンを保持することができる。
複数のビジョン言語ベンチマークによる実験では、TORINOは良好な効率と精度のトレードオフを実現し、パフォーマンス損失を最小限に抑えた視覚トークンの数を削減している。
関連論文リスト
- Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models [8.482327499828154]
視覚言語モデルのためのプラグイン・アンド・プレイ・モジュールとして,注意フリーで軽量なトークン削減フレームワークを提案する。
我々のフレームワークは、コンパクトな視覚表現を生成するために重要なトークンと多様なトークンの両方を保存します。
論文 参考訳(メタデータ) (2026-07-15T06:55:08Z) - VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set [80.50996301430108]
視覚言語表現のアライメントは、強いマルチモーダル推論能力を持つ現在のビジョン言語モデルを実現する。
視覚言語表現をその隠れアクティベーションにエンコードするスパースオートエンコーダVL-SAEを提案する。
解釈において、視覚と言語表現のアライメントは、意味論と概念を比較することで理解することができる。
論文 参考訳(メタデータ) (2025-10-24T10:29:31Z) - ZSPAPrune: Zero-Shot Prompt-Aware Token Pruning for Vision-Language Models [7.7352936204066]
本稿では,タスク関連性と情報多様性のバランスとして,視覚トークンプルーニングをモデル化する新しいゼロショット手法を提案する。
本手法は,精度の低下を最小限に抑えて,最先端技術に適合または超越した性能を実現する。
これらのゲインには、GPUメモリフットプリントの大幅な削減と推論レイテンシが伴っている。
論文 参考訳(メタデータ) (2025-10-20T06:18:47Z) - Rethinking Visual Token Reduction in LVLMs under Cross-modal Misalignment [38.04426918886084]
視覚言語モデル(LVLM)は、視覚入力をパッチレベルのトークンの密度の高いシーケンスとしてエンコードし、微細なセマンティクスをキャプチャする。
これまでは、大型言語モデル(LLM)の前か中のいずれかで、視覚トークンの削減を検討してきた。
トレーニングフリーで視覚のみのプルーニングフレームワークであるVisionDropを導入し、モーダル内(視覚から視覚への)注目に基づいて情報的視覚トークンを選択する。
論文 参考訳(メタデータ) (2025-06-27T14:55:40Z) - Revisit What You See: Disclose Language Prior in Vision Tokens for LVLM Decoding [6.612630497074871]
LVLM(Large Vision-Language Models)は、視覚認識と言語理解を統合することで、マルチモーダルタスクにおける強力なパフォーマンスを実現する。
テキスト生成のガイドとして視覚トークンを参照するトレーニング不要な復号法であるReVisiTを提案する。
論文 参考訳(メタデータ) (2025-06-11T08:46:55Z) - ToDRE: Visual Token Pruning via Diversity and Task Awareness for Efficient Large Vision-Language Models [59.47738955960352]
ToDREは、2段階でトレーニング不要なトークン圧縮フレームワークである。
トークンの多様性とトークン-タスク関連性に基づいてトークンをプルーニングすることで、優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-05-24T15:47:49Z) - End-to-End Vision Tokenizer Tuning [73.3065542220568]
低レベルの再構築のために最適化された視覚トークンーは、様々な表現と意味論を必要とする下流タスクである。
視覚トークン化の損失は、ターゲットタスクの表現ボトルネックになる可能性がある。
本研究では,視覚トークン化と目標自己回帰タスクを協調的に最適化するエンド・ツー・エンドの視覚トークン化チューニング手法であるETTを提案する。
論文 参考訳(メタデータ) (2025-05-15T17:59:39Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z) - Towards Semantic Equivalence of Tokenization in Multimodal LLM [149.11720372278273]
視覚トークン化は、視覚と言語間のセマンティックアライメントに不可欠である。
本稿では,新しい動的セマンティック等価ビジョントケナイザ(SeTok)を提案する。
SeTokは動的クラスタリングアルゴリズムを通じて、視覚的特徴をセマンティックユニットにグループ化する。
結果として得られる視覚トークンは意味的整合性を効果的に保持し、低周波と高周波の両方の視覚特徴をキャプチャする。
論文 参考訳(メタデータ) (2024-06-07T17:55:43Z) - Revisiting Multimodal Representation in Contrastive Learning: From Patch
and Token Embeddings to Finite Discrete Tokens [76.40196364163663]
本稿では,CLIPのような学習型視覚言語事前学習手法を提案する。
提案手法は,より包括的な表現を学習し,意味のある相互対応を捉えることができることを示す。
論文 参考訳(メタデータ) (2023-03-27T00:58:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。