論文の概要: Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles
- arxiv url: http://arxiv.org/abs/2608.04483v1
- Date: Wed, 05 Aug 2026 06:16:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.737441
- Title: Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles
- Title(参考訳): すべての冗長なトークンが似ているわけではない - 視覚的トークンのプルーニングをTokenロールを通して分析する
- Authors: Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim,
- Abstract要約: EmbedLensによって同定されたトークンロールのレンズを通して、視覚的トークンプルーニングを分析する。
我々はトークンロールの割り当て手順を洗練し、ロールプロテクトされたプルーニングのバリエーションを評価する。
以上の結果から,非アレーブトークンの保存は,時として性能の維持や改善につながることが示唆された。
- 参考スコア(独自算出の注目度): 2.8997601131408466
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) process an image as a sequence of visual tokens, which creates a substantial computational bottleneck during inference. Recent visual token pruning methods address this issue by removing seemingly redundant tokens, yet it remains unclear how these pruning decisions relate to the functional roles of visual tokens. In this work, we analyze visual token pruning through the lens of token roles identified by EmbedLens. We first show that representative pruning methods exhibit distinct token-role biases, but these biases do not directly correlate with downstream performance. To better understand this behavior, we refine the token-role assignment procedure and evaluate role-protected pruning variants. Our results show that preserving non-alive tokens can sometimes maintain or improve performance, suggesting that tokens with weak direct semantic alignment may still affect model behavior under pruning. Our code is publicly available at https://github.com/jaykim9870/Not_All_Redundant_Tokens_Are_Alike.
- Abstract(参考訳): 視覚言語モデル(VLM)は、イメージを視覚トークンのシーケンスとして処理し、推論中にかなりの計算ボトルネックを発生させる。
最近の視覚的トークンプルーニング法は、一見冗長なトークンを除去することでこの問題に対処しているが、これらのプルーニング決定が視覚的トークンの機能的役割にどのように関係しているかは定かではない。
本研究では,EmbedLensが同定したトークンロールのレンズを通して視覚的トークンプルーニングを分析する。
まず,代表プルーニング法は異なるトークンロールバイアスを示すが,これらのバイアスは下流性能と直接相関しない。
この振る舞いをよりよく理解するため、トークンロール代入手順を洗練し、ロール保護されたプルーニング変種を評価する。
この結果から, 直接的意味的アライメントの弱いトークンは, プルーニング時のモデル動作に影響を与える可能性が示唆された。
私たちのコードはhttps://github.com/jaykim9870/Not_All_Redundant_Tokens_Are_Alikeで公開されています。
関連論文リスト
- DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models [13.866355425347384]
視覚言語モデルの視覚入力は、しばしばテキストよりもかなり長いトークンシーケンスに符号化される。
近年の手法では、トークンの重要度を判定し、低スコアのトークンを1回のパスでプルーニングすることで、このボトルネックに対処している。
この知見に触発されたDIVEは、動的エビデンス構築として視覚障害者のプルーニングをリキャストする、トレーニング不要のフレームワークである。
論文 参考訳(メタデータ) (2026-08-05T06:32:25Z) - Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention [50.97683288777336]
MLLM(Multimodal Large Language Models)は、巨大な視覚トークンに依存するため、計算オーバーヘッドがかなり大きい。
近年の研究では、この問題を緩和するためにトークンプルーニングが検討されている。
本稿では,効率的な推論のためのビジュアルトークン・プルーニング・フレームワークであるHoloVを提案する。
論文 参考訳(メタデータ) (2025-10-03T11:33:40Z) - TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models [4.779482139419908]
テキストトークンと意味的に視覚トークンを除去する相互情報に基づくトークンプルーニング戦略を導入する。
LLaVA-15-7BやLLaVA-7Bといったモデルでは,テキストトークンを88.9%削減しながら高い性能を維持している。
論文 参考訳(メタデータ) (2025-08-30T02:43:50Z) - PoRe: Position-Reweighted Visual Token Pruning for Vision Language Models [12.189644988996022]
本稿では,視覚的トークンプルーニングにおける遅延バイアスを軽減するための,極めて単純かつ効果的なアプローチを提案する。
画像内の空間的位置に応じて視覚的トークンの注意点を調節する簡単なリウェイト機構を提案する。
提案手法は,既存のビジュアルトークンプルーニングフレームワークにシームレスに組み込むことができるプラグイン・アンド・プレイソリューションである。
論文 参考訳(メタデータ) (2025-08-25T08:56:32Z) - VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization [70.98122339799218]
LMM(Large Multimodal Models)は、多数の視覚トークンを微粒な視覚情報に活用することにより、視覚言語タスクに優れる。
推論中の視覚トークンを減らすことを目的とした以前の研究は、一般的に、視覚のみのトークンや視覚言語トークンの注意スコアから得られた重要マップを利用して、1つまたは複数のプルーニング段階にわたってトークンをプルーンする。
重要地図導出プロセスとリサイクル機構を備えたプログレッシブプルーニングモジュールを導入したトークンプルーニングフレームワークであるVFlowOptを提案する。
実験により、VFlowOptは、同等のパフォーマンスを維持しながら、90%のビジュアルトークンをプルークでき、KVキャッシュメモリが89%削減され、3.8になった。
論文 参考訳(メタデータ) (2025-08-07T09:47:21Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs [34.3615740255575]
大規模視覚言語モデル(LVLM)は一般的に、テキストのトークンよりもはるかに多くの視覚トークンを含んでいる。
LVLMにおけるより効果的なトークンプルーニングに視覚的手がかりを利用するプラグイン・アンド・プレイ方式であるVisPrunerを提案する。
その結果, VisPruner は LLaVA-1.5-7B の FLOP を 91% 削減し, 推論遅延を 75% 削減できることを示した。
論文 参考訳(メタデータ) (2024-12-02T18:57:40Z) - What Are You Token About? Dense Retrieval as Distributions Over the
Vocabulary [68.77983831618685]
本稿では,2つのエンコーダが生成するベクトル表現を,モデルの語彙空間に投影することで解釈する。
得られたプロジェクションは、リッチな意味情報を含み、それらの間の接続を描画し、スパース検索を行う。
論文 参考訳(メタデータ) (2022-12-20T16:03:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。