論文の概要: ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs
- arxiv url: http://arxiv.org/abs/2606.00543v1
- Date: Sat, 30 May 2026 05:28:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 00:57:58.903955
- Title: ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs
- Title(参考訳): ETC: VLMにおけるタスク認識型視覚情報蒸留による極端トーケン圧縮
- Abstract要約: 高解像度画像は多数の視覚トークンを生成するため、推論時に高い計算コストとKVキャッシュオーバーヘッドが生じる。
本稿では,入力トークン数を減らす際にタスク損失を最小限に抑えるExtreme Token Compressionフレームワークを提案する。
ETCはシングルトーケン圧縮でも有効であり、強いタスク性能を維持しながらKVキャッシュオーバーヘッドを大幅に削減する。
- 参考スコア(独自算出の注目度): 34.659605252016036
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In Vision-Language Models (VLMs), high-resolution images produce a large number of visual tokens, resulting in high computational costs and KV-cache overhead during inference. To address this problem, we propose an Extreme Token Compression (ETC) framework that minimizes task loss when reducing the number of input tokens based on the principle of variational information distillation. Specifically, from an information-theoretic perspective, we show that minimizing task loss requires the compact representation to preserve the instruction-aware sufficient statistic of the task-relevant visual information for prediction. In practice, ETC leverages text-to-image cross-attention to weight the original visual features to approximate the latent instruction-aware predictive statistic. Moreover, ETC introduces a variational information distillation, enabling the compact representation to preserve the essential information to recover this predictive statistic. Experiments on LLaVA-1.5-7B and Qwen3-VL-2B show that ETC remains effective even under single-token compression, substantially reducing KV-cache overhead while retaining strong task performance.
- Abstract(参考訳): Vision-Language Models (VLM) では、高解像度画像は多数の視覚トークンを生成するため、推論時に高い計算コストとKVキャッシュオーバーヘッドが発生する。
この問題に対処するために,変量情報蒸留の原理に基づく入力トークン数を削減する際に,タスク損失を最小限に抑えるETC(Extreme Token Compression)フレームワークを提案する。
具体的には、情報理論の観点から、タスクの損失を最小限に抑えるためには、タスク関連視覚情報の十分な統計量を保持するために、コンパクトな表現が必要であることを示す。
実際には、ETCはテキストと画像の相互アテンションを利用して、元の視覚的特徴を重み付けし、潜伏した命令認識予測統計を近似する。
さらに、ETCは変動情報蒸留を導入し、コンパクト表現が必須情報を保存し、この予測統計を復元することを可能にする。
LLaVA-1.5-7B と Qwen3-VL-2B の実験では、ETC はシングルトーケン圧縮の下でも有効であり、強いタスク性能を維持しながら KV-cache オーバーヘッドを大幅に低減することを示した。
関連論文リスト
- VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression [52.23010472235226]
視覚言語モデル(VLM)は大量の視覚トークンを処理し、かなりの推論とオーバーヘッドレイテンシをもたらす。
本稿では,VLM自体を固有圧縮機として再利用する,トレーニング効率のよい自己圧縮フレームワークであるVisCoを提案する。
論文 参考訳(メタデータ) (2026-07-14T13:21:36Z) - VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding [50.904820090651974]
VEN-VLは、効果的かつ効率的な知覚のための視覚アンサンブルMoEフレームワークである。
まず、異なる視点の視覚的表現を統一することで、情報容量を増強する。
そして、情報密度を高めるために、特殊視覚の専門家による適応ルータで段階的に圧縮する。
論文 参考訳(メタデータ) (2026-05-25T15:28:48Z) - VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions [51.41587958253802]
視覚情報を捨てることなく推論コストを削減するVISOR(VISion On Request)を導入する。
VISORは画像とテキストトークン間の相互作用をスパースすることで効率を向上する。
実験により、VISORは、最先端の結果を一致または超えながら、計算コストを大幅に削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T17:58:17Z) - Less Is More -- Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models [69.84867664371826]
視覚トークン圧縮はLVLM(Large Vision-Language Models)のロバスト性を大幅に低下させることを示す。
小さくて知覚不能な摂動はトークンの重要度を著しく変更し、圧縮機構が誤ってタスククリティカル情報を破棄する。
我々は,この脆弱性を体系的に研究し,活用するための圧縮認識攻撃を提案する。
論文 参考訳(メタデータ) (2026-01-17T13:02:41Z) - Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation [8.316354570715491]
VLA(Vision-Language-Action)モデルは、Embodied AIにおいて強力なパラダイムとして登場した。
本稿では,視覚情報の効率的なタスク指向圧縮を目的とした,ハイブリッドな命令条件付きトークン圧縮フレームワークを提案する。
提案手法は,FLOPを59%,視覚トークン数を3倍以上削減しつつ,LIBEROベンチマークの競争的成功率を実現していることを示す。
論文 参考訳(メタデータ) (2025-11-24T10:06:41Z) - Variation-aware Vision Token Dropping for Faster Large Vision-Language Models [24.952668143243542]
大規模視覚言語モデル(LVLM)はマルチモーダル理解タスクにおいて顕著な機能を示した。
トーケン圧縮は、処理されるトークンの数を減らすことにより、計算効率を向上させることにより、直接的な解を提供する。
我々は,LVLM推論中に最小限の変動を伴う視覚トークンを段階的に除去する,変分認識型視覚トークンドロップ(textiti.e., textbfV$2$Drop)を提案する。
論文 参考訳(メタデータ) (2025-09-01T15:28:44Z) - Efficient LLaMA-3.2-Vision by Trimming Cross-attended Visual Features [24.33252753245426]
我々は、相互注意マップにおけるスパースの性質を利用して、冗長な視覚的特徴を選択的に創り出す。
我々のモデルは、ベンチマークパリティを達成しながら、推論レイテンシとメモリ使用量を減らすことができる。
論文 参考訳(メタデータ) (2025-04-01T09:10:32Z) - TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model [56.43860351559185]
高速かつ低メモリの textbfVLM に対する推論時間最適化を備えた textbfToken textbfPruning の互換性である textbfTopV を導入する。
我々のフレームワークは、各ソースの視覚的トークンの重要性を測定するために、視覚的なコスト関数を組み込んでおり、低重要トークンの効果的なプルーニングを可能にしている。
論文 参考訳(メタデータ) (2025-03-24T01:47:26Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z) - Efficient Large Multi-modal Models via Visual Context Compression [23.966237939194514]
本稿では,視覚トークンに関する冗長性の解析と,大規模言語モデルにおける効率的な訓練について述べる。
最初の実験では、単に平均プーリングによってテスト段階で最大70%の視覚トークンを除去することは、視覚的質問応答精度の最小3%の低下にしか至らないことが示された。
GQAベンチマークにビジュアルコンテキストを導入し、視覚トークンの数を減らし、性能を犠牲にすることなくトレーニングと推論効率を向上させる。
論文 参考訳(メタデータ) (2024-06-28T17:57:14Z) - TPC-ViT: Token Propagation Controller for Efficient Vision Transformer [6.341420717393898]
ビジョントランス (ViT) は様々なコンピュータビジョンタスクにおいて有望な結果を得た。
この課題に対処するために、段階的なトークン削減を採用する以前のアプローチでは、ひとつのレイヤにおけるトークンの冗長性は、以下のすべてのレイヤにおける冗長性を意味すると仮定されている。
本稿では、2つの異なるトークン分布を組み込んだ新しいトークン伝搬制御器(TPC)を提案する。
論文 参考訳(メタデータ) (2024-01-03T00:10:33Z) - Disentangled Representation Learning with Transmitted Information Bottleneck [57.22757813140418]
textbfDisTIB (textbfTransmitted textbfInformation textbfBottleneck for textbfDisd representation learning) は情報圧縮と保存のバランスを保った新しい目的である。
論文 参考訳(メタデータ) (2023-11-03T03:18:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。