論文の概要: VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
- arxiv url: http://arxiv.org/abs/2607.12756v1
- Date: Tue, 14 Jul 2026 13:21:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.157328
- Title: VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
- Title(参考訳): VisCo: ビジュアルトークン圧縮のための固有エンコーダとして大規模言語モデルを活用する
- Authors: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu,
- Abstract要約: 視覚言語モデル(VLM)は大量の視覚トークンを処理し、かなりの推論とオーバーヘッドレイテンシをもたらす。
本稿では,VLM自体を固有圧縮機として再利用する,トレーニング効率のよい自己圧縮フレームワークであるVisCoを提案する。
- 参考スコア(独自算出の注目度): 52.23010472235226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) process large numbers of visual tokens, resulting in substantial inference latency and memory overhead. This has motivated extensive research on visual token compression. While training-free strategies rely on heuristic metrics and suffer significant performance degradation under high compression ratios, many training-based methods introduce external compression modules that force the VLM backbone to adapt, incurring substantial retraining cost and compromising VLMs' priors. Effective visual token compression hinges on strong information encoding, a capability already present in pretrained VLMs but underutilized by existing approaches. Motivated by this, we propose VisCo, a training-efficient self-compression framework that reuses the pretrained VLM itself as an intrinsic compressor. VisCo is a parameter-sharing autoencoder that compresses visual information using a small set of memory tokens and transfers hierarchical information from encoding to decoding. Experiments show that VisCo surpasses prior methods across all evaluated compression ratios, with larger gains under more aggressive compression, and remains stable even in the extreme single-token setting. Moreover, when combined with the original visual tokens, the learned memory tokens can even improve the base model, suggesting that VisCo captures complementary representations beyond compression.
- Abstract(参考訳): 視覚言語モデル(VLM)は大量の視覚トークンを処理し、推論遅延とメモリオーバーヘッドを著しく増大させる。
これは視覚的トークン圧縮に関する広範な研究を動機付けている。
トレーニングフリー戦略はヒューリスティックな指標に頼り、高い圧縮比で大幅な性能低下を被るが、多くのトレーニングベースの手法は、VLMのバックボーンに適応させ、かなりの再トレーニングコストを発生させ、VLMの先行を妥協させる外部圧縮モジュールを導入している。
効果的なビジュアルトークン圧縮は、事前訓練されたVLMにすでに存在するが、既存のアプローチでは利用されていない強力な情報符号化に基づいている。
そこで本研究では,VLM自体を固有圧縮機として再利用する,トレーニング効率の高い自己圧縮フレームワークであるVisCoを提案する。
VisCoはパラメータ共有オートエンコーダで、メモリトークンの小さなセットを使用して視覚情報を圧縮し、階層的な情報をエンコーディングからデコードに転送する。
実験により、VisCoは全ての評価された圧縮比で先行手法を超越し、より攻撃的な圧縮の下で大きなゲインが得られ、極端に単調な設定でも安定していることがわかった。
さらに、元のビジュアルトークンと組み合わせることで、学習したメモリトークンはベースモデルを改善することができ、VisCoは圧縮以上の補完的な表現をキャプチャする。
関連論文リスト
- KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy [8.24188371483346]
VLM(Vision-Language Models)は、LLM(Large Language Models)の重要かつ急速に成長する拡張として登場した。
視覚トークンのための新しいKVキャッシュ圧縮フレームワークであるKVCapsuleを提案する。
圧縮率の60%でTPSの最大2倍、KVキャッシュメモリの2.4倍の削減を実現し、精度や応答品質の劣化を無視できることを示した。
論文 参考訳(メタデータ) (2026-05-14T23:01:58Z) - PIO-FVLM: Rethinking Training-Free Visual Token Reduction for VLM Acceleration from an Inference-Objective Perspective [59.24570811503256]
本稿では,視覚モデル(VLM)における冗長な視覚トークンを減らし,推論を高速化するPIO-FVLMを提案する。
提案されているPIO-FVLMは、トレーニングフリーで、FlashAttentionと互換性があり、実用的なアプリケーションやデプロイメントに親しみやすい。
LLaVA-Next-7Bでは、PIO-FVLMは視覚トークンの11.1%しか保持していないが、オリジナルのパフォーマンスの97.2%を維持している。
論文 参考訳(メタデータ) (2026-02-04T15:33:10Z) - VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs [82.72388893596555]
MLLM(Multimodal Large Language Models)は、計算とメモリのボトルネックに遭遇する。
従来のトークン圧縮技術は、重要な情報を破棄するリスクを負うルールによって制約されることが多い。
我々は,トークン圧縮をエンドツーエンドの学習可能な決定プロセスに再構成する軽量なプラグアンドプレイフレームワークとして,トークン圧縮を再構成する。
論文 参考訳(メタデータ) (2025-10-18T17:54:18Z) - LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models [62.240460476785934]
視覚エンコーダの中間層内で効果的なトークン圧縮を実現する新しいフレームワークであるLaCo(Layer-wise Visual Token Compression)を提案する。
LaCoは,1)空間-チャネル変換によって隣接するトークンを体系的にマージするレイヤワイドピクセルシャッフル機構,2)非パラメトリックショートカットを用いた残差学習アーキテクチャ,の2つのコアコンポーネントを導入している。
論文 参考訳(メタデータ) (2025-07-03T03:42:54Z) - DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models [28.379533608574814]
トークン表現の最適化とビデオ大言語モデルの高速化を目的とした,トレーニング不要なトークン圧縮手法であるDyCokeを提案する。
DyCokeは、フレーム間で冗長トークンをマージすることによって、時間的冗長性を最小化するために、プラグインとプレイの時間的圧縮モジュールを組み込んでいる。
各デコードステップでクリティカルトークンを動的に保持することで、高品質な推論を保証する。
論文 参考訳(メタデータ) (2024-11-22T15:55:19Z) - VoCo-LLaMA: Towards Vision Compression with Large Language Models [31.398537194299752]
VLM(Vision-Language Models)は、様々なマルチモーダルタスクにおいて顕著な成功を収めている。
LLMを用いて視覚トークンを圧縮する最初の方法であるVoCo-LLaMAを提案する。
提案手法は, 576$times$の圧縮比で最小性能損失を達成し, 最大94.8$%のFLOPと69.6$%の高速化を実現した。
論文 参考訳(メタデータ) (2024-06-18T05:05:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。