論文の概要: Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
- arxiv url: http://arxiv.org/abs/2603.23914v1
- Date: Wed, 25 Mar 2026 04:01:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-26 21:06:11.120887
- Title: Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
- Title(参考訳): メモリ効率を考慮した大規模視覚言語モデルの注意認識推論最適化
- Authors: Fatih Ilhan, Gaowen Liu, Ramana Rao Kompella, Selim Furkan Tekin, Tiansheng Huang, Zachary Yahn, Yichang Xu, Ling Liu,
- Abstract要約: 本稿では,大規模視覚言語モデルに適した適応型・注目型最適化フレームワークであるAttentionPackについて述べる。
AttentionPackはメモリ効率を最大8倍改善し、より高いバッチサイズと高速なバッチ推論を可能にします。
また,アテンションPackとエビテーション,量子化,カーネル融合の併用効果についても報告する。
- 参考スコア(独自算出の注目度): 32.02306732686021
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Vision-Language Models (VLMs) have achieved remarkable success in multi-modal reasoning, but their inference time efficiency remains a significant challenge due to the memory overhead during decoding, especially when the query and answer of VLMs consist of long sequences of visual and text tokens. This paper presents AttentionPack, an adaptive and attention-aware optimization framework tailored for large vision-language models with improving memory-efficiency during decoding, focusing on addressing the challenges due to the increased high number of visual inputs and interactions, particularly in long-context tasks with multiple high-resolution images or videos. AttentionPack is novel in two aspects: (i) We introduce a multi-head attention compaction method for economically storing key and value matrices by exploiting the implicit low-rank structure, and (ii) we develop a token-specific attention-aware decompression mechanism to reduce latency overhead. Experimental results on multiple benchmarks demonstrate that AttentionPack improves memory efficiency by up to 8x, enabling higher batch sizes and faster batch inference while preserving the model output quality or longer context lengths for superior retrieval performance. We also report the effectiveness of AttentionPack combined with eviction, quantization and kernel fusion, showing further efficiency gains for resource-limited environments.
- Abstract(参考訳): VLM(Large Vision-Language Models)はマルチモーダル推論において顕著な成功を収めているが、その推論時間効率はデコード時のメモリオーバーヘッド、特にVLMのクエリと応答が視覚トークンとテキストトークンの長いシーケンスで構成されている場合、大きな課題である。
本稿では,大規模な視覚言語モデルに適した適応型・注目型最適化フレームワークであるAttentionPackについて述べる。
AttentionPackは2つの点で斬新である。
一 暗黙の低ランク構造を利用して、鍵及び価値行列を経済的に記憶するためのマルチヘッドアテンション圧縮法を導入し、
(II) 遅延オーバーヘッドを低減するためにトークン固有の注意認識圧縮機構を開発する。
複数のベンチマーク実験の結果、AttentionPackは最大8倍のメモリ効率向上を実現し、モデル出力の品質を保ちながら、より高いバッチサイズと高速なバッチ推論を可能にした。
また,アテンションPackとエビテーション,量子化,カーネル融合の併用効果について報告する。
関連論文リスト
- VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions [51.41587958253802]
視覚情報を捨てることなく推論コストを削減するVISOR(VISion On Request)を導入する。
VISORは画像とテキストトークン間の相互作用をスパースすることで効率を向上する。
実験により、VISORは、最先端の結果を一致または超えながら、計算コストを大幅に削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T17:58:17Z) - MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval [111.99106496142474]
Visual Document Retrieval (VDR)は、微細な視覚的詳細とグローバルな文書構造の両方をキャプチャする表現を必要とする。
既存のVDRモデルは、高解像度文書を処理する際に効率と効率のバランスをとるのに苦労する。
本稿では,X-VisEmbパラダイムを提案する。X-VisEmbパラダイムは,多分解能サンプリングと符号化から,粒度横断的特徴融合から適応的表現蒸留へと進展する。
論文 参考訳(メタデータ) (2026-03-07T15:17:22Z) - An Image Is Worth Ten Thousand Words: Verbose-Text Induction Attacks on VLMs [48.05423013052023]
本稿では,良性画像に知覚不能な逆方向の摂動を注入する新しい動詞文誘導攻撃(VTIA)を提案する。
まず、敵のプロンプトを自動的に識別する強化学習戦略を用いて、敵のプロンプト検索を行う。
次に、入力画像の対角的例を作成するために、視線対応摂動最適化を行い、摂動画像の視覚的埋め込みと対角的プロンプトの類似性を最大化する。
論文 参考訳(メタデータ) (2025-11-20T09:03:43Z) - FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding [55.700832127331324]
FLoCは、施設位置関数に基づく効率的なビジュアルトークン圧縮フレームワークである。
本手法は,トークンのコンパクトな部分集合を迅速に選択することにより,顕著な効率向上を実現する。
私たちのアプローチは、トレーニング不要、モデル非依存、クエリ非依存で、汎用的なソリューションを提供しています。
論文 参考訳(メタデータ) (2025-10-31T17:29:39Z) - AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference [11.73134417321505]
本稿では,LVLM推論の高速化を目的とした新しいKVキャッシュ圧縮手法であるAirCacheを提案する。
本手法は,視覚的KVキャッシュの10%を保ちながら,フルキャッシュに匹敵する性能を実現する。
論文 参考訳(メタデータ) (2025-03-31T11:13:18Z) - TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model [56.43860351559185]
高速かつ低メモリの textbfVLM に対する推論時間最適化を備えた textbfToken textbfPruning の互換性である textbfTopV を導入する。
我々のフレームワークは、各ソースの視覚的トークンの重要性を測定するために、視覚的なコスト関数を組み込んでおり、低重要トークンの効果的なプルーニングを可能にしている。
論文 参考訳(メタデータ) (2025-03-24T01:47:26Z) - FOLDER: Accelerating Multi-modal Large Language Models with Enhanced Performance [9.782362715017596]
視覚トークン列の長さを削減するために設計された,シンプルで効果的なプラグアンドプレイモジュールであるFOLDERを紹介する。
我々は、異なる還元戦略によってもたらされた情報損失を分析し、視覚的冗長性を取り除きながら鍵情報を保存するFOLDERを開発した。
FOLDERは、オリジナルのモデルと同等またはそれ以上のパフォーマンスを達成すると同時に、最大70%のビジュアルトークンを削除することで、複雑さを劇的に低減する。
論文 参考訳(メタデータ) (2025-01-05T03:28:45Z) - FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression [45.37530855889661]
高解像度画像は、多モード大言語モデルに入力される視覚トークンの数を2次的に増加させる。
現在の研究は、しばしば性能を犠牲にして、効率を改善するために視覚的トークン圧縮法を開発している。
情報密度の低い冗長領域を圧縮する視覚誘導型サンプルラと、ユーザ指示と強く相関する視覚トークンを選択するテキスト誘導型サンプルラとを用いて、粗大な視覚トークン圧縮法を構築する。
論文 参考訳(メタデータ) (2024-11-21T15:37:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。