論文の概要: ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs
- arxiv url: http://arxiv.org/abs/2606.31982v1
- Date: Tue, 30 Jun 2026 17:20:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.325538
- Title: ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs
- Title(参考訳): ERA:効率的なMLLMのための意図的注意によるエントロピー誘導型視覚トーケンプルーニング
- Abstract要約: 本稿では,効率的なMLLMを実現するために,Rectified Attention を用いたエントロピー誘導型ビジュアルトークン解析フレームワーク ERA を提案する。
ERAはDEP(Dual-view Entropy Pruning)、BTR(Bias-Aware Tokencycle)、LAR(Logit-Reserving Attention Rectification)の3つの重要な構成要素から構成される。
- 参考スコア(独自算出の注目度): 77.57757084153083
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) incur prohibitive inference costs due to long visual token sequences. Training-free visual token reduction provides an efficient solution. However, existing methods distort attention distributions, giving rise to a phenomenon we term Attention Logit Collapse. To address this issue, we propose ERA, an Entropy-guided visual token pruning framework with Rectified Attention for efficient MLLMs. Specifically, ERA comprises three crucial components: Dual-view Entropy Pruning (DEP), Bias-aware Token Recycling (BTR), and Logit-preserving Attention Rectification (LAR). First, DEP identifies representative anchor tokens by jointly modeling visual diversity and head-wise saliency. BTR then recycles pruned tokens into their corresponding anchors while estimating a cluster-level logit bias. Building upon this, LAR injects the estimated bias into attention logits, effectively rectifying the collapse induced by token reduction. Together, these components preserve visual evidence even under aggressive compression, enabling robust performance across single-image, multi-image, and video settings on a wide range of MLLMs. Beyond delivering practical acceleration, ERA establishes logit-preserving visual token pruning as a principled framework for efficient MLLMs, unifying theoretical foundation, algorithmic design, and practical deployment. The code is at https://github.com/924973292/ERA.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、長い視覚的トークンシーケンスによる推論の禁止コストを発生させる。
トレーニング不要のビジュアルトークン削減は、効率的なソリューションを提供する。
しかし、既存の手法は注意分布を歪め、注意ログ崩壊(Atention Logit Collapse)と呼ぶ現象を生じさせる。
この問題に対処するために,効率的なMLLMのためのRectified Attentionを用いたエントロピー誘導型ビジュアルトークン解析フレームワークであるERAを提案する。
具体的には、DEP(Dual-view Entropy Pruning)、BTR(Bias-Aware Tokencycle)、LAR(Logit-Reserving Attention Rectification)の3つの重要な構成要素からなる。
まず、DEPは視覚的多様性と頭部の正当性を共同でモデル化することで代表的アンカートークンを識別する。
その後、BTRはクラスタレベルのロジットバイアスを推定しながら、プルーンドトークンを対応するアンカーにリサイクルする。
これに基づいて、LARは推定バイアスをアテンションロジットに注入し、トークン還元によって引き起こされる崩壊を効果的に修正する。
これらのコンポーネントは、積極的圧縮でも視覚的証拠を保存し、幅広いMLLM上でのシングルイメージ、マルチイメージ、ビデオ設定での堅牢なパフォーマンスを実現する。
ERAは、実用的なアクセラレーションを提供するだけでなく、効率的なMLLM、理論基盤の統合、アルゴリズム設計、実用的な展開のための原則的なフレームワークとして、ロジット保存型ビジュアルトークンプルーニングを確立している。
コードはhttps://github.com/924973292/ERAにある。
関連論文リスト
- Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs [44.74237674161132]
MLLM(Multimodal Large Language Models)における推論は、きめ細かい視覚認識と厳密な論理推論の両方を必要とする。
明示的なテキストベースのChain-of-Thought (CoT) は計算に高価であり、視覚幻覚を起こしやすい。
既存の潜在的推論手法は、通常、コストのかかる訓練を必要とする。
論文 参考訳(メタデータ) (2026-08-04T10:46:10Z) - Disentangling Semantic Attention from Structural Bias in the Attention Manifold [61.68044165974505]
MLLM(Multimodal Large Language Models)は、意味的に非形式的な視覚トークンに対して不均等な注意を払っている。
本研究では,SPAR(Saliency-guided Purification and Adaptive Redistribution)を導入した。
論文 参考訳(メタデータ) (2026-07-27T05:30:19Z) - Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction [42.23525789989544]
MLLM(Multimodal Large Language Models)において、しばしば注意がモデルによって引き起こされる。
我々は,タスク条件付き注意をモデル誘発前と区別するために,事前補正トークン削減(PriorTR)を提案する。
PriorTRは、強いトレーニングのないベースラインよりも精度と効率のトレードオフを一貫して改善する。
論文 参考訳(メタデータ) (2026-06-23T05:24:50Z) - Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs [89.7106332677868]
意味進化から空間的相互作用を分離する学習自由推論パラダイムであるVisual-Skipを提案する。
V-Skipは、ブロックワイドの空間性を達成するために、冗長な視覚的注意を効果的に回避し、様々なMLLM間で94.16%から100.31%のパフォーマンス維持を維持している。
論文 参考訳(メタデータ) (2026-06-07T08:32:13Z) - RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models [24.3914653184824]
LVLM(Large Vision-Language Models)は、言語デコーダによって処理される膨大な数の視覚トークンによって、推論の禁止コストに悩まされる。
既存のプルーニング法は、視覚トークンの可逆的な除去が、事前訓練されたフルトケン状態から逸脱した隠れ状態の分布シフトを引き起こすため、大きな性能劣化を引き起こすことが多い。
本稿では,累積的視覚トークンプルーニングと遅延修復機構を統合した一貫性表現プルーナを提案する。
論文 参考訳(メタデータ) (2026-04-04T13:31:45Z) - Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation [51.743225614196774]
マルチモーダル大言語モデル (MLLM) は視覚言語推論において顕著な進歩を遂げている。
彼らは幻覚に弱いままであり、そこで生成されたコンテンツは視覚的証拠から逸脱する。
近年の視覚強調法では、復号時に視覚トークンを補強することでこの問題に対処しようとしている。
本稿では,MLLMのトレーニングフリーフレームワークであるAdaptive Visual Reinforcement (AIR)を提案する。
論文 参考訳(メタデータ) (2026-02-27T14:18:51Z) - CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models [14.30682201364961]
本研究では,注目度をベクトルサイズで重み付けした注意貢献が,視覚的トークン選択のためのより正確な基準を提供することを示す。
本稿では、重要な機能遷移における注意貢献を用いて視覚トークンを創出する二重戦略フレームワークであるCAPA(Contribution-Aware Pruning and FFN Approximation)を紹介する。
論文 参考訳(メタデータ) (2026-01-30T19:09:03Z) - Attention Reallocation: Towards Zero-cost and Controllable Hallucination Mitigation of MLLMs [62.9348974370985]
約ゼロの余剰コストで幻覚を緩和するための注意再配置(AttnReal)を提案する。
我々のアプローチは,MLLMの注意分布が,歴史的出力トークンによって特徴が支配されるという重要な観測によって動機付けられている。
この観測に基づいて、AttnRealは出力トークンからの過剰な注意をリサイクルし、それを視覚トークンに再配置することで、MLLMの言語優先への依存を軽減します。
論文 参考訳(メタデータ) (2025-03-11T11:52:37Z) - RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs [38.34856927170692]
MLLM(Multimodal Large Language Model)の学習用フレームワークを提案する。
Probe-Activated Dynamic FFNとHollow Attentionで構成されており、ビジュアルトークンの計算の調整可能な削減を可能にする。
実験では、デコーダのみのMLLMに特有の、実質的で、構造化され、クラスタ化された冗長性を示す。
論文 参考訳(メタデータ) (2025-01-31T11:09:16Z) - Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters [54.01228554126122]
視覚言語モデル(VLM)は、様々な視覚的理解と推論タスクにまたがる強力な能力を示している。
推論コストを削減するために、LLM(Large Language Models)を縮小するか、イメージを表すのに必要な入力トークンの数を削減できる。
高速圧縮に適したトークン圧縮アルゴリズムを設計する第一歩を踏み出す。
論文 参考訳(メタデータ) (2024-11-05T18:54:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。