論文の概要: Visual Token Compression Enhances Robustness of MLLMs
- arxiv url: http://arxiv.org/abs/2607.22716v1
- Date: Tue, 21 Jul 2026 15:52:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.83936
- Title: Visual Token Compression Enhances Robustness of MLLMs
- Title(参考訳): 視覚的トーケン圧縮はMLLMのロバスト性を高める
- Abstract要約: 視覚的トークンプルーニングがマルチモーダル大言語モデル(MLLM)のロバスト性を高めることを初めて示す。
我々は,ロバスト・プルーニング層におけるOOD視覚トークンを削減し,ジェイルブレイクや幻覚に対するモデルロバスト性を高めることを目指している。
本手法は,ジェイルブレイク攻撃の防御において平均13.29%の改善を達成し,幻覚の緩和において一貫して競争力を発揮し,MMEなどの一般データセット上での強い結果を維持する。
- 参考スコア(独自算出の注目度): 54.28558472087342
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this paper, we show for the first time that visual token pruning enhances the robustness of Multimodal Large Language Models (MLLMs), mitigating vulnerabilities such as jailbreak attacks and hallucinations. Given that vision and language modalities cannot be perfectly aligned, the misaligned visual tokens might act as out-of-distribution (OOD) inputs, leading to unpredictable outputs and introducing potential vulnerabilities. Building on this insight, we aim to enhance model robustness against jailbreaks and hallucinations by reducing OOD visual tokens at robust-pruning layers, while also reducing inference cost as a side benefit. Specifically, we measure the distance between each visual token and the language feature space. Then, visual tokens with large distances are identified as OOD tokens, which can be iteratively pruned. To demonstrate the effectiveness of our method, we evaluate it on seven diverse popular benchmarks. Notably, our method yields an average improvement of 13.29\% in defending jailbreak attacks, consistently achieves competitive performance in mitigating hallucinations, and maintains strong results on general datasets like MME.
- Abstract(参考訳): 本稿では,視覚的トークンプルーニングによってマルチモーダル大規模言語モデル(MLLM)の堅牢性が向上し,脱獄攻撃や幻覚などの脆弱性が軽減されることを示す。
ビジョンと言語のモダリティが完全に整合することができないことを考えると、不整合の視覚トークンはアウト・オブ・ディストリビューション(OOD)の入力として機能し、予測不能なアウトプットと潜在的な脆弱性をもたらす可能性がある。
この知見に基づいて,ロバストプレーニング層におけるOOD視覚トークンの削減と,副作用としての推論コストの削減により,ジェイルブレイクや幻覚に対するモデルロバスト性の向上を目指す。
具体的には,各視覚トークンと言語特徴空間の距離を測定する。
次に、大きな距離を持つ視覚トークンをOODトークンとして識別し、反復的にプルーニングすることができる。
提案手法の有効性を示すため,7つの多種多様なベンチマークを用いて評価を行った。
特に,本手法は,ジェイルブレイク攻撃の防御において平均13.29.%の改善を達成し,幻覚の緩和における競争性能を一貫して達成し,MMEなどの一般データセット上での強い結果を維持する。
関連論文リスト
- SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models [25.951841702056544]
MLLM(Multimodal large language model)は、長い視覚トークンシーケンスを処理する際に、かなりの計算オーバーヘッドを発生させる。
SinkPrunerは、効率的なMLLM推論のためのトレーニング不要なビジュアルトークンプルーニングフレームワークである。
SinkPrunerは、ハイノーム冗長性をフィルタし、注意シンクと注意分散を緩和するビジュアルサニタイザと、テキストクエリにセマンティックに整合したトークンを保持するテキスト誘導プルーナーの2つの主要なモジュールで、粗い粒度の設計に従う。
論文 参考訳(メタデータ) (2026-09-01T09:52:10Z) - ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs [77.57757084153083]
本稿では,効率的なMLLMを実現するために,Rectified Attention を用いたエントロピー誘導型ビジュアルトークン解析フレームワーク ERA を提案する。
ERAはDEP(Dual-view Entropy Pruning)、BTR(Bias-Aware Tokencycle)、LAR(Logit-Reserving Attention Rectification)の3つの重要な構成要素から構成される。
論文 参考訳(メタデータ) (2026-06-30T17:20:29Z) - CHASD: Language Increment-Calibrated Contrastive Decoding against Hallucination in LVLMs [16.77211535169488]
本稿では,大規模視覚言語モデルのためのコントラスト型幻覚認識ステップワイドデコーディング(CHASD)を提案する。
CHASDは、次のトークンの最大確率が閾値以下である場合にのみ、不確実性駆動の信頼ゲートを使用してコントラスト分岐を活性化する。
実験の結果,CHASDは強いトレーニングのないベースラインよりも幻覚関連指標を向上し,競争的推論効率が向上することが示された。
論文 参考訳(メタデータ) (2026-05-22T08:03:12Z) - Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation [51.743225614196774]
マルチモーダル大言語モデル (MLLM) は視覚言語推論において顕著な進歩を遂げている。
彼らは幻覚に弱いままであり、そこで生成されたコンテンツは視覚的証拠から逸脱する。
近年の視覚強調法では、復号時に視覚トークンを補強することでこの問題に対処しようとしている。
本稿では,MLLMのトレーニングフリーフレームワークであるAdaptive Visual Reinforcement (AIR)を提案する。
論文 参考訳(メタデータ) (2026-02-27T14:18:51Z) - Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention [50.97683288777336]
MLLM(Multimodal Large Language Models)は、巨大な視覚トークンに依存するため、計算オーバーヘッドがかなり大きい。
近年の研究では、この問題を緩和するためにトークンプルーニングが検討されている。
本稿では,効率的な推論のためのビジュアルトークン・プルーニング・フレームワークであるHoloVを提案する。
論文 参考訳(メタデータ) (2025-10-03T11:33:40Z) - Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models [16.540220733551823]
VLM(Large Vision-Language Models)は、強力なマルチモーダル推論を実現するが、冗長な視覚トークンから重い推論コストを発生させる。
注意に基づく手法は、しばしばレイヤやヘッド間で不安定な生の注意スコアに依存する。
簡単な直感に基づいて構築されたトレーニング不要のフレームワークとして,我々の提案する。
論文 参考訳(メタデータ) (2025-09-29T14:20:05Z) - Rethinking Visual Token Reduction in LVLMs under Cross-modal Misalignment [38.04426918886084]
視覚言語モデル(LVLM)は、視覚入力をパッチレベルのトークンの密度の高いシーケンスとしてエンコードし、微細なセマンティクスをキャプチャする。
これまでは、大型言語モデル(LLM)の前か中のいずれかで、視覚トークンの削減を検討してきた。
トレーニングフリーで視覚のみのプルーニングフレームワークであるVisionDropを導入し、モーダル内(視覚から視覚への)注目に基づいて情報的視覚トークンを選択する。
論文 参考訳(メタデータ) (2025-06-27T14:55:40Z) - ToDRE: Visual Token Pruning via Diversity and Task Awareness for Efficient Large Vision-Language Models [59.47738955960352]
ToDREは、2段階でトレーニング不要なトークン圧縮フレームワークである。
トークンの多様性とトークン-タスク関連性に基づいてトークンをプルーニングすることで、優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-05-24T15:47:49Z) - Attention Reallocation: Towards Zero-cost and Controllable Hallucination Mitigation of MLLMs [62.9348974370985]
約ゼロの余剰コストで幻覚を緩和するための注意再配置(AttnReal)を提案する。
我々のアプローチは,MLLMの注意分布が,歴史的出力トークンによって特徴が支配されるという重要な観測によって動機付けられている。
この観測に基づいて、AttnRealは出力トークンからの過剰な注意をリサイクルし、それを視覚トークンに再配置することで、MLLMの言語優先への依存を軽減します。
論文 参考訳(メタデータ) (2025-03-11T11:52:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。