論文の概要: Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain
- arxiv url: http://arxiv.org/abs/2609.00788v1
- Date: Tue, 01 Sep 2026 06:34:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.418512
- Title: Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain
- Title(参考訳): 注意禁止:スペクトル領域における本質的な焦点を選択的に取り除くことでマルチモーダルな大言語モデルを食う
- Authors: Daizong Liu, Junhao Dong, Zhiyuan Ma, Xiaoye Qu, Xiang Fang, Runwei Guan, Keke Tang, Jianfeng Dong, Yew-Soon Ong,
- Abstract要約: MLLM(Multimodal large language model)は、より文脈的なマルチモーダル情報を処理するために、大規模言語モデル(LLM)の能力を拡張した。
近年の研究では、MLLMは敵対的な入力、特に視覚成分を標的とする入力に対して非常に脆弱であることが示されている。
本稿では, 構造関連位相領域に対する対向的摂動を明示的に制限する, 位相対応型対向攻撃フレームワークを提案する。
- 参考スコア(独自算出の注目度): 94.64605746540472
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (MLLMs) have extended the capability of large language models (LLMs) to process more contextual multimodal information, showing remarkable progress in diverse realistic multimodal applications. Despite their strong perception and reasoning abilities, recent studies reveal that MLLMs remain highly vulnerable to adversarial inputs, especially those targeting visual components. However, existing attacks mainly focus on global perturbations, lacking an understanding of how MLLMs internally interpret visual structures. In this paper, we make the attempt to investigate the intrinsic focus of MLLMs in the frequency domain and discover that their predictions are particularly sensitive to phase information, which encodes essential structural and semantic cues. Based on this observation, we propose a novel phase-aware adversarial attack framework that explicitly restricts adversarial perturbations to structure-relevant phase regions to suppress the MLLMs' focus for effective and imperceptible attacks. To further amplify the structural influence, we also introduce an auxiliary adversarial prompt learning module to guide multimodal misalignment around phase-sensitive regions, misleading the MLLM's attention toward targeted structural patterns. Extensive experiments on multiple representative MLLM models and datasets demonstrate the superior effectiveness of our method compared to existing attacks.
- Abstract(参考訳): MLLM(Multimodal large language model)は、より文脈的なマルチモーダル情報を処理するために、大規模言語モデル(LLM)の能力を拡張し、多様な現実的なマルチモーダルアプリケーションにおいて顕著な進歩を見せている。
強い知覚力と推論能力にもかかわらず、最近の研究では、MLLMは敵の入力、特に視覚成分を標的とする入力に対して非常に脆弱であることが明らかになっている。
しかし、既存の攻撃は主にグローバルな摂動に焦点を当てており、MLLMが内部の視覚構造をどのように解釈するかの理解が欠如している。
本稿では、周波数領域におけるMLLMの本質的な焦点を調査し、それらの予測が重要な構造的・意味的な手がかりを符号化した位相情報に特に敏感であることを示す。
本研究は,MLLMが効果的かつ知覚不能な攻撃に対する焦点を抑えるために,構造関連位相領域に対する対向的摂動を明示的に制限する新しい位相対応対向攻撃フレームワークを提案する。
さらに,その構造的影響を増幅するために,相感受性領域の多モード不整合を誘導する補助的対向的学習モジュールを導入し,MLLMがターゲットとなる構造的パターンに注意を向けていることを誤解させる。
複数の代表的MLLMモデルとデータセットに対する大規模な実験により,既存の攻撃と比較して,本手法の有効性が示された。
関連論文リスト
- A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning [6.442194752385315]
マルチモーダル・タイポグラフィー(Multi-Modal Typography)は、タイポグラフィー攻撃がマルチモーダル・大規模言語モデルにどのように悪影響を及ぼすかを研究する体系的な研究である。
我々は、音声、視覚、テキストの摂動の相互作用を分析し、コーディネートされたマルチモーダルアタックが単一モーダルアタックよりもはるかに強力な脅威を生み出すことを明らかにした。
論文 参考訳(メタデータ) (2026-04-05T06:32:08Z) - Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models [84.94288033791346]
我々は,MLLMにおける視覚的表現の劣化という,広範にわたる課題を明らかにするために,詳細な診断分析を行う。
我々は,この現象を,単一のテキスト生成目標によって引き起こされる視覚的犠牲とみなし,そのモデルが解答生成の最適化のためにその視覚的忠実度を損なう。
本研究では,初期視覚特性を予測するために,劣化した中間特徴を強制的に予測し,MLLMの内部表現に固有の視覚特性を維持するための予測正則化を提案する。
論文 参考訳(メタデータ) (2026-03-21T13:10:37Z) - Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models [19.847438086389616]
Masked Diffusion Language Modelsは、Autoregressive Language Modelsに代わる有望な選択肢として登場した。
本研究は,MDLMの局所性バイアスが強いことを示す。
本稿では,マスク数に不変な予測を推奨するマスク非依存損失関数を提案する。
論文 参考訳(メタデータ) (2025-11-26T12:44:29Z) - A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models [85.30893355216486]
我々は,異なるdMLLMアーキテクチャとタスクを用いて,視覚的トークン冗長性がどのように進化するかを検討する。
本研究により, 視覚的冗長性は, 長時間のタスクを処理しながら, オフスクラッチdMLLMでのみ現れることが明らかとなった。
層スキッピングはAR-to-diffusion dMLLMの加速に有効であるのに対し、プログレッシブプルーニングやレイトステッププルーニングはストクラッチdMLLMよりも効果的である。
論文 参考訳(メタデータ) (2025-11-19T04:13:36Z) - Explaining multimodal LLMs via intra-modal token interactions [55.27436637894534]
MLLM(Multimodal Large Language Models)は、様々な視覚言語タスクにおいて顕著な成功を収めているが、その内部決定機構は十分に理解されていない。
モーダル内相互作用を利用した解釈可能性の向上を提案する。
論文 参考訳(メタデータ) (2025-09-26T14:39:13Z) - MLLMs are Deeply Affected by Modality Bias [158.64371871084478]
MLLM(Multimodal Large Language Models)の最近の進歩は、テキストや画像などの多様なモダリティを統合する上で、有望な成果を示している。
MLLMはモダリティバイアスに強く影響され、しばしば言語に依存し、視覚入力のような他のモダリティを過小評価する。
本稿では,MLLMはモダリティバイアスの影響を強く受けており,様々なタスクにまたがってその発現を明らかにする。
論文 参考訳(メタデータ) (2025-05-24T11:49:31Z) - Improving Adversarial Transferability in MLLMs via Dynamic Vision-Language Alignment Attack [16.70399451598529]
DynVLAアタック(Dynamic Vision-Language Alignment, DynVLA)は,視覚言語コネクタに動的摂動を注入し,様々なモデルの視覚言語アライメントの一般化を促進する手法である。
実験の結果,DynVLAはBLIP2,InstructBLIP,MiniGPT4,LLaVA,およびGeminiなどのクローズドソースモデルなど,さまざまなMLLMの逆例の転送可能性を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2025-02-27T01:33:19Z) - Extending Token Computation for LLM Reasoning [5.801044612920816]
大規模言語モデル(LLM)は、自然言語処理の進歩において重要な要素である。
LLMは、非効率な注意分布のため、複雑な推論タスクに苦しむことが多い。
本稿では,アテンション機構の最適化を利用して,計算トークンをChain-of-Thoughtプロセスで拡張する新しい手法を提案する。
論文 参考訳(メタデータ) (2024-03-22T03:23:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。