論文の概要: On Adversarial Vulnerability of Vision-Language Models through the Lens of Intermediate Spectral Subspaces
- arxiv url: http://arxiv.org/abs/2607.07375v1
- Date: Wed, 08 Jul 2026 13:06:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.388747
- Title: On Adversarial Vulnerability of Vision-Language Models through the Lens of Intermediate Spectral Subspaces
- Title(参考訳): 中間スペクトル部分空間のレンズによる視覚言語モデルの逆問題性について
- Authors: Chethan Krishnamurthy Ramanaik, Tobias Callies, Michael Hecht, Eirini Ntoutsi,
- Abstract要約: ディープニューラルネットワーク(DNN)の逆脆弱性は、決定境界幾何学、特徴ロバスト性、入力出力ジャコビアン、逆問題の不安定性の観点から研究されている。
本稿では、現代のDNNを通して情報を伝播する中間線形変換のスペクトル構造、すなわち、敵対的脆弱性の解明されていないメカニズムに焦点を当てる。
本稿では,中間表現を右下特異ベクトルで表される部分空間と整列する白色箱スペクトル空間誘導攻撃(SSGRA)を提案する。
- 参考スコア(独自算出の注目度): 0.7419725234099728
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adversarial vulnerability in deep neural networks (DNNs) has been studied from the perspectives of decision-boundary geometry, feature robustness, input-output Jacobians, and the instability of inverse problems. Here, we focus on the spectral structure of intermediate linear transformations that propagate information through modern DNNs, an unexplored mechanism of adversarial vulnerability. Specifically, we investigate transformer-based vision-language models, whose linear layers admit interpretable spectral decompositions and whose widespread adoption makes understanding their robustness increasingly important. We propose a white-box spectral-subspace-guided attack (SSGRA) that aligns intermediate representations with the subspace spanned by the bottom right singular vectors. Our experiments show improved attack effectiveness over existing baselines. In addition, SSGRA offers a spectral interpretation of adversarial vulnerability in VLMs, providing insights for improving their robustness.
- Abstract(参考訳): ディープニューラルネットワーク(DNN)の逆脆弱性は、決定境界幾何学、特徴ロバスト性、入力出力ジャコビアン、逆問題の不安定性の観点から研究されている。
本稿では、現代のDNNを通して情報を伝播する中間線形変換のスペクトル構造、すなわち、敵対的脆弱性の解明されていないメカニズムに焦点を当てる。
具体的には,線形層が解釈可能なスペクトル分解を許容するトランスフォーマーに基づく視覚言語モデルについて検討する。
本稿では,中間表現を右下特異ベクトルで表される部分空間と整列する白色箱スペクトル空間誘導攻撃(SSGRA)を提案する。
実験の結果,既存のベースラインに対する攻撃効果が向上した。
さらに、SSGRAはVLMの敵対的脆弱性のスペクトル解釈を提供し、その堅牢性を改善するための洞察を提供する。
関連論文リスト
- Large Vision-Language Models Get Lost in Attention [51.851592109135716]
本稿では,情報理論と幾何に基づく統合フレームワークを提案し,残差更新の幾何的およびエントロピー的性質を定量化する。
注意は再設定に焦点を当てたサブスペース言語演算子として機能し、FFNはセマンティックイノベーションを駆動するサブスペース言語演算子として機能します。
論文 参考訳(メタデータ) (2026-05-07T04:45:52Z) - MirrorLA: Reflecting Feature Map for Vision Linear Attention [49.41670925034762]
リニアアテンションはトランスフォーマーの2次から線形への計算複雑性を著しく低下させるが、パフォーマンスにおけるソフトマックスに基づくアテンションの遅れは一貫して遅れる。
我々は、受動トランケーションをアクティブなリオリエンテーションに置き換える幾何学的枠組みであるMirrorLAを提案する。
MirrorLAは標準的なベンチマークで最先端のパフォーマンスを実現し、表現の忠実さを損なうことなく厳密な線形効率を実現できることを示した。
論文 参考訳(メタデータ) (2026-02-04T09:14:09Z) - FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction [82.6826848085638]
視覚的ジェイルブレイク攻撃は、洗練されたテキスト攻撃よりも簡単にオープンソースのMLLMを操作することができる。
これらの攻撃は、非常に限られたクロスモデル転送可能性を示し、クローズドソースMLLMの脆弱性を確実に特定することができない。
本稿では,FORCE(Feature Over-Reliance CorrEction)手法を提案する。
論文 参考訳(メタデータ) (2025-09-25T11:36:56Z) - Structure before the Machine: Input Space is the Prerequisite for Concepts [11.573510865918863]
ハイレベルな表現は、AIの透明性と制御を強化することの中心となり、個々のニューロンや回路から人間の解釈可能な概念に沿った構造化されたセマンティックな方向へと注目を移している。
線形表現仮説 (LRH) によって動機付けられた入力空間線形性仮説 (ISLH) を提案する。
次に、スペクトル主経路(SPP)フレームワークを導入し、より深いネットワークが支配的なスペクトル方向の小さなセットに沿って線形表現を段階的に蒸留する方法を定式化する。
論文 参考訳(メタデータ) (2025-06-10T08:08:52Z) - The Shape of Adversarial Influence: Characterizing LLM Latent Spaces with Persistent Homology [4.280045926995889]
本研究では,大規模言語モデルの内部表現空間に対して,逆入力が体系的にどう影響するかに着目した。
アクティベーションの形状と神経情報の流れを定量化することにより、アーキテクチャに依存しない枠組みは、表現的変化の基本的な不変性を明らかにする。
論文 参考訳(メタデータ) (2025-05-26T18:31:49Z) - Hallucination Detection in LLMs with Topological Divergence on Attention Graphs [60.83579255387347]
幻覚(Halucination)、すなわち、事実的に誤ったコンテンツを生成することは、大きな言語モデルにとって重要な課題である。
本稿では,TOHA (Topology-based HAllucination detector) をRAG設定に導入する。
論文 参考訳(メタデータ) (2025-04-14T10:06:27Z) - Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals [52.123343364599094]
敵の攻撃は、正常な例に基づいて慎重に摂動を行い、ディープニューラルネットワーク(DNN)を騙す
まず,低次元線形部分空間において,クリーン信号と逆方向の摂動の特徴が冗長であり,重なりが最小であることを示す。
これにより、DNNは、摂動が破棄されている間、クリーン信号の特徴のみが存在する部分空間を学習することができる。
論文 参考訳(メタデータ) (2024-03-24T14:35:44Z) - Occlusion Sensitivity Analysis with Augmentation Subspace Perturbation
in Deep Feature Space [7.021872917042116]
本稿では,コンピュータビジョンのための新しい摂動に基づく解釈可能性アプローチであるOcclusion Sensitivity Analysis with Deep Feature Augmentation Subspace (OSA-DAS)を紹介する。
提案手法では,DNNの出力ベクトルを用いて,深部特徴ベクトル空間内に低次元部分空間を構築する。
我々はImageNet-1kを広範囲にテストし、クラスやモデルに依存しないアプローチは一般的に使われているインタプリタよりも優れています。
論文 参考訳(メタデータ) (2023-11-25T13:26:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。