論文の概要: Securing Multimodal AI through Internal Information Decomposition
- arxiv url: http://arxiv.org/abs/2607.21600v1
- Date: Sun, 03 May 2026 19:21:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.932373
- Title: Securing Multimodal AI through Internal Information Decomposition
- Title(参考訳): 内部情報分解によるマルチモーダルAIの確保
- Abstract要約: マルチモーダルな言語モデルは、単調なシステムに存在しない攻撃面を導入している。
本稿では,内部のマルチモーダル一貫性を監視して有害な入力を検出する軽量な推論時間フレームワークであるFlowGuardを提案する。
本研究は,マルチモーダル推論において,クロスモーダル整合性監視が効率的かつ効果的に防御できることを示す。
- 参考スコア(独自算出の注目度): 43.51030662124641
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models introduce attack surfaces absent in unimodal systems: adversaries can distribute malicious intent across modalities to evade unimodal safeguards. This motivates using cross-modal consistency as a detection signal rather than inspecting each modality in isolation. Our key observation is that benign inputs induce compatible predictive behavior from text-only and vision-only reasoning that stabilizes when fused, whereas adversarial manipulation disrupts this consistency, causing abnormal multimodal behavior. Existing defenses that examine raw inputs or outputs overlook this internal fusion process, rendering them brittle and computationally expensive. We propose FlowGuard, a lightweight inference-time framework that detects harmful inputs by monitoring internal multimodal consistency. Unlike approaches that rely on scalar confidence metrics, FlowGuard derives FlowVectors inspired by Partial Information Decomposition that quantify cross-modal redundancy, synergy, and modality-specific dominance, capturing whether fused multimodal predictions remain aligned with unimodal semantic evidence. In a one-class classification problem trained solely on benign data, FlowGuard reduces Attack Success Rates from >90% to <15% on unseen attacks, with <3% utility loss and up to a 6 times latency reduction. Our results demonstrate that monitoring cross-modal consistency offers an efficient and effective defense for multimodal reasoning.
- Abstract(参考訳): 敵は、不正な意図をモダリティに分散して、不正な保護を回避することができる。
これは、分離された各モードを検査するのではなく、クロスモーダル一貫性を検出信号として使用する動機付けである。
我々のキーとなる観察は、良性入力は、テキストのみおよび視覚のみの推論から互換性のある予測行動を誘導し、融合時に安定化する一方、対向的な操作は、この一貫性を阻害し、異常なマルチモーダル動作を引き起こすことである。
生のインプットや出力を調べる既存の防御は、この内部融合プロセスを見落とし、不安定で計算コストがかかる。
本稿では,内部のマルチモーダル一貫性を監視して有害な入力を検出する軽量な推論時間フレームワークであるFlowGuardを提案する。
FlowGuardは、スカラーの信頼度に依存するアプローチとは異なり、部分的な情報分解にインスパイアされたFlowVectorsを派生し、クロスモーダルな冗長性、シナジー、モダリティ固有の優位性を定量化し、融合したマルチモーダル予測が非モーダルなセマンティックエビデンスと一致しているかどうかをキャプチャする。
良質なデータのみに基づいてトレーニングされた一級分類問題では、FlowGuardは、攻撃成功率を90%から15%に削減し、3%のユーティリティ損失と最大6倍のレイテンシ削減を実現している。
本研究は,マルチモーダル推論において,クロスモーダル整合性監視が効率的かつ効果的に防御できることを示す。
関連論文リスト
- Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction [43.59114552026716]
MLLM(Multimodal large language model)は、テキストモダリティで学習した安全性機能を意味的に等価な非テキスト入力に転送するのに失敗することが多い。
本研究は,テキストアライメントされた拒絶方向とモダリティによるドリフト方向を解析することにより,このギャップについて検討する。
本稿では,自己修正によるモダリティドリフトを適応的に補正するトレーニングフリー推論時間法であるReGapを提案する。
論文 参考訳(メタデータ) (2026-05-18T09:16:55Z) - Adversarial Evasion in Non-Stationary Malware Detection: Minimizing Drift Signals through Similarity-Constrained Perturbations [4.8475753151256695]
攻撃者は同時に分類を回避し、ドリフト監視機構に注意を払わない敵のマルウェアサンプルを生成できるのか?
本稿では,高度な類似性正規化器を付加した,分類器の標準特徴空間における逆例を生成する新しい手法を提案する。
我々は、摂動予算が、より高い攻撃成功率とより実質的なドリフト指標で、回避トレードオフに大きな影響を与えることを観察する。
論文 参考訳(メタデータ) (2026-04-23T06:03:50Z) - When One Modality Rules Them All: Backdoor Modality Collapse in Multimodal Diffusion Models [32.77084507646192]
マルチモーダル拡散モデルにおけるバックドアモダリティ崩壊現象について検討する。
攻撃はしばしばサブセット・モダリティの優位に崩壊し、相互モダリティの相互作用は無視または否定的である。
これらの結果は、攻撃の成功率が高いことが、モダリティのサブセットに根本的な依存を隠蔽していることを示唆している。
論文 参考訳(メタデータ) (2026-03-06T17:42:08Z) - CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs [10.42126976065225]
MLLM(Multimodal large language model)は、テキストと画像の相互作用を可能にする。
本稿では,クロスモーダル信頼性を評価するベンチマークであるCSR-Benchを紹介する。
我々は16の最先端MLLMを評価し,系統的な相互アライメントギャップを観察した。
論文 参考訳(メタデータ) (2026-02-03T08:49:44Z) - Contamination Detection for VLMs using Multi-Modal Semantic Perturbation [73.76465227729818]
オープンソースのVision-Language Models (VLM)は、ベンチマークタスクで最先端のパフォーマンスを達成した。
プレトレーニングコーパスは,テストセットリークによるパフォーマンスの低下という,実践者とユーザ双方にとって重要な懸念を提起する。
既存の検出手法が不整合性を示すか,不整合性を示すかを示す。
マルチモーダルなセマンティック摂動に基づく,新しい簡易かつ効果的な検出法を提案する。
論文 参考訳(メタデータ) (2025-11-05T18:59:52Z) - DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models [55.30555646945055]
テキスト・ツー・イメージ(T2I)モデルはセマンティック・リークに対して脆弱である。
DeLeakerは、モデルのアテンションマップに直接介入することで、漏洩を緩和する軽量なアプローチである。
SLIMはセマンティックリークに特化した最初のデータセットである。
論文 参考訳(メタデータ) (2025-10-16T17:39:21Z) - CoDefend: Cross-Modal Collaborative Defense via Diffusion Purification and Prompt Optimization [4.6467356929461925]
MLLM(Multimodal Large Language Models)は、画像キャプション、視覚的質問応答、モーダル間推論といったタスクにおいて顕著な成功を収めている。
彼らのマルチモーダルな性質は敵の脅威に晒され、攻撃者はモダリティまたは共同で有害な、誤解を招く、あるいは政策に違反するアウトプットを誘導することができる。
敵の訓練や入力の浄化といった既存の防衛戦略は、顕著な制限に直面している。
本稿では,2対の逆方向のクリーンな画像データセットをファインチューン拡散モデルに活用する,教師付き拡散に基づくDenoisingフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T07:44:54Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - Backdoor Cleaning without External Guidance in MLLM Fine-tuning [76.82121084745785]
Believe Your Eyes (BYE)は、アテンションエントロピーパターンを自己教師信号として活用して、バックドアサンプルを特定してフィルタリングするデータフィルタリングフレームワークである。
クリーンタスクのパフォーマンスを維持しながら、ほぼゼロの攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-05-22T17:11:58Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。