論文の概要: Render Before Reading: Visual Rendering as a Prompt Injection Defense
- arxiv url: http://arxiv.org/abs/2609.36121v1
- Date: Mon, 28 Sep 2026 18:54:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.96165
- Title: Render Before Reading: Visual Rendering as a Prompt Injection Defense
- Title(参考訳): Render before Reading: Prompt Injection Defenseとしてのビジュアルレンダリング
- Abstract要約: 大規模な言語モデルはインジェクション攻撃に弱い。
敵データの入力モダリティが果たす役割について検討する。
攻撃の成功率を一定に抑えることを示します。
- 参考スコア(独自算出の注目度): 34.63256348303783
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are vulnerable to prompt injection attacks, where third-party adversarial content can hijack the model's behavior. In this paper, we study the role played by the adversarial data's input modality, and identify a systematic asymmetry: multimodal LLMs are more likely to follow adversarial instruction when they appear as text than when the same instruction is delivered through a non-textual channel (e.g., as an image). We hypothesize that this modality gap arises from text-centric instruction tuning, which teaches models to obey textual instructions while treating other modalities mainly as content to parse or describe. We then demonstrate how this gap can be turned into a training-free defense, by rendering all untrusted payloads as typographic images (or audio) before they reach the model. Across ten models and two prompt injection benchmarks (DirectInject and AgentDojo) we show that our defense Pictionary consistently reduces attack success rates even against the strongest adaptive attacks and human red teamers, while largely preserving benign utility. We further show that benign fine-tuning on image-rendered instructions erodes the modality gap, tracing it to the text-centric instruction-tuning distribution.
- Abstract(参考訳): 大規模な言語モデルはインジェクション攻撃に対して脆弱であり、サードパーティの敵対的コンテンツがモデルの動作をハイジャックする可能性がある。
本稿では, 対向データの入力モダリティが果たす役割を考察し, 体系的非対称性を同定する: マルチモーダル LLM は, テキストとして現れるときよりも, 同一の命令が非テクスチュアルチャネル(例えば画像として)を通して配信されるときよりも, 対向的命令に従う傾向にある。
我々は、このモダリティギャップは、主に解析や記述のコンテンツとして他のモダリティを扱いながら、モデルにテキスト命令に従うように教えるテキスト中心のインストラクションチューニングから生じると仮定する。
そして、モデルに到達する前に、すべての信頼できないペイロードをタイポグラフィー画像(またはオーディオ)としてレンダリングすることで、このギャップをトレーニング不要の防御にする方法を実証する。
10のモデルと2つのプロンプトインジェクションベンチマーク(DirectInjectとAgentDojo)で、当社のディフェンスであるPictionaryは、強い適応攻撃や人間のレッドチームに対する攻撃の成功率を一貫して低減しつつ、良質なユーティリティをほとんど保っていることを示しています。
さらに、画像レンダリング命令の良性な微調整がモダリティギャップを侵食し、テキスト中心の命令調整分布に追従することを示す。
関連論文リスト
- Towards Robustness against Typographic Attack with Training-free Concept Localization [42.575178574443946]
Contrastive Language-Image Pretraining Model (CLIP)は、現代のLVLM(Large Vision Language Models)の基盤となるビジョンエンコーダとして機能する。
CLIPモデルには重要な障害モードがあり、画像内に現れる無関係なテキストは、真の視覚的意味論ではなく、語彙的な意味に偏っている。
この問題は、一般的にはTypographic Attack (TA)と呼ばれ、自律運転のような安全クリティカルなアプリケーションに重大なリスクをもたらす脆弱性を露呈する。
そこで本稿では,TAに対する解釈可能かつ効果的なロバスト性を実現するための,新しい学習自由な機械的解釈法を提案する。
論文 参考訳(メタデータ) (2026-07-02T17:55:24Z) - Web Artifact Attacks Disrupt Vision Language Models [61.59021920232986]
視覚言語モデル(VLM)は、大規模で軽量にキュレートされたWebデータセットに基づいて訓練されている。
意味概念と無関係な視覚信号の間に意図しない相関関係を学習する。
これまでの研究は、これらの相関関係をモデル予測を操作するための攻撃ベクトルとして武器化してきた。
非マッチングテキストとグラフィカル要素の両方を使ってモデルを誤解させる新しい操作のクラスである「アーティファクトベース」アタックを導入する。
論文 参考訳(メタデータ) (2025-03-17T18:59:29Z) - Prompt-driven Transferable Adversarial Attack on Person Re-Identification with Attribute-aware Textual Inversion [17.18411620606476]
本稿では,歩行者画像の微細な意味的特徴を損なうために,Attribute-aware Prompt Attack (AP-Attack)を導入する。
AP-Attackは最先端の転送可能性を実現し、従来の手法よりも22.9%上回った。
論文 参考訳(メタデータ) (2025-02-27T02:32:58Z) - Few-Shot Adversarial Prompt Learning on Vision-Language Models [62.50622628004134]
知覚不能な逆境摂動に対するディープニューラルネットワークの脆弱性は、広く注目を集めている。
それまでの努力は、相手の視覚的特徴をテキストの監督と整合させることで、ゼロショットの敵の堅牢性を達成した。
本稿では、限られたデータで入力シーケンスを適応させることで、対向性を大幅に向上させる、数ショットの対向的プロンプトフレームワークを提案する。
論文 参考訳(メタデータ) (2024-03-21T18:28:43Z) - Instruct2Attack: Language-Guided Semantic Adversarial Attacks [76.83548867066561]
Instruct2Attack (I2A) は、自由形式の言語命令に従って意味のある摂動を生成する言語誘導セマンティックアタックである。
我々は最先端の潜伏拡散モデルを用いて、逆拡散過程を逆ガイドし、入力画像とテキスト命令に条件付けされた逆潜伏符号を探索する。
I2Aは、強い敵の防御の下でも最先端のディープニューラルネットワークを破ることができることを示す。
論文 参考訳(メタデータ) (2023-11-27T05:35:49Z) - Unleashing Text-to-Image Diffusion Models for Visual Perception [84.41514649568094]
VPD (Visual Perception with a pre-trained diffusion model) は、視覚知覚タスクにおいて、事前訓練されたテキスト・画像拡散モデルの意味情報を利用する新しいフレームワークである。
本稿では,提案したVPDを用いて,下流の視覚的タスクに迅速に適応できることを示す。
論文 参考訳(メタデータ) (2023-03-03T18:59:47Z) - Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image
Diffusion Models [103.61066310897928]
最近のテキスト・ツー・イメージ生成モデルは、ターゲットのテキスト・プロンプトによって導かれる多様な創造的な画像を生成する非例外的な能力を実証している。
革命的ではあるが、現在の最先端拡散モデルは、与えられたテキストプロンプトのセマンティクスを完全に伝達するイメージの生成に失敗する可能性がある。
本研究では, 一般に公開されている安定拡散モデルを分析し, 破滅的無視の有無を評価し, そのモデルが入力プロンプトから1つ以上の被写体を生成するのに失敗した場合について検討する。
提案するジェネレーティブ・セマンティック・ナーシング(GSN)の概念は、推論時間中にハエの生殖過程に介入し、忠実性を改善するものである。
論文 参考訳(メタデータ) (2023-01-31T18:10:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。