論文の概要: Repeat-After-Me: Black-Box Adaptive Visual Prompt Injection
- arxiv url: http://arxiv.org/abs/2609.04533v1
- Date: Thu, 03 Sep 2026 22:44:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.844512
- Title: Repeat-After-Me: Black-Box Adaptive Visual Prompt Injection
- Title(参考訳): Repeat-After-Me: Black-Box Adaptive Visual Prompt Injection
- Abstract要約: ブラックボックス適応型ビジュアルプロンプトインジェクション攻撃であるRepeat-After-Meを提案する。
本評価では, 1つのサロゲートに最適化された注射は, 2つの商業的犠牲者に対して, 元のASRの43~46%を保持した。
デフォルトのOpenClaw Discordデプロイメントでは、信頼できないユーザは、最小限の注入されたイメージを使用してTOOLS.mdを上書きすることができる。
- 参考スコア(独自算出の注目度): 40.37588773528427
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prompt injection is widely recognized as a major security threat to AI agents that interact with untrusted external data, such as websites, documents, and emails. Prior work has shown that, in the text domain, black-box prompt injection can achieve near-perfect attack success rates (ASRs). In the image domain, however, existing visual prompt injection methods are substantially less effective in attacking frontier commercial VLMs for materially harmful behavior. Achieving such outputs is hard because it requires a long and/or format-compliant target string, such as a precise, parseable native tool call with exact function names and arguments. We present Repeat-After-Me, a black-box adaptive visual prompt injection attack that can reveal personally identifiable information or make malicious tool calls. Across both open-weight and commercial frontier VLMs, including Qwen3.6-27B and GPT-5.5, our method achieves ASRs exceeding 80% and 47%, respectively, under a realistic setting in which the benign user prompt is semantically unrelated to the injected task and does not verbally authorize it. In our evaluation, injections optimized on one surrogate retain 43-46% of the original ASR on two commercial victims, and cross-sample transferability retains 64-66% of the original ASR on those two models. We test our attack in a real-world OpenClaw agent: in a default OpenClaw Discord deployment, an untrusted user can use a minimally injected image to overwrite TOOLS.md, enabling future sensitive behaviors like remote code execution and secret exfiltration. We show our new attack vector works in cases where adaptive textual prompt injection fails. We discuss potential defenses.
- Abstract(参考訳): プロンプトインジェクションは、ウェブサイト、ドキュメント、電子メールなどの信頼できない外部データと対話するAIエージェントにとって、主要なセキュリティ脅威として広く認識されている。
これまでの研究では、テキスト領域では、ブラックボックスプロンプトインジェクションがほぼ完璧な攻撃成功率(ASR)を達成することが示されている。
しかし、画像領域では、既存の視覚的プロンプト注入法は、物質的に有害な振る舞いをするためにフロンティアの商業用VLMを攻撃するのに、かなり効果が低い。
このような出力を得るには、正確な関数名と引数を持つ、正確に解析可能なネイティブツールコールのような、長いおよび/またはフォーマット準拠のターゲット文字列を必要とするため、難しい。
ブラックボックス適応型ビジュアルプロンプトインジェクション攻撃であるRepeat-After-Meを提案する。
Qwen3.6-27B と GPT-5.5 を含むオープンウェイトおよび商用フロンティアVLM の両分野において,本手法は,入力タスクと意味的に無関係で,言語的に許可されていない現実的な条件下で,それぞれ80% と 47% の ASR を達成する。
本評価では, 1つのサロゲートに最適化された注入は, 元のASRの43~46%を2つの商用犠牲者に保持し, クロスサンプルトランスファービリティは元のASRの64~66%をこれらの2つのモデルに保持した。
デフォルトのOpenClaw Discordデプロイメントでは、信頼できないユーザは、最小限のインジェクトイメージを使用してTOOLS.mdを上書きすることができ、リモートコードの実行やシークレットエクスプロイトといった将来の機密性の高い動作を可能にします。
適応的なテキストプロンプトインジェクションが失敗した場合に、新たな攻撃ベクトルが機能することを示す。
我々は防衛の可能性について議論する。
関連論文リスト
- SIR: Self-improving Red-teaming for Compute Use Agents [71.71987044117371]
コンピュータ・ユース・エージェント(CUA、Computer use agent)は、マウス、キーボード、端末を通じて画面を認識し、実際のオペレーティングシステムに作用する視覚言語モデルである。
操作中に信頼できないコンテンツに晒されるため、間接的プロンプトインジェクション(IPI)に弱い。
SIRは,平易な言語で記述された再利用原則の小さなライブラリからステルスインジェクションを構成するブラックボックスIPIアタックである。
論文 参考訳(メタデータ) (2026-08-31T03:39:43Z) - ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation [11.545542144576395]
プロンプトインジェクションはAIエージェントに対する第1の脅威としてリストされている。
本稿では,トークンレベルのフィードバックによって微調整を誘導するSecure On-Policy Distillation (SecOPD)を提案する。
SecOPDは、SoTA PISmith適応的インジェクションに対して9.0%のASRを達成するが、以前のSoTAのMeta-SecAlignでは94.0%である。
論文 参考訳(メタデータ) (2026-08-21T16:14:07Z) - MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents [74.64265314956441]
そこで我々は,グラフ構造化外部メモリにテキスト画像のコーディネートを施したブラックボックス攻撃フレームワークを提案する。
MemVenomは、GPT-5ファミリーのWebエージェントで最大99.15%に達する、良質なパフォーマンスに最小限の影響を伴って、強力なエンドツーエンド攻撃を成功させる。
論文 参考訳(メタデータ) (2026-06-09T11:53:25Z) - An Empirical Study of Privacy Leakage Chains via Prompt Injection in Black-Box Chatbot Environments [3.275342475988451]
本稿では,間接的プロンプトインジェクションに基づくプライバシフリー・アタック・チェーンについて検討する。
まず、攻撃者が被疑者の意図したタスクをハイジャックする方法について分析する。
次に、ユーザプロンプトと検索ページの良質な開始を再構成するために、外部コンテンツにブリッジを用いた「例示」と呼ばれる新しいプロンプト言語手法を評価する。
論文 参考訳(メタデータ) (2026-05-18T09:38:18Z) - Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection [37.5890320718138]
安全に整合した無害なUI要素をスクリーンショット上にオーバーレイしてエージェントの視覚的接地を誤指示する赤チーム設定を提案する。
本手法では,モジュール型エディター-オーバーラッパー-ヴィクティムパイプラインと,複数の候補編集を抽出する反復探索手法を用いる。
攻撃は攻撃成功率を最大4.4倍に向上させる。
論文 参考訳(メタデータ) (2026-04-09T05:32:34Z) - Silent Egress: When Implicit Prompt Injection Makes LLM Agents Leak Without a Trace [0.0]
自動生成されたURLプレビューに埋め込まれた敵対的命令は、サイレント・エクスプレスと呼ばれるシステムレベルのリスクをもたらす可能性があることを示す。
完全にローカルで再現可能なテストベッドを使用して、悪意のあるWebページがエージェントを誘導し、機密性の高いランタイムコンテキストを透過するアウトバウンドリクエストを発行できることを実証する。
qwen2.5:7bをベースとした480の実験では、攻撃は高い確率 (P (exress) =0.89) で成功し、95%の攻撃は出力ベースの安全チェックでは検出されない。
論文 参考訳(メタデータ) (2026-02-25T22:26:23Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile Agents [54.35629963816521]
この研究は、VLMベースのモバイルエージェントをターゲットにした最初のクリーンテキストバックドアアタックであるVIBMAを紹介する。
この攻撃は、視覚的な入力だけを変更することによって、悪意ある振る舞いをモデルに注入する。
クリーンタスクの動作を保ちながら高い成功率を達成できることを示す。
論文 参考訳(メタデータ) (2025-06-16T08:09:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。