論文の概要: Rethinking Indirect Prompt Injection as a Test-Time Search Problem
- arxiv url: http://arxiv.org/abs/2609.04495v1
- Date: Thu, 03 Sep 2026 21:28:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.83445
- Title: Rethinking Indirect Prompt Injection as a Test-Time Search Problem
- Title(参考訳): テスト時間探索問題としての間接プロンプト注入の再考
- Abstract要約: タスク依存攻撃面上での試験時間探索として間接的プロンプトインジェクションを定式化する。
本研究では,環境偵察を行う専用のサーチハーネスを備えたエージェント攻撃手法を提案する。
攻撃者のテストタイムの計算量が増加すると、脆弱性の発見とエクスプロイトが改善される。
- 参考スコア(独自算出の注目度): 3.247379743630575
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We formulate indirect prompt injection as a test-time search over a task-dependent attack surface induced by the environment, user task, and injection task. To operationalize this formulation, we introduce an agentic attacker with a dedicated search harness that performs environment reconnaissance, structured reasoning over attack strategies, and adaptive evaluation using victim-agent feedback. Across heterogeneous tasks, we find that increasing attacker test-time compute improves vulnerability discovery and exploitation, while ablations show that explicit strategy management is important for avoiding redundant search and sustaining gains at larger budgets. These results suggest that agentic security evaluations should characterize both the attacker's search procedure and compute budget, rather than treating attack success as a budget-independent property of the victim. More broadly, our findings identify the attacker's adaptive search over the system attack surfaces as an important and underexplored security risk for tool-using agents.
- Abstract(参考訳): 本研究では,環境,ユーザタスク,インジェクションタスクによって誘導されるタスク依存攻撃面に対するテスト時間探索として間接的プロンプトインジェクションを定式化する。
この定式化を運用するために,環境偵察,攻撃戦略に対する構造化推論,被害者エージェントのフィードバックを用いた適応評価を行う専用検索ハーネスを用いたエージェント攻撃を導入した。
不均一なタスク全体にわたって、攻撃者のテストタイム計算の増加は脆弱性発見とエクスプロイトを改善する一方、明示的な戦略管理は、より大きな予算で冗長な検索や利益を維持するために重要であることを示す。
これらの結果は,攻撃成功を被害者の予算に依存しない特性として扱うのではなく,攻撃者の探索手順と計算予算の両方を特徴付けることを示唆している。
より広義には、攻撃者がシステム攻撃面を適応的に探索することは、ツール使用エージェントにとって重要で未調査のセキュリティリスクである。
関連論文リスト
- Breadcrumbing Search Agents [118.20284823674382]
LLMベースの検索エージェントは情報検索タスクに広く利用されているが、外部ツールへの依存度は重大なセキュリティリスクをもたらす。
検索およびページ観察を行うチャネルは脆弱なセキュリティ境界であることを示す。
制約付きツール仲介脅威モデルの下では、クエリ毎に1つのコントロールされた結果のみを追加することで、攻撃の成功を大幅に増加させることができる。
論文 参考訳(メタデータ) (2026-08-05T07:57:27Z) - PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections [51.8246149916068]
大きな言語モデル(LLM)は、外部のツールや環境と相互作用するエージェントシステムへと急速に進化しています。
LLMエージェントのプロアクティブな脆弱性暴露のための自動エージェント監査フレームワークPI-Hunterを提案する。
論文 参考訳(メタデータ) (2026-06-10T22:57:02Z) - WMAttack: Automated Attack Search for Adversarial Evaluation of World-Model Agents [53.84430233754606]
WMAttackは、世界モデルエージェントの敵意評価のための自動攻撃探索フレームワークである。
WMAttackは攻撃構成に対する有限予算探索としてロバストネス評価を定式化する。
WMAttackは評価ベースラインよりも強力な攻撃を継続的に発見することを示す。
論文 参考訳(メタデータ) (2026-05-22T04:31:09Z) - Benchmarking Misuse Mitigation Against Covert Adversaries [80.74502950627736]
既存の言語モデルの安全性評価は、オーバースト攻撃と低レベルのタスクに重点を置いている。
我々は、隠蔽攻撃と対応する防御の評価を自動化するデータ生成パイプラインである、ステートフルディフェンスのためのベンチマーク(BSD)を開発した。
評価の結果,分解攻撃は有効な誤用防止剤であり,その対策としてステートフルディフェンスを強調した。
論文 参考訳(メタデータ) (2025-06-06T17:33:33Z) - The Silent Saboteur: Imperceptible Adversarial Attacks against Black-Box Retrieval-Augmented Generation Systems [101.68501850486179]
本稿では,RAGシステムに対する敵攻撃について検討し,その脆弱性を同定する。
このタスクは、ターゲット文書を検索する非知覚的な摂動を見つけることを目的としており、もともとはトップ$k$の候補セットから除外されていた。
本稿では、攻撃者とターゲットRAG間の相互作用を追跡する強化学習ベースのフレームワークであるReGENTを提案する。
論文 参考訳(メタデータ) (2025-05-24T08:19:25Z) - Stealthy Multi-Task Adversarial Attacks [17.24457318044218]
マルチタスクフレームワーク内の他のタスクのパフォーマンスを保ちながら、タスクを選択的にターゲティングする。
このアプローチの動機は、自律運転のような現実世界のアプリケーションにおけるタスク間でのセキュリティの優先順位の変化にある。
本稿では,複数のアルゴリズムを用いて入力に知覚不可能なノイズを注入するステルスマルチタスク攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-26T23:18:32Z) - Fortify the Guardian, Not the Treasure: Resilient Adversarial Detectors [0.0]
アダプティブアタックとは、攻撃者が防御を意識し、その戦略を適応させる攻撃である。
提案手法は, クリーンな精度を損なうことなく, 敵の訓練を活用して攻撃を検知する能力を強化する。
CIFAR-10とSVHNデータセットの実験的評価により,提案アルゴリズムは,適応的敵攻撃を正確に識別する検出器の能力を大幅に向上することを示した。
論文 参考訳(メタデータ) (2024-04-18T12:13:09Z) - Defense of Adversarial Ranking Attack in Text Retrieval: Benchmark and
Baseline via Detection [12.244543468021938]
本稿では,敵対的文書に対する2種類の検出タスクを提案する。
敵のランク防衛の調査を容易にするために、ベンチマークデータセットが確立されている。
いくつかの検出基準線の性能を総合的に調査する。
論文 参考訳(メタデータ) (2023-07-31T16:31:24Z) - Probabilistic Categorical Adversarial Attack & Adversarial Training [45.458028977108256]
敵対的な例の存在は、人々が安全クリティカルなタスクにディープニューラルネットワーク(DNN)を適用することに大きな懸念をもたらします。
分類データを用いて敵の例を生成する方法は重要な問題であるが、広範囲にわたる探索が欠如している。
本稿では,離散最適化問題を連続的な問題に変換する確率的カテゴリー逆攻撃(PCAA)を提案する。
論文 参考訳(メタデータ) (2022-10-17T19:04:16Z) - Illusory Attacks: Information-Theoretic Detectability Matters in Adversarial Attacks [76.35478518372692]
エプシロン・イリューソリー(epsilon-illusory)は、シーケンシャルな意思決定者に対する敵対的攻撃の新たな形態である。
既存の攻撃と比較して,エプシロン・イリューソリーの自動検出は極めて困難である。
以上の結果から, より優れた異常検知器, 効果的なハードウェアおよびシステムレベルの防御の必要性が示唆された。
論文 参考訳(メタデータ) (2022-07-20T19:49:09Z) - Behaviour-Diverse Automatic Penetration Testing: A Curiosity-Driven
Multi-Objective Deep Reinforcement Learning Approach [3.5071575478443435]
侵入テストは、実際のアクティブな敵をエミュレートすることで、ターゲットネットワークのセキュリティを評価する上で重要な役割を果たす。
深層強化学習(Deep Reinforcement Learning)は,浸透テストのプロセスを自動化するための,有望なソリューションだと考えられている。
我々は,チェビシェフ分解批判者に対して,侵入試験における異なる目的のバランスをとる多様な敵戦略を見出すことを提案する。
論文 参考訳(メタデータ) (2022-02-22T02:34:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。