論文の概要: Prompt Injection Detection for Email Agents Through Attack Chain Modeling
- arxiv url: http://arxiv.org/abs/2609.30657v1
- Date: Fri, 25 Sep 2026 00:51:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.178176
- Title: Prompt Injection Detection for Email Agents Through Attack Chain Modeling
- Title(参考訳): 攻撃連鎖モデリングによるメールエージェントのプロンプト注入検出
- Abstract要約: 大規模言語モデル電子メールアシスタントは特に間接的なインジェクションに対して脆弱である。
本稿では,テキスト検出器,各ステージ固有の検証器,明示的なルールベースのリスク信号,ユーザ意図と行動整合性の分析,ロジスティックな決定ポリシを組み合わせることで,この攻撃チェーンをモデル化する検出フレームワークを提案する。
- 参考スコア(独自算出の注目度): 1.0195618602298682
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model email assistants are particularly vulnerable to indirect prompt injection because untrusted email content can be retrieved into the model context and influence subsequent tool use. Existing prompt injection detectors mainly formulate this problem as binary malicious text classification, which overlooks the important factor that harmful agent behavior often arises through a sequence of stages. We propose a detection framework that models this attack chain by combining a text detector, verifiers specific to each stage, explicit rule-based risk signals, user intent and action consistency analysis, and a logistic decision policy. To support this framework, we derive attack chain labels from prompt injection datasets, evaluate the proposed framework under random splits, temporal phase transfer, conditional stage transfer, cross-dataset transfer, and conduct ablation studies on multiple benchmarks. Results show that random train test splits substantially overestimate robustness under distribution shift, while later tool argument stages are more predictable than earlier stages in the framework. We also show that training on harmless emails that resemble attacks helps reduce false alarms while preserving the ability to detect real attacks. Across five binary benchmarks, our framework achieves a mean F1 score of 0.406 under the strict threshold setting policy, compared with 0.216 for the strongest of five pretrained detectors evaluated without additional training. These results highlight the value of combining attack stage predictions with checks for conflicts between the user's request and instructions in retrieved emails. Our experiments also demonstrate the importance of training with challenging benign examples to balance attack detection and false alarms.
- Abstract(参考訳): 大規模な言語モデルEメールアシスタントは、信頼できないEメールコンテンツをモデルコンテキストに検索し、その後のツール使用に影響を与える可能性があるため、間接的なインジェクションに対して特に脆弱である。
既存のプロンプトインジェクション検出器は、主にこの問題をバイナリな悪意のあるテキスト分類として定式化し、有害なエージェントの挙動が一連の段階を通してしばしば起こる重要な要因を見落としている。
本稿では,テキスト検出器,各ステージ固有の検証器,明示的なルールベースのリスク信号,ユーザ意図と行動整合性の分析,ロジスティックな決定ポリシを組み合わせることで,この攻撃チェーンをモデル化する検出フレームワークを提案する。
このフレームワークをサポートするために, インジェクションデータセットからアタックチェーンラベルを導出し, ランダムスプリット, 時相転送, 条件付きステージ転送, クロスデータセット転送, 複数ベンチマークでのアブレーション試験を行った。
その結果、ランダムな列車試験は分散シフト下ではかなり過大評価されるが、その後のツール引数の段階はフレームワークの初期の段階よりも予測可能であることがわかった。
また、攻撃に類似した無害なメールのトレーニングは、実際の攻撃を検知する能力を維持しながら、誤報を減らすことに役立つことも示している。
5つのベンチマークにおいて,本フレームワークは厳密なしきい値設定ポリシーの下で平均F1スコア0.406を達成する。
これらの結果から,攻撃ステージ予測とユーザの要求と受信したメールの指示との衝突のチェックを併用する価値が浮かび上がった。
また,本実験では,攻撃検出と誤報のバランスをとるために,良質な事例を用いたトレーニングの重要性も示している。
関連論文リスト
- TraceGuard: Adaptive Multimodal Poison Filtering through Cross-Feature Rank Agreement [16.617942353017963]
マルチモーダルトレーニングは、外部ソースから収集された画像テキストコーパスに依存しており、攻撃者がデータを汚染する機会を生み出している。
補間的特徴ランキング間の一致を利用して不審な事例を識別する適応的なランクに基づくフィルタリング手法であるTraceGuardを紹介する。
選択したセットを共有パターンを通じて洗練し、攻撃や中毒率を知ることなく、各コーパスに除去しきい値を適用する。
論文 参考訳(メタデータ) (2026-09-24T06:28:15Z) - Evidence-Consistent Generative Detection under Scenario-Level Distribution Shift [11.714767952479434]
In-distriion評価は、トレーニングとテストデータが繰り返し発生するタスク固有のパターンやサーフェスキューを共有するときに、ロバスト性を過大評価する可能性がある。
本研究では,SMSと音声フィッシングのシナリオレベルのアウト・オブ・ディストリビューション(SL-OOD)検出手法としてこの問題を考察する。
本稿では,エビデンス・スパンの監督と合理的・ラベルの整合性を組み合わせたエビデンス・一貫性・ジェネレーティブ・フレームワークであるECoGを提案する。
論文 参考訳(メタデータ) (2026-08-21T12:36:36Z) - AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning [93.77763753231338]
CLIP画像エンコーダを微調整し、2つの中間対向クエリに対して同様の埋め込みを抽出するために、ACPT(Adversarial Contrastive Prompt Tuning)を提案する。
我々は,ACPTが7つの最先端クエリベースの攻撃を検出できることを示す。
また,ACPTは3種類のアダプティブアタックに対して堅牢であることを示す。
論文 参考訳(メタデータ) (2024-08-04T09:53:50Z) - How adversarial attacks can disrupt seemingly stable accurate classifiers [76.95145661711514]
敵攻撃は、入力データに不連続な修正を加えることで、非正確な学習システムの出力を劇的に変化させる。
ここでは,これは高次元入力データを扱う分類器の基本的特徴であると考えられる。
実用システムで観測される重要な振る舞いを高い確率で発生させる、単純で汎用的なフレームワークを導入する。
論文 参考訳(メタデータ) (2023-09-07T12:02:00Z) - Identifying Adversarially Attackable and Robust Samples [1.4213973379473654]
アドリアックは、入力サンプルに小さな、知覚不能な摂動を挿入し、ディープラーニングモデルの出力に大きな、望ましくない変化を引き起こす。
本研究は, 対人攻撃に最も影響を受けやすいサンプルを同定することを目的とした, サンプル攻撃可能性の概念を紹介する。
本研究では,未知のターゲットモデルに対する未知のデータセットにおいて,逆攻撃可能で頑健なサンプルを識別するディープラーニングベースの検出器を提案する。
論文 参考訳(メタデータ) (2023-01-30T13:58:14Z) - Adversarial Attacks are a Surprisingly Strong Baseline for Poisoning
Few-Shot Meta-Learners [28.468089304148453]
これにより、システムの学習アルゴリズムを騙すような、衝突する入力セットを作れます。
ホワイトボックス環境では、これらの攻撃は非常に成功しており、ターゲットモデルの予測が偶然よりも悪化する可能性があることを示す。
攻撃による「過度な対応」と、攻撃が生成されたモデルと攻撃が転送されたモデルとのミスマッチという2つの仮説を探索する。
論文 参考訳(メタデータ) (2022-11-23T14:55:44Z) - Zero-Query Transfer Attacks on Context-Aware Object Detectors [95.18656036716972]
敵は、ディープニューラルネットワークが誤った分類結果を生成するような摂動画像を攻撃する。
自然の多目的シーンに対する敵対的攻撃を防御するための有望なアプローチは、文脈整合性チェックを課すことである。
本稿では,コンテキスト整合性チェックを回避可能な,コンテキスト整合性攻撃を生成するための最初のアプローチを提案する。
論文 参考訳(メタデータ) (2022-03-29T04:33:06Z) - Adversarial Self-Supervised Contrastive Learning [62.17538130778111]
既存の対数学習アプローチは、主にクラスラベルを使用して、誤った予測につながる対数サンプルを生成する。
本稿では,未ラベルデータに対する新たな逆攻撃を提案する。これにより,モデルが摂動データサンプルのインスタンスレベルのアイデンティティを混乱させる。
ラベル付きデータなしで頑健なニューラルネットワークを逆さまにトレーニングするための,自己教師付きコントラスト学習フレームワークを提案する。
論文 参考訳(メタデータ) (2020-06-13T08:24:33Z) - Investigating Robustness of Adversarial Samples Detection for Automatic
Speaker Verification [78.51092318750102]
本研究は,ASVシステムに対して,別個の検出ネットワークによる敵攻撃から防御することを提案する。
VGGライクな二分分類検出器を導入し、対向サンプルの検出に有効であることが実証された。
論文 参考訳(メタデータ) (2020-06-11T04:31:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。