論文の概要: ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents
- arxiv url: http://arxiv.org/abs/2605.17324v1
- Date: Sun, 17 May 2026 08:30:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.90084
- Title: ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents
- Title(参考訳): ASPI: 曖昧性の解明はLPM剤のプロンプト注入脆弱性を増幅する
- Authors: Udari Madhushani Sehwag, Zhengyang Shan, Heming Liu, Dileepa Lakshan, Joseph Brandifino, Max Fenkell,
- Abstract要約: 我々は,標準実行から明確化検索状態への遷移が,インジェクション攻撃に対するエージェントの感受性を高めるかどうかを検討する。
728のタスクアタックシナリオのベンチマークであるASPIを導入し、明確なエージェント状態として明確化を分離する。
明確化の探究は一貫して、脆弱性を大幅に増幅する。
- 参考スコア(独自算出の注目度): 2.585367539248893
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Clarification-seeking behavior is widely regarded as a desirable property of LLM agents, enabling them to resolve ambiguity before acting on underspecified tasks. However, the security implications of this interaction pattern remain unexplored. We investigate whether the transition from standard execution to a clarification-seeking state increases an agent's susceptibility to prompt injection attacks. We introduce ASPI (Ambiguous-State Prompt Injection), a benchmark of 728 task-attack scenarios that isolates clarification as a distinct agent state and measures how this state transition affects vulnerability under controlled conditions. Each benchmark instance is evaluated under matched execution and clarification settings: in the execution setting, the agent acts on a fully specified instruction and encounters adversarial content only through tool-returned data; in the clarification setting, the agent must first request and incorporate additional user input before acting. We evaluate ten frontier LLMs and find that clarification-seeking consistently and substantially amplifies vulnerability. For instance, attack success rises from 1.8% to 34.0% for o3 and from 2.2% to 35.7% for Gemini-3-Flash. A decomposition analysis reveals that this gap reflects both a state-dependent shift in how models process incoming content and a channel-specific effect arising from the agent-solicited clarification interface. These findings demonstrate that standard execution-time security evaluation systematically underestimates the attack surface of interactive agents, and that robustness under fully specified tasks does not translate to robustness under ambiguity. For reproducibility, our data and source code are available at https://github.com/scaleapi/aspi.
- Abstract(参考訳): 明確化探索行動はLLM剤の望ましい性質として広く認められており、不特定タスクに作用する前に曖昧さを解消することができる。
しかし、この相互作用パターンのセキュリティへの影響は未解明のままである。
我々は,標準実行から明確化検索状態への遷移が,インジェクション攻撃に対するエージェントの感受性を高めるかどうかを検討する。
ASPI(Ambiguous-State Prompt Injection)は、728のタスクアタックシナリオのベンチマークで、明確なエージェント状態として明確化を分離し、この状態遷移が制御条件下での脆弱性に与える影響を測定する。
各ベンチマークインスタンスは、一致した実行と明確化の設定で評価される。実行設定では、エージェントは、完全に指定された命令を実行し、ツールが返却したデータを通してのみ敵対的コンテンツに遭遇する。
我々は10個のフロンティアLSMを評価し、明確化検索が一貫して脆弱性を著しく増幅することを発見した。
例えば、攻撃の成功率はo3では1.8%から34.0%に増加し、Gemini-3-Flashでは2.2%から35.7%に増加した。
分解分析により、このギャップは、モデルが入力コンテンツを処理する方法における状態依存的なシフトと、エージェントソリテートされた明確化インターフェースから生じるチャネル固有の効果の両方を反映していることが明らかになった。
これらの結果は、標準的な実行時セキュリティ評価が対話エージェントの攻撃面を体系的に過小評価していることを示し、完全に指定されたタスク下でのロバスト性はあいまいさ下でのロバスト性に変換されないことを示した。
再現性のために、我々のデータとソースコードはhttps://github.com/scaleapi/aspi.comで入手できる。
関連論文リスト
- Exploiting LLM Agent Supply Chains via Payload-less Skills [10.141577783380281]
本稿では、自律的なコーディング環境をターゲットにしたペイロードレスサプライチェーンアタックであるSemantic Compliance Hijacking(SCH)を紹介する。
SCHアプローチは、悪意のある目標を、必要なコンプライアンスルールとしてフォーマットされた非構造化の自然言語命令に変換する。
この発見は、この脅威の広範性を示し、SCHは機密性侵害に対して77.67%の最高成功率を達成した。
論文 参考訳(メタデータ) (2026-05-14T06:55:47Z) - LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments [26.85543164204341]
行動ジェイルブレイクは、敵がエージェントに危険なOSレベルの操作を不可逆的な結果で実行するように誘導する場所である。
既存のベンチマークでは、セマンティックレイヤ単独で安全性を評価したり、物理的レイヤの障害を欠いたり、テストケースの分離に失敗したりしている。
セマンティック物理二重検証機構とOSレベルの状態ロールバックにより,両方のギャップに対処するベンチマークLITMUSを提案する。
論文 参考訳(メタデータ) (2026-05-11T16:14:04Z) - Proactive Rejection and Grounded Execution: A Dual-Stage Intent Analysis Paradigm for Safe and Efficient AIoT Smart Homes [37.92248202525651]
本稿では,低レベルの物理的実行から高レベルのユーザ意図理解を分離するためのDual-Stage Intent-Aware (DS-IA)フレームワークを提案する。
試験の結果、DS-IAは58.56%(ベースラインを28%以上上回る)のエクサクトマッチ(EM)を達成し、無効命令の拒否率を87.04%に改善した。
論文 参考訳(メタデータ) (2026-03-17T07:38:39Z) - When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift [0.0]
有害なリクエスト、ジェイルブレイク、間接的なプロンプトインジェクション、抽出攻撃にまたがる18のデータセットのベンチマークを用いて、包括的な分析を行う。
我々は,真のアウト・オブ・ディストリビューションの一般化を評価するために,LODO(Leave-One-Dataset-Out)評価を提案する。
論文 参考訳(メタデータ) (2026-02-15T14:21:43Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Visual Backdoor Attacks on MLLM Embodied Decision Making via Contrastive Trigger Learning [89.1856483797116]
MLLMをベースとした組込みエージェントに視覚的バックドアを注入する最初のフレームワークであるBEATを紹介する。
テキストトリガーとは異なり、オブジェクトトリガーは視点や照明の幅が広いため、確実に移植することは困難である。
BEATは攻撃の成功率を最大80%まで達成し、強い良識のあるタスクパフォーマンスを維持します。
論文 参考訳(メタデータ) (2025-10-31T16:50:49Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Defending against Indirect Prompt Injection by Instruction Detection [109.30156975159561]
InstructDetectorは、LLMの動作状態を利用して潜在的なIPI攻撃を特定する、新しい検出ベースのアプローチである。
InstructDetectorは、ドメイン内設定で99.60%、ドメイン外設定で96.90%の検出精度を達成し、攻撃成功率をBIPIAベンチマークで0.03%に下げる。
論文 参考訳(メタデータ) (2025-05-08T13:04:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。