論文の概要: OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents
- arxiv url: http://arxiv.org/abs/2605.08876v1
- Date: Sat, 09 May 2026 10:55:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.94867
- Title: OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents
- Title(参考訳): OTora: LLMエージェントにおけるレゾナリングレベルサービス拒否のための統一されたレッドチームフレームワーク
- Authors: Xinyu Li, Ronghui Mu, Lin Li, Tianjin Huang, Gaojie Jin,
- Abstract要約: OToraは、Reasoning-Level Denial-of-Service攻撃をインスタンス化するフレームワークである。
OToraはICL誘導遺伝子探索によってエージェント認識推論ペイロードを生成する。
トークンの推論とマグニチュードの遅延の遅延ダウンで最大10倍増加する。
- 参考スコア(独自算出の注目度): 21.836018755837085
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are increasingly deployed as autonomous agents that execute tool-augmented, multi-step tasks, where latency is a critical factor for real-world applications. Yet an overlooked threat is Reasoning-Level Denial-of-Service (R-DoS), in which an attacker preserves task correctness but degrades availability by inflating an agent's reasoning depth or tool-use budget. We introduce OTora, the first unified, two-stage red-teaming framework for instantiating R-DoS attacks. Stage I optimizes an adversarial trigger that induces targeted tool invocations using insertion-aware scoring and dynamic target co-evolution, supporting both black-box and white-box settings. Stage II generates agent-aware reasoning payloads via an ICL-guided genetic search that amplifies overthinking while maintaining correct task outcomes. Across WebShop, Email, and OS agents built on multiple backbone models such as LLaMA-70B and GPT-OSS-120B, OTora achieves up to 10 times increases in reasoning tokens and order-of-magnitude latency slowdowns, all while preserving near-baseline task accuracy. Finally, we discuss mitigation strategies for detecting and constraining abnormal reasoning and latency spikes. The code is available at https://github.com/llm2409/OTora.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ツール拡張されたマルチステップタスクを実行する自律エージェントとして、ますます多くデプロイされている。
しかし、見落とされた脅威はReasoning-Level Denial-of-Service (R-DoS) であり、攻撃者はタスクの正確性を維持するが、エージェントの推論深度やツール使用予算を膨らませることで可用性を低下させる。
我々は、R-DoS攻撃をインスタンス化するための最初の統合された2段階のレッドチームフレームワークOToraを紹介する。
ステージ1は、インサート対応スコアリングと動的ターゲット共進化を使用してターゲットツールの実行を誘導する対向トリガを最適化し、ブラックボックスとホワイトボックスの両方の設定をサポートする。
Stage II は ICL で誘導された遺伝的検索を通じてエージェント認識推論ペイロードを生成し、これは正しいタスク結果を維持しながら過度な思考を増幅する。
WebShop、Email、OSエージェントがLLaMA-70BやGPT-OSS-120Bのような複数のバックボーンモデル上に構築されているため、OToraは、ほぼベースラインのタスク精度を維持しながら、推論トークンとオーダー・オブ・マグニチュードの遅延を最大10倍増加させる。
最後に、異常な推論と遅延スパイクを検出し、制限するための緩和戦略について議論する。
コードはhttps://github.com/llm2409/OTora.comで公開されている。
関連論文リスト
- AttriGuard: Defeating Indirect Prompt Injection in LLM Agents via Causal Attribution of Tool Invocations [38.49666480491258]
LLMエージェントは間接プロンプト注入(IPI)に対して非常に脆弱である
本稿では,特定のツールコールが生成される理由を問うことでエージェントをセキュアにする,アクションレベルの因果属性という新しいパラダイムを提案する。
我々はこのパラダイムを、並列対実テストに基づくランタイムディフェンスであるAttriGuardでインスタンス化する。
論文 参考訳(メタデータ) (2026-03-11T13:23:46Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents [58.83028403414688]
大規模言語モデル(LLM)エージェントは、計画、メモリ、ツールの使用を組み合わせた多段階ワークフローを通じてタスクを実行する。
エージェントワークフローの特定のステージに注入されたバックドアトリガーは、複数の中間状態を通して持続し、下流出力に悪影響を及ぼす可能性がある。
LLMエージェントにおけるバックドア脅威を統一したエージェント中心のビューを提供するモジュールおよびステージアウェアフレームワークである textbfBackdoorAgent を提案する。
論文 参考訳(メタデータ) (2026-01-08T03:49:39Z) - A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks [1.1435139523855764]
本稿では,インジェクション攻撃をリアルタイムに検出・中和する新しいマルチエージェント・ディフェンス・フレームワークを提案する。
我々は2つの異なるアーキテクチャ、シーケンシャル・チェーン・オブ・エージェント・パイプラインと階層的コーディネータ・ベース・システムを用いてアプローチを評価した。
論文 参考訳(メタデータ) (2025-09-16T19:11:28Z) - AgentSight: System-Level Observability for AI Agents Using eBPF [10.37440633887049]
既存のツールは、エージェントの高レベルな意図(LSMプロンプトを介して)または低レベルな行動(例えば、システムコール)を観察するが、これら2つのビューを関連付けることはできない。
AgentOpsはハイブリッドアプローチを使用して,このセマンティックギャップをブリッジする,AgentOpsオブザーバビリティフレームワークです。
AgentSightはTLS暗号化されたLLMトラフィックをインターセプトしてセマンティックインテントを抽出し、カーネルイベントを監視してシステム全体の効果を観察し、これら2つのストリームをプロセス境界を越えて因果的に関連付ける。
論文 参考訳(メタデータ) (2025-08-02T01:43:39Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。