論文の概要: TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking
- arxiv url: http://arxiv.org/abs/2605.30883v1
- Date: Fri, 29 May 2026 06:13:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.414892
- Title: TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking
- Title(参考訳): TRACE: タスク対応型自己進化型エージェントジェイルブレイク
- Abstract要約: LLMエージェントの台頭は、計画、コーディング、さらにはエキスパートレベルの攻撃のエンドツーエンド実行を可能にすることで、新たな脅威をもたらす。
本稿では,この脅威表面のリスクを明らかにするための実用的なエージェントジェイルブレイクフレームワークであるTRACEを提案する。
- 参考スコア(独自算出の注目度): 40.259937753172224
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rise of LLM agents introduces a new threat by enabling planning, coding, and even end-to-end execution of expert-level attack workflows. However, this threat remains underexplored and underestimated since (i) safety alignment prevents LLMs from directly generating harmful instructions, and (ii) most existing jailbreak methods cannot consistently induce agents to execute malicious operations. In this paper, we propose TRACE, a practical agentic jailbreaking framework to further reveal the risks of this threat surface. To conceal the malicious intent, TRACE decomposes a malicious task into multiple subtask sequences under different schemes and selects the sequence with the fewest explicitly harmful subtasks. TRACE then disguises the remaining harmful subtasks as benign-looking instructions by embedding them in task-aware scenarios with related roles, environments, directives, and heuristics. The scenarios are iteratively evolved through well-defined transformation actions, which are sampled by a Q-learning-inspired mechanism, for inducing the agent to execute on the harmful subtasks. Extensive evaluations on AgentHarm and AdvCUA show that TRACE consistently outperforms existing jailbreak baselines across multiple advanced LLM agents, achieving up to 100% bypass rate and 0.73 average success score. We also demonstrate the effectiveness of TRACE in controlled cyberattack instances. Our code and demos are available at https://github.com/ZJU-LLM-Safety/TRACE.git.
- Abstract(参考訳): LLMエージェントの台頭は、専門家レベルのアタックワークフローの計画、コーディング、さらにはエンドツーエンドの実行を可能にすることで、新たな脅威をもたらす。
しかし、この脅威はその後も過小評価され、過小評価されている。
一 安全アライメントにより、LSMが有害な指示を直接発生することを防ぎ、
(ii) 既存のjailbreakメソッドのほとんどは、悪意のある操作を実行するためにエージェントを一貫して誘導することはできない。
本稿では,この脅威表面のリスクを明らかにするための実用的なエージェントジェイルブレイクフレームワークであるTRACEを提案する。
悪意のある意図を隠蔽するために、TRACEは悪意のあるタスクを異なるスキームの下で複数のサブタスクシーケンスに分解し、最小限の有害なサブタスクで選択する。
TRACEは、残りの有害なサブタスクを、関連する役割、環境、ディレクティブ、ヒューリスティックといったタスク認識シナリオに埋め込むことによって、良心的な命令として偽装する。
シナリオは、Qラーニングにインスパイアされたメカニズムによってサンプリングされる、明確に定義された変換アクションを通じて反復的に進化し、有害なサブタスク上でエージェントの実行を誘導する。
AgentHarmとAdvCUAの大規模な評価は、TRACEが既存のジェイルブレイクベースラインを複数の先進的なLCMエージェントで一貫して上回り、100%バイパス率と0.73の平均成功スコアを達成していることを示している。
また,制御サイバー攻撃におけるTRACEの有効性を実証した。
私たちのコードとデモはhttps://github.com/ZJU-LLM-Safety/TRACE.git.comで公開されています。
関連論文リスト
- SafeFlow: Semantic Information-Flow Control for Blocking Malicious Propagation in Multi-Agent Systems [9.486092743924472]
SafeFlowは、セマンティックな情報フロー問題として悪意あるクロスエージェントの伝搬を形式化するマルチエージェントシステムのための防御フレームワークである。
プロンプトインジェクション、Jailbreakベースの安全でないツール使用、リスクの高いコード実行、有害なWebエージェント動作の4つのベンチマークで評価された。
論文 参考訳(メタデータ) (2026-07-28T03:55:47Z) - AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents [38.755035623707656]
本稿では,エージェントツールの利用を生かした新しいマルチターンアタックフレームワークSTACについて紹介する。
我々は,483のSTACケースを自動生成し,評価するために,1,352セットのユーザエージェント環境相互作用を特徴とするフレームワークを適用した。
GPT-4.1を含む最先端のLSMエージェントはSTACに対して極めて脆弱であり,攻撃成功率(ASR)は90%以上である。
論文 参考訳(メタデータ) (2025-09-30T00:31:44Z) - Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation [19.30407680164485]
エージェントタスクを実行するための微調整された大規模言語モデル(LLM)は、有害なタスクを実行する可能性が高くなる可能性がある。
プリフィックスインジェクションガード(PING)は、エージェント応答に自動的に生成された自然言語プレフィックスをプリペンドする。
Pingは、Webナビゲーションとコード生成タスクの両方において、さまざまなベンチマークで既存のプロンプトアプローチを一貫して上回っている。
論文 参考訳(メタデータ) (2025-08-19T17:53:35Z) - AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents [54.29555239363013]
本稿では,間接的なインジェクション脆弱性を自動的に検出し,悪用するための汎用的なブラックボックスファジリングフレームワークであるAgentVigilを提案する。
我々はAgentVigilをAgentDojoとVWA-advの2つの公開ベンチマークで評価し、o3-miniとGPT-4oに基づくエージェントに対して71%と70%の成功率を達成した。
攻撃を現実世界の環境に適用し、悪質なサイトを含む任意のURLに誘導するエージェントをうまく誘導する。
論文 参考訳(メタデータ) (2025-05-09T07:40:17Z) - UDora: A Unified Red Teaming Framework against LLM Agents by Dynamically Hijacking Their Own Reasoning [17.448966928905733]
外部ツールを備えた大規模言語モデル(LLM)エージェントは、複雑なタスクに対してますます強力になっている。
UDoraはLDMエージェント用に設計された統一されたレッド・チーム・フレームワークで、エージェントの推論プロセスを動的にハイジャックし、悪意ある振る舞いを強制する。
論文 参考訳(メタデータ) (2025-02-28T21:30:28Z) - AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents [84.96249955105777]
LLMエージェントは誤用された場合、より大きなリスクを引き起こすが、その堅牢性は未発見のままである。
我々は, LLMエージェント誤用の研究を容易にするために, AgentHarmと呼ばれる新しいベンチマークを提案する。
主要なLLMは、ジェイルブレイクなしで悪意のあるエージェント要求に驚くほど準拠している。
論文 参考訳(メタデータ) (2024-10-11T17:39:22Z) - Compromising Embodied Agents with Contextual Backdoor Attacks [69.71630408822767]
大型言語モデル(LLM)は、エンボディドインテリジェンスの発展に変化をもたらした。
本稿では,このプロセスにおけるバックドアセキュリティの重大な脅威を明らかにする。
ほんの少しの文脈的デモンストレーションを毒殺しただけで、攻撃者はブラックボックスLDMの文脈的環境を隠蔽することができる。
論文 参考訳(メタデータ) (2024-08-06T01:20:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。