論文の概要: Jailbreak Context Lingers: Divergent Safety Routing and Its Cross-Task Predictability in Tool Agents
- arxiv url: http://arxiv.org/abs/2609.34686v1
- Date: Mon, 28 Sep 2026 09:12:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 11:17:46.193247
- Title: Jailbreak Context Lingers: Divergent Safety Routing and Its Cross-Task Predictability in Tool Agents
- Title(参考訳): ジェイルブレイク・コンテクスト・リンガー:ツールエージェントにおけるダイバージェント・セーフティ・ルーティングとそのクロスタスク予測可能性
- Abstract要約: 42ドメインにまたがる192の親タスクにまたがるペア型継続フレームワークを導入する。
12,148個の分析連続対(最初に設計した12,288個のペアから算出した)を8種類の多種多様なエージェントで評価した。
同一の安全フィードバックは、一様保護ではなく、モデルに依存した行動ルーティングを著しく引き起こすことがわかった。
- 参考スコア(独自算出の注目度): 15.105431288408704
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language models increasingly operate as tool-using agents, post-jailbreak safety feedback is often assumed to serve as a reliable safeguard; however, how lingering jailbreak context shapes subsequent agent behavior remains largely unexplored. To systematically examine this dynamic, we introduce a paired continuation framework across 192 parent tasks spanning 42 domains, evaluating 12,148 analyzed continuation pairs (curated from a 12,288-pair initially design) across eight diverse agents. We find that identical safety feedback induces sharply model-dependent behavioral routing rather than uniform protection: redirecting unsafe trajectories toward legitimate completion (\emph{rescue}), sustaining unauthorized execution (\emph{persistent unsafe}), or triggering over-refusal on benign tasks (\emph{collateral loss}). Through layer-wise activation patching, we discover a shared \emph{late-commit pattern} where causal intervention effects surge sharply near the final layers (relative depths of 0.958--0.984) despite an over 30-fold variation in peak magnitude across architectures. Crucially, critical-layer representations correlate with macroscopic routing outcomes, and intervening at these layers causally alters concrete next-step tool actions. Building on this causal foundation, we test whether localized intervention-derived features can serve as predictive proxies for full-trajectory routing outcomes on unseen parent tasks under leave-one-parent-task-out evaluation, finding that they provide viable predictive signals in responsive agents with peak ROC AUCs reaching 0.675 for \emph{rescue}, 0.777 for \emph{collateral loss}, and 0.702 for \emph{persistent unsafe}. These findings establish a mechanistic lens and a predictive baseline for anticipating the safety and utility trade-offs of post-jailbreak feedback in autonomous agents.
- Abstract(参考訳): 大規模な言語モデルがツール使用エージェントとしてますます機能するにつれて、ジェイルブレイク後の安全フィードバックが信頼性の高いセーフガードとして機能することがしばしば考えられているが、ジェイルブレイクのコンテキストがその後のエージェントの振る舞いをいかに形作るかは、まだ明らかにされていない。
このダイナミクスを体系的に検証するために、42ドメインにまたがる192の親タスクにまたがるペア型継続フレームワークを導入し、12,148の解析的継続ペア(最初に設計された12,288のペア)を8種類のエージェントで評価した。
同一の安全フィードバックは、安全でない軌跡を正統な完了(\emph{rescue})にリダイレクトしたり、不正な実行(\emph{persistent unsafe})を継続したり、良心的なタスク(\emph{collateral loss})に対して過剰な拒絶を引き起こす(\emph{collateral loss)。
階層単位のアクティベーション・パッチングにより,アーキテクチャ全体にわたるピーク等級の30倍以上の変動にもかかわらず,最終層(0.958-0.984)付近で因果介入効果が急激に上昇する,共有 \emph{late-commit pattern が発見された。
臨界層表現は、マクロ的なルーティング結果と相関し、これらの層に介入することで、具体的な次のステップのツールアクションを因果的に変更する。
この因果的基礎に基づいて、我々は、局所的介入による特徴が、ピーク値のROC AUCが0.675、emph{colateral loss}が0.777、emph{peristent unsafe}が0.702に達する応答性エージェントにおいて、未確認の親タスクの完全な軌道ルーティング結果の予測プロキシとして機能するかどうかを検証した。
これらの知見は,自律エージェントのジェイルブレイク後のフィードバックの安全性と実用上のトレードオフを予測するためのメカニスティックレンズと予測ベースラインを確立した。
関連論文リスト
- PROACT-Agent: Progressive Runtime Oversight and Active Circuit-breaking for Real-Time Safety [15.95756753197665]
PROACT-Agentはリアルタイムガードレールを実現するために高忠実度軌道を合成するためのフレームワークである。
ProACT-Benchは155,780の状態をマルチモデルでラベル付けしたバイリンガル安全ベンチマークである。
AgentDojoでは、非DoSターゲット攻撃の成功を20.82%から0.40%に削減する。
論文 参考訳(メタデータ) (2026-09-28T06:30:49Z) - MeshHeal: Two-Timescale Self-Healing for Gray Failures in Decentralized LLM Agent Networks [60.95806999869478]
MeshHealは、完全に分散化された自己修復フレームワークである。
能力にマッチしたピアレビューを2つのタイムスケールに分けている。
1タスクあたり51kのトータルモデルトークンを使用して0.839の劣化位相精度を達成し、最強のベースラインでは1タスクあたり115kの0.807の精度を達成した。
論文 参考訳(メタデータ) (2026-09-24T04:29:37Z) - BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents [20.217145643468598]
我々は、長距離ツール使用エージェントの軌道レベルの安全校正のためのベンチマークであるBlindspotを紹介する。
Blindspotは、適応的な対角的相互作用、ステートフルなツールの実行、実行に基づく適応を通じて、完全なユーザ-エージェント-環境トラジェクトリを評価する。
安全でない完成度, 適切な拒絶性, 便宜性, 過度な拒絶性, 繰り返し発生する頑健性, 拒絶後の失敗などをカバーする8つの指標を用いて, 13のプロプライエタリかつオープンウェイトLCMを評価した。
論文 参考訳(メタデータ) (2026-09-14T20:12:27Z) - ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - The Capability Paradox: How Smarter Auditors Make Multi-Agent Systems Less Secure [11.822284421559814]
これは、有害な要求がドメイン固有の物語の中に隠され、Workerレポートを通じてマネージャに伝達される攻撃である。
労働者の能力が増加するにつれて、平均的なシステムレベルの攻撃成功率(ASR)は18.4%から63.9%に増加し、94.4%がピークである。
非対称なドメイン能力とWorkersのペアを組み合わさった異種アンサンブル検証を提案する。
論文 参考訳(メタデータ) (2026-05-17T14:42:44Z) - Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback [38.251599309409]
我々は,悪質なツールが探索中に合理的に振る舞う,異なる障害モード,認知的中毒について検討する。
ファイナルアクションリスクスコアリングのためのバックボーンに依存しないフレームワークであるVISTA-Guardを提案する。
論文 参考訳(メタデータ) (2026-05-17T13:51:34Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations [55.251494694783894]
災害対応エージェントベンチマーク(DORA)は、エンド・ツー・エンドの災害対応のための最初のエージェントベンチマークである。
タスクは、災害認識、空間関係分析、救助・避難計画、時間的進化推論、マルチモーダルレポート合成という、災害対応パイプラインをカバーする5つの次元にまたがる。
DORAは、運用上の信頼性の高い災害対応エージェントのための厳格なテストベッドを確立する。
論文 参考訳(メタデータ) (2026-05-12T06:57:41Z) - DRAFT: Task Decoupled Latent Reasoning for Agent Safety [59.46137757545185]
DRAFT(Task Decoupled Latent Reasoning for Agent Safety)を提案する。
エクストラクターは、完全な軌跡をコンパクトな連続的な潜伏ドラフトに蒸留し、リゾナーはドラフトと元の軌跡に共同で参加して安全性を予測する。
DRAFTの精度は63.27%(LoRA)から91.18%に向上した。
論文 参考訳(メタデータ) (2026-02-11T07:45:14Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI [0.0]
トラジェクトリガードはシームズ・リカレント・オートエンコーダであり、コントラスト学習によるタスク・トラジェクトリアライメントと、再構成によるシーケンシャル・アライメントを共同で学習するハイブリッド・ロス機能を備えている。
32ミリ秒のレイテンシで、当社のアプローチは LLM Judge のベースラインよりも17-27倍高速で動作し、実運用環境におけるリアルタイムの安全性検証を可能にします。
論文 参考訳(メタデータ) (2026-01-02T00:27:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。