論文の概要: THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
- arxiv url: http://arxiv.org/abs/2606.01738v1
- Date: Mon, 01 Jun 2026 06:02:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:31.406373
- Title: THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
- Title(参考訳): THRD:大規模言語モデルに対するジェイルブレイク攻撃のためのトレーニング不要なマルチターン防御フレームワーク
- Authors: Zhiqing Ma, Zhonghao Xu, Dong Yu, Chen Kang, Changliang Li, Pengyuan Liu,
- Abstract要約: マルチターンジェイルブレイク攻撃はLLMに対する脅威を増大させる。
THRDは、時間的リスク蓄積を明示的にモデル化する最初のトレーニング不要のフレームワークである。
- 参考スコア(独自算出の注目度): 19.719248410180263
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-turn jailbreak attacks pose a growing threat to LLMs by exploiting conversational dynamics such as gradual escalation and cross-turn coordination. Existing defenses either rely on costly retraining -- often degrading model utility -- or apply single-turn analysis independently at each turn, failing to capture how risk accumulates along interaction trajectories. We observe that safety behavior in multi-turn interaction is trajectory-dependent: dialogue history continuously reshapes the model's conditioning context, making it insufficient to evaluate each turn in isolation. Motivated by this insight, we present THRD, the first training-free framework that explicitly models temporal risk accumulation for multi-turn jailbreak defense. THRD integrates four modules: a Turn-level Risk Assessor (TRA) for instantaneous risk estimation, a Historical Context Analyzer (HCA) for cross-turn intent escalation detection, a Response Evaluator (RE) for identifying facilitative outputs, and a Decision Module that combines these signals through a time-evolving scoring mechanism with attenuation-based modulation and trend-aware adjustment. Experiments against state-of-the-art multi-turn attacks -- including tree-search-based and multi-agent collaborative methods -- across two target models show that THRD reduces ASR to 0.2--4.0% while preserving model utility within 1.5% degradation on MMLU and GSM8K. Ablation studies confirm non-redundant module contributions and stable cross-architecture generalization. Analysis of first rejection triggers reveals that over 70% of multi-turn attacks require Turn~2 or later to detect, validating the necessity of explicit temporal aggregation.
- Abstract(参考訳): マルチターンジェイルブレイク攻撃は、徐々にエスカレーションやクロスターン調整といった会話のダイナミクスを活用することで、LSMに対する脅威が増大する。
既存の防御は、コストのかかる再トレーニング(しばしばモデルユーティリティの劣化)に依存するか、各ターンで独立してシングルターン分析を適用するかのいずれかで、インタラクションの軌跡に沿ってリスクが蓄積されるかの把握に失敗する。
対話履歴は、モデルの条件付けコンテキストを継続的に再認識し、各ターンの独立性を評価するのに不十分である。
この知見に触発されたTHRDは,マルチターンジェイルブレイク防御のための時間的リスク蓄積を明示的にモデル化した最初のトレーニングフリーフレームワークである。
THRDは、即時リスク推定のためのターンレベルリスク評価器(TRA)、横方向のインテントエスカレーション検出のための履歴コンテキストアナライザ(HCA)、ファシリテーティブな出力を識別する応答評価器(RE)、時間発展的なスコアリング機構と減衰に基づく変調とトレンドアウェア調整を備えた決定モジュールの4つのモジュールを統合する。
ツリー検索とマルチエージェントの共同手法を含む最先端のマルチターン攻撃に対する実験では、THRDはMMLUとGSM8Kの1.5%の劣化率でモデルユーティリティを保ちながら、ASRを0.2--4.0%に削減している。
アブレーション研究は、非冗長加群寄与と安定なクロスアーキテクチャ一般化を裏付ける。
最初の拒絶反応の解析により、マルチターン攻撃の70%以上がターン~2以降で検出し、明示的な時間的アグリゲーションの必要性を検証する必要があることが明らかになった。
関連論文リスト
- Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks [0.0]
本稿では,動的生存予測と軌道力学問題として安全検証を定式化する。
マルチモーダルおよびマルチターン対話フローを連続軌道としてマッピングする予測モデルとして,トリプル層異常防御(TRIAD)フレームワークが提案されている。
論文 参考訳(メタデータ) (2026-05-18T18:06:20Z) - MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models [17.848889547838173]
MUSE (Multimodal Unified Safety Evaluation) は、自動クロスモーダルペイロード生成を統合するオープンソースの実行中心プラットフォームである。
ハードアタック成功率(コンプライアンスのみ)とソフトASR(部分コンプライアンスを含む)を区別するデュアルメトリックフレームワーク
実験により、マルチターン戦略は、ほぼ完全な単一ターン拒否を持つモデルに対して最大90-100%のASRを達成することができることが示された。
論文 参考訳(メタデータ) (2026-03-03T00:10:23Z) - OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs [36.57820295876294]
MLLMの安全性評価のための統一的,モジュール型,高スループットのRed-teamingフレームワークであるOpenRTを紹介した。
OpenRTのコアとなるのは,5次元にわたるモジュール分離を可能にする対角カーネルを導入することで,自動化された再チームのパラダイムシフトだ。
このフレームワークは、ホワイトボックス勾配、マルチモーダル摂動、高度なマルチエージェント進化戦略など、37の多様な攻撃手法を統合している。
論文 参考訳(メタデータ) (2026-01-04T16:41:33Z) - Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning [137.33138614095435]
Retrieval-augmented Generation (RAG) は、大規模言語モデルにおける幻覚の緩和に有効であることが証明されている。
近年、検索に基づく対話をRAGに組み込んで、リアルタイム検索による反復推論を可能にしている。
提案するBi-RARは,各中間ステップを前方方向と後方方向の両方で共同で評価する,新たな検索拡張推論フレームワークである。
論文 参考訳(メタデータ) (2025-11-12T08:29:39Z) - AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models [2.6799007584079884]
AutoAdvは、自動マルチターンジェイルブレイクのためのトレーニング不要のフレームワークである。
Llama-3.1-8Bの攻撃成功率は最大95%に達する。
論文 参考訳(メタデータ) (2025-11-04T08:56:28Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。