論文の概要: AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation
- arxiv url: http://arxiv.org/abs/2607.11151v1
- Date: Mon, 13 Jul 2026 06:46:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.359003
- Title: AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation
- Title(参考訳): AMT-X: Checklist-Gated Evaluation を用いた位相変動型マルチTurnリレーティング
- Abstract要約: AMT-X(Adaptive Multi-Turn Exploitation)は,位相構造を持つマルチターン赤チームフレームワークである。
AMT-Xは、被害者からのセマンティック信号によって駆動される明示的で再現可能な多相状態マシンとして攻撃をキャストする。
総合的な攻撃成功率は97.6-100%と高いスコアの閾値で達成されるが、66.7-78.6%はより厳格なゲートで、完全、実戦、作戦の詳細を必要とする。
- 参考スコア(独自算出の注目度): 1.3891530345631953
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety evaluation of large language models (LLMs) relies largely on single-turn attack datasets and single-judge scoring, underestimating risk from adaptive multi-turn adversaries and reporting a single success rate that does not separate partially actionable outputs from those carrying complete operational detail. We propose AMT-X (Adaptive Multi-Turn Exploitation), a phase-structured multi-turn red-teaming framework. Unlike prior multi-turn attacks that rely on ad hoc escalation or free-form per-goal plans, AMT-X casts the attack as an explicit, reproducible multi-phase state machine driven by semantic signals from the victim, and replaces single-judge scoring with a multi-role jury whose phase-conditioned checklists gate success on actionable harm. Across six frontier victim models (queried under their default safety alignment, without added moderation layers) and seven Moderation sub-categories, AMT-X attains overall attack success rates of 97.6-100% under a lenient score threshold, but 66.7-78.6% under a stricter gate requiring complete, real, and operational detail: a gap of up to 33 percentage points between partially and fully actionable harm.
- Abstract(参考訳): 大規模言語モデル(LLM)の安全性評価は、主にシングルターン攻撃データセットとシングルジャッジスコアに依存し、適応的なマルチターン敵からのリスクを過小評価し、完全な運用詳細を持つものから部分的に実行可能なアウトプットを分離しない単一成功率を報告している。
AMT-X(Adaptive Multi-Turn Exploitation)は,位相構造を持つマルチターン赤チームフレームワークである。
アドホックエスカレーションやフリーフォームのゴールプランに依存する以前のマルチターン攻撃とは異なり、AMT-Xは攻撃を被害者のセマンティック信号によって駆動される明示的で再現可能なマルチフェーズ状態マシンとして、フェーズ条件のチェックリストがゲートの成功をアクション可能な害で達成するマルチロール陪審に置き換える。
6つのフロンティア犠牲者モデル(デフォルトの安全アライメント、追加のモデレーション・レイヤなし)と7つのモデレーション・サブカテゴリにまたがって、AMT-Xは97.6-100%の攻撃成功率を達成したが、66.7-78.6%は厳密なゲートの下で、完全な、現実的な、運用上の詳細を必要とする。
関連論文リスト
- MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models [53.05463623673949]
MaskForgeは完全にブラックボックス対応の攻撃で、構造パターンのライブラリを最適化した検索としてdLLMのレッドチームを実行する。
攻撃成功率は79.3%であり、最強のdLLMベースラインよりも17.6%向上している。
論文 参考訳(メタデータ) (2026-06-01T18:10:21Z) - SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models [55.48982086345088]
SABERは、VLAモデルに対する命令ベースの敵攻撃を自動的に生成するエージェント中心のアプローチである。
SABERはタスク成功率を20.6%減らし,アクションシーケンス長を55%増し,制約違反を33%減らした。
論文 参考訳(メタデータ) (2026-03-26T01:56:01Z) - SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks [53.97948802255959]
本稿では,既存の戦略や外部データに頼ることなく,マルチターン攻撃者を訓練するフレームワークを提案する。
準備された自己調整は、非拒否的で、よく構造化された、多ターンの逆のプロンプトを微調整することで、使用可能なロールアウトを可能にする。
私たちは、意図の整合性、コンプライアンスリスク、詳細レベルを組み合わせたインテントドリフト対応の報酬を通じて、多ターンジェイルブレイクにおける有害な意図を保ちます。
論文 参考訳(メタデータ) (2026-02-06T16:44:57Z) - AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models [2.6799007584079884]
AutoAdvは、自動マルチターンジェイルブレイクのためのトレーニング不要のフレームワークである。
Llama-3.1-8Bの攻撃成功率は最大95%に達する。
論文 参考訳(メタデータ) (2025-11-04T08:56:28Z) - X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents [76.66287343106204]
X-Teamingは、一見無害な相互作用が有害な結果へとエスカレートし、対応する攻撃シナリオを生成するフレームワークである。
X-Teamingは最新のClaude 3.7 Sonnetモデルに対して96.2%の攻撃成功率を達成した。
XGuard-Trainは、オープンソースのマルチターン安全トレーニングデータセットで、前回のベストリソースの20倍大きい。
論文 参考訳(メタデータ) (2025-04-15T16:11:28Z) - Making Every Step Effective: Jailbreaking Large Vision-Language Models Through Hierarchical KV Equalization [74.78433600288776]
HKVE (Hierarchical Key-Value Equalization) は、勾配最適化結果を選択的に受け入れる革新的なジェイルブレイクフレームワークである。
HKVEは既存の手法を20.43%,21.01%,26.43%のマージンで大幅に上回った。
論文 参考訳(メタデータ) (2025-03-14T17:57:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。