論文の概要: Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
- arxiv url: http://arxiv.org/abs/2605.08778v1
- Date: Sat, 09 May 2026 08:07:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.882622
- Title: Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
- Title(参考訳): マルチターンジェイルブレーカーのクレジットアサインメント(動画あり)
- Abstract要約: 我々は、強化学習に基づくマルチターンジェイルブレイクのためのターンアウェア・クレジット・アサインメント・フレームワークであるTRACEを提案する。
トラジェクトリが成功するためには、TRACEはLeft-one-turn-outセマンティックマスクを通じてターンレベルのコントリビューションを見積もる。
失敗した場合、TRACEは迅速な有害性と意味的関連性に基づいて罰則を割り当てる。
- 参考スコア(独自算出の注目度): 39.11709072420052
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying LLMs in multi-turn dialogues facilitates jailbreak attacks that distribute harmful intent across seemingly benign turns. Recent training-based multi-turn jailbreak methods learn long-horizon attack strategies from interaction feedback, but often rely on coarse trajectory-level outcome signals that broadcast uniformly to every turn. However, we find that turn-level contributions in multi-turn jailbreaking are non-uniform, phase-dependent, and target-specific. Such coarse outcome supervision induces a credit assignment problem, leading to over-rewarding redundant turns in successful trajectories and under-crediting useful intermediate turns in failed ones. To address this, we propose TRACE, a turn-aware credit assignment framework for reinforcement learning (RL)-based multi-turn jailbreaking. For successful trajectories, TRACE estimates turn-level contributions via leave-one-turn-out semantic masking; for failed ones, TRACE assigns penalties based on prompt harmfulness and semantic relevance, with an additional local refusal-aware penalty. Furthermore, we reuse the attack-side credit signal for multi-turn defense alignment. Extensive experiments on open-source and closed-source targets show that TRACE achieves strong overall performance in effectiveness, transferability, and efficiency, yielding about a 25% relative improvement in attack success rate over the strongest RL baseline while also improving the safety-utility balance when reused for defense alignment.
- Abstract(参考訳): マルチターンダイアログにLSMを配置することは、一見良心的なターンに有害な意図を分散するジェイルブレイク攻撃を促進する。
最近の訓練ベースのマルチターンジェイルブレイク法は、相互作用フィードバックから長距離攻撃戦略を学習するが、多くの場合、全てのターンに均一に放送される粗い軌跡レベルの結果信号に依存している。
しかし, マルチターンジェイルブレイクにおけるターンレベルの貢献は, 非一様, 位相依存, ターゲット固有であることがわかった。
このような粗い結果の監督は信用割当問題を誘導し、成功軌道における冗長な旋回を過度に反転させ、失敗軌道における有効な中間旋回を過度に反復させる。
そこで我々は,強化学習(RL)に基づくマルチターンジェイルブレイクのためのターンアウェア・クレジット・アサインメント・フレームワークであるTRACEを提案する。
trajectories の成功のために TRACE は、Left-one-turn-out semantic masking を通じてターンレベルのコントリビューションを見積もるが、失敗した場合は、TRACE は、迅速な有害性とセマンティック関連性に基づいて罰則を割り当て、さらに局所的拒絶認識のペナルティを課す。
さらに,攻撃側のクレジットカード信号を多ターン防御アライメントに再利用する。
オープンソースおよびクローズドソースターゲットに対する大規模な実験により、TRACEは有効性、転送可能性、効率において高い総合的な性能を達成し、最強のRLベースラインに対する攻撃成功率を約25%改善し、防御アライメントのために再利用された場合の安全ユーティリティバランスも改善した。
関連論文リスト
- HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents [45.00250014235802]
強化学習による長期LLMエージェントの訓練は、タスクが成功するか、どの中間動作が結果を引き起こしたのか、どのように修正されるべきなのかを明らかにするため、困難である。
近年の手法では、ターンレベルのアクション出力信号から報酬やテキストヒントを生成したり、あるいはフィードバック条件の自己蒸留を用いてこの問題を緩和している。
本研究では,HINT-SDを提案する。HINT-SDは,フルトラジェクティブ・ヒンドシット(Hndsight)を用いて,障害関連アクションを選択し,目標アクションスパンのみにフィードバック条件付き蒸留を適用する。
論文 参考訳(メタデータ) (2026-05-18T05:34:03Z) - SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks [53.97948802255959]
本稿では,既存の戦略や外部データに頼ることなく,マルチターン攻撃者を訓練するフレームワークを提案する。
準備された自己調整は、非拒否的で、よく構造化された、多ターンの逆のプロンプトを微調整することで、使用可能なロールアウトを可能にする。
私たちは、意図の整合性、コンプライアンスリスク、詳細レベルを組み合わせたインテントドリフト対応の報酬を通じて、多ターンジェイルブレイクにおける有害な意図を保ちます。
論文 参考訳(メタデータ) (2026-02-06T16:44:57Z) - R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification [44.99719889905381]
強化学習は推論とエージェント能力の最近の進歩を促進するが、現在のアプローチは探索と搾取の両方で苦労している。
本稿では,R$3$L,Reflection-then-Retry Reinforcement Learning with Language-Guided Exploration,Pivotal Credit,Positive Amplificationを提案する。
エージェントおよび推論タスクの実験は、トレーニング安定性を維持しながら、ベースラインよりも5%から52%改善したことを示している。
論文 参考訳(メタデータ) (2026-01-07T09:04:52Z) - RL-MTJail: Reinforcement Learning for Automated Black-Box Multi-Turn Jailbreaking of Large Language Models [60.201244463046784]
大規模な言語モデルは、ジェイルブレイク攻撃に弱い。
本稿では,ブラックボックスのマルチターンジェイルブレイクについて検討し,ブラックボックスモデルから有害なコンテンツを引き出すように攻撃者のLDMを訓練することを目的とした。
論文 参考訳(メタデータ) (2025-12-08T17:42:59Z) - bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs [33.470999703070866]
既存のジェイルブレイクのトリガーを埋め込むアプローチは、一般化の貧弱さ、ステルスネスの妥協、文脈的ユーザビリティの低下といった制限に悩まされている。
ジェイルブレイクバックドア注入に適した新しいRLベースのフレームワークであるbi-GRPOを提案する。
論文 参考訳(メタデータ) (2025-09-24T05:56:41Z) - A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks [3.8246557700763715]
中間モデル表現のレベルにおけるCrescendoマルチターンジェイルブレイクの有効性について検討する。
本研究は, シングルターンジェイルブレイク防御が多ターン攻撃に対して一般的に効果がない理由を説明するのに有効である。
論文 参考訳(メタデータ) (2025-06-29T23:28:55Z) - GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication [55.63412213263305]
大規模言語モデルは、悪意のある目的のために誤用される可能性があるため、顕著な安全性のリスクを生じさせる。
そこで本研究では,各インタラクションにおける攻撃経路をグローバルに洗練する,新しいマルチターンジェイルブレーキング手法を提案する。
さらに、モデル応答を積極的に作成し、安全性に関する警告を抑えることにより、有害な出力を誘発する可能性を高める。
論文 参考訳(メタデータ) (2025-06-22T03:15:05Z) - Improving LLM Safety Alignment with Dual-Objective Optimization [81.98466438000086]
大規模言語モデル(LLM)の既存のトレーニング時間安全アライメント技術は、ジェイルブレイク攻撃に対して脆弱なままである。
本研究では,DPOの目的を2つの構成要素にまとめる安全アライメントの改善について提案する。(1) 安全でない世代が部分的に発生しても拒否を促す頑健な拒絶訓練,(2) 有害な知識の未学習。
論文 参考訳(メタデータ) (2025-03-05T18:01:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。