論文の概要: MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment
- arxiv url: http://arxiv.org/abs/2607.11070v1
- Date: Mon, 13 Jul 2026 04:19:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.327101
- Title: MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment
- Title(参考訳): MJ:Multi-turn LLM Jailbreaking by Decomposed Credit Assignment
- Abstract要約: マルチターンジェイルブレイク攻撃の学習における中核的な課題は、クレジットの割り当てである。
我々は,一貫したターンレベルのクレジット割り当てフレームワークであるCredit GRPOを提案する。
このフレームワークを静的および動的重み付けルールでインスタンス化する。
- 参考スコア(独自算出の注目度): 7.3239173910002
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern large language models (LLMs) operate in interactive multi-turn settings, making multi-turn jailbreaking a realistic threat model and an important setting for automated red teaming. A core challenge in learning multi-turn jailbreak attackers is credit assignment: different turns contribute differently to the final outcome, yet existing learning signals are often too coarse to identify their individual contributions. We propose decomposed credit GRPO (DC-GRPO), a unified turn-level credit assignment framework for Group Relative Policy Optimization in multi-turn jailbreak learning. DC-GRPO assigns a separate group-relative learning signal to each turn by combining immediate and future credit, avoiding the credit misassignment induced by broadcasting a single trajectory-level score across the dialogue. We instantiate this framework with static and dynamic weighting rules that differ in how the two credit sources are balanced while sharing the same turn-level structure. Across multiple victim LLMs and benchmarks, the dynamic- and static-weighted variants achieve average ASR5@3 scores of 98.26% and 97.88%, respectively, substantially outperforming the state-of-the-art methods, including SEMA (86.58%) and TROJail (86.23%). Their consistently strong performance indicates that the central empirical benefit comes from turn-level group-relative credit assignment rather than a particular weighting rule. Warning: This paper contains examples of harmful content.
- Abstract(参考訳): 現代の大規模言語モデル(LLM)はインタラクティブなマルチターン設定で動作し、マルチターンジェイルブレイクは現実的な脅威モデルであり、自動化されたレッドチームにとって重要な設定となっている。
異なるターンが最終的な結果に異なる貢献をする一方で、既存の学習信号は個々のコントリビューションを識別するには大きすぎることが多い。
マルチターンジェイルブレイク学習におけるグループ相対ポリシー最適化のための一貫したターンレベルクレジット割り当てフレームワークである、非分割クレジットGRPO(DC-GRPO)を提案する。
DC-GRPOは、対話中に単一の軌道レベルスコアをブロードキャストすることによって誘導されるクレジットミス割り当てを回避し、即時と将来のクレジットを組み合わせたグループ相対学習信号を各ターンに割り当てる。
このフレームワークを静的および動的重み付けルールでインスタンス化し、同じターンレベルの構造を共有しながら、2つのクレジットソースのバランスを保っています。
複数の犠牲者のLSMとベンチマークで、動的および静的に重み付けされた変種はそれぞれ平均で98.26%と97.88%のスコアを獲得し、SEMA (86.58%) やTROJail (86.23%) など最先端の手法を大幅に上回っている。
彼らの一貫して強いパフォーマンスは、特定の重み付け規則よりもターンレベルのグループ相対的信用割り当てによる中心的な経験的利益を示している。
警告: 本論文は有害な内容の例を含む。
関連論文リスト
- SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models [66.92079232778707]
本稿では,アルゴリズムに依存しない軽量な動的重み付け機構として,SAW(Stage-Aware Dynamic Weighting)を提案する。
SAWは、各次元の報酬または利益の貢献を、バッチ内の相対的な情報性によって重み付けする。
ツールコールとテキスト要約タスクの実験により、SAWはトレーニング効率と最終的なパフォーマンスの両方を一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-06-05T10:00:19Z) - What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents [70.6980022118038]
強化学習は、緩やかなタスク報酬からLLMエージェントを訓練することができるが、長期的なクレジット割り当ては依然として困難である。
既存の方法は、ステップごとの環境フィードバックを完全に活用することなく、軌道レベルの報酬やプロキシ信号に依存している。
環境重み付け学習フレームワークであるSERLを紹介する。
論文 参考訳(メタデータ) (2026-05-19T07:00:55Z) - MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks [16.699418698714585]
マルチターンジェイルブレイクは、大きな言語モデルが会話のコンテキストに蓄積して作用する能力を利用する。
報告されたゲインがより強力な攻撃機構や異なる実験条件を反映しているかは、しばしば不明である。
固定条件下でマルチターンジェイルブレイクをベンチマークするモジュール評価フレームワークMT-JailBenchを紹介する。
論文 参考訳(メタデータ) (2026-05-10T00:17:14Z) - Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking [39.11709072420052]
我々は、強化学習に基づくマルチターンジェイルブレイクのためのターンアウェア・クレジット・アサインメント・フレームワークであるTRACEを提案する。
トラジェクトリが成功するためには、TRACEはLeft-one-turn-outセマンティックマスクを通じてターンレベルのコントリビューションを見積もる。
失敗した場合、TRACEは迅速な有害性と意味的関連性に基づいて罰則を割り当てる。
論文 参考訳(メタデータ) (2026-05-09T08:07:30Z) - MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety [34.69024935656433]
MultiBreakは、大規模言語モデル(LLM)の安全性を評価するために、スケーラブルで多様なマルチターンジェイルブレイクベンチマークである。
我々のベンチマークは、DeepSeek-R1-7BとGPT-4.1-miniの2番目に高いデータセットよりも54.0と34.6高い攻撃成功率(ASR)を達成した。
論文 参考訳(メタデータ) (2026-05-03T02:55:30Z) - Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation [57.61006679699323]
強化学習は人間の嗜好信号を用いた視覚生成モデルの訓練後の効果的な枠組みとして登場した。
現代の視覚生成では、視覚的品質、動きの整合性、テキストアライメントなどの不均一な目的を捉えるために、複数の報酬モデルがしばしば使用される。
GRPO の微粒化学習のための構造化フレームワークである Objective-Aware Trajectory Credit Assignment (OTCA) を提案する。
論文 参考訳(メタデータ) (2026-04-21T08:37:13Z) - Counterfactual Credit Policy Optimization for Multi-Agent Collaboration [27.260904103460664]
協調多エージェント大言語モデル(LLM)は、役割を分解し、多様な仮説を集約することで複雑な推論タスクを解くことができる。
本稿では,エージェント固有の学習信号を割り当てるフレームワークであるCCPOを紹介する。
CCPOは、エージェントのコントリビューションを除去して結果をシミュレートする動的反ファクト的ベースラインを構築する。
論文 参考訳(メタデータ) (2026-03-23T04:35:02Z) - SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks [53.97948802255959]
本稿では,既存の戦略や外部データに頼ることなく,マルチターン攻撃者を訓練するフレームワークを提案する。
準備された自己調整は、非拒否的で、よく構造化された、多ターンの逆のプロンプトを微調整することで、使用可能なロールアウトを可能にする。
私たちは、意図の整合性、コンプライアンスリスク、詳細レベルを組み合わせたインテントドリフト対応の報酬を通じて、多ターンジェイルブレイクにおける有害な意図を保ちます。
論文 参考訳(メタデータ) (2026-02-06T16:44:57Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges [10.382464507264784]
我々は、Jailbreakプロンプトとスコアリングテンプレートを共同で進化させるメタ最適化フレームワークAMISを紹介する。
AMISは最先端のパフォーマンスを実現しており、Claude-3.5-Haikuでは88.0%、Claude-4-Sonnetでは100.0%である。
論文 参考訳(メタデータ) (2025-11-03T09:18:27Z) - Improved Generation of Adversarial Examples Against Safety-aligned LLMs [72.38072942860309]
勾配に基づく手法を用いて生成した敵対的プロンプトは、安全対応のLDMに対して自動ジェイルブレイク攻撃を行う際、優れた性能を示す。
本稿では,この問題に対する新たな視点を探求し,トランスファーベースの攻撃にインスパイアされたイノベーションを活用することで緩和できることを示唆する。
この組み合わせによって生成されたクエリ固有逆接接尾辞の87%がLlama-2-7B-Chatを誘導し、AdvBench上のターゲット文字列と正確に一致する出力を生成することを示した。
論文 参考訳(メタデータ) (2024-05-28T06:10:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。