論文の概要: TACS: Trajectory-Aware Candidate Selection for LLM Jailbreak Suffix Optimization
- arxiv url: http://arxiv.org/abs/2608.29564v2
- Date: Tue, 01 Sep 2026 03:40:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.640298
- Title: TACS: Trajectory-Aware Candidate Selection for LLM Jailbreak Suffix Optimization
- Title(参考訳): TACS: LLMジェイルブレイクサフィックス最適化のための軌道対応候補選択
- Authors: Shiliang Xiao,
- Abstract要約: 勾配に基づくジェイルブレイクサフィックス最適化手法は、候補を最低電流損失で保持することでサフィックスを更新する。
現段階のプロキシの下では、よりよく見える候補が、検索の後半でよりよいジェイルブレイクの結果を出すのに失敗することが多いことを示しています。
本稿では,ジェイルブレイクサフィックス最適化のための軌道対応候補選択フレームワークTACSを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Gradient-based jailbreak suffix optimization methods typically update the suffix by retaining the candidate with the lowest current loss. We show that this seemingly natural design is fundamentally myopic: candidates that look better under the current-step proxy often fail to produce better jailbreak outcomes later in the search, revealing a form of selection-stage reward hacking. This suggests that candidate selection, rather than candidate generation alone, is a hidden bottleneck in suffix optimization. To address this issue, we propose TACS, a trajectory-aware candidate selection framework for jailbreak suffix optimization. Instead of selecting candidates solely by their immediate loss, TACS augments per-step evaluation with a trajectory-aware proxy and stabilizes selection with reference-policy regularization and a discriminator-estimated chi-squared correction, encouraging choices that remain effective beyond the current step. Experiments on HarmBench show that TACS consistently outperforms strong baselines under the same search budget, substantially improving attack success rates while exhibiting more stable optimization behavior throughout the search. Our findings highlight that mitigating selection-stage reward hacking caused by myopic candidate selection is critical for improving jailbreak suffix optimization.
- Abstract(参考訳): グラディエントベースのジェイルブレイクサフィックス最適化手法は、典型的には、候補を最低電流損失で保持することでサフィックスを更新する。
この一見自然のように見えるデザインは、基本的にミステリーだ: 現在の段階のプロキシの下では、検索の後半で、より良いジェイルブレイクの結果が得られず、選択段階の報酬ハックの形式が明らかになる。
これは、候補生成のみではなく、候補選択が接尾辞最適化の隠れボトルネックであることを示唆している。
そこで本研究では,ジェイルブレイクサフィックス最適化のための軌道対応候補選択フレームワークであるTACSを提案する。
TACSは、直接の損失のみで候補を選定する代わりに、軌跡認識プロキシによるステップ毎の評価を強化し、参照ポリティ正規化による選択を安定化し、差別者による2乗補正を安定化し、現在のステップを超えて有効な選択を奨励する。
HarmBenchの実験では、TACSは同じ検索予算の下で強いベースラインを一貫して上回り、攻撃成功率を大幅に向上し、検索全体を通してより安定した最適化動作を示す。
以上の結果から、ミオピック候補選択による選択段階報酬ハッキングの軽減が、ジェイルブレイク接尾辞最適化の改善に重要であることが示唆された。
関連論文リスト
- Learning Not to Optimize: Physics-Informed Action-Space Reshaping for Intent-Based Network Control [50.46501177871741]
LNOQRD は小物候補を75.9% で削減し、90.8% でニアオラクルのカバレッジを維持している。
実験の結果、LNOQRDは実用性と意図の満足度が最も高く、かつ、法律違反が最低で、世代後レイテンシが低いことがわかった。
論文 参考訳(メタデータ) (2026-08-02T00:27:01Z) - JailbreakOPT: Tool-Assisted Iterative Jailbreak Prompt Optimization [6.473799439592539]
JailbreakOPTは、反復的な単一ターンジェイルブレイク即時最適化を改善するためのツールアシストフレームワークである。
JailbreakOPTは、多様なアトミックジェイルブレイクプロンプトをアタックツールライブラリに整理し、エポソード内最適化を統一した抽象化を通じて構成する。
実験の結果、JailbreakOPTは攻撃成功率(ASR)を改善し、成功(No.A)まで攻撃回数をアトミック単一ターン攻撃と比較して減少させることがわかった。
論文 参考訳(メタデータ) (2026-06-09T20:22:29Z) - Aligning Data-Driven Predictors with Allocation: A Decision-Focused Approach to Survival Analysis [52.10284705210197]
機械学習予測器は、アロケーションに使用する場合、任意に貧弱な結果が得られることを示す。
正規化割引累積ゲイン(NDCG)の最適化に基づく意思決定型学習手法を提案する。
既存の生存モデルのNDCGを最適化するためのブートストラップ手法を提案する。
論文 参考訳(メタデータ) (2026-06-01T12:03:22Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - APAO: Adaptive Prefix-Aware Optimization for Generative Recommendation [26.371939617653084]
生成レコメンデーションは自動回帰生成プロセスであり、ユーザインタラクション履歴に基づいて、次の項目の離散トークンを予測する。
既存の生成レコメンデーションモデルは、通常、クロスエントロピー損失のようなトークンレベルの可能性目標で訓練される。
標準的なトレーニングでは、推論中にビームサーチが低確率の分岐を産み出すという事実を無視して、地道の歴史が常に利用可能であると仮定している。
論文 参考訳(メタデータ) (2026-03-03T08:29:15Z) - Optimized Distortion in Linear Social Choice [28.227695590829086]
決定的およびランダムな投票規則に対する線形社会的選択の歪みについて検討する。
候補と票の集合による歪みを最小化する多時間インスタンス最適化アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-10-22T20:42:49Z) - A Principled Approach to Randomized Selection under Uncertainty: Applications to Peer Review and Grant Funding [61.86327960322782]
本稿では,各項目の品質の間隔推定に基づくランダム化意思決定の枠組みを提案する。
最適化に基づく最適化手法であるMERITを導入する。
MERITが既存のアプローチで保証されていない望ましい公理特性を満たすことを証明している。
論文 参考訳(メタデータ) (2025-06-23T19:59:30Z) - Non-Elitist Selection Can Improve the Performance of Irace [0.8258451067861933]
本研究では,旅行セールスパーソン問題に対するアリコロニー最適化アルゴリズムのチューニング方法と2次代入問題について検討する。
実験結果から, テストベンチマークでは, iraceの既定選択よりも改善が見られた。
さらに, この結果から, アルゴリズムの動作を理解するため, 多様なアルゴリズム構成が得られることが示唆された。
論文 参考訳(メタデータ) (2022-03-17T10:34:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。