論文の概要: Red-TTT: Test-Time Training for Automated Jailbreaking Large Language Models
- arxiv url: http://arxiv.org/abs/2610.05282v1
- Date: Sun, 04 Oct 2026 15:03:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 22:02:21.9877
- Title: Red-TTT: Test-Time Training for Automated Jailbreaking Large Language Models
- Title(参考訳): Red-TTT:大規模言語モデルの自動ジェイルブレークのためのテスト時間トレーニング
- Abstract要約: 自動化されたレッドチーム化は、大規模な言語モデルでジェイルブレイクを見つける標準的な方法です。
Red-TTTは、各動作に対する攻撃中に攻撃者のパラメータを更新する。
各ラウンドで、攻撃者は候補者のグループをサンプリングし、被害者の回答に対してそれらをスコアし、次のグループを描く前に政策段階のステップを取る。
- 参考スコア(独自算出の注目度): 90.48884120934277
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large language models remain vulnerable to jailbreaks, and automated red teaming is the standard way to find jailbreaks in large language models at scale. Current methods either draw more samples at test time through search, rewriting, and tree expansion, or train a stronger attacker offline with reinforcement learning. Both share a limitation: once an attack on a specific target behavior begins, the attacker's weights are frozen. Any signal it gathers about the behavior stays in its context window and is discarded afterward. The attacker never adapts its proposal distribution mid-attack, so success depends almost entirely on the sampling budget, and under a budget affordable at scale, many behaviors remain unbroken. We propose Red-TTT, which updates the attacker's parameters during the attack on each behavior. At each round, the attacker samples a group of candidates, scores them against the victim's replies, and takes a policy-gradient step before drawing the next group, so what it discovers about the current victim is consolidated into weights rather than accumulated as context. We also adapt the training objective to red teaming, where success is judged by the single best sample rather than the average. Red-TTT requires only sampling access to the victim and integrates into existing attack pipelines with no other changes. Against the Best-of-N baseline, Red-TTT raises attack success rate from 55.9\% to 72.4\% on average at a budget of 120 samples, improving over the baseline in every configuration and cracking many behaviors previous method cannot. The code is available at https://github.com/SaFo-Lab/Red-TTT
- Abstract(参考訳): 大きな言語モデルはジェイルブレイクに弱いままであり、大規模な言語モデルでジェイルブレイクを見つけるのに、自動化されたレッドチーム化が標準的な方法である。
現在のメソッドは、検索、書き換え、ツリー拡張を通じてテスト時により多くのサンプルを描画するか、強化学習によってより強力な攻撃者をオフラインにトレーニングする。
どちらも制限を共有している: ある特定の標的行動に対する攻撃が開始されると、攻撃者の重みは凍結される。
行動について収集した信号は、そのコンテキストウィンドウに留まり、その後破棄される。
攻撃者は攻撃の途中で提案された分布に適応しないので、成功はサンプリング予算にほぼ依存し、大規模で手頃な予算の下では、多くの行動は未解決のままである。
そこで我々は,攻撃時の攻撃パラメータを更新するRed-TTTを提案する。
各ラウンドで、攻撃者は候補者のグループをサンプリングし、被害者の回答に対してスコアを付け、次のグループを描く前に政策段階のステップを取る。
また、トレーニングの目標をレッドチーム化に適応させ、成功は平均よりも単一のベストサンプルによって判断されます。
Red-TTTは、被害者へのアクセスをサンプリングするだけで、他の変更なしに既存のアタックパイプラインに統合できる。
Best-of-Nベースラインに対して、Red-TTTは平均55.9\%から72.4\%までの攻撃成功率を120の予算で引き上げ、すべての構成におけるベースラインを改良し、以前の方法ではできない多くの動作を破る。
コードはhttps://github.com/SaFo-Lab/Red-TTTで入手できる。
関連論文リスト
- Boundary Point Jailbreaking of Black-Box LLMs [22.806138486774202]
我々は,新しい自動ジェイルブレイク攻撃のクラスである境界点ジェイルブレイク(BPJ)を紹介した。
BPJは完全にブラックボックスで、クエリ毎にたった1ビットの情報のみを使用する。
BPJは、憲法違反に対する普遍的ジェイルブレイクの開発に成功した最初の完全自動攻撃アルゴリズムであると考えています。
論文 参考訳(メタデータ) (2026-02-16T18:29:09Z) - SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks [53.97948802255959]
本稿では,既存の戦略や外部データに頼ることなく,マルチターン攻撃者を訓練するフレームワークを提案する。
準備された自己調整は、非拒否的で、よく構造化された、多ターンの逆のプロンプトを微調整することで、使用可能なロールアウトを可能にする。
私たちは、意図の整合性、コンプライアンスリスク、詳細レベルを組み合わせたインテントドリフト対応の報酬を通じて、多ターンジェイルブレイクにおける有害な意図を保ちます。
論文 参考訳(メタデータ) (2026-02-06T16:44:57Z) - An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks [87.64278063236847]
本研究では,ジェイルブレイク攻撃の原理的比較のための統一的脅威モデルを提案する。
私たちの脅威モデルは、あるジェイルブレイクがテキストの配布で起こりそうなかどうかをチェックします。
私たちはこの脅威モデルに人気のある攻撃を適応させ、これらの攻撃を同等の足場でベンチマークしました。
論文 参考訳(メタデータ) (2024-10-21T17:27:01Z) - RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking [28.95203269961824]
我々は,害の防止という目的の下に悪意のある意図を隠蔽し,マルチターンシナリオを構築する新しいジェイルブレイク手法RED QUEEN ATTACKを提案する。
我々の実験によると、全てのLLMはRED QUEEN ATTACKに対して脆弱であり、GPT-4oで87.62%、Llama3-70Bで75.4%に達する。
安全を優先するために, RED QUEEN GUARDと呼ばれる簡単な緩和戦略を導入する。
論文 参考訳(メタデータ) (2024-09-26T01:24:17Z) - Weak-to-Strong Jailbreaking on Large Language Models [92.52448762164926]
大規模言語モデル(LLM)は、ジェイルブレイク攻撃に対して脆弱である。
既存のジェイルブレイク法は計算コストがかかる。
我々は、弱々しく強固な脱獄攻撃を提案する。
論文 参考訳(メタデータ) (2024-01-30T18:48:37Z) - One-bit Flip is All You Need: When Bit-flip Attack Meets Model Training [54.622474306336635]
メモリフォールトインジェクション技術を利用したビットフリップ攻撃(BFA)と呼ばれる新たな重み修正攻撃が提案された。
本稿では,高リスクモデルを構築するための訓練段階に敵が関与する,訓練支援ビットフリップ攻撃を提案する。
論文 参考訳(メタデータ) (2023-08-12T09:34:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。