論文の概要: Target-free Latent Safety Alignment
- arxiv url: http://arxiv.org/abs/2610.04467v1
- Date: Sat, 03 Oct 2026 12:13:23 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:43:10.534851
- Title: Target-free Latent Safety Alignment
- Title(参考訳): 無目標潜時安全アライメント
- Abstract要約: 大規模言語モデル(LLM)は、ジェイルブレイク攻撃に対して非常に脆弱である。
本研究では,非教師的手法で対向的なサンプルを生成する,標的のない対向訓練フレームワークを提案する。
- 参考スコア(独自算出の注目度): 26.33319537947663
- License:
- Abstract: Large language models (LLMs) remain highly vulnerable to jailbreak attacks that induce harmful behaviors and circumvent safety alignment. To defend against such attacks, adversarial training paradigms have been proposed to first simulate failure modes and then train the model to correct them, yielding promising improvements in safety alignment. However, these methods typically construct adversarial samples either by encouraging fixed harmful target completions or by performing targeted activation ablation derived from fixed benign--harmful data pairs. As a result, the generated adversarial samples tend to induce homogeneous harmful behaviors that poorly reflect the diversity of behaviors elicited by real-world jailbreak attacks. This behavior-level narrowness fundamentally limits their robustness. To address this issue, we propose a target-free adversarial training framework that generates adversarial samples in an unsupervised manner. By amplifying and diversifying behavior-level shifts in the model's latent space, our approach produces semantically diverse adversarial samples that induce a wide range of harmful behaviors. This expanded behavioral coverage exposes more diverse failure modes and thereby improves safety alignment. To quantify this effect, we use semantic entropy as an output-level measure of adversarial behavioral diversity. Empirically, our method elicits diverse harmful behaviors in the target model, substantially mitigating behavioral narrowness and improving robustness to jailbreak attacks.
- Abstract(参考訳): 大規模言語モデル(LLM)は、有害な振る舞いを誘発し、安全アライメントを回避するジェイルブレイク攻撃に対して脆弱なままである。
このような攻撃に対する防御策として、まず障害モードをシミュレートし、モデルの修正を訓練し、安全アライメントの有望な改善をもたらすために、敵の訓練パラダイムが提案されている。
しかし、これらの手法は、通常、固定された有害な目標完了を奨励するか、または固定された良性データペアから誘導される標的活性化アブレーションを実行することによって、敵のサンプルを構築する。
その結果、生成した敵のサンプルは、現実世界の脱獄攻撃によって引き起こされる行動の多様性を十分に反映していない均一な有害な行動を引き起こす傾向にある。
この行動レベルの狭さは、基本的にその頑健さを制限します。
この問題に対処するために、教師なしの方法で敵のサンプルを生成する標的のない敵訓練フレームワークを提案する。
モデルの潜在空間における行動レベルシフトを増幅し、多様化させることにより、我々のアプローチは、幅広い有害な行動を引き起こす意味論的に多様な敵のサンプルを生成する。
この拡張された行動カバレッジにより、より多様な障害モードが公開され、それによって安全性が向上する。
この効果を定量化するために、我々は、敵の行動多様性の出力レベル尺度として意味エントロピーを用いる。
実験的に,本手法は標的モデルに多様な有害な行動をもたらし,行動の狭さを著しく軽減し,脱獄攻撃に対する堅牢性を向上する。
関連論文リスト
- When Behavioral Safety Evaluation Fails: A Representation-Level Perspective [23.598318016787147]
大規模言語モデル(LLM)の安全性は、しばしば行動レベルで評価され、内部の堅牢性の限られた証拠を提供する。
我々は,この相違を監査ギャップとして定式化し,介入時の行動安全と頑健さの相違を考察した。
パラメータと潜伏空間のソフトな介入を通してモデルロバスト性をテストするための介入に基づく評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-06T08:10:56Z) - Scaling Patterns in Adversarial Alignment: Evidence from Multi-LLM Jailbreak Experiments [4.547649832854566]
大規模言語モデル(LLM)は、マルチエージェントと安全クリティカルな設定でますます運用され、モデルが逆向きに相互作用する際の脆弱性のスケールに関するオープンな疑問が提起される。
本研究は,アライメント保護にもかかわらず有害な拘束行動を引き起こす,より大規模なモデルで,より小さなモデルを体系的に緩和できるかどうかを検討する。
論文 参考訳(メタデータ) (2025-11-16T15:16:33Z) - NegBLEURT Forest: Leveraging Inconsistencies for Detecting Jailbreak Attacks [8.416892421891761]
安全メカニズムをバイパスするために設計された脱獄攻撃は、倫理的ガイドラインに従っているにもかかわらず、LLMに有害または不適切なコンテンツを生成するよう促すことで深刻な脅威となる。
この研究は、成功と失敗の間のセマンティックな一貫性分析を導入し、否定を意識したスコアリングアプローチが意味のあるパターンをキャプチャすることを示した。
NegBLEURT Forestと呼ばれる新しい検出フレームワークが提案され、敵のプロンプトによって引き起こされる出力と期待される安全行動の間のアライメントの程度を評価する。
アイソレーションフォレストアルゴリズムを用いて異常応答を特定し、信頼性の高いジェイルブレイク検出を可能にする。
論文 参考訳(メタデータ) (2025-11-14T14:43:54Z) - Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions [50.40122190627256]
非倫理的反応を引き起こすために、対照的な推論を利用する新しいジェイルブレイク手法であるPOATEを導入する。
PoATEは意味論的に意図に反し、敵のテンプレートと統合し、有害なアウトプットを驚くほど微妙に操る。
これに対応するために、悪意のある意図と理性を検出するためにクエリを分解して、有害な応答を評価し、拒否するIntent-Aware CoTとReverse Thinking CoTを提案する。
論文 参考訳(メタデータ) (2025-01-03T15:40:03Z) - Distributional Adversarial Loss [15.258476329309044]
本研究では,分散対向損失と呼ばれる新たな対向損失の概念について検討する。
目標は、全体的な敵の損失を最小限にすることである。
対向的損失という概念に対して,PAC学習環境におけるサンプルの複雑性境界を示す。
論文 参考訳(メタデータ) (2024-06-05T17:03:47Z) - Improving Adversarial Robustness to Sensitivity and Invariance Attacks
with Deep Metric Learning [80.21709045433096]
対向ロバスト性の標準的な方法は、サンプルを最小に摂動させることによって作られたサンプルに対して防御する枠組みを仮定する。
距離学習を用いて、最適輸送問題として逆正則化をフレーム化する。
予備的な結果から, 変分摂動の規則化は, 変分防御と敏感防御の両方を改善することが示唆された。
論文 参考訳(メタデータ) (2022-11-04T13:54:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。