論文の概要: Efficient Safety Alignment of Language Models via Latent Personality Traits
- arxiv url: http://arxiv.org/abs/2607.07918v1
- Date: Wed, 08 Jul 2026 21:03:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.342971
- Title: Efficient Safety Alignment of Language Models via Latent Personality Traits
- Title(参考訳): 潜在パーソナリティトラクトによる言語モデルの効率的な安全アライメント
- Abstract要約: 本研究は,66件の無害文に対する対人訓練による明示的調和拒否を代替するLatent Personality Alignment(LPA)を導入する。
LPAは、直接の要求と5つのジェイルブレイクメソッドで、HarmBenchでほぼゼロの攻撃成功率を達成する。
全プロシージャは1つのGPUで数分で完了し、標準のLATよりも75倍少ないサンプルを使用する。
- 参考スコア(独自算出の注目度): 3.72609623254254
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current safety methods for large language models are known to be vulnerable to adversarial attacks, motivating research into robust alternatives. Latent Adversarial Training (LAT) is among the most effective defenses, but can degrade utility and requires training on large datasets of harmful prompts. We introduce Latent Personality Alignment (LPA), which replaces explicit harm refusal with adversarial training on just 66 harm-agnostic statements drawn from psychometric personality literature. We hypothesize that personality-anchored representations share latent structure with harm avoidance, so adversarially stabilizing them implicitly constrains the subspace exploited by jailbreak attacks. LPA achieves near-zero attack success rates on HarmBench across direct requests and five jailbreak methods, despite never seeing harmful content during training and no loss of performance on standard benchmarks. Moreover, the training process is lightweight; the entire procedure completes in minutes on a single GPU and uses 75x fewer examples than standard LAT. Extensive ablations demonstrate the robustness, efficiency, and generalization of our method.
- Abstract(参考訳): 大規模言語モデルの現在の安全性手法は、敵の攻撃に弱いことが知られており、堅牢な代替手段の研究を動機付けている。
Latent Adversarial Training (LAT) は最も効果的な防御手段であるが、実用性は低下し、有害なプロンプトの大規模なデータセットの訓練を必要とする。
心理学的パーソナリティ文献から抽出した66件のハーモナミズム・アライメント(LPA)を相手に,明示的なハーモナリティー・アライメント(LPA)を導入する。
パーソナライズされた表現は、危害を避けるために潜伏構造を共有すると仮定するので、敵対的にそれらを安定化することは、ジェイルブレイク攻撃によって悪用されるサブスペースを暗黙的に制限する。
LPAは、トレーニング中に有害なコンテンツを見たことがなく、標準ベンチマークのパフォーマンスが失われることもないにもかかわらず、HarmBenchのダイレクトリクエストと5つのジェイルブレイクメソッドでほぼゼロの攻撃成功率を達成した。
さらに、トレーニングプロセスは軽量で、プロシージャ全体が1つのGPU上で数分で完了し、標準のLATよりも75倍少ないサンプルを使用する。
本手法の強靭性, 効率, 一般化を広範囲に示す。
関連論文リスト
- Boundary-targeted Membership Inference Attacks on Safety Classifiers [70.20833439671131]
安全分類器は、セルフハームとメンタルヘルスの議論を含むセンシティブなデータセットに基づいて訓練される。
低信頼例を識別する新たな境界目標選択戦略を導入する。
実験により、相手は会話の19%を安全分類器が5%の偽陽性率でユーザーの苦痛を示すようにフラグ付けして回復できることが示された。
これは最先端のMIAメソッドだけで攻撃するより3.5ドル高い。
論文 参考訳(メタデータ) (2026-05-21T12:05:22Z) - Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms [3.121353276954014]
ラテント・パーソナリティ・アライメント(Latent Personality Alignment, LPA)は、特定の有害な行動ではなく、抽象的パーソナリティ特性のモデルを訓練することによって堅牢性を達成する、サンプル効率のよい防御法である。
LPAは、100未満の特性ステートメントと潜在敵のトレーニングを使用して、150k以上の例でトレーニングされたメソッドに対して、同等の攻撃成功率を達成する。
以上の結果から,人格に基づくアライメントは,最小限のコストでロバスト・ディフェンスを構築するための原則的アプローチを提供することが示された。
論文 参考訳(メタデータ) (2026-05-08T21:21:59Z) - A Simple and Efficient Jailbreak Method Exploiting LLMs' Helpfulness [32.47621091096285]
安全性アライメントは、LLM(Large Language Models)が有害なクエリに応答することを防ぐことを目的としている。
本稿では,命令的有害な要求を学習スタイルの質問に変換する新しいジェイルブレイク手法であるHILLを紹介する。
幅広いモデルにわたるAdvBenchデータセットの実験は、HILLの強い有効性、一般化可能性、有害性を示している。
論文 参考訳(メタデータ) (2025-09-17T04:21:20Z) - Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models [0.0]
カモフラージュされたジェイルブレイクは 明らかに良心的な言語の中に 悪意のある意図を埋め込んで 既存の安全メカニズムを回避している
本稿では, 従来のキーワードベース検出手法の誤り特性と限界に着目し, カモフラージュされたジェイルブレイクプロンプトの構築と影響について検討する。
論文 参考訳(メタデータ) (2025-09-05T19:57:38Z) - Improving LLM Safety Alignment with Dual-Objective Optimization [81.98466438000086]
大規模言語モデル(LLM)の既存のトレーニング時間安全アライメント技術は、ジェイルブレイク攻撃に対して脆弱なままである。
本研究では,DPOの目的を2つの構成要素にまとめる安全アライメントの改善について提案する。(1) 安全でない世代が部分的に発生しても拒否を促す頑健な拒絶訓練,(2) 有害な知識の未学習。
論文 参考訳(メタデータ) (2025-03-05T18:01:05Z) - Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks [23.793583584784685]
大規模言語モデル(LLM)は、システム脆弱性を利用して安全対策を回避し、有害または不適切な出力を誘発するジェイルブレイク攻撃の影響を受ける。
LATPC(Latent-space Adrial Training with Post-aware framework)を紹介する。
LATPCは有害な入力と良性入力を対比することにより安全性に重要な潜伏次元を同定し、ターゲットの拒絶特徴除去攻撃を適応的に構築する。
論文 参考訳(メタデータ) (2025-01-18T02:57:12Z) - Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense [55.77152277982117]
私たちは、jailbreak攻撃から防御するために設計された方法であるLayer-AdvPatcherを紹介します。
私たちは、自己拡張データセットを通じて、大規模言語モデル内の特定のレイヤにパッチを適用するために、未学習の戦略を使用します。
我々の枠組みは、脱獄攻撃の有害性と攻撃の成功率を減らす。
論文 参考訳(メタデータ) (2025-01-05T19:06:03Z) - Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models [55.253208152184065]
大規模言語モデル(LLM)におけるジェイルブレークは、LLMを騙して有害なテキストを生成するというセキュリティ上の問題である。
我々は7つの異なるジェイルブレイク法を詳細に分析し、不一致が不十分な観察サンプルから生じることを確認した。
安全境界内でのアクティベーションを適応的に制限する「textbfActivation Boundary Defense (ABD)」という新しい防衛法を提案する。
論文 参考訳(メタデータ) (2024-12-22T14:18:39Z) - LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds [98.20826635707341]
ジェイルブレイク攻撃は、慎重に製作されたプロンプトを通じて有害なアウトプットを引き出すことによって、安全に整合したLDMの脆弱性を露呈する。
私たちはジェイルブレイクを推論時のミスアライメントとして捉え、高速でブラックボックスのベスト・オブ・N$サンプリングアタックであるLIARを導入しました。
また、安全アライメント強度を定量化し、最適下界を導出するための理論的「ジェイルブレイクに対する安全ネット」指標も導入する。
論文 参考訳(メタデータ) (2024-12-06T18:02:59Z) - Efficient Adversarial Training in LLMs with Continuous Attacks [99.5882845458567]
大規模言語モデル(LLM)は、安全ガードレールをバイパスできる敵攻撃に対して脆弱である。
本稿では,2つの損失からなる高速対向訓練アルゴリズム(C-AdvUL)を提案する。
C-AdvIPOは、対向的に堅牢なアライメントのためのユーティリティデータを必要としない、対向型のIPOである。
論文 参考訳(メタデータ) (2024-05-24T14:20:09Z) - Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks
with Self-Refinement [2.854482269849925]
言語モデル(LM)は、敵の誤用に対する悪用に対して脆弱である。
安全でないLMであっても、優れた安全性を実現するフォーマッティングによる自己再定義を提案する。
また、安全性に配慮しないLMは、より便利で安全な応答を提供することで、安全に配慮したLMよりも優れていることも見てきた。
論文 参考訳(メタデータ) (2024-02-23T08:22:24Z) - Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization [98.18718484152595]
本研究は,学習段階と推論段階の両方において,目標の優先順位付けを統合することで,支援と安全性の確保という目標との本質的な対立に対処することを提案する。
我々の研究は、脱獄攻撃と防衛の理解に寄与し、LLMの能力と安全性の関係に光を当てている。
論文 参考訳(メタデータ) (2023-11-15T16:42:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。