論文の概要: Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning
- arxiv url: http://arxiv.org/abs/2608.11705v1
- Date: Wed, 12 Aug 2026 06:33:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.482169
- Title: Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning
- Title(参考訳): LLMの安全性をより客観的に - トレート不変の安全性チューニングによるLLMの安全性行動の安定化
- Authors: Lang Cao,
- Abstract要約: 適応型大言語モデル(LLM)は,ユーザ要求の内容に基づいて安全行動を示すことが期待されている。
システムプロンプトに割り当てられた異なる特性の下で、同じ要求が実質的に異なる安全性決定を導出できることを示す。
- 参考スコア(独自算出の注目度): 2.481804875781114
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Aligned large language models (LLMs) are expected to exhibit safety behavior based on the content of the user request: they should refuse unsafe requests and comply with safe ones. However, we show that the same request can elicit substantially different safety decisions under different traits assigned in the system prompt, a failure mode we call trait-induced safety variation. To measure this failure, we introduce refusal-based metrics: Trait-Induced Deviation measures dataset-level deviation from the no-trait baseline, while Trait-Induced Flip Rate measures whether the same request receives different safety decisions across traits. We then provide a representation-level analysis of the mechanism behind trait-induced safety shifts and find that traits perturb the model's safety representations within a low-dimensional subspace. To achieve trait-invariant safety, where safety behavior remains stable across traits, we introduce Trait-Invariant Safety Tuning (TIST), a simple yet effective self-distillation framework that aligns an LLM's trait-conditioned behavior with its no-trait behavior. Guided by our analysis, we further propose Trait-Subspace Neutralization (TraSN), an instantiation of TIST, which enforces invariance only within the identified trait subspace. Experiments show that TraSN improves trait-invariant safety and strengthens harmful-request safety while preserving general capability. Our results highlight traits as an important factor in LLM safety and robust model behavior.
- Abstract(参考訳): 統一された大言語モデル(LLM)は、ユーザ要求の内容に基づいて安全行動を示すことが期待されている。
しかし, システムプロンプトに割り当てられた異なる特性, 特性誘導型安全性変動と呼ばれる障害モードにおいて, 同じ要求が実質的に異なる安全性決定を導出できることが示される。
Trait-induced Deviationは、no-traitベースラインからのデータセットレベルの逸脱を計測し、Trit-induced Flip Rateは、同じ要求が特性間で異なる安全性決定を受けるかどうかを測定します。
次に、特性誘導型安全性シフトの背後にあるメカニズムの表現レベル解析を行い、その特性が低次元部分空間内でモデルの安全性表現を乱すことを示す。
トレート不変安全チューニング(TIST)は, トレート不変安全チューニング(TIST)という, LLMのトレート条件の挙動と非トレート動作とを整合させる, 単純かつ効果的な自己蒸留フレームワークである。
我々はさらに,TISTのインスタンス化であるTrit-Subspace Neutralization (TraSN)を提案する。
実験の結果,TraSNは特性不変の安全性を向上し,汎用性を維持しつつ有害な要求安全を強化していることがわかった。
LLMの安全性と頑健なモデル行動において,特徴が重要な要素であることを示す。
関連論文リスト
- Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation [52.122731171289665]
クロスモデル安全ステアリングのための最初のフレームワークを紹介する。
私たちのパイプラインは、ターゲット側の安全でないデータにアクセスしません。
多様なソース・ターゲット・モデル・ペア間のテキスト・ツー・イメージとテキスト・ツー・ビデオ生成におけるアプローチを評価する。
論文 参考訳(メタデータ) (2026-06-03T18:00:04Z) - Rethinking Safety in LLM Fine-tuning: An Optimization Perspective [56.31306558218838]
我々は、本質的にトレードオフではなく、最適化の貧弱な選択が、しばしば安全上の問題を引き起こすことを示し、敵のプロンプトに対する有害な応答として測定する。
安全性能を保ったパラメータ空間における簡易指数移動平均(EMA)運動量法を提案する。
複数のデータセットにまたがるLlamaファミリーに関する実験は、安全性の問題が特別な介入なしに回避できることを実証している。
論文 参考訳(メタデータ) (2025-08-17T23:46:36Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z) - Safety Layers in Aligned Large Language Models: The Key to LLM Security [43.805905164456846]
整列 LLM の内部パラメータは、微調整攻撃を受けた場合のセキュリティ劣化に対して脆弱である。
我々の研究は、パラメータレベルでのLLMの整列化におけるセキュリティのメカニズムを明らかにし、モデルの中央に小さな連続した層を識別する。
そこで本稿では, 安全部分調整(SPPFT)方式を提案する。
論文 参考訳(メタデータ) (2024-08-30T04:35:59Z) - SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering [56.92068213969036]
悪意のある命令から脅威を守るために、LLM(Large Language Models)には安全アライメントが不可欠である。
近年の研究では、過大な安全性の問題により、安全性に配慮したLCMは、良質な問い合わせを拒否する傾向にあることが明らかになっている。
過大な安全性の懸念を和らげるために,SCANS法を提案する。
論文 参考訳(メタデータ) (2024-08-21T10:01:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。