論文の概要: Refusal Lives Downstream of Persona in Chat Models
- arxiv url: http://arxiv.org/abs/2606.26161v1
- Date: Wed, 24 Jun 2026 04:25:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.016567
- Title: Refusal Lives Downstream of Persona in Chat Models
- Title(参考訳): チャットモデルでペルソナの下流に住む拒絶
- Abstract要約: アクティベーション空間における線形方向は、命令調整型チャットモデルにおける拒絶特性とペルソナ特性の両方について同定されている。
従順なペルソナゲートは拒否します。
Qwen2.5-7B-インストラクトとLlama-3.1-8B-インストラクトでは、一致したモデルペルソナ方向と拒絶方向を抽出し、両方に介入する。
- 参考スコア(独自算出の注目度): 1.6161758036820544
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Linear directions in activation space have been identified for both refusal and persona traits in instruction-tuned chat models, but the two have been studied as separate mechanisms. We show they interact: a compliant persona gates refusal. In Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct, we extract a compliant model-persona direction and a refusal direction and intervene on both. Compliant persona steering suppresses refusal -- in Llama, the refusal rate falls from 97% to 2%. Reintroducing the refusal direction partially restores refusal at late layers but not at early ones. Projecting out the persona direction in a late-layer window restores it to baseline; projecting out a random direction does not. Refusal is therefore gated at the late-layer expression stage, downstream of where it is computed. Treating refusal as a single isolated direction misses its dependence on persona.
- Abstract(参考訳): アクティベーション空間における線形方向は、命令調整型チャットモデルにおける拒絶特性とペルソナ特性の両方について同定されているが、これら2つのメカニズムは別々に研究されている。
従順なペルソナゲートは拒否します。
Qwen2.5-7B-インストラクトとLlama-3.1-8B-インストラクトでは、一致したモデルペルソナ方向と拒絶方向を抽出し、両方に介入する。
一貫性のあるペルソナのステアリングは拒絶を抑制するが、ラマでは拒絶率は97%から2%に低下する。
拒絶方向の再導入は、後期層での拒絶を部分的に復元するが、初期層ではない。
後層のウィンドウにペルソナ方向を投影すると、それをベースラインに復元する。
したがって、Refusalは、計算された下流の遅延層式ステージでゲートされる。
拒絶を単一の孤立した方向として扱うことは、ペルソナへの依存を欠く。
関連論文リスト
- Refusal geometry reflects refusal training: diverse refusal prefixes can raise stable rank and weaken refusal vector ablation attacks [1.0152838128195467]
フェールトレーニングは、トレーニングモデルによってAIモデルをジェイルブレイクから保護し、安全でないクエリを減らし、誤用のリスクを低減する。
近年の研究では、アライメント言語モデルにおける拒絶行動は、単一のアクティベーション方向または有害なプロンプト間で共有される低次元の拒絶部分空間によって媒介されることが判明している。
しかし、なぜ広範囲のモデルで安全クリティカルな特徴が集中した低次元構造に現れるのかは、いまだ不明である。
論文 参考訳(メタデータ) (2026-08-26T05:35:54Z) - Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration [24.010665397925333]
言語モデルがプロンプトに答えることを拒否した場合、正しい答えが内部表現から削除されるか、単に出力層で抑圧されるかは不明確である。
この機構を制御された無条件設定を用いて検討し, 双方向アクティベーションパッチのための完全一致の解答と拒否軌道を導出する。
論文 参考訳(メタデータ) (2026-08-16T14:47:33Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Latent-space Attacks for Refusal Evasion in Language Models [14.290157825353846]
我々は,リフレクションをリフレクションから分離するよう訓練された線形プローブに対する遅延空間回避攻撃として再放送した。
我々は15の命令調整、マルチモーダル、推論モデルに対して、最先端の攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-05-20T20:10:27Z) - There Is More to Refusal in Large Language Models than a Single Direction [10.766705737230781]
大規模言語モデルの拒絶は,単一のアクティベーション空間方向によって媒介されることを示す。
拒絶行動と非コンプライアンスの11のカテゴリにおいて、これらの拒絶行動は活性化空間における幾何学的に異なる方向に対応することが分かる。
論文 参考訳(メタデータ) (2026-02-02T14:15:44Z) - An Embarrassingly Simple Defense Against LLM Abliteration Attacks [47.347413305965006]
失語症と呼ばれる最近の攻撃は、拒否行動に最も責任がある唯一の潜伏方向を特定し、抑制する。
本稿では、モデルが拒否を表現する方法を根本的に変える防衛法を提案する。
微調整のLlama-2-7B-ChatとQwen2.5-Instructは、消音下で高い断熱率を維持するモデルを生成する。
論文 参考訳(メタデータ) (2025-05-25T09:18:24Z) - The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence [57.57786477441956]
以前の研究は、モデルのアクティベーション空間における1つの拒絶方向が、LCMが要求を拒否するかどうかを決定することを示唆している。
本稿では,表現工学における勾配に基づく新しい手法を提案し,それを用いて拒絶方向を同定する。
LLMの拒絶機構は複雑な空間構造によって制御され、機能的に独立な方向を識別する。
論文 参考訳(メタデータ) (2025-02-24T18:52:59Z) - Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models [68.15108215197279]
安全で信頼性の高い言語モデルを構築する上で重要な要素は、モデルが特定の質問に答えることを適切に拒否することである。
本稿では,学習中のモデルの応答に先立って,各拒絶カテゴリに対する1つのそのようなトークン,あるいは1つの拒絶トークンを提案する。
論文 参考訳(メタデータ) (2024-12-09T18:40:44Z) - Steering Without Side Effects: Improving Post-Deployment Control of Language Models [61.99293520621248]
言語モデル(LM)は、デプロイ後予期せず振る舞うことが示されている。
KL-then-steer (KTS) は, その利点を保ちながら, 操舵の副作用を低減する技術である。
本手法はLlama-2-chat-7Bモデルと比較して44%のジェイルブレイク攻撃を防ぐ。
論文 参考訳(メタデータ) (2024-06-21T01:37:39Z) - Refusal in Language Models Is Mediated by a Single Direction [4.532520427311685]
リファリングは1次元のサブスペースによって媒介され、最大72Bのパラメータを持つ13の人気のオープンソースチャットモデルにまたがる。
そこで本研究では,他の機能に最小限の影響を伴って拒絶を手術的に無効にする,新しいホワイトボックス・ジェイルブレイク法を提案する。
論文 参考訳(メタデータ) (2024-06-17T16:36:12Z) - Do Generative Models Know Disentanglement? Contrastive Learning is All
You Need [59.033559925639075]
本論文では,変数空間におけるコントラスト(DisCo)による非監視的,モデル非依存的手法を提案する。
DisCoは、GAN、VAE、およびフローを含む、事前訓練された非解離生成モデルに与えられた最先端の解離を達成します。
論文 参考訳(メタデータ) (2021-02-21T08:01:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。