論文の概要: When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models
- arxiv url: http://arxiv.org/abs/2608.03201v1
- Date: Tue, 04 Aug 2026 06:43:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.06266
- Title: When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models
- Title(参考訳): 拒否が安全に見えるとき:安全ガードモデルにおける拒絶命令のショートカット
- Authors: Yu Feng, Chunting Zang, Chen Shen, Rui Miao, Ge Teng, Weidong Cai, Jieping Ye,
- Abstract要約: 安全ガードは有害なコンテンツをフィルターするために広く使用され、通常はラベル付きプロンプト-レスポンスペアの監督された微調整によって訓練される。
有害なプロンプトに対する反応のうち、拒絶表現は、ほとんど無害なラベルと共起していることがわかった。
拒絶のキューを有害な反応に挿入することは、警備員の判断を有害なものから有害なものへと覆す可能性がある。
- 参考スコア(独自算出の注目度): 42.46742964735819
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety guards are widely used to filter harmful content and are typically trained via supervised fine-tuning on labeled prompt-response pairs. We audit two widely used safety-guard training datasets, WildGuardMix and GR-Train, and find that among responses to harmful prompts, refusal expressions co-occur almost exclusively with unharmful labels. This imbalance motivates what we term the refusal-cue shortcut: inserting a refusal cue into a harmful response could flip the guard's verdict from harmful to unharmful. The shortcut affects not only guards trained on these datasets but also officially released models such as LlamaGuard3 and Qwen3Guard whose training data is undisclosed. It persists across response positions and is generally stronger in smaller variants within a family. To mitigate it, we adapt sparse complementary masking as a lightweight post-hoc intervention that identifies and suppresses a small set of shortcut-associated attention heads and MLP neurons without retraining. On two primary benchmarks, the intervention achieves an approximately 79% relative reduction in response-initial detection failures induced by refusal cues, while preserving standard detection performance. Although optimized using cues at a single response position, the suppression effect transfers to unseen positions and datasets, suggesting that shortcut manifestations across positions are partly mediated by shared internal components. Further analysis provides evidence that shortcut reliance and legitimate refusal recognition are partially functionally separable, as suppressing the shortcut broadly preserves the guard's ability to recognize genuine refusals.
- Abstract(参考訳): 安全ガードは有害なコンテンツをフィルターするために広く使用され、通常はラベル付きプロンプト-レスポンスペアの監督された微調整によって訓練される。
広範に使用されている安全ガードトレーニングデータセットであるWildGuardMixとGR-Trainを監査し、有害なプロンプトに対する応答の中で、表現の拒絶は、ほとんど害のないラベルと共起していることを発見した。
拒絶のキューを有害な反応に挿入することは、警備員の判断を有害なものから有害なものへと覆す可能性がある。
このショートカットは、これらのデータセットでトレーニングされたガードだけでなく、トレーニングデータが開示されていないLlamaGuard3やQwen3Guardといった公式リリースモデルにも影響する。
応答位置を越えて持続し、一般的に家族内のより小さな変種においてより強い。
そこで我々は,スパルス補体マスクを軽量なポストホック介入として適応させ,ショートカット関連アテンションヘッドとMLPニューロンの小さなセットを再トレーニングすることなく識別・抑制する。
2つの主要なベンチマークにおいて、この介入は、標準検出性能を保ちながら、拒絶キューによって引き起こされる応答初期検出障害の約79%の相対的な減少を達成する。
単一の応答位置でキューを使用して最適化されているが、抑制効果は見当たらない位置とデータセットに転送され、位置間のショートカットが部分的には内部コンポーネントの共有によって媒介されていることが示唆されている。
さらに分析は、ショートカットの信頼性と正当な拒絶認識が部分的に機能的に分離可能であることを示し、ショートカットの抑制はガードの真の拒絶を認識できる能力を広範囲に保持する。
関連論文リスト
- HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment [23.776344382492997]
本研究は,LLMのアライメントにより,残差ストリームにおける有害性と拒絶を,プロンプト側トークン位置における分離可能な方向としてエンコードしていることを示す。
本稿では,2方向をプロンプト位置と応答位置でペアリングする微調整手法であるHARCを紹介する。
論文 参考訳(メタデータ) (2026-07-01T07:58:16Z) - Boundary-targeted Membership Inference Attacks on Safety Classifiers [70.20833439671131]
安全分類器は、セルフハームとメンタルヘルスの議論を含むセンシティブなデータセットに基づいて訓練される。
低信頼例を識別する新たな境界目標選択戦略を導入する。
実験により、相手は会話の19%を安全分類器が5%の偽陽性率でユーザーの苦痛を示すようにフラグ付けして回復できることが示された。
これは最先端のMIAメソッドだけで攻撃するより3.5ドル高い。
論文 参考訳(メタデータ) (2026-05-21T12:05:22Z) - Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning? [68.82210578851442]
メカニスティックな解釈可能性レンズによる推論モデルにおいて、なぜ安全アライメントが失敗するのかを考察する。
トークン位置における拒絶意図の追跡のための線形探索手法を用いて,textbfrefusal cliff と呼ばれる現象を発見した。
提案手法は,最大断崖を示す訓練例を識別し,推論モデルの安全性を向上する手法であるtextbfCliff-as-a-Judge を提案する。
論文 参考訳(メタデータ) (2025-10-07T15:32:59Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack [22.48980625853356]
大規模言語モデル(LLM)は、単純な言語的変化によって回避できる脆い拒絶行動を示す。
本研究では、この特定の脆弱性を外科的に軽減する、洞察に富んだ機械的インフォームドフレームワークであるアクティベーション・スケーリングガード(ASGuard)を紹介する。
論文 参考訳(メタデータ) (2025-09-30T06:33:52Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。