論文の概要: When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning
- arxiv url: http://arxiv.org/abs/2609.01455v1
- Date: Tue, 01 Sep 2026 15:59:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.828739
- Title: When Safety Routing Breaks: Understanding Alignment Fragility under Benign Fine-Tuning
- Title(参考訳): 安全ルーティングが破られるとき - 良質な微調整下でのアライメント脆弱性の理解
- Authors: Yitong Guo, Xiaoyi Chen, Siyuan Zhang, Xiaofeng Wang, Haixu Tang,
- Abstract要約: 我々は安全フィッシャーが低ランクであることを示し、アライメントは出力経路を保ちながら安全幾何学をよりフラットにする。
LoRAとASAMは出力側シャープネスを抑えることで早期崩壊を緩和するが、その保護はより大きな微調整スケールで弱まる。
全体として、安全故障は低ランク出力ルーティング機構の破壊であると理解されている。
- 参考スコア(独自算出の注目度): 19.41242962849505
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Benign fine-tuning severely weakens the safety alignment of large language models (LLMs), so we study why refusal behavior is so fragile. While prior work often attributes this failure to gradient conflict, we propose a fundamentally different Fisher-geometric explanation: safety Fisher is low-rank, and alignment makes the safety geometry flatter while preserving an output-routing pathway. After 100 benign fine-tuning examples, this pathway is selectively re-sharpened in output-side MLP modules, explaining the asymmetric fragility: safety can collapse to high attack success rates, while general utility degrades mildly. The routing view also explains why few safety examples can restore refusal behavior, indicating that internal safety-relevant representations are preserved. Finally, we show that LoRA and ASAM mitigate early collapse by suppressing output-side sharpness, but their protection weakens at larger fine-tuning scales. Overall, safety failure is best understood as a disruption of a low-rank output-routing mechanism
- Abstract(参考訳): 良質な微調整は大きな言語モデル(LLM)の安全性のアライメントを著しく弱めるため、リファインダーの動作が脆弱な理由について検討する。
従来の研究はしばしば、勾配の衝突によるこの失敗を、基本的に異なるフィッシャー幾何学的説明として、安全フィッシャーは低ランクであり、アライメントは、出力ルーティング経路を保ちながら、安全幾何学をよりフラットにする。
100個の良質な微調整の例の後、この経路は出力側のMLPモジュールで選択的に再調整され、非対称な不安定さを説明できる:安全性は高い攻撃成功率に崩壊し、一般用途は軽度に劣化する。
ルーティングビューでは、リフレクションの動作を復元できる安全例がほとんどない理由も説明されており、内部の安全関連表現が保存されていることを示している。
最後に,LoRAとASAMは出力側シャープネスを抑えることで早期崩壊を緩和するが,その保護はより微細な調整スケールで弱まることを示す。
全体として、安全故障は低ランク出力ルーティング機構の破壊として最もよく理解される
関連論文リスト
- When Autoregressive Consistency Hurts Safety Alignment [20.12397699480725]
自動回帰一貫性は、初期トークンのアライメント更新に集中できることを示す。
同じメカニズムは、大規模言語モデルに対するより広範な攻撃のクラスを予測する。
最悪の有害な継続状態に基づく初期枠組みである敵の安全アライメントを提案する。
論文 参考訳(メタデータ) (2026-06-02T19:32:23Z) - THINKSAFE: Self-Generated Safety Alignment for Reasoning Models [60.10077024249373]
外部の教師がいなくても安心して安心できるフレームワークであるThinkSafeを提案する。
我々の重要な洞察は、コンプライアンスは安全メカニズムを抑制するが、モデルはしばしば害を特定するために潜伏した知識を保持することである。
DeepSeek-R1-DistillとQwen3の実験では、ThinkSafeは推論能力を維持しながら安全性を大幅に向上している。
論文 参考訳(メタデータ) (2026-01-30T16:31:02Z) - Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance [20.0828672005664]
安全アライメントは, 単一の安全事例のみで完全に回復可能であることを示す。
安全勾配の低ランク構造を明らかにし,なぜこのような効率的な補正が可能かを説明する。
論文 参考訳(メタデータ) (2026-01-05T08:26:34Z) - Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning? [68.82210578851442]
メカニスティックな解釈可能性レンズによる推論モデルにおいて、なぜ安全アライメントが失敗するのかを考察する。
トークン位置における拒絶意図の追跡のための線形探索手法を用いて,textbfrefusal cliff と呼ばれる現象を発見した。
提案手法は,最大断崖を示す訓練例を識別し,推論モデルの安全性を向上する手法であるtextbfCliff-as-a-Judge を提案する。
論文 参考訳(メタデータ) (2025-10-07T15:32:59Z) - Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection [47.347413305965006]
大規模言語モデル(LLM)における安全性の整合性は、しばしば有害な要求を拒否するために内部表現を仲介する。
近年の研究では、これらの安全メカニズムは特定の表現方向を非難したり削除したりすることで回避可能であることが示されている。
そこで本研究では,リファレンシャル・メディア・サブスペースへのアクティベーションを永久に操り,モデルの安全アライメントを向上する手法であるランクワン・セーフティ・インジェクション(ROSI)を提案する。
論文 参考訳(メタデータ) (2025-08-28T13:22:33Z) - Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets [64.96967819446553]
本稿では,上流アライメントデータセットと下流微調整タスクの表現類似性のレンズによる安全ガードレールの劣化について検討する。
これらのデータセット間の高い類似性は、安全ガードレールを著しく弱め、モデルがジェイルブレイクの影響を受けやすくする。
これら2種類のデータセット間の類似性が低いと、より堅牢なモデルが得られ、有害度スコアが最大10.33%減少する。
論文 参考訳(メタデータ) (2025-06-05T17:59:55Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。