論文の概要: From Parameter Dynamics to Risk Scoring : Quantifying Sample-Level Safety Degradation in LLM Fine-tuning
- arxiv url: http://arxiv.org/abs/2605.04572v1
- Date: Wed, 06 May 2026 07:17:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.696437
- Title: From Parameter Dynamics to Risk Scoring : Quantifying Sample-Level Safety Degradation in LLM Fine-tuning
- Title(参考訳): パラメータダイナミクスからリスクスコーディングへ : LLMファインチューニングにおけるサンプルレベル安全性劣化の定量化
- Authors: Xiao Wang, Yifei Zhang, YongKang Liu, Xiaocui Yang, Zihan Wang, Shi Feng, Daling Wang,
- Abstract要約: 少数の良性サンプルを微調整すると、何百万もの好みの例から学んだ安全行動が消去される。
安全劣化のサンプルレベル定量化手法を提案し,各トレーニング試料の安全性劣化への影響を定量化する。
- 参考スコア(独自算出の注目度): 35.51358735144414
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety alignment of Large Language Models (LLMs) is extremely fragile, as fine-tuning on a small number of benign samples can erase safety behaviors learned from millions of preference examples. Existing studies attempt to explain this phenomenon by comparing parameters and hidden states before and after fine-tuning, but overlook their dynamic evolution during fine-tuning. In this paper, we uncover a critical mechanism underlying safety degradation by analyzing parameter dynamics, where benign fine-tuning causes parameters to cumulatively drift toward danger-aligned directions, progressively undermining the model's safety. This finding suggests that samples contributing more to this drift has greater fine-tuning risks. Based on this insight, we propose a method of Sample-Level Quantification of Safety Degradation (SQSD), which quantifies the influence of each training sample on safety degradation. Specifically, SQSD computes continuous risk scores to samples by measuring their induced parameter updates' projection difference between danger and safety directions. Extensive experiments across multiple models and datasets demonstrate that SQSD effectively quantifies sample-level fine-tuning risks and exhibits strong transferability across model architectures, parameter scales, and parameter-efficient methods.
- Abstract(参考訳): 大きな言語モデル(LLM)の安全性の調整は非常に脆弱であり、少数の良質なサンプルを微調整することで、何百万もの好みの例から学んだ安全性の挙動を消去することができる。
既存の研究では、微調整前後のパラメータと隠された状態を比較して、この現象を説明しようとしているが、微調整中の動的進化を見落としている。
本稿では,パラメータの微調整によってパラメータが危険に沿った方向に向かって累積的にドリフトし,モデルの安全性を徐々に損なうパラメータのダイナミクスを解析することにより,安全性劣化の根底にある重要なメカニズムを明らかにする。
この発見は、この漂流に寄与するサンプルがより微調整のリスクが高いことを示唆している。
そこで本研究では,SQSD(Simple-Level Quantification of Safety Degradation)を提案する。
具体的には、SQSDは、予測パラメータ更新の危険方向と安全方向の予測差を測定して、サンプルに対する継続的なリスクスコアを算出する。
複数のモデルやデータセットにわたる大規模な実験により、SQSDはサンプルレベルの微調整リスクを効果的に定量化し、モデルアーキテクチャ、パラメータスケール、パラメータ効率のよい手法間で強い伝達可能性を示すことが示された。
関連論文リスト
- Token-level Data Selection for Safe LLM Fine-tuning [15.039068315115372]
カスタムデータセット上での微調整大型言語モデル(LLM)は、これらのモデルを特定のドメインやアプリケーションに適用するための標準的なアプローチとなっている。
近年の研究では、このような微調整がモデルの安全性を著しく低下させる可能性があることが示されている。
本稿では,安全劣化モデルとユーティリティ指向モデルとの損失差を測定することにより,各トークンの安全性リスクを定量化する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-01T16:52:05Z) - Rethinking Safety in LLM Fine-tuning: An Optimization Perspective [56.31306558218838]
我々は、本質的にトレードオフではなく、最適化の貧弱な選択が、しばしば安全上の問題を引き起こすことを示し、敵のプロンプトに対する有害な応答として測定する。
安全性能を保ったパラメータ空間における簡易指数移動平均(EMA)運動量法を提案する。
複数のデータセットにまたがるLlamaファミリーに関する実験は、安全性の問題が特別な介入なしに回避できることを実証している。
論文 参考訳(メタデータ) (2025-08-17T23:46:36Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z) - Mitigating Fine-tuning Risks in LLMs via Safety-Aware Probing Optimization [7.1060720569792215]
微調整された大きな言語モデル(LLM)は、必然的に安全性を損なう可能性がある。
安全リスクの軽減を目的とした安全意識探索(SAP)フレームワークを導入する。
実験の結果,SAPは従来の微調整モデルよりも有害性を効果的に低減できることがわかった。
論文 参考訳(メタデータ) (2025-05-22T14:52:10Z) - Gradient Co-occurrence Analysis for Detecting Unsafe Prompts in Large Language Models [16.369885004916668]
安全でないプロンプトは大きな言語モデル(LLM)に重大な安全リスクをもたらす
安全クリティカルパラメータ識別の範囲を拡大する勾配共起解析法であるGradCooを導入する。
提案手法は,既存手法と比較して最先端(SOTA)性能を実現することができる。
論文 参考訳(メタデータ) (2025-02-18T01:14:46Z) - Risk-Sensitive Diffusion: Robustly Optimizing Diffusion Models with Noisy Samples [58.68233326265417]
非画像データは実際のアプリケーションで広く使われており、ノイズが多い傾向にある。
リスク感受性SDEは、リスクベクトルによってパラメータ化された微分方程式(SDE)の一種である。
我々はガウス雑音分布と非ガウス雑音分布の両方について系統的研究を行う。
論文 参考訳(メタデータ) (2024-02-03T08:41:51Z) - Probabilities Are Not Enough: Formal Controller Synthesis for Stochastic
Dynamical Models with Epistemic Uncertainty [68.00748155945047]
複雑な力学系のモデルにおける不確実性を捉えることは、安全なコントローラの設計に不可欠である。
いくつかのアプローチでは、安全と到達可能性に関する時間的仕様を満たすポリシーを形式的な抽象化を用いて合成する。
我々の貢献は、ノイズ、不確実なパラメータ、外乱を含む連続状態モデルに対する新しい抽象的制御法である。
論文 参考訳(メタデータ) (2022-10-12T07:57:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。