論文の概要: DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning
- arxiv url: http://arxiv.org/abs/2608.04322v1
- Date: Wed, 05 Aug 2026 01:05:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.67999
- Title: DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning
- Title(参考訳): DataRx: 大きな言語モデルタスクに特有な微調整のための欠如を意識したサンプリング
- Authors: Junbo Zhang, Qianli Zhou, Xinyang Deng, Wen Jiang,
- Abstract要約: タスク固有の微調整は、整列した大きな言語モデルの安全ガードレールを弱める可能性がある。
本稿では,安全性に問題のあるサンプルを選択するための,欠落を意識したサンプリング手法であるDataRxを提案する。
- 参考スコア(独自算出の注目度): 23.890337519636986
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Task-specific fine-tuning can improve the performance of large language models (LLMs) on downstream tasks. However, our study reveals that task-specific fine-tuning can also weaken the safety guardrails of aligned LLMs. A widely adopted strategy for preserving safety during fine-tuning is to incorporate safety data. Although previous studies have shown that randomly mixing safety data can alleviate safety degradation, the underlying principle determining why some safety examples are more effective than others still remains unclear. In this paper, we propose DataRx, a missingness-aware sampling method for selecting safety-critical examples. DataRx is based on the hypothesis that a safety sample is more effective when the selected examples provide safety signals that fill the missing parts of LLMs' safety capabilities. DataRx's key insight is leveraging high-dimensional hidden representations rather than discrete tokens to quantify the safety signal gap between the target model's native response and the safety reference response. The results show that, with only 1% additional safety samples from BeaverTails, DataRx reduces the average attack success rate of Llama3-8B-Instruct across seven downstream tasks from 59.23% under random sampling to 13.70%. In addition, DataRx can be combined with the existing safety data synthesis method to further enhance safety defenses during fine-tuning. We hope that DataRx will inspire more data-centric defense research.
- Abstract(参考訳): タスク固有の微調整は、下流タスクにおける大きな言語モデル(LLM)のパフォーマンスを改善することができる。
しかし,本研究では,タスク固有の微調整が協調型LDMの安全ガードレールを弱める可能性があることを明らかにした。
微調整中の安全を守るための広く採用されている戦略は、安全データを組み込むことである。
従来の研究では、ランダムに混合された安全データが安全性の劣化を軽減することが示されているが、いくつかの安全事例が他のものよりも効果的である理由を決定する根本原理はいまだに不明である。
本稿では,安全クリティカルな事例を選択するための,欠落を意識したサンプリング手法であるDataRxを提案する。
DataRxは、選択されたサンプルがLLMの安全性能力の欠如部分を満たす安全信号を提供する場合、安全性サンプルがより効果的であるという仮説に基づいている。
DataRxの重要な洞察は、離散トークンではなく、高次元の隠れ表現を活用して、ターゲットモデルのネイティブ応答と安全基準応答の間の安全信号ギャップを定量化することである。
その結果、ビーバータイの安全サンプルを1%追加するだけで、7つの下流タスクにわたるLlama3-8B-Instructの平均攻撃成功率は、ランダムサンプリングで59.23%から13.70%に減少することがわかった。
さらに、DataRxを既存の安全データ合成手法と組み合わせることで、微調整時の安全防御をさらに強化することができる。
DataRxがよりデータ中心の防衛研究を刺激することを期待しています。
関連論文リスト
- DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning [21.57697098714205]
大きな言語モデル(LLM)は、良質なデータセットを微調整しても、安全性の低下に悩まされる。
良質なデータセットの安全性劣化サンプルを同定する既存の方法は、高い計算コストと重大なノイズの問題に悩まされている。
我々は,安全性劣化の可能性のあるサンプルを効率的かつ効果的に同定するために,DataShieldを提案する。
論文 参考訳(メタデータ) (2026-05-29T09:04:27Z) - Token-level Data Selection for Safe LLM Fine-tuning [15.039068315115372]
カスタムデータセット上での微調整大型言語モデル(LLM)は、これらのモデルを特定のドメインやアプリケーションに適用するための標準的なアプローチとなっている。
近年の研究では、このような微調整がモデルの安全性を著しく低下させる可能性があることが示されている。
本稿では,安全劣化モデルとユーティリティ指向モデルとの損失差を測定することにより,各トークンの安全性リスクを定量化する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-01T16:52:05Z) - Rethinking Safety in LLM Fine-tuning: An Optimization Perspective [56.31306558218838]
我々は、本質的にトレードオフではなく、最適化の貧弱な選択が、しばしば安全上の問題を引き起こすことを示し、敵のプロンプトに対する有害な応答として測定する。
安全性能を保ったパラメータ空間における簡易指数移動平均(EMA)運動量法を提案する。
複数のデータセットにまたがるLlamaファミリーに関する実験は、安全性の問題が特別な介入なしに回避できることを実証している。
論文 参考訳(メタデータ) (2025-08-17T23:46:36Z) - Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment [24.364891513019444]
本稿では, 微調整データセットには, 表面で容易に識別できない, 安全性の低下したサンプルがしばしば含まれていることを示す。
本稿では,レイヤ認識表現フィルタリング手法であるLARFを提案する。
実験結果から, LARFは良性データと安全性劣化の特徴を効果的に識別できることが示唆された。
論文 参考訳(メタデータ) (2025-07-24T17:59:24Z) - LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning [61.594212398272184]
Low-Rank Extrapolation (LoX)は、良質で悪意のある微調整攻撃に対する堅牢性を改善する。
LoXは攻撃成功率を11%から54%に下げる。
論文 参考訳(メタデータ) (2025-06-18T16:30:02Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z) - Enhancing AI Safety Through the Fusion of Low Rank Adapters [7.384556630042846]
低ランク適応核融合は、悪意のあるプロンプトに直面した場合に有害な応答を緩和する。
タスクアダプタと安全アダプタとのLoRA融合を利用して, 有害度率を42%低減した。
また、モデルが安全でないものに近い安全なプロンプトを拒否する、誇張された安全行動も観察する。
論文 参考訳(メタデータ) (2024-12-30T13:12:27Z) - Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment [56.2017039028998]
言語モデル・アズ・ア・サービス(LM)のファインチューニングは、特にファインチューニングベースのジェイルブレイク攻撃(FJAttack)に対する新たな脅威をもたらす
本稿では,バックドア攻撃の概念と類似性から着想を得たバックドア強化安全アライメント手法を提案する。
我々の総合的な実験は、バックドア強化安全アライメント(Backdoor Enhanced Safety Alignment)を通じて、悪質に微調整されたLSMは、良質な性能を損なうことなく、オリジナルのアライメントモデルと同じような安全性性能を達成することを実証している。
論文 参考訳(メタデータ) (2024-02-22T21:05:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。