論文の概要: High-quality Data Do not Mean Safe! Poisoning LLMs after Data Selection
- arxiv url: http://arxiv.org/abs/2610.01367v1
- Date: Thu, 01 Oct 2026 09:37:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.03352
- Title: High-quality Data Do not Mean Safe! Poisoning LLMs after Data Selection
- Title(参考訳): 高品質なデータは安全ではない! データ選択後にLCMをポーティングする
- Abstract要約: 安全に配慮した大規模言語モデルは、有害または良心的なサンプルの小さなセットの微調整に弱いままである。
選択は過剰に有害なサンプルを除去するが、いくつかの高品質なサンプルはモデルの安全性を損なう可能性がある。
安全性を低下させる影響は、高品質なサンプルを保存して品質ベースの選択を経ることができる。
- 参考スコア(独自算出の注目度): 21.479150999585272
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Safety-aligned Large Language Models remain vulnerable to fine-tuning on small sets of harmful or benign-looking samples. However, prior studies typically assume that poisoned samples directly enter downstream fine-tuning, overlooking quality-based selection in practical training pipelines. To fill this gap, we systematically evaluate both the filtering effects against poisoning and the downstream safety impact of retained data. The results reveal that selection removes many overtly harmful samples, yet some retained high-quality samples can still degrade model safety alignment possibly due to their harmful-like training-update patterns at the layer-wise gradient level. Together, these findings expose a practical vulnerability: safety-degrading influence can pass through quality-based selection via retained high-quality samples. To examine its systematic exploitability, we propose Bi-Stage Quality-Constrained Safety-Degradation Text Optimization (Bi-QSTO), which optimizes poisoned samples under an explicit quality constraint to survive selection while preserving their safety-degrading influence. Across poisoning settings, target models, and filtering rates, Bi-QSTO maintains attack effectiveness before and after selection. Even at 90% filtering, harmful-seeded samples achieve a Poisoning Retention Rate above 90% and Harmful Score of 3.30--4.01. Their attack effectiveness strongly transfers across models and their retention advantage generalizes to additional selection methods.
- Abstract(参考訳): 安全に配慮した大規模言語モデルは、有害または良心的なサンプルの小さなセットの微調整に弱いままである。
しかし、従来の研究では、有毒なサンプルが下流の微調整に直接入り込み、実践的な訓練パイプラインにおける品質ベースの選択を見越すのが普通だった。
このギャップを埋めるために, 汚染に対する濾過効果と, 保持データによる下流の安全影響の両方を系統的に評価した。
その結果, 選択は有害なサンプルの多くを除去するが, 高い品質のサンプルは, 層幅勾配における有害なトレーニング更新パターンのため, モデル安全性の整合性を低下させる可能性があることがわかった。
安全性を低下させる影響は、高品質なサンプルを保存して品質ベースの選択を経ることができる。
そこで, 本論文では, 安全性向上効果を保ちながら, 安全性を保ったまま選択を継続するために, 明確な品質制約の下で有毒試料を最適化するBi-QSTO(Bi-Stage Quality-Constrained Safety-Degradation Text Optimization)を提案する。
Bi-QSTOは、毒殺設定、ターゲットモデル、フィルタリングレートを越えて、選択前後の攻撃効果を維持している。
90%の濾過でも有害種子は90%以上、ハーモフルスコアは3.30--4.01に達する。
攻撃効果はモデル間で強く伝達され、保持優位性は追加選択法に一般化される。
関連論文リスト
- DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning [21.57697098714205]
大きな言語モデル(LLM)は、良質なデータセットを微調整しても、安全性の低下に悩まされる。
良質なデータセットの安全性劣化サンプルを同定する既存の方法は、高い計算コストと重大なノイズの問題に悩まされている。
我々は,安全性劣化の可能性のあるサンプルを効率的かつ効果的に同定するために,DataShieldを提案する。
論文 参考訳(メタデータ) (2026-05-29T09:04:27Z) - Continual Safety Alignment via Gradient-Based Sample Selection [14.306119791052575]
データ中心のレンズを通して、どのトレーニングサンプルがアライメントドリフトを引き起こすかを検討する。
微調整時に高次サンプルをフィルタする勾配型サンプル選択法を提案する。
提案手法は,選択率,タスク順序,多種多様な攻撃ベンチマークにまたがって堅牢である。
論文 参考訳(メタデータ) (2026-04-19T02:52:33Z) - Rethinking Safety in LLM Fine-tuning: An Optimization Perspective [56.31306558218838]
我々は、本質的にトレードオフではなく、最適化の貧弱な選択が、しばしば安全上の問題を引き起こすことを示し、敵のプロンプトに対する有害な応答として測定する。
安全性能を保ったパラメータ空間における簡易指数移動平均(EMA)運動量法を提案する。
複数のデータセットにまたがるLlamaファミリーに関する実験は、安全性の問題が特別な介入なしに回避できることを実証している。
論文 参考訳(メタデータ) (2025-08-17T23:46:36Z) - Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation [58.7395356511539]
有害な微調整攻撃は、微調整サービスに重大なセキュリティリスクをもたらす。
主流防衛は、後の有害な微調整攻撃がより効果的でないように、モデルを予防接種することを目的としている。
微調整後のモデルに適用可能な適応的摂動を最適化するパナセアを提案する。
論文 参考訳(メタデータ) (2025-01-30T02:47:09Z) - Safety-Aware Fine-Tuning of Large Language Models [29.5636201427693]
細調整された大規模言語モデル(LLM)は、個々のニーズや好みに合わせてモデルを調整するための一般的なプラクティスとして現れています。
本稿では,有害な可能性のあるデータを自動検出・除去する,新たなSAFT(Safety-Aware Fine-Tuning)フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-13T21:24:25Z) - Unlearnable Examples Detection via Iterative Filtering [84.59070204221366]
ディープニューラルネットワークは、データ中毒攻撃に弱いことが証明されている。
混合データセットから有毒なサンプルを検出することは極めて有益であり、困難である。
UE識別のための反復フィルタリング手法を提案する。
論文 参考訳(メタデータ) (2024-08-15T13:26:13Z) - Learning with Imbalanced Noisy Data by Preventing Bias in Sample
Selection [82.43311784594384]
実世界のデータセットには、ノイズの多いラベルだけでなく、クラス不均衡も含まれている。
不均衡なデータセットにおけるノイズラベルに対処する,単純かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-02-17T10:34:53Z) - Protecting Model Adaptation from Trojans in the Unlabeled Data [120.42853706967188]
本稿では,よく設計された毒物標的データによるモデル適応に対するトロイの木馬攻撃の可能性について検討する。
本稿では,既存の適応アルゴリズムとシームレスに統合可能なDiffAdaptというプラグイン・アンド・プレイ手法を提案する。
論文 参考訳(メタデータ) (2024-01-11T16:42:10Z) - Explore the Effect of Data Selection on Poison Efficiency in Backdoor
Attacks [10.817607451423765]
本研究では,サンプル選択の観点から,バックドアアタックの毒殺効率の向上に焦点をあてる。
各種毒物試料の寄与を示すために, 試料の忘れイベントを採用し, 損失面の曲率を用いて, この現象の有効性を解析した。
論文 参考訳(メタデータ) (2023-10-15T05:55:23Z) - Amplifying Membership Exposure via Data Poisoning [18.799570863203858]
本稿では,データ中毒の第3タイプについて検討し,良心的トレーニングサンプルのプライバシー漏洩リスクを高めることを目的とした。
そこで本研究では,対象クラスの加入者への露出を増幅するために,データ中毒攻撃のセットを提案する。
この結果から,提案手法は,テスト時間モデルの性能劣化を最小限に抑えることで,メンバーシップ推定精度を大幅に向上させることができることがわかった。
論文 参考訳(メタデータ) (2022-11-01T13:52:25Z) - How Robust are Randomized Smoothing based Defenses to Data Poisoning? [66.80663779176979]
我々は、トレーニングデータの品質の重要性を強調する堅牢な機械学習モデルに対して、これまで認識されていなかった脅威を提示します。
本稿では,二段階最適化に基づく新たなデータ中毒攻撃法を提案し,ロバストな分類器のロバスト性を保証する。
我々の攻撃は、被害者が最先端のロバストな訓練方法を用いて、ゼロからモデルを訓練しても効果的である。
論文 参考訳(メタデータ) (2020-12-02T15:30:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。