論文の概要: Mask2Shield: Strengthening LLM Safety against Neuron-Pruning Attacks
- arxiv url: http://arxiv.org/abs/2607.23015v1
- Date: Sat, 25 Jul 2026 03:16:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.967186
- Title: Mask2Shield: Strengthening LLM Safety against Neuron-Pruning Attacks
- Title(参考訳): Mask2Shield: 神経切断攻撃に対するLDM安全性の強化
- Abstract要約: 大規模言語モデル(LLM)は、有害なコンテンツ生成を減らすために、デプロイ前に安全に整合している。
ニューロンレベルのプルーニング攻撃は、拒絶は除去可能な小さなユニットのセットに依存する可能性があることを示している。
この機能的プルーニングの下でモデルをトレーニングするマスクフォワードアライメント手法であるMask2Shieldを紹介する。
- 参考スコア(独自算出の注目度): 12.335966705179906
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are safety-aligned before deployment to reduce harmful content generation. Yet neuron-level pruning attacks show that refusal can depend on a small set of removable units: disabling them can remove safety behavior while leaving much of the model usable. To address this problem, we introduce Mask2Shield (M2S), a masked-forward alignment method that trains a model under this functional pruning. The masked student must recover a safe refusal through the remaining computation, while a frozen, unmasked teacher supplies complete benign answers to limit capability drift. Across ten model configurations, M2S reduces successful recomputed pruning attacks from 80--279 to 1--44 out of 313 prompts while generally preserving four capability benchmarks. We also evaluate M2S with TwinBreak, which uses a different neuron-selection rule and iterative pruning procedure. Together, these results show that M2S makes targeted pruning less effective by reducing reliance on a small, removable safety-neuron set.
- Abstract(参考訳): 大規模言語モデル(LLM)は、有害なコンテンツ生成を減らすために、デプロイ前に安全に整合している。
しかし、ニューロンレベルのプルーニング攻撃は、拒絶は取り外し可能なユニットの小さなセットに依存する可能性があることを示している。
この問題に対処するために,マスク付き前方アライメント手法であるMask2Shield (M2S) を導入する。
マスクを被った生徒は、残りの計算によって安全な拒絶を回復しなければならないが、凍結した教師は、能力のドリフトを制限するために完全な良心的な答えを提供する。
10種類のモデル構成で、M2Sは313のプロンプトのうち80--279から1-44に再計算されたプルーニング攻撃を減らし、一般に4つの性能ベンチマークを保っている。
また,異なるニューロン選択規則と反復的プルーニング法を用いて,TwinBreakを用いたM2Sの評価を行った。
これらの結果から,M2Sは小型で除去可能な安全ニューロンセットへの依存を減らすことにより,目標プルーニングの軽減を図っている。
関連論文リスト
- SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs [69.51621286001262]
我々は、専用のニューロンレベルの介入戦略を採用する、モーダル間安全アライメントフレームワークであるSafeNexusを紹介する。
我々は、モダリティ結合型安全ニューロン(BS-Neurons)を同定し、各モダリティ内の安全行動の調節におけるそれらの役割を検証した。
我々は,アクティベーションレベル安全増幅器と安全ニューロン校正器の2つの安全アライメント戦略を提案する。
論文 参考訳(メタデータ) (2026-07-31T02:45:56Z) - MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks [12.70638634576904]
我々は、様々な安全シナリオにおけるMoEの振る舞いを、再トレーニングなしで柔軟に再構成できるフレームワークMASCingを提案する。
MASCingはLSTMベースのサロゲートモデルを使用して、層間ルーティングの依存関係をキャプチャし、ルーティングログを下流の動作にマップする。
次に、ステアリング行列を最適化し、行動関連の専門家回路を特定し、ルーティングゲートにステアリングマスクを適用して専門家の選択をオーバーライドする。
論文 参考訳(メタデータ) (2026-04-30T12:58:57Z) - Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model [50.29667251847595]
モデルサイズが大きく,安全性が向上しているにもかかわらず,教師と生徒の言語モデルの間にはアライメントギャップがあることが示される。
本稿では,不安全な動作を潜在空間のベースLLMに還元するBoNサンプリング手法を提案する。
特に7つの教師モデルと6つの生徒モデルが異なるクラスとサイズで、平均攻撃成功率(ASR)はDANで28.2%、WildJailbreakで31.3%、StrongREJECTベンチマークで35.4%低下した。
論文 参考訳(メタデータ) (2026-04-01T02:42:41Z) - Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use [6.622648583261088]
エージェント言語モデルは、単一のミスステップが不可逆的な害を引き起こす可能性のあるロングホライゾンアクションを計画、呼び出し、実行しなければなりません。
安全判断を明確化し,学習可能にすることで,エージェントを安全なマルチステップツール使用に整合させるフレームワークであるMOSAICを紹介する。
以上の結果から,MOSAICは有害行為を最大50%減らし,インジェクション攻撃で20%以上減らし,プライバシリークを減らし,良質なタスク性能を保ち,改善することを示した。
論文 参考訳(メタデータ) (2026-03-03T17:59:35Z) - Fewer Weights, More Problems: A Practical Attack on LLM Pruning [17.31903635101698]
最新のLCMプルーニング手法を悪質に悪用できることを示す。
提案手法は,各パラメータがプルーニングされる確率を推定するプロキシメトリックを,敵が計算できるという考えに基づいている。
5つのモデルに対する広範囲な評価を通じて,攻撃の重大さを実証する。
論文 参考訳(メタデータ) (2025-10-09T09:17:35Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning [12.293101110323722]
ファインチューニング・アズ・ア・サービス(英語版)は、有害なファインチューニング攻撃に対してモデルを公開する。
我々は、選択的な除去ではなく、モデル崩壊を誘発するパラダイムシフトを提案する。
この崩壊は、攻撃者が悪用する非常に一般的な機能を直接中和する。
論文 参考訳(メタデータ) (2025-05-22T11:47:08Z) - Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior [59.20260988638777]
本研究は, 応答発生前の安全反射の促進により, 虚偽の拒絶行動が軽減されることを実証する。
15種類の事前訓練モデルを対象としたアブレーション実験において, 安全性を考慮した微調整モデルでは, 誤検知の挙動が著しく低下することがわかった。
論文 参考訳(メタデータ) (2025-03-22T23:35:49Z) - Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities [49.09703018511403]
大規模言語モデル(LLM)のリスクと能力の評価は、AIのリスク管理とガバナンスフレームワークにますます取り入れられている。
現在、ほとんどのリスク評価は、システムから有害な振る舞いを誘発する入力を設計することで実施されている。
本稿では,遅延活性化や重みへの修正が可能なモデル改ざん攻撃を用いたLCMの評価を提案する。
論文 参考訳(メタデータ) (2025-02-03T18:59:16Z) - MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models [87.64417894918506]
この研究は、大規模言語モデルにおける半構造化(あるいはN:M'')のスパーシティを確立する学習可能なプルーニング手法であるMaskLLMを紹介した。
MaskLLMはGumbel Softmaxサンプリングを通じて学習可能な分布としてN:Mパターンを明示的にモデル化する。
論文 参考訳(メタデータ) (2024-09-26T02:37:41Z) - Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training [67.30423823744506]
我々は,LLMに対して,いかなる応答位置においても有害なプロンプトへのコンプライアンスを拒否する権限を付与する,新しいアプローチであるDecoupled Refusal Training(DeRTa)を導入する。
DeRTaは,(1)安全応答の開始に有害な応答のセグメントを付加することにより,安全でないコンテンツの認識と回避をモデルに訓練する,(2)有害応答シーケンスを通して潜在的障害から安全拒絶へ移行する能力をモデルに装備する強化遷移最適化(RTO)という,2つの新しいコンポーネントを組み込んでいる。
論文 参考訳(メタデータ) (2024-07-12T09:36:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。