論文の概要: Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning
- arxiv url: http://arxiv.org/abs/2608.05045v1
- Date: Wed, 05 Aug 2026 16:55:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.017128
- Title: Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning
- Title(参考訳): グラディエント免疫 : 悪性微調整に対するNull空間抵抗性
- Authors: Yuxuan Huang, Xingyu Zeng, Tianhang Zheng, Chaochao Lu,
- Abstract要約: 既存のディフェンスは主に、微調整・アズ・ア・サービスパラダイムのために設計されているか、あるいは下流のユーザーにさらなる安全手順に従うよう頼っている。
本稿では,一方向安全ゲート (USG) を提案し,最後のトランスフォーマー層に挿入された逆アダプタとともにヌル空間立方体層としてインスタンス化する。
実際には、ディフェンダーが保持する有害なデータを用いて閾値を調整し、近隣の非流通有害なサンプルに保護を一般化する。
- 参考スコア(独自算出の注目度): 25.789631205571734
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Released aligned large language models remain vulnerable to malicious downstream finetuning. Existing defenses are largely designed for the fine-tuning-as-a-service (FTaaS) paradigm or rely on downstream users to follow additional safety procedures, and therefore do not directly address the setting we study: a provider controlled partially protected open-weight (PPOW) release setting in which most weights remain trainable while a small safety-critical component is preserved at release. We propose a Unidirectional Safety Gate (USG), instantiated as a Null Space Cubic Layer together with an Inverse Adapter inserted after the final Transformer layer. During downstream fine-tuning, the cubic layer suppresses or blocks gradients from harmful samples whose hidden states fall in a calibrated protected region, while the Inverse Adapter restores the base model's forward behavior. In practice, we calibrate a threshold using defender-held harmful data, allowing protection to generalize to nearby in-distribution harmful samples. Across six evaluated model-dataset settings, USG keeps post-finetuning attack success rate close to the pre-release level under a fixed release threshold, while maintaining high safe-pass rates on easier settings and exhibiting a clearer safety-utility trade-off on unsafe samples from BeaverTails. These results suggest that release-time representation-space blocking can raise the cost of malicious downstream adaptation without requiring downstream cooperation. The code is available at https://github.com/OpenCausaLab/Gradient-Immunity.
- Abstract(参考訳): リリースされたアライメントされた大きな言語モデルは、悪意のある下流の微調整に対して脆弱なままである。
既存の防衛は、主にFTaaSパラダイムや、下流のユーザによる追加の安全手順に従うよう設計されているため、私たちが研究している設定には直接対応していない。
本稿では,一方向安全ゲート (USG) を提案し,最後のトランスフォーマー層に挿入された逆アダプタとともにヌル空間立方体層としてインスタンス化する。
下流の微調整の間、立方体層は、隠蔽状態が校正された保護領域に落下する有害なサンプルからの勾配を抑制またはブロックする一方、逆アダプタはベースモデルの前方動作を復元する。
実際には、ディフェンダーが保持する有害なデータを用いて閾値を調整し、近隣の非流通有害なサンプルに保護を一般化する。
モデルデータセットの6つの評価済み設定のうち、USGはリリース前レベルに近いリリース後攻撃成功率を維持しつつ、より簡単な設定で高いセーフパスレートを維持し、ビーバータイルからの安全でないサンプルに対してより明確な安全利用トレードオフを示す。
これらの結果から, リリース時表現空間のブロッキングは, 下流協調を必要とせず, 悪質な下流適応のコストを増大させる可能性が示唆された。
コードはhttps://github.com/OpenCausaLab/Gradient-Immunity.comで公開されている。
関連論文リスト
- Distribution-Specific Curvature Control with Finite-Sample Guarantees for Open-Weight Safety [22.283880969803846]
短い微調整で、オープンウェイトモデルの安全ガードを解除することができる。
経験的に、固定構造、有限予算の1次脅威モデルにおいて、HarmAlignは直接微調整と3つのデータまたは客観的アダプティブ攻撃をブロックする。
論文 参考訳(メタデータ) (2026-07-24T22:00:31Z) - Defending Against Harmful Supervision Hidden in Benign Samples [61.51852972402142]
既存の防御は、有害なコンテンツを下流の微調整データに明示的に混入した場合に有効であるが、工芸品のサンプルは、良質なタスクの中で有害な監視を隠すことができる。
本稿では,有害なQAペアを良質なトレーニングサンプルに埋め込んだ組込み攻撃を提案する。
論文 参考訳(メタデータ) (2026-06-29T13:11:49Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models [0.9772267314090434]
完全な良性データに微調整されたガードモデルは、すべての安全アライメントを失う可能性がある。
本研究は, 潜伏した安全形状の破壊に起因していることを示す。
漁業用安全部分空間規則化を提案する。
論文 参考訳(メタデータ) (2026-04-08T05:27:33Z) - Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment [45.772620696660034]
安全最適輸送(SOT)は、インスタンスレベルのフィルタリング課題から最適輸送(OT)に基づく分散レベルのアライメントタスクへ安全な微調整を再構成する新しいフレームワークである。
SOTは、下流の分布を信頼された安全なアンカーへ積極的に引き寄せ、同時に一般的な有害な参照から引き離すことで、サンプルの重要性を優先する。
さまざまなモデルファミリやドメインにわたる実験により、SOTは、競争力のある下流のパフォーマンスを維持しながら、モデルの安全性を大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-01-12T04:48:02Z) - A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space [91.99501941169831]
GuardSpaceは、微調整全体を通して安全アライメントを維持するためのガードレールフレームワークである。
GSM8Kで微調整されたLlama-2-7B-Chatでは、ガードスペースは最先端のAsFTよりも優れている。
論文 参考訳(メタデータ) (2025-10-16T04:57:53Z) - Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment [56.2017039028998]
言語モデル・アズ・ア・サービス(LM)のファインチューニングは、特にファインチューニングベースのジェイルブレイク攻撃(FJAttack)に対する新たな脅威をもたらす
本稿では,バックドア攻撃の概念と類似性から着想を得たバックドア強化安全アライメント手法を提案する。
我々の総合的な実験は、バックドア強化安全アライメント(Backdoor Enhanced Safety Alignment)を通じて、悪質に微調整されたLSMは、良質な性能を損なうことなく、オリジナルのアライメントモデルと同じような安全性性能を達成することを実証している。
論文 参考訳(メタデータ) (2024-02-22T21:05:18Z) - Over-the-Air Federated Learning with Privacy Protection via Correlated
Additive Perturbations [57.20885629270732]
我々は、複数のユーザ/エージェントからエッジサーバへの勾配更新をOtA(Over-the-Air)で送信することで、無線フェデレーション学習のプライバシー面を考察する。
従来の摂動に基づく手法は、トレーニングの精度を犠牲にしてプライバシー保護を提供する。
本研究では,エッジサーバにおけるプライバシリークの最小化とモデル精度の低下を目標とする。
論文 参考訳(メタデータ) (2022-10-05T13:13:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。