論文の概要: You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation
- arxiv url: http://arxiv.org/abs/2605.04992v1
- Date: Wed, 06 May 2026 14:52:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.886452
- Title: You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation
- Title(参考訳): 神経質なウェイト翻訳で安全アライメントを自動修復する「Snooze」
- Abstract要約: 安全でないドメイン固有アダプタを安全なアライメント多様体にマッピングするフレームワークを提案する。
NeWTralは、安全でないアダプタペアの様々なコーパスで事前訓練された非線形翻訳モジュールとして動作する。
- 参考スコア(独自算出の注目度): 15.648607231995163
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The open-source ecosystem has accelerated the democratization of Large Language Models (LLMs) through the public distribution of specialized Low-Rank Adaptation (LoRA) modules. However, integrating these third-party adapters often induces catastrophic forgetting of the base model's foundational safety alignment. Restoring these guardrails via fine-tuning on safety data introduces an opposing failure mode: the severe degradation of the specialized domain knowledge the adapter was originally designed to provide. To overcome this zero-resource challenge, we propose Neural Weight Translation (NeWTral), a framework that directly maps unsafe, domain-specific adapters onto a safe alignment manifold while rigorously preserving their core expertise. NeWTral operates as a non-linear translation module pre-trained on a diverse corpus of unsafe-to-safe adapter pairs. By executing this mapping entirely within the parameter space, NeWTral utilizes an adaptive Mixture of Experts (MoE) routing strategy to autonomously blend high-fidelity surgical translators and aggressive alignment experts. We evaluate our framework across four architectural families (Llama, Mistral, Qwen, and Gemma) at scales up to 72B parameters across eight diverse scientific and professional domains. Our results demonstrate that the MoE variant achieves a radical reduction in the average Attack Success Rate (ASR), dropping from 70% in unsafe experts to just 13%, while maintaining an exceptional 90\% average knowledge fidelity. Much like the crowdsourced adapters it remedies, the NeWTral module is designed as a standalone, downloadable asset that allows practitioners to restore safety alignment instantly without requiring access to original training data or hardware-intensive retraining.
- Abstract(参考訳): オープンソースのエコシステムは、Low-Rank Adaptation (LoRA)モジュールの公開配布を通じて、Large Language Models (LLM)の民主化を加速している。
しかしながら、これらのサードパーティアダプタを統合することで、ベースモデルの基本的な安全性の整合性を壊滅的に忘れてしまうことがしばしばある。
安全データを微調整することでこれらのガードレールを復元することは、もともとアダプタが提供するように設計されていた専門的なドメイン知識の深刻な劣化という、反対の障害モードをもたらす。
このゼロリソースの課題を克服するために、安全でないドメイン固有のアダプタを直接安全なアライメント多様体にマッピングし、コアとなる専門知識を厳格に保ちながら、NeWTral(Neural Weight Translation)を提案する。
NeWTralは、安全でないアダプタペアの様々なコーパスで事前訓練された非線形翻訳モジュールとして動作する。
このマッピングをパラメータ空間内で完全に実行することにより、NeWTralは適応型Mixture of Experts(MoE)ルーティング戦略を使用して、高忠実度手術用トランスレータとアグレッシブアライメントの専門家を自律的にブレンドする。
我々は、Llama、Mistral、Qwen、Gemmaの4つのアーキテクチャファミリにまたがるフレームワークを、8つの科学的および専門的なドメインにまたがる72Bパラメータのスケールで評価した。
その結果,MoEの変種は平均攻撃成功率(ASR)の急激な低下を実現し,安全性の低い専門家の70%からわずか13%に低下し,平均知識忠実度は90%に低下した。
NeWTralモジュールは、クラウドソースされたアダプタと同様、スタンドアロンでダウンロード可能なアセットとして設計されており、実践者はオリジナルのトレーニングデータやハードウェア集約的なリトレーニングを必要とせずに、即時に安全アライメントを復元することができる。
関連論文リスト
- SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment [9.53619777519017]
Mixture-of-Experts (MoE)は,トークン単位のエキスパートモジュールの小さなサブセットのみを活性化する,大規模言語モデルのスケーリングアーキテクチャである。
提案するSEAL++は,訓練中に既存の安全部分空間を保持する制約を付加した変種である。
論文 参考訳(メタデータ) (2026-09-02T08:40:19Z) - RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs [9.24144060095413]
RouteHijackは、大規模言語モデル(LLM)のためのルーティング対応のジェイルブレイクである。
RouteHijackは、安全クリティカルで有害な専門家を特定するために、応答駆動のエキスパートローカライゼーションを実行する。
次に、安全の専門家を抑圧し、有害な専門家を奨励し、早期の拒絶を防ぐルーティング対応の目的で、敵の接尾辞を構築する。
論文 参考訳(メタデータ) (2026-05-01T11:54:55Z) - SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models [67.84174763413178]
我々はSafeRedirを紹介した。SafeRedirは、迅速な埋め込みリダイレクトによる堅牢なアンラーニングのための軽量な推論時フレームワークである。
SafeRedirは,効果的な非学習能力,意味的・知覚的保存能力,堅牢な画像品質,対人攻撃に対する耐性の向上を実現している。
論文 参考訳(メタデータ) (2026-01-13T15:01:38Z) - Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment [55.14890249389052]
既存の防衛は、安全回復を微調整に埋め込んだり、微調整による修正に先立って微調整に頼ったりしている。
我々は,ポストトレーニング量子化に基づくポストホック防御手法であるtextttQ-realign を提案する。
私たちの仕事は、安全を意識したデプロイメントのための実践的でターンキーなソリューションを提供します。
論文 参考訳(メタデータ) (2026-01-13T00:07:24Z) - OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs [36.57820295876294]
MLLMの安全性評価のための統一的,モジュール型,高スループットのRed-teamingフレームワークであるOpenRTを紹介した。
OpenRTのコアとなるのは,5次元にわたるモジュール分離を可能にする対角カーネルを導入することで,自動化された再チームのパラダイムシフトだ。
このフレームワークは、ホワイトボックス勾配、マルチモーダル摂動、高度なマルチエージェント進化戦略など、37の多様な攻撃手法を統合している。
論文 参考訳(メタデータ) (2026-01-04T16:41:33Z) - GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs [24.327693899810615]
GateBreakerは、トレーニング不要で、軽量で、アーキテクチャに依存しない最初のアタックフレームワークです。
GateBreakerは、現代のMoE LLMの安全アライメントを推論時に妥協する。
本研究により,MoEの安全性はスパースルーティングによって調整された神経細胞の小さなサブセットに集中していることが判明した。
論文 参考訳(メタデータ) (2025-12-24T07:13:24Z) - Who Speaks for the Trigger? Dynamic Expert Routing in Backdoored Mixture-of-Experts Transformers [12.47462301643593]
大規模言語モデル (LLM) とMixture-of-Experts (MoE) アーキテクチャは、専門家として知られる専門職に入力を動的にルーティングすることで、優れたパフォーマンスと効率を達成する。
我々は,タスク結合型動的トリガ最適化と感性誘導型Top-Sエキスパートトレース機構を統合した,新しいバックドアフレームワークであるBadSwitchを提案する。
論文 参考訳(メタデータ) (2025-10-15T12:11:02Z) - Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation [13.971909819796762]
大規模言語モデル(LLM)は、医療、教育、サイバーセキュリティといった分野で大きな成功を収めている。
埋め込み空間中毒は、敵が入力データの内部意味表現を操作して安全アライメント機構をバイパスする微妙な攻撃ベクトルである。
本稿では,線形変換による埋め込み空間における毒性感受性次元の同定と減衰を行う新しいフレームワークETTAを提案する。
論文 参考訳(メタデータ) (2025-07-08T03:01:00Z) - Robust Anti-Backdoor Instruction Tuning in LVLMs [53.766434746801366]
大規模視覚言語モデル(LVLM)のための軽量で認証に依存しない防御フレームワークについて紹介する。
私たちのフレームワークは、命令チューニングの下で、アダプタモジュールとテキスト埋め込み層のみを微調整します。
Flickr30kとMSCOCOに対する7つの攻撃に対する実験は、我々の攻撃の成功率をほぼゼロに低下させることを示した。
論文 参考訳(メタデータ) (2025-06-04T01:23:35Z) - What Makes and Breaks Safety Fine-tuning? A Mechanistic Study [64.9691741899956]
安全性の微調整は、大規模な言語モデル(LLM)を、安全なデプロイメントのための人間の好みに合わせるのに役立つ。
安全でない入力の健全な側面をキャプチャする合成データ生成フレームワークを設計する。
これを用いて,3つのよく知られた安全微調整手法について検討する。
論文 参考訳(メタデータ) (2024-07-14T16:12:57Z) - Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training [67.30423823744506]
我々は,LLMに対して,いかなる応答位置においても有害なプロンプトへのコンプライアンスを拒否する権限を付与する,新しいアプローチであるDecoupled Refusal Training(DeRTa)を導入する。
DeRTaは,(1)安全応答の開始に有害な応答のセグメントを付加することにより,安全でないコンテンツの認識と回避をモデルに訓練する,(2)有害応答シーケンスを通して潜在的障害から安全拒絶へ移行する能力をモデルに装備する強化遷移最適化(RTO)という,2つの新しいコンポーネントを組み込んでいる。
論文 参考訳(メタデータ) (2024-07-12T09:36:33Z) - GI-NAS: Boosting Gradient Inversion Attacks Through Adaptive Neural Architecture Search [52.27057178618773]
グラディエント・インバージョン・アタック (Gradient Inversion Attacks) は、Federated Learning (FL) システムの伝達勾配を反転させ、ローカルクライアントの機密データを再構築する。
勾配反転法の大半は明示的な事前知識に大きく依存しており、現実的なシナリオでは利用できないことが多い。
本稿では,ニューラルネットワークを適応的に探索し,ニューラルネットワークの背後にある暗黙の先行情報をキャプチャするニューラルアーキテクチャ探索(GI-NAS)を提案する。
論文 参考訳(メタデータ) (2024-05-31T09:29:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。