論文の概要: Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing
- arxiv url: http://arxiv.org/abs/2606.00686v1
- Date: Sat, 30 May 2026 11:49:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 00:57:58.915385
- Title: Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing
- Title(参考訳): 配向の方言:動的安全ルーティングのための安全でない知識の調和
- Abstract要約: この作業は、安全でないデータが破棄されなければならないという正統性に挑戦する。
セーフモエ(SafeMoE)は、安全でない知識をドメイン固有のLowRank Adapters(LoRAの専門家)に分離するフレームワークである。
真の安全性は、安全でない知識のマスキングではなく、制御された統合のシフトを必要とする。
- 参考スコア(独自算出の注目度): 27.31688887825119
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The prevailing paradigm in large language model (LLM) alignment operates via erasure, filtering unsafe data or training models to strictly refuse harmful prompts. While effective at reducing immediate toxicity, this approach fundamentally constricts the model's epistemological scope, resulting in over-cautious systems that output uninformative blanket refusals to sensitive yet benign queries. In this work, we challenge the orthodoxy that unsafe data must be discarded. We propose a dialectical approach to alignment, positing that unsafe data encodes rich, domain specific knowledge critical for nuanced, safe, and informative generation. To operationalize this, we introduce SafeMoE, a Mixture-of-Experts (MoE) framework that isolates unsafe knowledge into domain-specific Low-Rank Adapters (LoRA experts) trained exclusively on harmful corpora. To synthesize safety from these unsafe primitives, we train a lightweight gating network using a minimal, highly curated set of safe-informative responses. During inference, this router dynamically orchestrates the unsafe experts, effectively steering the generation trajectory to harness their deep domain knowledge while strictly enforcing safety constraints. Extensive empirical evaluations across stringent safety benchmarks demonstrate that SafeMoE is not only safer, achieving over a 20% relative improvement in safe response rate (more than a 15% absolute gain), but also produces more informative responses when safety and harmfulness are of paramount concern. Furthermore, the routing mechanism exhibits strong zero-shot generalization to unseen domains and broader safety tasks without domain-specific supervision. Our findings suggest a paradigm shift in alignment: true safety requires not the masking of unsafe knowledge, but its controlled integration.
- Abstract(参考訳): 大規模言語モデル(LLM)アライメントにおける一般的なパラダイムは、有害なプロンプトを厳密に拒否するために、消去、不正なデータフィルタリング、トレーニングモデルによって機能する。
即時毒性の低減に効果があるが、このアプローチは基本的にモデルの認識的スコープを制限し、不定形な毛布の拒否を繊細で良質なクエリに出力する過注意なシステムをもたらす。
本研究では、安全でないデータを破棄しなければならないという正統性に挑戦する。
我々は、安全でないデータが、ニュアンス、安全、情報的生成に不可欠な、リッチでドメイン固有の知識をエンコードしていることを示す、アライメントに対する弁証的アプローチを提案する。
セーフモエ(SafeMoE)は、安全でない知識をドメイン固有のLow-Rank Adapters(LoRAの専門家)に分離し、有害なコーパスに特化して訓練するフレームワークである。
これらの安全でないプリミティブから安全性を合成するために、最小限の高度にキュレートされた安全な表現応答を用いて軽量なゲーティングネットワークを訓練する。
推論中、このルータは安全でない専門家を動的にオーケストレーションし、安全制約を厳格に実施しながら、その深いドメイン知識を活用するため、世代軌道を効果的に操る。
厳密な安全性ベンチマークによる広範囲な実験的な評価は、SafeMoEが安全であるだけでなく、安全性と有害性が最重要事項である場合に、安全応答率(15%以上の絶対利得)の20%以上の相対的な改善を達成していることを示している。
さらに、ルーティング機構は、目に見えない領域への強いゼロショットの一般化と、ドメイン固有の監督なしにより広範な安全タスクを示す。
真の安全性は、安全でない知識のマスキングではなく、その制御された統合を必要とする。
関連論文リスト
- Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models [31.940554924036807]
大規模推論モデル(LRM)は、高度なジェイルブレイクや直接的な有害なクエリに対して非常に脆弱である。
我々は、安全分析とガイダンスをトリガーする安全なタグを明示的に誘導するために、Supervised Fine-Tuning (SFT) を採用している。
また、安全分析およびガイダンスの正確性と安定性をさらに高めるために、直接選好最適化(DPO)を適用した。
論文 参考訳(メタデータ) (2026-06-15T14:51:34Z) - Internalizing Safety Understanding in Large Reasoning Models via Verification [33.2377930782685]
本稿では,安全確認タスクにのみ焦点をあてた LRM のトレーニングにより,安全性仕様を内部化するフレームワークを提案する。
検証の学習は、応答安全性の強力な一般化を誘導し、ドメイン外ジェイルブレイクに対する堅牢性を著しく向上させることを示した。
論文 参考訳(メタデータ) (2026-05-09T13:05:00Z) - SafeCtrl: Region-Aware Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress [13.834468340496414]
本研究では,検出-Then-Suppressパラダイム上で動作する地域意識型安全制御フレームワークであるSafeCtrlを提案する。
グローバルな安全介入とは異なり、SafeCtrlはまず、特定のリスク領域を正確にローカライズするために注意誘導検出モジュールを使用する。
SafeCtrlは,最先端の手法に比べて安全性と忠実さのトレードオフが優れていることを示す。
論文 参考訳(メタデータ) (2026-04-05T03:06:17Z) - SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond [134.43113804188195]
安全評価と科学的文脈の強化のための包括的枠組みであるSafeSciを紹介する。
SafeSciには、0.25Mサンプルを持つマルチディシプリナのベンチマークであるSafeSciBenchと、安全性向上のための1.5Mサンプルを含む大規模データセットであるSafeSciTrainが含まれている。
論文 参考訳(メタデータ) (2026-03-02T08:16:04Z) - SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models [67.84174763413178]
我々はSafeRedirを紹介した。SafeRedirは、迅速な埋め込みリダイレクトによる堅牢なアンラーニングのための軽量な推論時フレームワークである。
SafeRedirは,効果的な非学習能力,意味的・知覚的保存能力,堅牢な画像品質,対人攻撃に対する耐性の向上を実現している。
論文 参考訳(メタデータ) (2026-01-13T15:01:38Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z) - Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing [12.986006070964772]
安全性アライメントは、現実世界のAIアプリケーションにとって重要な研究トピックである。
本研究はまず,モデルの有用性を犠牲にすることなく,このような脆弱性を除去することの難しさを明らかにした。
本手法は,安全性を維持しつつモデルの有用性を高め,トレードオフを改善できる。
論文 参考訳(メタデータ) (2025-02-04T09:31:54Z) - SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals [51.49737867797442]
大規模言語モデル(LLM)は、様々なタスクにまたがる例外的な能力を示すが、有害なコンテンツを生成することでリスクを引き起こす。
LLMは、内部状態の安全性に関する内部評価を同様に行うことができることを示す。
本稿では,プロバーをベースとした内部状態モニタを用いて,安全でない出力を規制するSafeSwitchを提案する。
論文 参考訳(メタデータ) (2025-02-03T04:23:33Z) - SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior [56.10557932893919]
我々は、新しいAI安全モデレーションフレームワークであるSafetyAnalystを紹介する。
AIの振る舞いを考えると、SafetyAnalystはチェーン・オブ・シークレット・推論を使用してその潜在的な結果を分析する。
効果を28個の完全に解釈可能な重みパラメータを使って有害度スコアに集約する。
論文 参考訳(メタデータ) (2024-10-22T03:38:37Z) - Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training [67.30423823744506]
我々は,LLMに対して,いかなる応答位置においても有害なプロンプトへのコンプライアンスを拒否する権限を付与する,新しいアプローチであるDecoupled Refusal Training(DeRTa)を導入する。
DeRTaは,(1)安全応答の開始に有害な応答のセグメントを付加することにより,安全でないコンテンツの認識と回避をモデルに訓練する,(2)有害応答シーケンスを通して潜在的障害から安全拒絶へ移行する能力をモデルに装備する強化遷移最適化(RTO)という,2つの新しいコンポーネントを組み込んでいる。
論文 参考訳(メタデータ) (2024-07-12T09:36:33Z) - Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model [73.8765529028288]
我々は、モダリティ間の安全アライメントを評価するために、セーフインプットとアンセーフアウトプット(SIUO)と呼ばれる新しい安全アライメントの課題を導入する。
この問題を実証的に調査するため,我々はSIUOを作成した。SIUOは,自己修復,違法行為,プライバシー侵害など,9つの重要な安全領域を含むクロスモダリティベンチマークである。
以上の結果から, クローズドおよびオープンソース両方のLVLMの安全性上の重大な脆弱性が明らかとなり, 複雑で現実的なシナリオを確実に解釈し, 応答する上で, 現行モデルが不十分であることが示唆された。
論文 参考訳(メタデータ) (2024-06-21T16:14:15Z) - Towards Comprehensive Post Safety Alignment of Large Language Models via Safety Patching [74.62818936088065]
textscSafePatchingは包括的なPSAのための新しいフレームワークである。
textscSafePatchingはベースラインメソッドよりも包括的なPSAを実現する。
textscSafePatchingは、連続的なPSAシナリオにおいて、その優位性を示している。
論文 参考訳(メタデータ) (2024-05-22T16:51:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。