論文の概要: SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs
- arxiv url: http://arxiv.org/abs/2607.28969v1
- Date: Fri, 31 Jul 2026 02:45:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.575826
- Title: SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs
- Title(参考訳): SafeNexus:MLLMにおけるモダリティ-ユニバーサル安全ニューロンの発見とステアリング
- Authors: Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin. Xiaoyu Du, Jinhui Tang, Tat-Seng Chua,
- Abstract要約: 我々は、専用のニューロンレベルの介入戦略を採用する、モーダル間安全アライメントフレームワークであるSafeNexusを紹介する。
我々は、モダリティ結合型安全ニューロン(BS-Neurons)を同定し、各モダリティ内の安全行動の調節におけるそれらの役割を検証した。
我々は,アクティベーションレベル安全増幅器と安全ニューロン校正器の2つの安全アライメント戦略を提案する。
- 参考スコア(独自算出の注目度): 69.51621286001262
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although Large Language Models (LLMs) have demonstrated promising safety performance, extending them to Multimodal Large Language Models (MLLMs) exposes a significant gap between expanded multimodal capabilities and existing safety mechanisms. Current defenses remain predominantly confined to specific modal settings, thereby limiting their robustness against broader cross-modal threats. To bridge this gap, we introduce SafeNexus, a cross-modal safety alignment framework that adopts a dedicated neuron-level intervention strategy. First, we formulate a neuron localization paradigm that identifies functionally specialized neurons by characterizing intermediate-layer activation patterns and quantifying their functional salience through importance scoring. Building upon this paradigm, we exploit contrastive data to identify modality-bound safety neurons (BS-Neurons), and validate their role in regulating safety behavior within each modality via targeted suppression. Further cross-modal analysis defines modality-universal safety neurons (US-Neurons) as the shared subset of BS-Neurons identified across individual modalities, serving as the core for defending against harmful cross-modal attacks. We observe that suppressing these neurons substantially degrades safety performance across modalities, while leaving overall utility largely unaffected. Building on these insights, we propose two safety alignment strategies: activation-level safety amplifier and safety neuron calibrator. The proposed strategies enhance model safety through two distinct routes: the former amplifies the activation magnitudes of US-Neurons, while the latter selectively calibrates them via targeted fine-tuning. Extensive experiments demonstrate that our method outperforms prevailing state-of-the-art approaches on safety benchmarks spanning diverse modality combinations, while effectively preserving utility.
- Abstract(参考訳): LLM(Large Language Models)は、有望な安全性性能を示しているが、MLLM(Multimodal Large Language Models)に拡張することで、拡張されたマルチモーダル機能と既存の安全性メカニズムの間に大きなギャップが生じる。
現在の防衛は、主に特定のモーダル設定に限られており、より広いモーダル脅威に対するロバスト性を制限する。
このギャップを埋めるために、私たちは、専用のニューロンレベルの介入戦略を採用する、クロスモーダルな安全アライメントフレームワークであるSafeNexusを紹介します。
まず、中間層活性化パターンを特徴付けることによって機能特異的ニューロンを同定し、重要なスコアリングによって機能的サリエンスを定量化するニューロン局在化パラダイムを定式化する。
このパラダイムを基礎として,モダリティ結合型安全ニューロン(BS-Neurons)の同定と,標的抑制による各モダリティ内の安全行動の制御における役割を検証した。
さらにクロスモーダル分析では、モダリティ・ユニバーサル安全ニューロン(US-Neurons)を、個々のモダリティ間で識別されるBS-Neuronsの共有サブセットとして定義し、有害なクロスモーダル攻撃に対する防御のコアとして機能する。
これらのニューロンの抑制は、全体的な有用性がほとんど影響しないまま、モダリティ全体の安全性性能を著しく低下させる。
これらの知見に基づいて、アクティベーションレベル安全増幅器と安全ニューロン校正器の2つの安全アライメント戦略を提案する。
提案手法はモデル安全性を2つの異なる経路で強化する: 前者はUSニューロンの活性化度を増幅し、後者はターゲットの微調整によってそれらを選択的に校正する。
本手法は,多種多様なモダリティの組み合わせにまたがる安全性ベンチマークにおいて,実用性を効果的に保ちつつ,最先端の手法よりも優れていることを示す。
関連論文リスト
- One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs [63.29484454957031]
モーダリティと言語共有型安全ニューロン(MLS-Neurons)によって駆動されるニューロンレベルのクロス次元安全アライメントフレームワークを提案する。
提案手法は,多言語およびマルチモーダルの安全性ベンチマークにおいて,最先端のアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-07-30T09:30:03Z) - Precise Shield: Explaining and Aligning VLLM Safety via Neuron-Level Guidance [64.18179414483966]
実世界のデプロイメントでは、VLLM(Vision-Language Large Models)は、多言語およびマルチモーダル複合攻撃による重要な課題に直面している。
危険入力と良入力のアクティベーションパターンを対比することにより、まず安全ニューロンを識別する2段階のフレームワークであるPrecise Shieldを提案する。
この戦略は多言語および多モーダルの一般化を維持しながら安全性を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-10T02:42:52Z) - Robust Multimodal Safety via Conditional Decoding [52.92816441364308]
マルチモーダル大規模言語モデル(MLLM)は、有害なクエリが相互モーダル相互作用を悪用した場合、しばしば安全性の低下を経験する。
本稿では,MLLMの内部表現を利用して応答生成前の二項安全トークンを予測する,シンプルな条件付きデコード戦略であるCASAを提案する。
論文 参考訳(メタデータ) (2026-03-31T23:19:50Z) - SafeNeuron: Neuron-Level Safety Alignment for Large Language Models [71.50117566279185]
ネットワーク全体の安全表現を再分配することによって堅牢性を向上させる,ニューロンレベルの安全アライメントフレームワークであるSafeNeuronを提案する。
実験では、SafeNeuronは、ニューロンのプルーニング攻撃に対する堅牢性を大幅に改善し、レッドチームジェネレータとして再利用されるオープンソースモデルのリスクを低減し、一般的な機能を維持する。
論文 参考訳(メタデータ) (2026-02-12T16:40:05Z) - Who Transfers Safety? Identifying and Targeting Cross-Lingual Shared Safety Neurons [49.772147495578736]
言語間共有安全ニューロン(SS-Neurons)は、言語間の安全行動を制御する。
本稿では,言語資源分布とモデルアーキテクチャに基づいて,SS-Neuronsをターゲットにしたニューロン指向のトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-02-01T15:28:02Z) - NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs [19.133502330591092]
本稿では,スパースニューロンを動的に調整し,安全性と実用性を同時に最適化するフレームワークであるNeuronTuneを提案する。
提案手法は、まず、属性を介して全層にわたる安全クリティカルかつ実用的保存ニューロンを特定し、メタラーニングを用いて、安全ニューロンの活性化を適応的に増幅し、実用ニューロンの活性化を抑制する。
論文 参考訳(メタデータ) (2025-08-13T04:05:28Z) - Fine-Grained Safety Neurons with Training-Free Continual Projection to Reduce LLM Fine Tuning Risks [22.059668583508365]
本研究では,FGSN (Fen-Grained Safety Neurons) をトレーニング不要連続投射法で提案し,微調整安全性リスクの低減を図る。
FGSNは本質的に、安全層と神経細胞の間のマルチスケールの相互作用を統合し、スペーサーとより精密な安全ニューロンを局在させる。
論文 参考訳(メタデータ) (2025-08-08T03:20:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。