論文の概要: Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways
- arxiv url: http://arxiv.org/abs/2608.09095v1
- Date: Mon, 10 Aug 2026 03:48:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.073713
- Title: Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways
- Title(参考訳): 安全を橋渡しする人
- Authors: Shuyi Miao, Wangjie Qiu, Pengyang Shao, Canran Xiao, Fei Shen, Zhiming Zheng, Tat-Seng Chua,
- Abstract要約: 安全信号伝搬中に形成される多層機能経路を同定し,標的とする。
言語間共有安全経路に基づく経路目標アライメント手法を提案する。
実験結果から,NHR言語の安全性が著しく向上することが示唆された。
- 参考スコア(独自算出の注目度): 44.23839982612062
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Uncovering the internal mechanisms underlying the safety capabilities of large language models (LLMs) is crucial for developing trustworthy artificial intelligence. Currently, mechanistic interpretability studies on multilingual safety are largely confined to local components, such as isolated neurons. However, this static and fragmented perspective overlooks the synergy among components and fails to elucidate how safety signals dynamically propagate within the model to drive safety decisions ultimately. In this work, we move beyond isolated neurons to identify and target the cross-layer functional pathways formed during safety signal propagation, thereby uncovering the mechanisms driving the cross-lingual safety gap. Specifically, we first identify monolingual safety pathways and validate their impact on refusing harmful requests. Subsequent cross-lingual analyses reveal a sparse subset of cross-lingual shared safety pathways, confirming that this intersection acts as the internal bridge transferring safety capabilities from high-resource (HR) languages to non-high-resource (NHR) languages. Building on these mechanistic findings, we propose a pathways-targeted alignment method based on the cross-lingual shared safety pathways. Experimental results show that updating only a small fraction of pathway parameters significantly improves safety in NHR languages while largely preserving the model's general capabilities.
- Abstract(参考訳): 大規模言語モデル(LLM)の安全性機能を支える内部メカニズムを明らかにすることは、信頼できる人工知能を開発する上で不可欠である。
現在、多言語安全性に関する機械論的解釈可能性の研究は、主に孤立ニューロンのような局所的な構成要素に限られている。
しかし、この静的で断片化された視点は、コンポーネント間の相乗効果を見落とし、安全信号がモデル内でどのように動的に伝播し、最終的に安全決定を下すかを解明することができない。
本研究は、単離されたニューロンを超えて、安全信号伝達中に形成される層間機能経路を特定し、標的にすることで、言語間安全ギャップを駆動するメカニズムを明らかにする。
具体的には、まずモノリンガルの安全経路を特定し、有害な要求を拒絶する影響を検証する。
その後の言語横断解析により、多言語共用安全経路のスパースサブセットが明らかとなり、この交差点が高リソース(HR)言語から非高リソース(NHR)言語への安全機能を伝達する内部橋として機能することが確認された。
これらの力学的な知見に基づいて,言語間共有安全経路に基づく経路目標アライメント手法を提案する。
実験結果から,ごく少数の経路パラメータのみを更新するだけで,NHR言語の安全性が向上し,モデルの汎用性はほぼ保たれることがわかった。
関連論文リスト
- One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs [63.29484454957031]
モーダリティと言語共有型安全ニューロン(MLS-Neurons)によって駆動されるニューロンレベルのクロス次元安全アライメントフレームワークを提案する。
提案手法は,多言語およびマルチモーダルの安全性ベンチマークにおいて,最先端のアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-07-30T09:30:03Z) - Safety Targeted Embedding Exploit via Refinement [1.384477926572109]
本研究は、英語を主とする安全機構が多言語入力にまたがる一般化を想定できないことを示す。
STEERは、単語を低リソース言語に翻訳し、有害な意図を保ちながら拒絶を抑制する、勾配誘導攻撃である。
マルチリンガル安全性の向上にはアライメントとアウト・オブ・ディストリビューション・インプットを明示的に検出・棄却するメカニズムの広範な適用が必要であると論じる。
論文 参考訳(メタデータ) (2026-07-02T08:17:57Z) - Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation [52.122731171289665]
クロスモデル安全ステアリングのための最初のフレームワークを紹介する。
私たちのパイプラインは、ターゲット側の安全でないデータにアクセスしません。
多様なソース・ターゲット・モデル・ペア間のテキスト・ツー・イメージとテキスト・ツー・ビデオ生成におけるアプローチを評価する。
論文 参考訳(メタデータ) (2026-06-03T18:00:04Z) - Precise Shield: Explaining and Aligning VLLM Safety via Neuron-Level Guidance [64.18179414483966]
実世界のデプロイメントでは、VLLM(Vision-Language Large Models)は、多言語およびマルチモーダル複合攻撃による重要な課題に直面している。
危険入力と良入力のアクティベーションパターンを対比することにより、まず安全ニューロンを識別する2段階のフレームワークであるPrecise Shieldを提案する。
この戦略は多言語および多モーダルの一般化を維持しながら安全性を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-10T02:42:52Z) - Who Transfers Safety? Identifying and Targeting Cross-Lingual Shared Safety Neurons [49.772147495578736]
言語間共有安全ニューロン(SS-Neurons)は、言語間の安全行動を制御する。
本稿では,言語資源分布とモデルアーキテクチャに基づいて,SS-Neuronsをターゲットにしたニューロン指向のトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-02-01T15:28:02Z) - Safe-SAIL: Towards a Fine-grained Safety Landscape of Large Language Models via Sparse Autoencoder Interpretation Framework [31.278770676774325]
大規模言語モデル(LLM)内でのSAE機能を解釈するフレームワークであるSafe-SAILを提案する。
提案手法は,SAEを最も優れた概念特異的解釈可能性で体系的に識別し,安全性関連ニューロンを説明し,解釈プロセスをスケールアップするための効率的な戦略を導入する。
論文 参考訳(メタデータ) (2025-09-11T11:22:43Z) - Refusal Direction is Universal Across Safety-Aligned Languages [66.64709923081745]
本稿では,PolyRefuseを用いた14言語にわたる大規模言語モデル(LLM)の拒絶動作について検討する。
英語から抽出されたベクトルは、ほぼ完全な効果で他の言語での拒絶を回避できる。
この伝達性は、埋め込み空間における言語間の拒否ベクトルの並列性に起因し、言語間ジェイルブレイクの背後にあるメカニズムを同定する。
論文 参考訳(メタデータ) (2025-05-22T21:54:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。