論文の概要: MESA: Improving MoE Safety Alignment via Decentralized Expertise
- arxiv url: http://arxiv.org/abs/2606.00651v1
- Date: Sat, 30 May 2026 09:54:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.574625
- Title: MESA: Improving MoE Safety Alignment via Decentralized Expertise
- Title(参考訳): MESA: 分散エキスパートによるMoEの安全性アライメントの改善
- Authors: Yitong Sun, Yao Huang, Teng Li, Ranjie Duan, Yichi Zhang, Xingjun Ma, Hui Xue, Xingxing Wei,
- Abstract要約: MESA(MoE Safety Alignment)は、MoEベースの大規模言語モデルを対象としたアライメントフレームワークである。
安全責任を戦略的に分散し、カバー範囲を最大化し、実用性への干渉を最小限にする。
MESAは様々な有害なベンチマークに対して堅牢な防御性能を達成し、有用性を維持する。
- 参考スコア(独自算出の注目度): 55.2978630005606
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Mixture-of-Experts (MoE) architectures scale Large Language Models (LLMs) efficiently, enabling greater capacity with reduced computational cost by dynamically routing inputs to relevant experts, yet introduce a critical vulnerability: Safety Sparsity, where safety capabilities concentrate in few experts, making them susceptible to adversarial bypassing. Meanwhile, conventional alignment methods uniformly adapt all parameters, ignoring their functional differences and inadvertently degrading performances. To address these challenges, we propose MESA (MoE Safety Alignment), a targeted alignment framework for MoE-based LLMs that strategically decentralizes safety responsibility to maximize coverage while minimizing interference with utility. Based on Optimal Transport (OT) theory, MESA operates through two mechanisms: (1) Expert Capacity Reallocation uses a transport cost matrix to distribute safety duties to the most cost-effective experts, and (2) Dynamic Routing Refinement constrains the router to precisely activate these decentralized modules. Experiments show that MESA achieves robust defensive performance against varied harmful benchmarks while preserving helpfulness. Code is available at https://github.com/lorraine021/MESA.
- Abstract(参考訳): Mixture-of-Experts (MoE)アーキテクチャは、大規模言語モデル(LLM)を効率よくスケールし、関連する専門家に入力を動的にルーティングすることで、計算コストの削減によるより大きなキャパシティを実現する。
一方、従来のアライメント手法は全てのパラメータを均一に適応させ、機能的差異を無視し、不注意に性能を劣化させる。
これらの課題に対処するため,我々は,実用性への干渉を最小限に抑えつつ,安全責任を戦略的に分散化してカバー範囲を最大化する,MoEベースのLCMを対象としたアライメントフレームワークであるMESA(MoE Safety Alignment)を提案する。
最適輸送(OT)理論に基づき、MESAは、(1)専門家容量再配置は、輸送コスト行列を用いて、最もコスト効率の良い専門家に安全義務を分配し、(2)動的ルーティングリファインメントは、ルータがこれらの分散モジュールを正確に活性化することを制約する。
実験により、MESAは様々な有害なベンチマークに対して堅牢な防御性能を達成し、有用性を保っていることが示された。
コードはhttps://github.com/lorraine021/MESAで入手できる。
関連論文リスト
- BarrierSteer: LLM Safety via Learning Barrier Steering [83.12893815611052]
BarrierSteerは、学習した非線形安全性制約を直接モデルの潜在表現空間に埋め込むことで、安全性を形式化する新しいフレームワークである。
BarrierSteerは、敵の成功率を大幅に低下させ、安全でない世代を減少させ、既存の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-02-23T18:19:46Z) - RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models [10.741523413040559]
ルーティング対応の専門家レベルのアライメントフレームワークであるRASAを提案する。
RASAは、ジェイルブレイクの成功によって不当にアクティベートされた専門家を特定し、固定されたルーティングの下でこれらの専門家だけを選択的に微調整する。
この結果から,グローバルなパラメータ更新よりも,目標とする専門家の修復により,ロバストなMoEの安全性が向上することが示唆された。
論文 参考訳(メタデータ) (2026-02-04T11:19:15Z) - UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models [67.91151588917396]
大規模言語モデル(LLM)は、幅広いタスクで顕著な進歩を遂げているが、有害なコンテンツ生成やジェイルブレイク攻撃といった安全リスクに弱いままである。
安全に配慮したリサイクルによるLCMの安全性向上のための統合フレームワークであるUpSafe$circ$Cを提案する。
この結果から, 静的アライメントから動的, モジュール, 推論対応制御への移行という, LLMの安全性の新たな方向性が明らかになった。
論文 参考訳(メタデータ) (2025-10-02T16:43:33Z) - MAD-PINN: A Decentralized Physics-Informed Machine Learning Framework for Safe and Optimal Multi-Agent Control [13.531665564516155]
大規模マルチエージェントシステムにおける安全性とパフォーマンスの最適化は、依然として根本的な課題である。
マルチエージェント状態制約最適制御問題を解くための分散機械学習フレームワークMAD-PINNを提案する。
マルチエージェントナビゲーションタスクの実験では、MAD-PINNは優れた安全性と性能のトレードオフを実現し、エージェントの数が増えるにつれてスケーラビリティを維持し、常に最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2025-09-28T16:31:22Z) - MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security [40.03830223238795]
大規模言語モデルのセキュリティが重要な懸念事項として浮上している。
MoGUフレームワークは隠れた状態を検知することで動的に重みを割り当てる。
MoGU_v2は様々なLLMに対して高い適応性と安定した改善を示す。
論文 参考訳(メタデータ) (2025-09-08T15:39:17Z) - CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation [23.07221882519171]
大規模言語モデル(LLM)は、エンボディード・インテリジェンス(Embodied Intelligence, EI)システムの認知的コアになりつつある。
我々は,概念強化工学(CEE)という,新規で効率的な推論時防衛フレームワークを提案する。
CEEはモデルの内部表現を直接操作することで、モデル固有の安全性メカニズムを強化する。
論文 参考訳(メタデータ) (2025-04-15T03:50:04Z) - Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design [59.00758127310582]
本稿では、事前学習された高密度LCMをより小さなMoEモデルに変換する新しいフレームワークRead-MEを提案する。
当社のアプローチでは,専門家の抽出にアクティベーション空間を用いる。
Read-MEは、同様のスケールの他の人気のあるオープンソース高密度モデルよりも優れています。
論文 参考訳(メタデータ) (2024-10-24T19:48:51Z) - Mixture of insighTful Experts (MoTE): The Synergy of Thought Chains and Expert Mixtures in Self-Alignment [103.05005690990271]
MoTE(Mixture of insightful Experts)は、推論チェーンとエキスパートミックスを組み合わせて自己調整を改善する新しいフレームワークである。
MoTEはモデルの安全性、脱獄耐性、過剰な拒否機能を大幅に改善し、OpenAIの最先端のo1モデルに匹敵するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-05-01T15:06:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。