論文の概要: Decided Upstream, Written Late: Locating and Pricing the Cross-Lingual Refusal Circuit of a Multilingual MoE
- arxiv url: http://arxiv.org/abs/2608.08032v1
- Date: Sat, 08 Aug 2026 09:39:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.61454
- Title: Decided Upstream, Written Late: Locating and Pricing the Cross-Lingual Refusal Circuit of a Multilingual MoE
- Title(参考訳): 多言語 MoE のクロスリンガル回路における位置決めと価格設定
- Authors: Ramakrishna P. Kompella, Aadit Mahajan,
- Abstract要約: 多言語モデルの安全性の整合性は不均一である。
英語で有害な要求を確実に拒否するモデルは、しばしば低リソース言語で同じ要求に従う。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety alignment in multilingual models is uneven: a model that reliably refuses a harmful request in English will often comply with the same request in a lower-resource language. We trace this gap mechanistically in sarvam, an Indic-multilingual mixture-of-experts reasoning model, and find it is not a failure to detect harm. Harm is encoded as an internal direction that is nearly language-invariant in mid-network (English-vs-Indic cosine ${\approx}0.9$ at $L11$), and steering that direction upstream causally controls refusal. But the detection direction is orthogonal to the change that actually writes the refusal, which is late and assembled over the course of generation rather than read off in a single forward pass. We attribute the write to a specific, localizable circuit, a mixture-of-experts writer held in check by an attention opposer and price every way of intervening on it: damping the opposer is cheap and effective, amplifying the writer is a cost wall, and surgical edits to the responsible heads do nothing. The circuit's organization, and the gradient method that exposes it, recur in a second, unrelated MoE model, while the lever's strength is architecture-specific. The result is a cost-measured map of where a multilingual safety repair can land, and what it costs
- Abstract(参考訳): 英語の有害な要求を確実に拒否するモデルは、低リソースの言語では、しばしば同じ要求に従う。
我々は、このギャップを、Indic-multilingual Mixed-of-experts reasoning modelであるsarvamで機械的に追跡し、害を検出できないことを発見した。
Harmは、内部の方向としてエンコードされており、中級ネットワーク(英語-vs-Indic cosine ${\approx}0.9$ at L11$)でほとんど言語不変である。
しかし、検出方向は、単一のフォワードパスで読み取るのではなく、世代毎に遅れて組み立てられたリファインダーを実際に書き込む変更と直交している。
我々は,本書を特定の局部化可能な回路に当てはめ,専門家の混成作家が注意相手にチェックされ,介入するあらゆる方法により価格が設定される: 反対者を弱めることは安価で効果的であり,ライターを増幅することはコストウォールであり,責任ある頭部に対する外科的編集は一切しない。
回路の組織とそれを公開する勾配法は、第2の無関係なMoEモデルで再帰するが、レバーの強度はアーキテクチャ固有のものである。
その結果,多言語型安全修復がどこに着地できるか,何に費用がかかるのか,といったコスト測定マップが得られた。
関連論文リスト
- Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety [0.0]
大規模な言語モデルにおける安全性の整合性は、言語間でも不安定である。
我々は18言語にまたがる多言語ジェイルブレイクベンチマークであるtextscMinioneseを紹介した。
各攻撃タイプは、異なる脆弱性プロファイルを生成する。
論文 参考訳(メタデータ) (2026-07-11T04:13:42Z) - Untrusted Authors, Trusted Answers: A Calculus of Fidelity-Graded Translations [0.0]
私たちは、翻訳をグラフとして研究します -- 多くの言語、いくつかの推論対象、そして、真に異なる信頼関係のルートを独立に構築しています。
1つの非対称性は信頼を組織する: 目撃者による答えは、ソースでリプレイすることで自己証明される。
2026年7月、コンストラクト毎のカバレッジ、ソースレベルの目撃者による2つのISAに対する二重ルートのブランチ合意、正式に認証されたチェッカーによって再検証された未承認性、ゲート自体のエスケープレート、などを測定するとともに、アーキテクチャが自身の作者の作業で捉えた欠陥を報告します。
論文 参考訳(メタデータ) (2026-07-10T14:41:38Z) - Localizing Anchoring Pathways in Language Models [8.023077215864255]
プロンプト内の無関係な数は言語モデルの判断をシフトさせ、数値推論においてアンカー効果を生み出す。
我々は,このアンカー感性信号が言語モデル内でどこに運ばれるかを,共有応答オプションを持つ制御された複数選択設定を用いて検討する。
エッジレベルの手法はノードレベルの手法よりも忠実にこの信号を回復する。
論文 参考訳(メタデータ) (2026-06-11T02:28:16Z) - Beyond Input Understanding: Diagnosing Multilingual Mathematical Reasoning with Directed Acyclic Trace Graphs [54.72295694649798]
大規模な推論モデル (LRM) は、英語で強力な数学的推論性能を達成するが、多くの低級言語や中級言語では信頼性が低い。
モデルの推論言語を制御することは、精度を大幅に低下させることを示し、言語が推論実行自体に影響を及ぼすことを示唆する。
12言語にわたるQwen3シリーズの実験では、英語以外の推論ではアンカーカバレッジが減少し、依存関係の忠実度が低下することが多い。
論文 参考訳(メタデータ) (2026-05-26T21:41:52Z) - Why Do Safety Guardrails Degrade Across Languages? [21.521293656854183]
大規模な言語モデルは、英語以外の言語で安全性の低下を示す。
我々は、安全運転要因を分離する潜在変数モデル、多群項目応答理論(IRT)フレームワークを導入する。
5つの閉モデルファミリーと10の言語にまたがる61のモデル構成の安全性のロバスト性を評価する。
論文 参考訳(メタデータ) (2026-05-16T22:08:54Z) - Refusal Direction is Universal Across Safety-Aligned Languages [66.64709923081745]
本稿では,PolyRefuseを用いた14言語にわたる大規模言語モデル(LLM)の拒絶動作について検討する。
英語から抽出されたベクトルは、ほぼ完全な効果で他の言語での拒絶を回避できる。
この伝達性は、埋め込み空間における言語間の拒否ベクトルの並列性に起因し、言語間ジェイルブレイクの背後にあるメカニズムを同定する。
論文 参考訳(メタデータ) (2025-05-22T21:54:46Z) - Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions [50.40122190627256]
非倫理的反応を引き起こすために、対照的な推論を利用する新しいジェイルブレイク手法であるPOATEを導入する。
PoATEは意味論的に意図に反し、敵のテンプレートと統合し、有害なアウトプットを驚くほど微妙に操る。
これに対応するために、悪意のある意図と理性を検出するためにクエリを分解して、有害な応答を評価し、拒否するIntent-Aware CoTとReverse Thinking CoTを提案する。
論文 参考訳(メタデータ) (2025-01-03T15:40:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。