論文の概要: Language Shapes Instruction Hierarchy Compliance in Multilingual LLMs
- arxiv url: http://arxiv.org/abs/2607.23545v1
- Date: Sun, 26 Jul 2026 08:50:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.14634
- Title: Language Shapes Instruction Hierarchy Compliance in Multilingual LLMs
- Title(参考訳): 多言語LLMにおける言語形状指示階層コンプライアンス
- Abstract要約: 命令階層(IH)は、より優先度の高い命令が優先度の低い命令をオーバーライドすることを保証するために、ソースごとに命令を優先順位付けするモデルを必要とする。
既存の評価は英語のみに重点を置いており、多言語環境でのIHコンプライアンスが安定しているかどうかは不明だ。
XIH-Benchは、6つの言語、4つのドメイン、および3つのIH設定にまたがる同言語および言語間の競合を比較検討し、多言語IH評価のためのベンチマークである。
- 参考スコア(独自算出の注目度): 20.52924218496419
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Instruction hierarchy (IH) requires models to prioritize instructions by source, ensuring that higher-priority instructions override lower-priority ones. Despite its importance for safe and controllable deployment, existing evaluations have focused almost exclusively on English, leaving it unclear whether IH compliance remains stable in multilingual settings. We introduce XIH-Bench, a benchmark for multilingual IH evaluation with both same-language and cross-language conflicts across six languages, four domains, and three IH settings. Across models, we find two consistent patterns. First, IH compliance exhibits a clear language-dependent asymmetry: a language that strengthens compliance in the higher-priority position can become disruptive in the lower-priority position. Second, cross-language conflicts yield higher compliance than same-language conflicts, a phenomenon we term the Language Boundary Effect. We further show that language specialization can make lower-priority instructions in model-favored languages harder to override, creating multilingual reliability and security risks.
- Abstract(参考訳): 命令階層(IH)は、より優先度の高い命令が優先度の低い命令をオーバーライドすることを保証するために、ソースごとに命令を優先順位付けするモデルを必要とする。
安全で制御可能なデプロイメントの重要性にもかかわらず、既存の評価は英語のみに重点を置いており、多言語環境でのIHコンプライアンスが安定しているかどうかは不明だ。
XIH-Benchは、6つの言語、4つのドメイン、および3つのIH設定にまたがる同言語および言語間の競合を比較検討し、多言語IH評価のためのベンチマークである。
モデル全体で、2つの一貫したパターンを見つけます。
第一に、IHコンプライアンスは明確な言語依存の非対称性を示す: 上位のプライオリティ位置におけるコンプライアンスを強化する言語は、下位のプライオリティ位置において破壊的になる。
第2に、言語間の紛争は、言語境界効果(Language boundary effect)と呼ばれる同言語紛争よりも高いコンプライアンスをもたらす。
さらに,言語スペシャライゼーションにより,多言語的信頼性とセキュリティリスクを生じるモデル指向言語では,低優先度の命令をオーバーライドしにくくすることができることを示す。
関連論文リスト
- LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance [77.58408743830314]
強化学習は大規模言語モデルにおける多段階推論の強化に有効であることが証明されている。
しかし、その利点は多言語文脈に完全には翻訳されていない。
我々は、言語条件付きヒントを利用して、英語以外の推論タスクの探索をガイドする新しいフレームワークを開発する。
論文 参考訳(メタデータ) (2026-05-21T14:47:52Z) - Multilingual Refusal Alignment for Safer Large Language Models [53.64286756804503]
単言語アライメントが言語横断的に伝達されるか,トレーニング中に言語一貫性が保たれるか,一般的な知識能力とのトレードオフが生じるかを検討する。
RefusEUは、12のヨーロッパ言語をカバーする新しい拒絶アライメントデータセットであり、現在の最先端モデルを評価するための専用のテストセットを含む。
制御された直接選好最適化(DPO)実験は、2つの重要な洞察を提供する: 英語でのみモデルを整列することは、同じハーネスカテゴリであっても、言語間安全を保証するには不十分である。
論文 参考訳(メタデータ) (2026-04-24T09:29:14Z) - Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment [15.241143079313757]
既存のモノリンガルアライメントパイプラインに組み込むことができるMLC(Multi-Lingual Consistency)ロスをプラグアンドプレイで導入する。
これにより、低リソース言語でのセマンティックレスポンスレベルの監視を必要とせずに、多言語プロンプト変種のみを使用して、複数の言語を同時にアライメントすることができる。
論文 参考訳(メタデータ) (2026-02-18T18:01:23Z) - When Meanings Meet: Investigating the Emergence and Quality of Shared Concept Spaces during Multilingual Language Model Training [57.230355403478995]
本研究では,EuroLLMの事前学習における言語に依存しない概念空間の開発について検討する。
共有概念空間は早期に出現し、洗練され続けていますが、それらとの整合性は言語に依存しています。
従来の作業とは対照的に、細かな手作業分析により、翻訳品質の顕著な向上は、行動の変化を反映していることが判明した。
論文 参考訳(メタデータ) (2026-01-30T11:23:01Z) - Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation [49.2073409243885]
大規模言語モデル(LLM)は、英語の対物生成に優れ、多言語習熟度を示す。
対象言語における直接生成された反事実と6言語間の英訳によって導出されるものの両方について自動評価を行う。
言語間で生成した偽物に一貫して現れる4つの主要なエラーを識別し分類する。
論文 参考訳(メタデータ) (2026-01-01T08:53:49Z) - MPO: Multilingual Safety Alignment via Reward Gap Optimization [88.76638442683391]
大規模言語モデル(LLM)は、世界中でAIアプリケーションの中心となっている。
RLHFやDPOのような既存の安全アライメントのための選好学習手法は、主に単言語であり、ノイズの多い多言語データと競合する。
本稿では,複数言語間の安全アライメントを改善するために,支配言語(英語)の安全能力の整合性を活用した新しいアプローチである多言語報酬gaP Optimization(MPO)を紹介する。
論文 参考訳(メタデータ) (2025-05-22T16:24:51Z) - The Hidden Space of Safety: Understanding Preference-Tuned LLMs in Multilingual context [0.9130277390156759]
アライメントチューニングにより、大きな言語モデルは、推論、命令追従、有害な世代を最小化できる。
広く展開されているにもかかわらず、これらのモデルはモノリンガルバイアスを示し、言語間のアライメントの有効性に関する懸念を提起する。
現在のアライメント手法は主に英語に重点を置いており、アライメント機構が多言語設定にどのように一般化するかははっきりしない。
論文 参考訳(メタデータ) (2025-04-03T15:46:46Z) - AdaMCoT: Rethinking Cross-Lingual Factual Reasoning through Adaptive Multilingual Chain-of-Thought [40.16140566668239]
AdaMCOTは多言語の事実推論を強化するフレームワークである。
AdaMCOTは、ターゲット言語応答を生成する前に、中間言語における思考プロセスを動的にルーティングする。
本評価は, 事実推論品質と言語間整合性の両方において, 大幅な改善を示すものである。
論文 参考訳(メタデータ) (2025-01-27T15:48:57Z) - Analyzing the Mono- and Cross-Lingual Pretraining Dynamics of
Multilingual Language Models [73.11488464916668]
本研究では,多言語事前学習プロセスのダイナミクスについて検討する。
我々は,XLM-Rプレトレーニング全体から抽出したチェックポイントを,一連の言語的タスクを用いて探索する。
分析の結果,より複雑なものよりも低レベルな言語スキルが得られ,早期に高い言語性能が得られることがわかった。
論文 参考訳(メタデータ) (2022-05-24T03:35:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。