論文の概要: Latent Mechanisms of Language Control in Multilingual Language Models
- arxiv url: http://arxiv.org/abs/2609.00325v1
- Date: Mon, 31 Aug 2026 20:21:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.063931
- Title: Latent Mechanisms of Language Control in Multilingual Language Models
- Title(参考訳): 多言語言語モデルにおける言語制御の潜在メカニズム
- Abstract要約: 本稿では,多層トランスコーダにおける言語制御ラテントを識別する3つの手法の比較研究を行う。
生成言語を効果的に操作する3つの手法がすべて,FreqSelが全体的なパフォーマンスで最強を達成していることがわかった。
ノックアウト分析は、メソッドが重複しないが各機能的な潜在サブセットを選択し、単一の標準言語方向ではなく冗長性を示すことを示唆している。
- 参考スコア(独自算出の注目度): 2.24159028524593
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multilingual large language models can exhibit unintended code-switching -- unnecessarily alternating between languages during generation. We present a comparative study of three methods that identify language-controlling latents in cross-layer transcoders: activation value-based selection (ValSel), activation frequency-based selection (FreqSel), and LLM-generated latent annotation-based selection (AnnSel). To evaluate the efficacy of these methods in identifying language-controlling latents, we introduce two multilingual benchmarks that exhibit code-switching for fine-grained analysis of language steering across seven languages. Through targeted intervention experiments on Gemma-2-2B and Qwen3-4B, we find that all three methods effectively manipulate generation language, with FreqSel achieving the strongest overall performance, while AnnSel offering interpretable latent selection through explicit language annotations. A knock-out analysis suggests the methods select non-overlapping but each-functional latent subsets, indicating redundancy rather than a single canonical language direction. Code and data can be found at https://github.com/rm-3284/Latent-Mechanism-Multilingual.
- Abstract(参考訳): 多言語の大きな言語モデルは、世代間の言語間を不必要に交互に、意図しないコードスイッチングを示すことができる。
本稿では,アクティベーション値ベース選択(ValSel),アクティベーション周波数ベース選択(FreqSel),LCM生成ラテントアノテーションベース選択(AnnSel)の3つの手法を比較した。
言語制御潜伏語同定におけるこれらの手法の有効性を評価するために,7言語にわたる言語ステアリングの微粒化解析のためのコードスイッチングを示す2つの多言語ベンチマークを導入する。
Gemma-2-2B と Qwen3-4B を対象とする介入実験により,FreqSel が最強の全体的な性能を達成し,AnnSel が明示的な言語アノテーションによる解釈可能な潜時選択を提供するのに対し,これら3つの手法が生成言語を効果的に操作できることが判明した。
ノックアウト分析は、メソッドが重複しないが各機能的な潜在サブセットを選択し、単一の標準言語方向ではなく冗長性を示すことを示唆している。
コードとデータはhttps://github.com/rm-3284/Latent-Mechanism-Multilingualで見ることができる。
関連論文リスト
- Disentangled Contrastive Learning for Zero-Shot Multilingual Dense Retrieval [18.12664959335536]
本稿では,多言語高密度検索のための非交叉型コントラスト学習(DCL)手法を提案する。
具体的には、階層的セマンティックアライメントとコントラスト学習の言語不偏に基づく、非絡み合った最適化目標を設計する。
提案手法は、その有効性と一般化能力を示すとともに、いくつかの強いベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-08-03T13:13:15Z) - LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering [6.007532648369572]
LangFIRは,少量のモノリンガルデータとランダムなシーケンスのみを用いて,言語固有のSAE特徴を検出する手法である。
これらの特徴は, 対象言語に対して高度に選択的であり, 因果的に重要であり, 指向性アブレーションは, 対応する言語に対してのみ, 相互エントロピー損失を増大させる。
論文 参考訳(メタデータ) (2026-04-04T00:56:13Z) - LangGPS: Language Separability Guided Data Pre-Selection for Joint Multilingual Instruction Tuning [49.22807995935406]
大規模言語モデル(LLM)の多言語命令追従能力と下流性能を改善するための多言語命令チューニングは広く採用されている手法である。
既存の選択法は、しばしばテキストの品質、多様性、タスク関連性といった特徴に基づいており、典型的には多言語データの固有の言語構造を見落としている。
言語分離性によって導かれる軽量な2段階事前選択フレームワークであるLangGPSを提案する。
論文 参考訳(メタデータ) (2025-11-13T12:02:32Z) - Evaluating Multilingual and Code-Switched Alignment in LLMs via Synthetic Natural Language Inference [2.172419551358714]
大規模言語モデル(LLM)は多言語的文脈においてますます適用されているが、言語間で一貫した論理的に根ざしたアライメントの能力は未定である。
本稿では、論理に基づく前提-仮説ペアを生成する多言語自然言語推論のフレームワークを提案し、それらを類型的に多様な言語に翻訳する。
コードスイッチングは劣化せず、性能も向上し、翻訳によって引き起こされる語彙の変化が正規化信号として機能することを示唆している。
論文 参考訳(メタデータ) (2025-08-20T14:30:34Z) - Balanced Multi-Factor In-Context Learning for Multilingual Large Language Models [53.38288894305388]
MLLM(Multilingual Large Language Model)は,言語間知識伝達をパラメータ更新なしで活用することにより,文脈内学習(ICL)を活用して高い性能を実現する。
1) 意味的類似性,(2) 言語的アライメント,(3) 言語固有のパフォーマンスの3つの要因が多言語ICLに影響を与える。
我々は,これらの因子を定量化し,最適にバランスをとる手法として,バランスの取れた多要素ICL(textbfBMF-ICL)を提案する。
論文 参考訳(メタデータ) (2025-02-17T06:56:33Z) - Soft Language Clustering for Multilingual Model Pre-training [57.18058739931463]
本稿では,インスタンスを条件付きで符号化するためのフレキシブルガイダンスとして,コンテキスト的にプロンプトを検索するXLM-Pを提案する。
我々のXLM-Pは、(1)言語間における言語不変および言語固有知識の軽量なモデリングを可能にし、(2)他の多言語事前学習手法との容易な統合を可能にする。
論文 参考訳(メタデータ) (2023-06-13T08:08:08Z) - Are Multilingual Models Effective in Code-Switching? [57.78477547424949]
多言語モデルの有効性を検討し,複合言語設定の能力と適応性について検討する。
この結果から,事前学習した多言語モデルでは,コードスイッチングにおける高品質な表現が必ずしも保証されないことが示唆された。
論文 参考訳(メタデータ) (2021-03-24T16:20:02Z) - FILTER: An Enhanced Fusion Method for Cross-lingual Language
Understanding [85.29270319872597]
我々は,XLMファインタニングの入力として言語間データを利用する拡張融合法を提案する。
推論中は、ターゲット言語で入力されたテキストとソース言語の翻訳に基づいて予測を行う。
この問題に対処するため,対象言語における翻訳テキストのための自動生成ソフト擬似ラベルに基づくモデル学習のためのKL分割自己学習損失を提案する。
論文 参考訳(メタデータ) (2020-09-10T22:42:15Z) - Inducing Language-Agnostic Multilingual Representations [61.97381112847459]
言語間の表現は、世界中のほとんどの言語でNLP技術が利用可能になる可能性がある。
i) 対象言語のベクトル空間をピボットソース言語に再配置すること、(ii) 言語固有の手段と分散を取り除くこと、(ii) 副産物としての埋め込みの識別性を向上すること、(iii) 形態的制約や文の並べ替えを除去することによって言語間の入力類似性を高めること、の3つのアプローチを検討する。
論文 参考訳(メタデータ) (2020-08-20T17:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。