論文の概要: Strengthening Target-Language Features: SAE-Based Steering for Multilingual Inference
- arxiv url: http://arxiv.org/abs/2608.04904v1
- Date: Wed, 05 Aug 2026 14:32:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.960778
- Title: Strengthening Target-Language Features: SAE-Based Steering for Multilingual Inference
- Title(参考訳): 目標言語的特徴の強化:多言語推論のためのSAEベースのステアリング
- Authors: Hongsheng Wang, Phlipp Koehn,
- Abstract要約: 本稿では,事前訓練されたスパースオートエンコーダを用いて,ターゲット言語に関連する特徴を特定し,強化する推論時多言語ステアリング手法を提案する。
Gemma-3-12B-itを用いた実験では、XCOPAでは10.9ポイント、XNLIでは5.3ポイント、MGSMでは1.9ポイントの平均精度が向上した。
- 参考スコア(独自算出の注目度): 0.4125187280299247
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multilingual large language models exhibit substantial performance differences across languages, while existing adaptation methods often require parameter updates and considerable multilingual training data. We propose an inference-time multilingual steering method that uses pretrained sparse autoencoders to identify and strengthen target-language-related features. Using multilingual parallel sentences, we compare SAE activations across languages and select a small number of layer-specific features associated with each target language. These features are decoded into steering signals and injected into the model's hidden states without additional training. Experiments with Gemma-3-12B-it show average accuracy improvements of 10.9 percentage points on XCOPA, 5.3 points on XNLI, and 1.9 points on MGSM.
- Abstract(参考訳): 多言語大言語モデルは言語間で大きな性能差を示すが、既存の適応法ではパラメータ更新や多言語訓練データを必要とすることが多い。
本稿では,事前訓練されたスパースオートエンコーダを用いて,ターゲット言語に関連する特徴を特定し,強化する推論時多言語ステアリング手法を提案する。
多言語並列文を用いて、言語間でのSAEアクティベーションを比較し、ターゲット言語に関連付けられた少数の層固有の特徴を選択する。
これらの機能はステアリング信号にデコードされ、追加のトレーニングなしでモデルの隠れた状態に注入される。
Gemma-3-12B-itを用いた実験では、XCOPAでは10.9ポイント、XNLIでは5.3ポイント、MGSMでは1.9ポイントの平均精度が向上した。
関連論文リスト
- Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection [16.857692737043198]
マルチリンガルデータ上でのSAEのトレーニングは、一貫して言語間表現を強化していることを示す。
我々は,多言語アライメントと言語分離性の交差に基づく,強調優先階層選択ルールを導入する。
その結果,多言語SAEと交叉選択層を組み合わせることで,言語識別精度と生成品質のトレードオフを安定化できることがわかった。
論文 参考訳(メタデータ) (2026-05-21T21:00:32Z) - LangGPS: Language Separability Guided Data Pre-Selection for Joint Multilingual Instruction Tuning [49.22807995935406]
大規模言語モデル(LLM)の多言語命令追従能力と下流性能を改善するための多言語命令チューニングは広く採用されている手法である。
既存の選択法は、しばしばテキストの品質、多様性、タスク関連性といった特徴に基づいており、典型的には多言語データの固有の言語構造を見落としている。
言語分離性によって導かれる軽量な2段階事前選択フレームワークであるLangGPSを提案する。
論文 参考訳(メタデータ) (2025-11-13T12:02:32Z) - Causal Language Control in Multilingual Transformers via Sparse Feature Steering [7.754609745940422]
マルチ言語モデルの生成言語を操るために,スパースオートエンコーダの機能を活用できるかどうかを検討する。
我々は、FastText言語分類によって測定された、最大90%の成功で制御された言語シフトを達成する。
解析の結果,言語ステアリングは中間から後期のトランスフォーマー層において最も効果的であることが判明した。
論文 参考訳(メタデータ) (2025-07-17T06:49:16Z) - Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling [50.62091603179394]
最も先進的なASRモデルの1つであるWhisperは99の言語を効果的に扱う。
しかし、ウィスパーは未確認の言語と戦っているが、それらは事前訓練には含まれていない。
本研究では,これらの関係を利用して未知言語上でのASR性能を向上させる手法を提案する。
論文 参考訳(メタデータ) (2024-12-21T04:05:43Z) - Adapting the adapters for code-switching in multilingual ASR [10.316724084739892]
訓練済みの大規模多言語音声モデルは、多くの低リソース言語に自動音声認識を拡張できる可能性を示している。
これらのモデルのいくつかは、言語アダプタを定式化に用い、モノリンガルのパフォーマンスを改善するのに役立つ。
この定式化は、2つの言語が同じ発話で混在するコードスイッチト音声におけるこれらのモデルのユーザビリティを制限する。
提案手法は,ネットワーク内の各言語適応点において,両言語アダプタからの情報を同調することにより,コード切替音声上でそのようなモデルを効果的に微調整する方法である。
論文 参考訳(メタデータ) (2023-10-11T12:15:24Z) - Soft Language Clustering for Multilingual Model Pre-training [57.18058739931463]
本稿では,インスタンスを条件付きで符号化するためのフレキシブルガイダンスとして,コンテキスト的にプロンプトを検索するXLM-Pを提案する。
我々のXLM-Pは、(1)言語間における言語不変および言語固有知識の軽量なモデリングを可能にし、(2)他の多言語事前学習手法との容易な統合を可能にする。
論文 参考訳(メタデータ) (2023-06-13T08:08:08Z) - xGQA: Cross-Lingual Visual Question Answering [100.35229218735938]
xGQAは視覚的質問応答タスクのための新しい多言語評価ベンチマークである。
確立された英語GQAデータセットを7言語に拡張する。
本稿では,マルチモーダルトランスフォーマーモデルに適応するアダプタベースの新しいアプローチを提案する。
論文 参考訳(メタデータ) (2021-09-13T15:58:21Z) - Are Multilingual Models Effective in Code-Switching? [57.78477547424949]
多言語モデルの有効性を検討し,複合言語設定の能力と適応性について検討する。
この結果から,事前学習した多言語モデルでは,コードスイッチングにおける高品質な表現が必ずしも保証されないことが示唆された。
論文 参考訳(メタデータ) (2021-03-24T16:20:02Z) - Learning to Scale Multilingual Representations for Vision-Language Tasks [51.27839182889422]
SMALRの有効性は、これまでビジョン言語タスクでサポートされた2倍以上の10の多言語で実証されている。
単語の埋め込み手法と比較して,訓練パラメータの1/5以下で,複数言語による画像文検索と先行作業の3~4%の性能評価を行った。
論文 参考訳(メタデータ) (2020-04-09T01:03:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。