論文の概要: Learning to Route Languages for Multilingual Policy Optimization
- arxiv url: http://arxiv.org/abs/2605.25360v1
- Date: Mon, 25 May 2026 02:28:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:19.253827
- Title: Learning to Route Languages for Multilingual Policy Optimization
- Title(参考訳): 多言語政策最適化のための経路言語学習
- Authors: Geyang Guo, Hiromi Wakaki, Yuki Mitsufuji, Alan Ritter, Wei Xu,
- Abstract要約: 大規模言語モデルは異種多言語コーパスで訓練される。
本稿では,言語を選択可能な変数として扱うオンラインポリシー最適化フレームワークLRPOを提案する。
- 参考スコア(独自算出の注目度): 50.044784120224335
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models~(LLMs) are trained on heterogeneous multilingual corpora, yet existing policy optimization methods often implicitly restrict each training question to a single response language or rely on a fixed dominant language for supervision. We propose language-routed policy optimization (LRPO), an online policy optimization framework that treats language as a selectable variable. LRPO elicits multilingual rollouts for each training question and integrates their relative quality into preference-based policy updates, increasing the diversity and informativeness of training signals under the fixed rollout budget. To adaptively determine which languages to explore during reinforcement learning, we introduce a trainable language router formulated as a multi-armed bandit, balancing exploration of underutilized languages with exploitation of more informative ones. Extensive experiments show that LRPO consistently improves multilingual performance, demonstrating that adaptive language routing enables effective cross-lingual knowledge exploitation for training. We release all the resources at https://github.com/Guochry/LRPO.
- Abstract(参考訳): 大規模な言語モデル~(LLM)は、異種多言語コーパスで訓練されるが、既存のポリシー最適化手法では、各トレーニングの問題を暗黙的に単一の応答言語に制限したり、固定支配言語に依存して監督を行うことが多い。
本稿では,言語を選択可能な変数として扱うオンラインポリシー最適化フレームワークLRPOを提案する。
LRPOは、各トレーニング質問に対して多言語ロールアウトを導入し、相対的な品質を嗜好ベースのポリシー更新に統合し、固定されたロールアウト予算の下でのトレーニング信号の多様性と情報性を高める。
強化学習中にどの言語を探索すべきかを適応的に決定するために,マルチアームバンディットとして定式化された訓練可能な言語ルータを導入する。
広範な実験によりLRPOは多言語性能を一貫して改善し、適応型言語ルーティングがトレーニングに有効な言語間知識の活用を可能にすることを示した。
私たちはすべてのリソースをhttps://github.com/Guochry/LRPOでリリースします。
関連論文リスト
- Optimizing Language Models for Crosslingual Knowledge Consistency [90.86445137816942]
大規模な言語モデルは、しばしば一貫性のない知識を示すことが知られている。
これは、モデルが異なる言語で同様の質問をすることが多い、多言語シナリオにおいて特に問題となる。
本研究では,この問題を構造化報酬関数を用いた強化学習を用いて緩和することができることを示す。
論文 参考訳(メタデータ) (2026-03-04T23:36:55Z) - Align Once, Benefit Multilingually: Enforcing Multilingual Consistency for LLM Safety Alignment [15.241143079313757]
既存のモノリンガルアライメントパイプラインに組み込むことができるMLC(Multi-Lingual Consistency)ロスをプラグアンドプレイで導入する。
これにより、低リソース言語でのセマンティックレスポンスレベルの監視を必要とせずに、多言語プロンプト変種のみを使用して、複数の言語を同時にアライメントすることができる。
論文 参考訳(メタデータ) (2026-02-18T18:01:23Z) - Language-Coupled Reinforcement Learning for Multilingual Retrieval-Augmented Generation [73.54930910609328]
多言語検索強化学習フレームワークLcRLを提案する。
LcRLは言語に結合したグループ相対ポリシー最適化をポリシーと報酬モデルに統合する。
我々は,言語結合型グループサンプリングをロールアウトモジュールに導入し,知識バイアスを低減し,報酬モデルにおける補助的反一貫性のペナルティを正規化し,知識衝突を軽減する。
論文 参考訳(メタデータ) (2026-01-21T11:32:32Z) - AdaMCoT: Rethinking Cross-Lingual Factual Reasoning through Adaptive Multilingual Chain-of-Thought [40.16140566668239]
AdaMCOTは多言語の事実推論を強化するフレームワークである。
AdaMCOTは、ターゲット言語応答を生成する前に、中間言語における思考プロセスを動的にルーティングする。
本評価は, 事実推論品質と言語間整合性の両方において, 大幅な改善を示すものである。
論文 参考訳(メタデータ) (2025-01-27T15:48:57Z) - No Train but Gain: Language Arithmetic for training-free Language Adapters enhancement [59.37775534633868]
本稿では,学習不要な後処理が可能な言語演算法を提案する。
提案手法の有効性を,MAD-Xに基づく言語間スキームの3つの下流課題に適用した。
論文 参考訳(メタデータ) (2024-04-24T08:52:40Z) - Soft Language Clustering for Multilingual Model Pre-training [57.18058739931463]
本稿では,インスタンスを条件付きで符号化するためのフレキシブルガイダンスとして,コンテキスト的にプロンプトを検索するXLM-Pを提案する。
我々のXLM-Pは、(1)言語間における言語不変および言語固有知識の軽量なモデリングを可能にし、(2)他の多言語事前学習手法との容易な統合を可能にする。
論文 参考訳(メタデータ) (2023-06-13T08:08:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。