論文の概要: GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings
- arxiv url: http://arxiv.org/abs/2608.13698v1
- Date: Thu, 13 Aug 2026 18:43:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.189717
- Title: GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings
- Title(参考訳): GRPO over English: A Large-Scale Study of GRPO in non- English and multilingual settingss
- Abstract要約: ネイティブ言語で推論するためのトレーニングは、英語の推論のためのトレーニングにわずかなギャップしか残っていないことが多いことに気付きました。
1つの言語でのトレーニングは、他の多くの言語のパフォーマンスを向上する。
特定の言語のトレーニングは、他の言語のドメイン外の能力に深刻な回帰を誘導する場合もある。
- 参考スコア(独自算出の注目度): 2.1851076088498296
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement Learning with Verifiable Rewards (RLVR), often optimized with Group Relative Policy Optimization (GRPO), has become a central recipe for improving the reasoning capabilities of pretrained language models but current studies remain heavily English-centric. We conduct a large-scale empirical study of multilingual and non-English GRPO across a wide range of base models, training languages, and different reasoning language rewards. We find that training to reason in the native language often leaves only a small gap to training for English reasoning. We further observe strong crosslingual transfer: training in one language often improves performance in many others. However, specific trends are highly model- and language-dependent. In some cases, training in a particular language induces severe regressions on out-of-domain capabilities in other languages. Our analysis shows that RLVR beyond English can provide broad crosslingual gains, but also requires broad evaluation to detect language-specific regressions.
- Abstract(参考訳): RLVR(Reinforcement Learning with Verifiable Rewards)は、しばしばグループ相対政策最適化(GRPO)に最適化され、事前訓練された言語モデルの推論能力を改善する中心的なレシピとなっているが、現在の研究は英語中心のままである。
我々は、多言語および非英語のGRPOについて、幅広い基礎モデル、訓練言語、異なる推論言語報酬に対して大規模な実証的研究を行う。
ネイティブ言語で推論するためのトレーニングは、英語の推論のためのトレーニングにわずかなギャップしか残っていないことが多いことに気付きました。
1つの言語でのトレーニングは、他の多くの言語のパフォーマンスを向上する。
しかし、特定の傾向はモデルに依存し、言語に依存している。
特定の言語のトレーニングは、他の言語のドメイン外の能力に深刻な回帰を誘導する場合もある。
分析の結果、RLVRは英語以外の言語よりも広い言語間ゲインを提供するが、言語固有の回帰を検出するには幅広い評価が必要であることがわかった。
関連論文リスト
- English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training [7.141617235075284]
ポストトレーニングパイプラインは主に英語中心であり、言語間のパフォーマンス格差に寄与している。
本稿では,学習言語カバレッジ,モデルスケール,タスクドメイン間の相互作用を体系的に制御した研究を行う。
ポストトレーニング中の言語カバレッジの増加は、タスクやモデルスケールに大きく影響している。
論文 参考訳(メタデータ) (2026-04-14T20:26:34Z) - ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection [39.813397419564936]
我々は,強化学習における探索と搾取を改善するために,オンライン思考言語選択を可能にする新しいポストトレーニングパイプラインExpLangを提案する。
提案手法は英語のみのトレーニングを同じトレーニング予算で継続的に上回りつつ,見知らぬ言語と目に見えない言語の両方に対して高い思考的言語コンプライアンスを示す。
論文 参考訳(メタデータ) (2026-02-25T13:10:58Z) - Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective [52.452449102961225]
本研究は、推論一般化を探求する新たな言語横断的視点を提案する。
本研究により,言語間の伝達性は,初期モデル,対象言語,訓練パラダイムによって大きく異なることが明らかとなった。
我々の研究は、LRM推論が人間の認知を反映し、言語に依存しないLRMの開発に重要な洞察を与えるという仮定に挑戦する。
論文 参考訳(メタデータ) (2025-10-02T17:49:49Z) - Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models [44.94287386776289]
textbfCross-lingual Collapseは、多言語言語モデルが支配的な事前学習言語に回帰する体系的なドリフトである。
実験の結果, (i)GRPOは事前学習言語の不均衡を急速に増幅し, わずか数百回の更新で低リソース言語が侵食され, (ii) 言語整合性報酬はこのドリフトを緩和するが, ほぼ5~10ppの精度の低下を犠牲にしていることがわかった。
論文 参考訳(メタデータ) (2025-06-06T08:08:48Z) - When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners [111.50503126693444]
言語固有のアブレーションは多言語推論性能を継続的に向上させることを示す。
トレーニング後のアブレーションと比較して、トレーニング不要のアブレーションは、計算オーバーヘッドを最小限に抑えながら、同等または優れた結果が得られる。
論文 参考訳(メタデータ) (2025-05-21T08:35:05Z) - Crosslingual Reasoning through Test-Time Scaling [51.55526326294275]
英語中心の推論言語モデル(RLM)に対する推論計算のスケールアップは、多くの言語における多言語数学的推論を改善する。
英語中心の RLM の CoT は自然に英語が主流であるが、引用された非英語入力を推論するための引用と思考のパターンは一貫して従っている。
我々は、ドメイン外推論の一般化、特にSTEMから文化常識の知識まで、英語においても、貧弱なドメイン外推論の一般化を観察する。
論文 参考訳(メタデータ) (2025-05-08T16:50:06Z) - Demystifying Multilingual Chain-of-Thought in Process Reward Modeling [86.98098988779809]
プロセス報酬モデル(PRM)を多言語設定に拡張するという課題に対処する。
我々は、7つの言語にまたがるデータセット上で多言語PRMを訓練し、それを英語から翻訳する。
本結果は,学習言語数と英語データ量の両方に対する多言語PRMの感度を強調した。
論文 参考訳(メタデータ) (2025-02-18T09:11:44Z) - AdaMCoT: Rethinking Cross-Lingual Factual Reasoning through Adaptive Multilingual Chain-of-Thought [40.16140566668239]
AdaMCOTは多言語の事実推論を強化するフレームワークである。
AdaMCOTは、ターゲット言語応答を生成する前に、中間言語における思考プロセスを動的にルーティングする。
本評価は, 事実推論品質と言語間整合性の両方において, 大幅な改善を示すものである。
論文 参考訳(メタデータ) (2025-01-27T15:48:57Z) - Targeted Multilingual Adaptation for Low-resource Language Families [17.212424929235624]
我々は、事前学習されたモデルを言語族に適応させるためのベストプラクティスについて研究する。
適応モデルは単言語および多言語ベースラインを大きく上回る。
低リソース言語は、高リソース言語のパフォーマンスをほとんど犠牲にすることなく、トレーニング中に積極的にアップサンプリングできる。
論文 参考訳(メタデータ) (2024-05-20T23:38:06Z) - The Role of Language Imbalance in Cross-lingual Generalisation: Insights from Cloned Language Experiments [57.273662221547056]
本研究では,言語間一般化の非直感的な新規ドライバである言語不均衡について検討する。
学習中に支配的な言語が存在することが、あまり頻度の低い言語の性能を高めることを観察する。
分析を実言語に拡張するにつれ、頻繁な言語は依然として恩恵を受けていますが、言語不均衡が言語間の一般化を引き起こすかどうかは決定的ではありません。
論文 参考訳(メタデータ) (2024-04-11T17:58:05Z) - Analyzing the Mono- and Cross-Lingual Pretraining Dynamics of
Multilingual Language Models [73.11488464916668]
本研究では,多言語事前学習プロセスのダイナミクスについて検討する。
我々は,XLM-Rプレトレーニング全体から抽出したチェックポイントを,一連の言語的タスクを用いて探索する。
分析の結果,より複雑なものよりも低レベルな言語スキルが得られ,早期に高い言語性能が得られることがわかった。
論文 参考訳(メタデータ) (2022-05-24T03:35:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。