論文の概要: ReasonXL: Shifting LLM Reasoning Language Without Sacrificing Performance
- arxiv url: http://arxiv.org/abs/2604.12378v1
- Date: Tue, 14 Apr 2026 07:10:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-15 19:11:32.308059
- Title: ReasonXL: Shifting LLM Reasoning Language Without Sacrificing Performance
- Title(参考訳): ReasonXL: パフォーマンスを犠牲にすることなく、LLM推論言語をシフト
- Authors: Daniil Gurgurov, Tom Röhr, Sebastian von Rohrscheidt, Josef van Genabith, Alexander Löser, Simon Ostermann,
- Abstract要約: ヨーロッパ5言語にまたがるクロスドメイン推論トレースの最初の大規模並列コーパスであるReasonXLを紹介する。
ReasonXL を用いて、所望のターゲット言語で LLM が完全に論理に適応できることを実証する。
適応の広範な表現解析を行い、モデル深度を横断する明確な機能分割を求める。
- 参考スコア(独自算出の注目度): 44.67427662307542
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Despite advances in multilingual capabilities, most large language models (LLMs) remain English-centric in their training and, crucially, in their production of reasoning traces. Even when tasked with non-English problems, these models predominantly reason in English, creating a fundamental mismatch for non-English usage scenarios. We address this disparity directly with three contributions. (i) We introduce ReasonXL, the first large-scale parallel corpus of cross-domain reasoning traces spanning five European languages (English, German, French, Italian, and Spanish), with over two million aligned samples per language, each comprising prompts, reasoning traces, and final outputs, enabling direct supervision of language-specific reasoning. (ii) Using ReasonXL, we demonstrate that LLMs can be adapted to reason entirely in a desired target language, using a simple two-stage pipeline of supervised fine-tuning (SFT) followed by reinforcement learning with verifiable rewards (RLVR). The resulting models match or exceed baseline performance, with minimal loss in general knowledge and broadly preserved cross-lingual transfer. (iii) We conduct an extensive representational analysis of the adaptation and find a clear functional division across model depth: early layers contain an activation bottleneck that causally determines language identity, while upper layers concentrate the weight and activation changes driven by adaptation. We further find that RLVR achieves greater behavioral divergence from the base model with smaller parameter updates than SFT, suggesting a more efficient representational rerouting despite much smaller weight updates.
- Abstract(参考訳): 多言語能力の進歩にもかかわらず、ほとんどの大きな言語モデル(LLM)はトレーニングにおいて英語中心であり、重要な点として、推論トレースの生成において英語中心のままである。
英語以外の問題に取り組む場合でも、これらのモデルは英語では主に理にかなっているため、英語以外の使用シナリオに対する根本的なミスマッチが生じる。
この格差を3つのコントリビューションで直接解決する。
(i)5つのヨーロッパ言語(英語,ドイツ語,フランス語,イタリア語,スペイン語)にまたがるクロスドメイン推論トレースの最初の大規模並列コーパスであるReasonXLを導入し,それぞれがプロンプト,推論トレース,最終的なアウトプットから構成され,言語固有の推論の直接的な監視を可能にする。
2) ReasonXLを用いて, 教師付き微調整(SFT)の単純な2段階パイプラインと, 検証可能な報酬付き強化学習(RLVR)を用いて, LLMを目的言語に完全に適応できることを実証した。
結果として得られたモデルは、一般的な知識の損失が最小限に抑えられ、言語間移動が広く保存される。
初期層には、言語アイデンティティを因果的に決定するアクティベーションボトルネックが含まれており、上位層は適応によって引き起こされる重みとアクティベーションの変化に集中している。
さらに、RLVRはSFTよりも小さいパラメータ更新でベースモデルからより大きな振舞いを達成し、より少ない重み更新にもかかわらず、より効率的な表現再帰を実現することを示唆している。
関連論文リスト
- Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning [71.4175109189942]
Pivot-Aligned Self-Feedback Multilingual Reasoning (PASMR)を提案する。
このアプローチは、モデルの第一言語をピボット言語として指定する。
外部の正しい回答や報酬モデルに頼ることなく、言語横断的な自己フィードバック機構を確立する。
論文 参考訳(メタデータ) (2026-01-25T03:20:00Z) - Code-Switching In-Context Learning for Cross-Lingual Transfer of Large Language Models [64.54005959758733]
我々は,コードスイッチング・イン・コンテキスト・ラーニング(CSICL)を,推論中の翻訳障壁を克服するための原則的かつ堅牢なアプローチとして導入する。
4つのLLM、6つのデータセット、10の言語にわたる広範な実験を行い、知識集約型ドメインと推論指向ドメインの両方にまたがる。
その結果、CSICLはX-ICLベースラインを一貫して上回り、ターゲット言語と見当たらない言語の両方で3.1%pと1.9%pを達成した。
論文 参考訳(メタデータ) (2025-10-07T08:35:42Z) - Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective [52.452449102961225]
本研究は、推論一般化を探求する新たな言語横断的視点を提案する。
本研究により,言語間の伝達性は,初期モデル,対象言語,訓練パラダイムによって大きく異なることが明らかとなった。
我々の研究は、LRM推論が人間の認知を反映し、言語に依存しないLRMの開発に重要な洞察を与えるという仮定に挑戦する。
論文 参考訳(メタデータ) (2025-10-02T17:49:49Z) - Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models [44.94287386776289]
textbfCross-lingual Collapseは、多言語言語モデルが支配的な事前学習言語に回帰する体系的なドリフトである。
実験の結果, (i)GRPOは事前学習言語の不均衡を急速に増幅し, わずか数百回の更新で低リソース言語が侵食され, (ii) 言語整合性報酬はこのドリフトを緩和するが, ほぼ5~10ppの精度の低下を犠牲にしていることがわかった。
論文 参考訳(メタデータ) (2025-06-06T08:08:48Z) - The Unreasonable Effectiveness of Model Merging for Cross-Lingual Transfer in LLMs [45.08958917457921]
大規模言語モデル(LLM)は、ハイソース言語以外のタスクで依然として苦戦している。
本研究では,タスク固有のポストトレーニングデータが不足している低リソース言語への言語間移動について検討する。
論文 参考訳(メタデータ) (2025-05-23T20:28:31Z) - When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners [111.50503126693444]
言語固有のアブレーションは多言語推論性能を継続的に向上させることを示す。
トレーニング後のアブレーションと比較して、トレーニング不要のアブレーションは、計算オーバーヘッドを最小限に抑えながら、同等または優れた結果が得られる。
論文 参考訳(メタデータ) (2025-05-21T08:35:05Z) - Enhancing Non-English Capabilities of English-Centric Large Language Models through Deep Supervision Fine-Tuning [42.166438218926274]
本稿では、モデルの内部層にさらなる監視を取り入れ、ワークフローをガイドする深層監視微調整法(DFT)を提案する。
提案手法は,非英語入力処理における最終生成結果だけでなく,内部表現の精度も保証する。
論文 参考訳(メタデータ) (2025-03-03T07:59:32Z) - Eliciting Better Multilingual Structured Reasoning from LLMs through Code [17.870002864331322]
我々は6言語にまたがる4つのタスクを網羅する,xSTREETと呼ばれる多言語構造推論と説明データセットを提案する。
xSTREETは、英語と非英語の推論タスクの基本的なLLMパフォーマンスのギャップを露呈する。
このギャップを緩和する2つの方法を提案する。
論文 参考訳(メタデータ) (2024-03-05T00:48:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。