論文の概要: On-Policy Delta Distillation for Multilingual Math Reasoning
- arxiv url: http://arxiv.org/abs/2608.05802v1
- Date: Thu, 06 Aug 2026 09:37:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.867484
- Title: On-Policy Delta Distillation for Multilingual Math Reasoning
- Title(参考訳): 多言語数学推論のためのオンポリシィデルタ蒸留法
- Abstract要約: 我々は,英語,韓国語,日本語の数学的推論のためのオンライン蒸留(OPD)について検討する。
OPD$2$は、韓国語と日本語で特に強い改良が加えられたオリジナルのPDより一貫して上回っている。
英語のみのOPDは韓国語と日本語のパフォーマンスも向上するが、しばしば英語に切り替える。
- 参考スコア(独自算出の注目度): 61.76889440384448
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-Policy Distillation (OPD) is emerging as a promising alternative to reinforcement learning for LLM post-training, yet its effectiveness in multilingual settings remains underexplored. We study OPD and its advanced variant, On-Policy Delta Distillation (OPD$^2$), for mathematical reasoning in English, Korean, and Japanese. OPD$^2$ improves OPD by using the probability gap between a post-trained teacher and its base model as the learning signal. Experiments with Qwen3 show that OPD$^2$ consistently outperforms the original OPD, with particularly strong improvements in Korean and Japanese, and generally narrows the English-Korean performance gap. We further find that English-only OPD can also increase performance for Korean and Japanese, but often shifts the responses toward English, highlighting the importance of multilingual data to preserving target-language responses.
- Abstract(参考訳): オンライン蒸留(OPD:On-Policy Distillation)は、LLMポストトレーニングにおける強化学習の代替として期待されているが、多言語設定におけるその有効性は未解明のままである。
我々は,英語,韓国語,日本語の数学的推論のために,OPDとその高度な変種であるOn-Policy Delta Distillation (OPD$^2$)について検討した。
OPD$^2$は、訓練後教師とそのベースモデル間の確率ギャップを学習信号として利用することにより、OPDを改善する。
Qwen3の実験では、OPD$^2$は元々のPDよりも一貫して優れており、特に朝鮮語と日本語に強い改善が見られ、一般的には英語と韓国語のパフォーマンスギャップを狭めている。
さらに、英語のみのOPDは、韓国語と日本語のパフォーマンスも向上するが、多言語データの重要性を強調して、しばしば英語にシフトする。
関連論文リスト
- Crosslingual On-Policy Self-Distillation for Multilingual Reasoning [48.68444770923683]
Crosslingual On-Policy Self-Distillation (COPSD)は、モデル自身の高リソース推論動作を低リソース言語に転送する。
17の低リソースアフリカ言語に対する実験では、COPSDはモデルサイズ全体の低リソース数学的推論を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-10T14:06:09Z) - CLEAR: Cross-Lingual Enhancement in Alignment via Reverse-training [25.752819016822574]
クロスLingual Enhancement in Retrieval via Reverse-training (CLEAR) は、逆トレーニングスキームを用いて検索性能を向上させる新しい損失関数である。
CLEARは、特に低リソース言語で最大15%向上した、言語間シナリオの顕著な改善を実現している。
論文 参考訳(メタデータ) (2026-04-07T12:54:38Z) - Do LLMs Need Inherent Reasoning Before Reinforcement Learning? A Study in Korean Self-Correction [7.756650000650388]
強化学習が韓国の推論能力を英語に匹敵する程度に向上させるかどうかを検討する。
韓国固有の推論能力に欠けるモデルに適用した場合,RLだけでは限定的な改善が得られた。
モデルの内部推論過程と韓国入力との整合性を示す。特に,韓国固有のニューロンを初期層に調整することで,RLの有効性を解き放つことが重要である。
論文 参考訳(メタデータ) (2026-01-09T01:17:31Z) - Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective [52.452449102961225]
本研究は、推論一般化を探求する新たな言語横断的視点を提案する。
本研究により,言語間の伝達性は,初期モデル,対象言語,訓練パラダイムによって大きく異なることが明らかとなった。
我々の研究は、LRM推論が人間の認知を反映し、言語に依存しないLRMの開発に重要な洞察を与えるという仮定に挑戦する。
論文 参考訳(メタデータ) (2025-10-02T17:49:49Z) - ShifCon: Enhancing Non-Dominant Language Capabilities with a Shift-based Multilingual Contrastive Framework [78.07201802874529]
ShifConはシフトベースの多言語コントラストフレームワークで、他の言語の内部のフォワードプロセスを支配的な言語に合わせる。
実験により、我々のShifConフレームワークは、非支配言語の性能を大幅に向上させることが示された。
論文 参考訳(メタデータ) (2024-10-25T10:28:59Z) - MoE-LPR: Multilingual Extension of Large Language Models through Mixture-of-Experts with Language Priors Routing [78.62611800987817]
大規模言語モデル(LLM)は、事前学習データに言語が不均等に分布するため、しばしば英語中心である。
そこで本稿では,MoE-LPR (Mixture-of-Experts with Language Priors) と呼ばれる手法を提案する。
論文 参考訳(メタデータ) (2024-08-21T07:43:49Z) - RedWhale: An Adapted Korean LLM Through Efficient Continual Pretraining [0.0]
韓国語処理に特化したモデルであるRedWhaleを紹介する。
RedWhaleは、韓国の包括的コーパス前処理パイプラインを含む効率的な継続事前訓練アプローチを用いて開発されている。
実験の結果、RedWhaleは韓国のNLPベンチマークで他の主要なモデルよりも優れていた。
論文 参考訳(メタデータ) (2024-08-21T02:49:41Z) - The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights [108.40766216456413]
大規模言語モデルの英語と非英語のパフォーマンスのギャップを埋めるための質問アライメントフレームワークを提案する。
実験結果から、さまざまな推論シナリオ、モデルファミリー、サイズにわたって、多言語のパフォーマンスを向上できることが示された。
我々は、表現空間、生成された応答とデータスケールを分析し、質問翻訳訓練がLLM内の言語アライメントをどのように強化するかを明らかにする。
論文 参考訳(メタデータ) (2024-05-02T14:49:50Z) - Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities [20.40712512748528]
大規模な言語モデル(LLM)の言語間連続的な事前学習は、最初は英語コーパスで訓練され、大量の英語リソースを活用でき、事前学習のコストを削減できる。
我々はLlama 2の語彙を日本語の文字に拡張し、大規模な日本語Webコーパスで継続事前学習を行うことにより、日本語能力を高めるLLMであるSwallowを構築した。
論文 参考訳(メタデータ) (2024-04-27T06:07:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。