論文の概要: SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
- arxiv url: http://arxiv.org/abs/2608.03573v1
- Date: Tue, 04 Aug 2026 12:32:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.188155
- Title: SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
- Title(参考訳): SFT Conflicts, RL Coexists:LLMのためのマルチタスク学習の理論的および実証的分析
- Authors: Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai, Kang Liu, Juanzi Li, Jun Zhao,
- Abstract要約: Supervised Fine-Tuning (SFT) と Reinforcement Learning (RL) は、大規模言語モデル(LLM)に対するマルチタスク推論の強化において、根本的に異なる振る舞いを示す。
予備実験の結果,SFTは多段階訓練下でのタスクコンフリクトに悩まされ,RLは多様なタスクにまたがる安定した共存を可能にした。
マルチタスクトレーニングを分離し,効率と柔軟性を大幅に向上させるパラダイムであるParallel-RLを提案する。
- 参考スコア(独自算出の注目度): 55.96262261252617
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL) exhibit fundamentally different behaviors in enhancing multi-task reasoning for large language models (LLMs). Our preliminary experiments revealed a phenomenon: SFT suffers from severe task conflicts under multi-stage training, whereas RL enables stable coexistence across diverse tasks. Empirically, we trace this to the parameter level, observing that RL induces sparse and approximately orthogonal updates across tasks. We provide a theoretical explanation for this mechanism by analyzing multi-task gradient interference. Our results reveal a distinction: interference in SFT is norm-limited, scaling with the absolute gradient magnitude, whereas interference in RL is variance-limited, bounded by the gradient variance induced by advantage normalization and on-policy optimization. This small variance bound yields near-orthogonal optimization directions across tasks. Leveraging this insight, we propose Parallel-RL, a paradigm that decouples multi-task training, significantly improving efficiency and flexibility.
- Abstract(参考訳): Supervised Fine-Tuning (SFT) と Reinforcement Learning (RL) は、大規模言語モデル(LLM)に対するマルチタスク推論の強化において、根本的に異なる振る舞いを示す。
予備実験では,SFTは多段階訓練下でのタスクコンフリクトに悩まされ,RLは多様なタスクにまたがる安定した共存を可能にした。
経験的に、我々はこれをパラメータレベルまで追跡し、RLがタスク間でスパースとほぼ直交の更新を誘導するのを観察した。
マルチタスク勾配干渉の解析により,この機構の理論的説明を行う。
SFTにおける干渉は、絶対勾配等級でスケーリングされるのに対し、RLにおける干渉は、高次正規化とオン・ポリティクス最適化によって誘導される勾配分散によって制限される。
この小さな分散境界は、タスク間のほぼ直交の最適化方向をもたらす。
この知見を活用することで、マルチタスクトレーニングを分離し、効率と柔軟性を大幅に向上させるパラダイムであるParallel-RLを提案する。
関連論文リスト
- Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models [2.497936211748472]
強化学習(RL)によって訓練された大規模な推論モデルは、数学的推論タスクにおいて教師付き微調整(SFT)よりも優れていることがますます示されている。
第一に,RLモデルはSFTモデルと比較して解答正解率の予測において高い精度を達成しがちであることを示す。
第2に、平均アブレーション研究により、RLモデルはより深い層が徐々に重要になる階層構造を発達させ、SFTモデルは層間で重要性を均一に分配することを示した。
論文 参考訳(メタデータ) (2026-07-28T17:42:42Z) - DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models [55.01951088768769]
DiffusionOPDはオンライン政策蒸留(OPD)に基づく拡散モデルのための新しいマルチタスクトレーニングパラダイムである
本研究では,DiffusionOPDがトレーニング効率と最終性能において,マルチリワードRLとカスケードRLのベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-14T16:49:09Z) - Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning [10.4404175363648]
大規模言語モデル(LLM)のポストトレーニングパラダイムは、基本的なジレンマに直面します。
SFTは安定性(低分散)を提供するが、高い適合バイアスに悩まされる一方、RLは探索(低バイアス)が可能であるが、高勾配のばらつきを持つ波紋である。
既存の統一最適化戦略では、これらの異なる勾配信号間の統計的衝突を見越して、単純な損失重み付けを用いることが多い。
我々は,この対立を構造的に緩和する統合フレームワークである textbfDYPO (Dynamic Policy Optimization) を提案する。
論文 参考訳(メタデータ) (2026-04-10T03:42:16Z) - DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning [44.10628322188708]
Reinforcement Learning with Verifiable Rewards (RLVR) は、大規模言語モデルで推論能力を引き出すための強力なパラダイムとして登場した。
一般的なSTEM領域では、ベースモデルに直接適用されるRLは、非常にサンプリング非効率であり、教師付き微調整によって一貫して上回っている。
本稿では,一般的な推論のための難易度に基づくデータデカップリング戦略であるDeReasonを提案する。
論文 参考訳(メタデータ) (2026-03-11T18:01:55Z) - NTKMTL: Mitigating Task Imbalance in Multi-Task Learning from Neural Tangent Kernel Perspective [58.345210583013454]
マルチタスク学習(MTL)は、1つのモデルで複数のタスクを同時に学習することを可能にする。
MTLにおけるタスクの不均衡は依然として大きな課題である。
NTKMTL という新しい MTL 法を提案し,MTL のトレーニングダイナミクスを解析する。
論文 参考訳(メタデータ) (2025-10-21T03:29:40Z) - RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization [111.1749164063616]
大規模言語モデル(LLM)のための新しいハイブリッド政治最適化手法RL-PLUSを提案する。
RL-PLUSは、外部データと内部エクスプロイトを相乗化して、より強力な推論能力を達成し、ベースモデルのバウンダリを超える。
提案手法の優位性と一般化性を示すため,理論解析と広範な実験を行った。
論文 参考訳(メタデータ) (2025-07-31T23:55:29Z) - Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections [65.36449542323277]
本稿では,Large Language Model (LLM) 後の学習において,SFT(Supervised Fine-Tuning) と優先学習を統合した理論フレームワークを提案する。
そこで本研究では,学習率の簡易かつ効果的な削減手法を提案する。
論文 参考訳(メタデータ) (2025-06-15T05:42:29Z) - The Nature of Temporal Difference Errors in Multi-step Distributional
Reinforcement Learning [46.85801978792022]
分散RLに対する多段階オフポリシー学習手法について検討する。
経路依存分布TD誤差の新しい概念を同定する。
我々は, 深部RLエージェントQR-DQN-Retraceを導く新しいアルゴリズムQuantile Regression-Retraceを導出する。
論文 参考訳(メタデータ) (2022-07-15T16:19:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。