論文の概要: Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
- arxiv url: http://arxiv.org/abs/2607.26119v1
- Date: Tue, 28 Jul 2026 17:42:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.434863
- Title: Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
- Title(参考訳): 推論性能の起源を探る:RLとSFT微調整モデルにおける数学的問題解法における表現品質
- Authors: Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit, Kevin Zhu, Aishwarya Balwani,
- Abstract要約: 強化学習(RL)によって訓練された大規模な推論モデルは、数学的推論タスクにおいて教師付き微調整(SFT)よりも優れていることがますます示されている。
第一に,RLモデルはSFTモデルと比較して解答正解率の予測において高い精度を達成しがちであることを示す。
第2に、平均アブレーション研究により、RLモデルはより深い層が徐々に重要になる階層構造を発達させ、SFTモデルは層間で重要性を均一に分配することを示した。
- 参考スコア(独自算出の注目度): 2.497936211748472
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large reasoning models trained via reinforcement learning (RL) have been increasingly shown to outperform their supervised fine-tuned (SFT) counterparts on mathematical reasoning tasks; Yet the mechanistic basis for this advantage remains unclear. We therefore ask, what internal representational differences enable RL models' superior performance? Our work presents two converging lines of evidence: First, linear probes trained on layer-wise hidden states reveal that RL models tend to achieve higher accuracy in predicting answer correctness compared to SFT models, indicating more linearly separable and structured representations. Second, mean ablation studies show that RL models develop a hierarchical architecture where deeper layers become progressively more critical, whereas SFT models distribute importance uniformly across layers. Together, these findings demonstrate that RL training fundamentally restructures how models represent and process reasoning problems. Finally, we analyze token-count variability under repeated sampling across problems to assess adaptive compute allocation. While we observe higher variability in some RL-tuned models than in their SFT counterparts, we see strong consistency in others, suggesting that token allocation may depend more on the overall training pipeline than on RL versus SFT alone. We believe this token-allocation variability reveals the spread of plausible on-policy reasoning, highlighting which models exhibit stable policies versus those that are under-determined, potentially non-identifiable solution behaviour.
- Abstract(参考訳): 強化学習(RL)によって訓練された大規模な推論モデルは、数学的推論タスクにおいて、教師付き微調整(SFT)よりも優れていることがますます示されている。
したがって、RLモデルの優れた性能を実現する内部表現の違いは何か?
第一に,RLモデルはSFTモデルと比較して解答正解率の予測精度が高い傾向を示し,より線形に分離可能かつ構造化された表現を示す。
第2に、平均アブレーション研究により、RLモデルはより深い層が徐々に重要になる階層構造を発達させ、SFTモデルは層間で重要性を均一に分配することを示した。
これらの結果は、RLトレーニングが、モデルがどのように表現し、プロセス推論の問題に対処するかを根本的に再構成することを示している。
最後に,問題の繰り返しサンプリングによるトークン数変動を分析し,適応的な計算割り当てを評価する。
いくつかのRL調整モデルではSFTモデルよりも高いばらつきが観察できるが、他のモデルでは強い一貫性が見られ、トークン割り当てはRLとSFT単独よりも全体的なトレーニングパイプラインに依存する可能性があることを示唆している。
このトークン・アロケーションの多様性は、プラウシブル・オン・ポリティクスの推論の拡散を明らかにし、未決定で、潜在的に特定不可能なソリューションの振る舞いに対して、どのモデルが安定したポリシーを示すかを強調します。
関連論文リスト
- Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models [51.45122910254346]
強化学習(RL)に基づくポストトレーニングは、トレーニングドメインを超えた大規模言語モデルの推論性能を改善することが多い。
Supervised Fine-tuning (SFT) はしばしば一般的な忘れる能力をもたらす。
制御された実験装置を用いてRL一般化を探索する特徴レベル力学解析手法を提案する。
論文 参考訳(メタデータ) (2026-04-27T21:22:34Z) - Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models [50.99097734404912]
RLフレンドリなモデルでは, クラス内コンパクト性やクラス間分離が, 正誤応答に対する確率割当に現れることを示す。
6つの数学ベンチマークによる実験では、すべてのモデルファミリで一貫した改善が見られ、AIME24では5.9ポイントまで向上した。
論文 参考訳(メタデータ) (2026-01-11T13:34:44Z) - How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns [51.02752099869218]
大きな言語モデル(LLM)は、非常に異なる一般化の振る舞いを示す。
推論を原子核スキルに分解する新しいベンチマークを導入する。
SFTモデルはよりシャープなドリフトと表面パターンへの過度な適合を示すのに対し、RL型モデルはより安定した行動プロファイルを維持し、推論スキルの崩壊に抵抗することを示す。
論文 参考訳(メタデータ) (2025-12-30T08:16:20Z) - Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions [17.407689582427437]
大規模言語モデル(LLM)推論は、強化学習(RL)を通して計画や自己回帰のような洗練された行動が現れることを示した。
textbfReLIFT (textbfReinforcement textbfL textbfInterleaved with Online textbfFine-textbfTuning)
ReLIFTでは、モデルを主にRLを使ってトレーニングするが、難しい問題に遭遇すると、ファインチューニングのための高品質なソリューションが収集され、トレーニングプロセスが交互に行われる。
論文 参考訳(メタデータ) (2025-06-09T08:11:20Z) - Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning [93.00629872970364]
強化学習(Reinforcement Learning, RL)は, 複雑な推論タスクにおいて, 言語モデルの性能向上のための主要なパラダイムとなっている。
SPARKLE(SPARKLE)は、3つの重要な次元にわたるRLの効果を詳細に解析するフレームワークである。
我々は、RL信号と混合品質の推論トレースを産出しない難題が、依然としてトレーニングに有効であるかどうかを調査する。
論文 参考訳(メタデータ) (2025-06-05T07:53:59Z) - Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining [74.83412846804977]
強化学習(RL)に基づく微調整は、訓練後の言語モデルにおいて重要なステップとなっている。
数理推論のためのRLファインタニングを、スクラッチから完全にトレーニングモデルを用いて体系的にエンドツーエンドに研究する。
論文 参考訳(メタデータ) (2025-04-10T17:15:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。