論文の概要: Fusion Training for Mathematical Generalization in Large Language Models
- arxiv url: http://arxiv.org/abs/2608.09893v1
- Date: Mon, 10 Aug 2026 17:41:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.402175
- Title: Fusion Training for Mathematical Generalization in Large Language Models
- Title(参考訳): 大規模言語モデルにおける数学的一般化のための融合学習
- Abstract要約: Thinking Mode Fusion (TMF) は、大規模な言語モデルで簡潔な応答と長文推論の両方をサポートする。
我々は,学習スケジュールと思考モードと非思考モードのデータ比率の影響を分析した。
- 参考スコア(独自算出の注目度): 15.245898003957327
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Thinking Mode Fusion (TMF) enables large language models to support both concise responses and long-form reasoning by unifying a non-thinking mode and a thinking mode within a single model. However, its training dynamics, including the \emph{data ratio} and \emph{training schedule} between the two modes, remain underexplored. In this work, we present a systematic study of TMF by analyzing the effects of the training schedule and data ratio between thinking and non-thinking modes. Focusing on mathematical problem solving, we construct a benchmark with multiple thinking-to-non-thinking data ratios and three training schedules. Our results reveal an asymmetric interaction between the two modes: increasing the ratio of non-thinking supervision reduces the accuracy of the thinking mode. We further show that different training schedules modulate this trade-off and that the optimal schedule depends on the data ratio. Finally, we quantify a negative correlation between non-thinking and thinking mode supervision, highlighting an inherent tension between these two modes. These findings provide practical guidance for designing effective TMF training settings. All code and data are released to support further research at: \href{https://github.com/caocongfeng/Fusion-Bench.git}{\textbf{Fusion Bench}}.
- Abstract(参考訳): シンキングモード融合(Thinking Mode Fusion, TMF)は、思考モードと思考モードを単一のモデルに統一することで、簡潔な応答と長文推論の両方をサポートする。
しかしながら、2つのモード間の \emph{data ratio} と \emph{training schedule} を含むトレーニングのダイナミクスは、まだ探索されていない。
本研究では,学習スケジュールと思考モードと非思考モードのデータ比の影響を解析し,TMFの体系的研究を行う。
数学的な問題解決に焦点をあて、複数の思考と非思考のデータ比率と3つのトレーニングスケジュールを持つベンチマークを構築した。
その結果,2つのモード間の非対称的相互作用が明らかとなり,非思考的監督の比率が増大すると,思考モードの精度が低下することがわかった。
さらに、異なるトレーニングスケジュールがこのトレードオフを変調し、最適なスケジュールがデータ比率に依存することを示す。
最後に、非思考と思考モードの監督の負の相関関係を定量化し、これらの2つのモードの間に固有の緊張関係を浮き彫りにする。
これらの知見は、効果的なTMFトレーニング設定を設計するための実践的なガイダンスを提供する。
すべてのコードとデータは、次の研究をサポートするためにリリースされている。
関連論文リスト
- FABSVer: Faster Training and Better Self-Verification for LLM Mathematical Reasoning [8.96133612398978]
自己検証モデルを備えた既存のアプローチは、解の生成と検証を2つの別々のタスクとして扱うのが一般的である。
本稿では,この2つのタスクを1世代パスに融合するFABSVerを提案する。
FABSVerは3つのモデルスケールで優れた自己検証と推論性能を実現する。
論文 参考訳(メタデータ) (2026-05-27T12:26:34Z) - The Thinking Boundary: Quantifying Reasoning Suitability of Multimodal Tasks via Dual Tuning [46.61419294791218]
提案するDual Tuningは、推論が目標タスクに対して肯定的な利得をもたらすかどうかを評価するためのフレームワークである。
多様なマルチモーダルタスクにおける推論学習の適性を評価するために,「シンキング境界」を確立した。
我々の研究は、適切なデータとトレーニング戦略を特定するための実践的なガイダンスを提供する「すべての理由」パラダイムに挑戦する。
論文 参考訳(メタデータ) (2026-02-04T04:13:39Z) - SPaRFT: Self-Paced Reinforcement Fine-Tuning for Large Language Models [51.74498855100541]
大規模言語モデル(LLM)は、強化学習(RL)による微調整時に強い推論能力を示す。
トレーニング対象のモデルの性能に基づいて,効率的な学習を可能にする自己評価学習フレームワークである textbfSPaRFT を提案する。
論文 参考訳(メタデータ) (2025-08-07T03:50:48Z) - ToReMi: Topic-Aware Data Reweighting for Dynamic Pre-Training Data Selection [28.75333303894706]
ToReMiは、トピックの関連や観察された学習パターンに応じてトレーニングサンプル重量を調整する新しいフレームワークである。
実験の結果,ToReMiの変種は従来の事前学習手法よりも優れた性能が得られることがわかった。
論文 参考訳(メタデータ) (2025-04-01T12:06:42Z) - MAP: Low-compute Model Merging with Amortized Pareto Fronts via Quadratic Approximation [80.47072100963017]
Amortized Pareto Front (MAP) を用いた新しい低演算アルゴリズム Model Merging を導入する。
MAPは、複数のモデルをマージするためのスケーリング係数のセットを効率的に識別し、関連するトレードオフを反映する。
また,タスク数が比較的少ないシナリオではベイジアンMAP,タスク数の多い状況ではNested MAPを導入し,計算コストを削減した。
論文 参考訳(メタデータ) (2024-06-11T17:55:25Z) - Robust Training of Federated Models with Extremely Label Deficiency [84.00832527512148]
フェデレーション半教師付き学習(FSSL)は、ラベル不足を伴う分散データを用いて機械学習モデルを協調訓練するための強力なパラダイムとして登場した。
我々は,ラベル付きおよびラベルなしデータの異なる視点から洞察を提供することにより相互指導を強化するために,ツインサイトと呼ばれる新しいツインモデルパラダイムを提案する。
4つのベンチマークデータセットに関する包括的な実験は、Twin-sightが様々な実験環境において最先端の手法を著しく上回っていることを示す重要な証拠となる。
論文 参考訳(メタデータ) (2024-02-22T10:19:34Z) - DMT: Dynamic Mutual Training for Semi-Supervised Learning [69.17919491907296]
自己学習法は通常、低信頼の擬似ラベルをフィルタリングするために単一のモデル予測の信頼性に依存する。
動的相互学習と呼ばれる動的に再重み付けされた損失関数を用いて、2つの異なるモデル間の相互学習を提案する。
実験の結果,DMTは画像分類とセマンティックセグメンテーションの両方において最先端の性能を実現することがわかった。
論文 参考訳(メタデータ) (2020-04-18T03:12:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。