論文の概要: How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data
- arxiv url: http://arxiv.org/abs/2604.14164v1
- Date: Mon, 23 Mar 2026 22:00:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.690184
- Title: How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data
- Title(参考訳): 推論モデルを微調整する方法 : 教師と教師の協調フレームワークによる学生のSFTデータの合成
- Authors: Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo,
- Abstract要約: 教師-学生協調データ合成フレームワーク(TESSY)を提案する。
TESSYは、教師の高度な推論能力を継承し、生徒の分布と整合性を維持しながら、合成シーケンスを生成する。
GPT-OSS-120Bを教師として使用するコード生成の実験では、教師生成データに対する微調整Qwen3-8Bは、LiveCodeBench-Proで3.25%、OJBenchで10.02%のパフォーマンス低下をもたらす。
- 参考スコア(独自算出の注目度): 37.59207409953944
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A widely adopted strategy for model enhancement is to use synthetic data generated by a stronger model for supervised fine-tuning (SFT). However, for emerging reasoning models like Qwen3-8B, this approach often fails to improve reasoning capabilities and can even lead to a substantial drop in performance. In this work, we identify substantial stylistic divergence between teacher generated data and the distribution of student as a major factor impacting SFT. To bridge this gap, we propose a Teacher-Student Cooperation Data Synthesis framework (TESSY), which interleaves teacher and student models to alternately generate style and non-style tokens. Consequently, TESSY produces synthetic sequences that inherit the advanced reasoning capabilities of the teacher while maintaining stylistic consistency with the distribution of the student. In experiments on code generation using GPT-OSS-120B as the teacher, fine-tuning Qwen3-8B on teacher-generated data leads to performance drops of 3.25% on LiveCodeBench-Pro and 10.02% on OJBench, whereas TESSY achieves improvements of 11.25% and 6.68%.
- Abstract(参考訳): モデル強化のための広く採用されている戦略は、教師付き微調整(SFT)のためのより強力なモデルによって生成された合成データを使用することである。
しかしながら、Qwen3-8Bのような新たな推論モデルでは、このアプローチは推論機能の改善に失敗し、パフォーマンスが大幅に低下する可能性がある。
本研究では,SFTに影響を及ぼす要因として,教師が生成したデータと学生の分布とを有意なスタイリスティックな相違点として同定する。
このギャップを埋めるために,教師と生徒のモデルをインターリーブし,スタイルと非スタイルのトークンを交互に生成するTESSY(Teacher-Student Cooperation Data Synthesis framework)を提案する。
その結果、TESSYは教師の高度な推論能力を継承し、生徒の分布と整合性を維持しつつ合成シーケンスを生成する。
GPT-OSS-120Bを教師として使用するコード生成の実験では、教師生成データに対する微調整Qwen3-8Bは、LiveCodeBench-Proで3.25%、OJBenchで10.02%、OJBenchで1.25%、TESSYは11.25%と6.68%のパフォーマンス低下をもたらす。
関連論文リスト
- Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation [47.814833568523255]
PerSynは、各学生モデルに適したデータを作成するために、新しいRoute、Generateのパラダイムの下で運用されている。
モデルファミリとスケールの異なる実験は、PerSynが一貫して優れたパフォーマンスまたは同等のパフォーマンスを達成していることを示している。
論文 参考訳(メタデータ) (2025-10-13T02:36:36Z) - DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs [58.4911494598431]
DistiLLM-2は、教師の反応の可能性を同時に増加させ、生徒の反応を減少させる対照的なアプローチである。
実験の結果,DistiLLM-2は様々なタスクにまたがって高性能な学生モデルを構築するだけでなく,多様なアプリケーションをサポートすることがわかった。
論文 参考訳(メタデータ) (2025-03-10T08:51:32Z) - Exploring and Enhancing the Transfer of Distribution in Knowledge Distillation for Autoregressive Language Models [62.5501109475725]
知識蒸留(KD)は、より小さな学生モデルを模倣するように訓練することで、大きな教師モデルを圧縮する技術である。
本稿では、教師ネットワークが小さなオンラインモジュールを統合し、学生モデルと同時学習するオンライン知識蒸留(OKD)について紹介する。
OKDは、様々なモデルアーキテクチャやサイズにおけるリードメソッドのパフォーマンスを達成または超え、トレーニング時間を最大4倍に短縮する。
論文 参考訳(メタデータ) (2024-09-19T07:05:26Z) - Collaborative Learning for Enhanced Unsupervised Domain Adaptation [15.97351561456467]
UDA(Collaborative Learning for UDA)は,教師の非塩分パラメータを学生モデルを用いて更新する手法である。
CLDAは、GTA-to-Cityscapesデータセットのベースラインモデルと比較して、教師モデルで+0.7% mIoU、学生モデルで+1.4% mIoUの改善を実現している。
論文 参考訳(メタデータ) (2024-09-04T13:35:15Z) - Periodically Exchange Teacher-Student for Source-Free Object Detection [7.222926042027062]
Source-free Object Detection (SFOD) は、ソースドメインデータがない場合に、未ラベルのターゲットドメインデータにソース検出器を適用することを目的としている。
ほとんどのSFOD法は、学生モデルを1つの教師モデルのみで指導する平均教師(MT)フレームワークを用いて、同じ自己学習パラダイムに従っている。
静的教師, 動的教師, 学生モデルからなる複数教師の枠組みを導入する, シンプルながら斬新な手法であるPETS法を提案する。
論文 参考訳(メタデータ) (2023-11-23T11:30:54Z) - Customizing Synthetic Data for Data-Free Student Learning [6.8080936803807734]
DFKDは、オリジナルトレーニングデータなしで軽量な学生モデルを得ることを目指している。
生徒モデルをより効果的に訓練するために、合成データを現在の学生学習能力に合わせてカスタマイズする。
本稿では,データ自由学習(CSD)のための合成データのカスタマイズを提案する。
論文 参考訳(メタデータ) (2023-07-10T13:17:29Z) - Distantly-Supervised Named Entity Recognition with Adaptive Teacher
Learning and Fine-grained Student Ensemble [56.705249154629264]
NERモデルの堅牢性を改善するために,自己学習型教員学生フレームワークを提案する。
本稿では,2つの教員ネットワークからなる適応型教員学習を提案する。
微粒な学生アンサンブルは、教師モデルの各フラグメントを、生徒の対応するフラグメントの時間移動平均で更新し、各モデルフラグメントのノイズに対する一貫した予測を強化する。
論文 参考訳(メタデータ) (2022-12-13T12:14:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。