論文の概要: Learning Style, Forgetting Semantics: A Case Study of SFT and RFT on Classification Tasks
- arxiv url: http://arxiv.org/abs/2610.02437v1
- Date: Thu, 01 Oct 2026 20:03:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.073644
- Title: Learning Style, Forgetting Semantics: A Case Study of SFT and RFT on Classification Tasks
- Title(参考訳): 意味論の学習スタイル : 分類課題における SFT と RFT の事例
- Abstract要約: 教師付き微調整が強化微調整よりも忘れやすい理由について検討した。
共通ポリシとプロンプトでは,SFTとRFTは並列的なセマンティックな更新を行うが,スタイルのダイナミクスは異なることを示す。
- 参考スコア(独自算出の注目度): 22.733602577854825
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Why does supervised fine-tuning (SFT) lead to more forgetting than reinforcement fine-tuning (RFT), even when all teacher demonstrations are semantically correct? We study this question on classification tasks where tokens within each semantic class express the same semantic answer in different styles. The tasks share an underlying semantic rule but differ in their prompt distributions and teachers' stylistic preferences. Using a tractable linear-softmax policy, we derive an exact decomposition of the updates into semantic and style components. We show that, at a common policy and prompt, SFT and RFT have parallel semantic updates but differ in their style dynamics. Starting from a policy with no within-class style preference, RFT with exact policy gradients preserves this symmetry, whereas SFT with a nonuniform teacher develops off-axis style drift along a nonzero task mean under population updates. We use this drift to establish a separation under explicit conditions: for population updates from a common perfectly fitted checkpoint, SFT forgetting admits a strictly positive lower bound over a finite training interval, while RFT retains zero semantic error. Simulations over task sequences support these theoretical predictions.
- Abstract(参考訳): 教師によるファインチューニング(SFT)は,教師のデモが意味論的に正しい場合でも,強化ファインチューニング(RFT)よりも忘れやすいのか?
本研究では,各セマンティッククラス内のトークンが,異なるスタイルで同じセマンティック応答を表現するような分類タスクについて検討する。
タスクは基本的なセマンティックルールを共有するが、その素早い分布と教師のスタイル的好みが異なる。
トラクタブルリニアソフトマックスポリシを用いて、更新をセマンティックおよびスタイルコンポーネントに正確に分解する。
共通ポリシとプロンプトでは,SFTとRFTは並列的なセマンティックな更新を行うが,スタイルのダイナミクスは異なることを示す。
クラス内スタイルの好みを持たない政策から始めると、正確な政策勾配を持つRFTはこの対称性を保ち、一方、一様でない教師を持つSFTは、非ゼロタスクの平均値に沿ってオフ軸スタイルのドリフトを発達させる。
一般的な完全適合チェックポイントからの集団更新では、SFTは有限トレーニング間隔で厳密に正の下位境界を認め、RFTはゼロセマンティックエラーを保持する。
タスクシーケンスのシミュレーションは、これらの理論予測をサポートする。
関連論文リスト
- RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning [32.00854012855933]
Supervised Fine-tuning (SFT) は、大規模言語モデルを推論タスクに適用するための一般的な手法である。
問題レベルの解決可能性に応じて専門家の監督を校正する政策対応型SFTフレームワークであるRASFTを提案する。
論文 参考訳(メタデータ) (2026-06-05T07:52:40Z) - Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - Test time training enhances in-context learning of nonlinear functions [51.56484100374058]
テストタイムトレーニング(TTT)は、各予測に先立って指定されたパラメータを明示的に更新することで、モデル性能を向上させる。
本研究では,TTTとテキスト内学習(ICL)の組み合わせについて検討する。
論文 参考訳(メタデータ) (2025-09-30T03:56:44Z) - UniAPL: A Unified Adversarial Preference Learning Framework for Instruct-Following [12.924923059340395]
トレーニング後のアライメントは基本的には、参照学習の統一的な問題である、と我々は主張する。
UniAPLは、SFTと嗜好データの混合バッチから共同で学習する、単一段階の統合トレーニング目標を実装している。
論文 参考訳(メタデータ) (2025-09-29T17:53:09Z) - Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning [33.899779762210976]
大規模言語モデルの教師付き微調整(SFT)は、非政治的な学習問題と見なすことができる。
既存の方法では、ギャップを積極的に減らすのではなく、パッシブに更新するKLペナルティやクリッピングによってこの問題を軽減する。
本稿では,トレーニング前の政策ギャップを積極的に縮小する,シンプルで効果的なデータ書き換えフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-18T17:02:30Z) - M-Tuning: Prompt Tuning with Mitigated Label Bias in Open-Set Scenarios [58.617025733655005]
緩和ラベルバイアス(M-Tuning)を用いた視覚言語プロンプトチューニング手法を提案する。
これはWordNetからのオープンワードを導入し、クローズドセットラベルワードのみからもっと多くのプロンプトテキストを形成する単語の範囲を広げ、シミュレートされたオープンセットシナリオでプロンプトをチューニングする。
提案手法は,様々なスケールのデータセット上で最高の性能を達成し,広範囲にわたるアブレーション研究もその有効性を検証した。
論文 参考訳(メタデータ) (2023-03-09T09:05:47Z) - Robust Mean Teacher for Continual and Gradual Test-Time Adaptation [5.744133015573047]
経時的テスト時間適応(TTA)は、単一のドメインシフトだけでなく、一連のシフトも考慮している。
我々は,TTAの設定において,平均教師の整合性損失として対称的クロスエントロピーが適していることを示す。
提案手法は, 連続的, 段階的評価ベンチマークにおいて, RMT (Robust mean teacher) の有効性を実証する。
論文 参考訳(メタデータ) (2022-11-23T16:14:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。