論文の概要: Online Self-Weighted Fine-Tuning
- arxiv url: http://arxiv.org/abs/2609.00734v1
- Date: Tue, 01 Sep 2026 05:12:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.378939
- Title: Online Self-Weighted Fine-Tuning
- Title(参考訳): オンライン自重ファインチューニング
- Authors: Haiquan Wen, Yiwei He, Bei Peng, Guangliang Cheng,
- Abstract要約: 強化学習(RL)に基づく手法は,モデル生成ロールアウトを用いて更新強度を適応する。
オンライントラジェクトリレベルの重み付けによりSFTを増強する簡単な方法である textbfOnline Self-Weighted Fine-Tuning (OSW-FT) を提案する。
OSW-FTは小さなスケールモデルではSFTよりも一貫して改善されている。
- 参考スコア(独自算出の注目度): 13.544097764061886
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Standard supervised fine-tuning (SFT) assigns the same explicit loss weight to every expert demonstration, regardless of the model's changing competence over training queries. Reinforcement learning (RL) based methods adapt update strength using model-generated rollouts, but often require substantially more sampling and can be unstable on hard tasks. We propose \textbf{Online Self-Weighted Fine-Tuning (OSW-FT)}, a simple method that augments SFT with online, trajectory-level weighting. For each query, OSW-FT estimates the model's current success rate using a small number of inference-only rollouts and rescales the standard SFT loss accordingly. The optimization direction remains anchored to the expert trajectory, while the update magnitude adapts online. For binary-verifiable reasoning, we connect this weighting to SFT and RL at the gradient level, inspired by variance-reduction principles. The resulting estimator is unbiased for the exact OSW-FT surrogate update for any finite rollout count, and we analyze convergence with respect to the corresponding surrogate objective. Evaluated across Qwen3 series ranging from 0.6B to 4B on multiple challenging benchmarks (e.g., AIME), OSW-FT consistently improves over SFT on small-to-medium scale models. OSW-FT offers a favorable compute-performance trade-off as a practical approach for fine-tuning small-to-medium LLMs on binary-verifiable reasoning tasks with only \textbf{2 online rollouts}.
- Abstract(参考訳): 標準教師付き微調整(SFT)は、訓練クエリに対するモデルの能力の変化に関わらず、すべての専門家のデモンストレーションに同じ明示的な損失重みを割り当てる。
強化学習(Reinforcement Learning, RL)に基づく手法は, モデル生成ロールアウトによる更新強度に適応するが, サンプリングがかなり必要であり, ハードタスクでは不安定であることが多い。
オンラインのトラジェクトリレベルの重み付けでSFTを増強する簡易な方法である \textbf{Online Self-Weighted Fine-Tuning (OSW-FT)} を提案する。
各クエリに対して、OSW-FTは、少数の推論のみのロールアウトを使用してモデルの現在の成功率を推定し、それに従って標準のSFT損失を再スケールする。
最適化の方向は専門家の軌道に固定され、更新の規模はオンラインで適応する。
バイナリ検証可能な推論では、この重み付けを分散還元原理にインスパイアされた勾配レベルで SFT と RL に接続する。
得られた推定器は, 有限ロールアウト数に対するOSW-FTサロゲートの正確な更新に偏りがなく, 対応するサロゲートの目的に対する収束を解析する。
Qwen3シリーズは0.6Bから4Bまでの複数の挑戦的なベンチマーク(例えばAIME)で評価され、OSW-FTは小さなスケールモデルでSFTよりも一貫して改善されている。
OSW-FTは、textbf{2 オンラインロールアウトのみを用いたバイナリ検証可能な推論タスクにおいて、小型から中級の LLM を微調整するための実用的なアプローチとして、好適な計算性能トレードオフを提供する。
関連論文リスト
- Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport [35.12591387008241]
Weightless Fine-Tuning (WFT) は、教師付き適応の分布効果を更新なしで近似する訓練なし復号時間法である。
WFTはデータセット間で最高の平均パフォーマンスを達成し、個々のタスクでSFTにマッチまたは超過し、他の軽量ベースラインを平均で上回る。
論文 参考訳(メタデータ) (2026-08-11T18:49:03Z) - Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models [52.11240605311707]
改良された微調整と強化学習は、大規模言語モデルの訓練後の標準パラダイムとなっている。
EKSFT(Entropy-KL Selective Fine-Tuning)は,参照モデルから高いエントロピーまたは高いKLの発散を示すトークンを選択的にマスクする。
数学的推論ベンチマークに関する実証的な評価は、EKSFTが標準SFTを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-28T03:36:05Z) - SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning [54.393763477932474]
Supervised Fine-Tuning (SFT) と Reinforcement Learning (RL) は、大規模言語モデル(LLM)の標準訓練パラダイムとして登場した。
本稿では,トークン探索空間に基づく多様性を適応的に促進するSED-SFTを提案する。
このフレームワークは、選択的なマスキング機構を備えた選択エントロピー正規化項を最適化目的に導入する。
論文 参考訳(メタデータ) (2026-02-07T09:39:21Z) - Trust-Region Adaptive Policy Optimization [82.09255251747818]
後学習法は,大規模言語モデル(LLM)の複雑な推論能力の向上に重要な役割を果たしている。
トレーニングインスタンス毎に,Fun-Tuning(SFT)とReinforcement Learning(RL)をインターリーブするフレームワークであるTRAPOを紹介する。
5つの数学的推論ベンチマークの実験は、TRAPOが標準SFT、RL、SFT-then-RLパイプラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-19T14:37:07Z) - AMFT: Aligning LLM Reasoners by Meta-Learning the Optimal Imitation-Exploration Balance [7.685078284407324]
大規模言語モデル(LLM)は通常、2段階のパイプライン(SFT)と強化学習(RL)による推論タスクのために微調整される。
最近の単段法では、SFTとRLを原理的に統一しようとするが、2つのパラダイムを動的にバランスさせるメカニズムが欠如している。
我々は,SFTの暗黙的,パスレベルの報酬とRLの明示的,結果に基づく報酬との最適バランスを学習する,新しいシングルステージアルゴリズムである textbf Meta Fine-Tuning (AMFT) を紹介する。
論文 参考訳(メタデータ) (2025-08-09T11:40:54Z) - On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification [61.607788999847564]
LLM(Large Language Model)のためのSFT(Supervised Fine-Tuning)の改良法を提案する。
標準SFT勾配は、モデルの一般化能力を著しく制限する問題のある報酬構造を暗黙的に符号化する。
本稿では,このトークンの確率で目的関数を動的に再スケーリングすることにより,各トークンの勾配を安定化する動的微調整(DFT)を提案する。
論文 参考訳(メタデータ) (2025-08-07T17:59:04Z) - Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective [98.45690529036848]
Supervised Fine-Tuning (SFT) や Reinforcement Fine-Tuning (RFT) といったポストトレーニングアルゴリズムは、マルチモーダルな大規模言語モデルを下流タスクに適応するために広く使われている。
タスク適応には有効であるが、以前の知識に対する影響はいまだ不明である。
論文 参考訳(メタデータ) (2025-06-30T04:15:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。