論文の概要: Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs
- arxiv url: http://arxiv.org/abs/2609.01573v1
- Date: Tue, 01 Sep 2026 17:39:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.901616
- Title: Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs
- Title(参考訳): 小型から大型LLMにおけるSFT-RLアノテーション予算のスケーリング
- Authors: Jingtan Wang, Arun Verma, Xiaoqiang Lin, Zhengyuan Liu, Nancy F. Chen, Daniela Rus, Bryan Kian Hsiang Low,
- Abstract要約: 教師付き微調整と強化学習の間に固定アノテーションの予算を分割する方法は、未解決の問題である。
ピーク性能の特定の許容範囲内でのアロケーションの集合である近最適領域を特徴付ける。
我々の結果は、タスク、モデルファミリー、および好みに基づくオフ・ポリティクスと報酬・スーパービジョン・オン・ポリティクスの2つの方法に一貫して当てはまる。
- 参考スコア(独自算出の注目度): 115.29900088092823
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How to divide a fixed annotation budget between supervised fine-tuning (SFT) and reinforcement learning (RL) during LLM post-training remains an open problem. Existing work characterizes only broad trends (e.g., SFT dominates in low-data regimes), lacks a principled allocation framework, and does not examine whether the optimal ratio transfers across model sizes. We frame this problem in terms of near-optimality: rather than seeking a single optimal SFT-RL ratio, we characterize the near-optimal region, the set of allocations within a specified tolerance of peak performance. Empirically, this region is wide even for small tolerances (2-10%), widens with model scale, and transfers reliably from small proxy models to large target models. This yields a practical strategy: small proxy-model experiments suffice to identify a transferable near-optimal region, eliminating the need for exhaustive large-scale search. Our results hold consistently across tasks, model families, and both preference-based off-policy and reward-supervision on-policy RL methods. We further analyze how the asymmetry in annotation costs between SFT and RL data shifts the near-optimal region.
- Abstract(参考訳): LLM後トレーニングにおいて、教師付き微調整(SFT)と強化学習(RL)の固定アノテーション予算を分割する方法は未解決の問題である。
既存の作業は、広範囲なトレンド(例えば、SFTは低データレシエーションにおいて支配的な)のみを特徴付け、原則的なアロケーションフレームワークが欠如しており、モデルサイズ間で最適な比が転送されるかどうかを検証していない。
最適なSFT-RL比を求めるのではなく、ピーク性能の許容範囲内でのアロケーションのセットである準最適領域を特徴付ける。
実証的には、この領域は小さな許容範囲(2-10%)でも広く、モデルスケールで拡張され、小さなプロキシモデルから大きなターゲットモデルへ確実に転送される。
小さいプロキシモデル実験は、転送可能な準最適領域を特定するのに十分であり、大規模な探索の必要がなくなる。
我々の結果は、タスク、モデルファミリー、および好みに基づくオフ・ポリティクスと報酬・スーパービジョン・オン・ポリティクスの2つの方法に一貫して当てはまる。
さらに、SFTデータとRLデータの間の非対称性が、近最適領域をどのようにシフトするかを解析する。
関連論文リスト
- RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment [57.588738943463646]
大規模言語モデル(LLM)は機械翻訳(MT)において顕著な性能を発揮した
大規模に展開するのは 違法に高価です
モデル内ルータである textbfRouteLMT を提案する。
論文 参考訳(メタデータ) (2026-04-24T13:02:45Z) - Trust-Region Adaptive Policy Optimization [82.09255251747818]
後学習法は,大規模言語モデル(LLM)の複雑な推論能力の向上に重要な役割を果たしている。
トレーニングインスタンス毎に,Fun-Tuning(SFT)とReinforcement Learning(RL)をインターリーブするフレームワークであるTRAPOを紹介する。
5つの数学的推論ベンチマークの実験は、TRAPOが標準SFT、RL、SFT-then-RLパイプラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2025-12-19T14:37:07Z) - Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved) [3.13388270461847]
我々は、教師付き微調整(SFT)と強化学習(RL)による最適政策の発見理論と実践との関係を描いている。
SFTに小さな修正を加えることで、RLのトレーニングに近く行動する重み付き変異が重要となることを示す。
我々は、この変種を重み付けされた教師付き微調整(iw-SFT)として参照する。
論文 参考訳(メタデータ) (2025-07-17T07:26:54Z) - Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections [65.36449542323277]
本稿では,Large Language Model (LLM) 後の学習において,SFT(Supervised Fine-Tuning) と優先学習を統合した理論フレームワークを提案する。
そこで本研究では,学習率の簡易かつ効果的な削減手法を提案する。
論文 参考訳(メタデータ) (2025-06-15T05:42:29Z) - Predictable Scale: Part II, Farseer: A Refined Scaling Law in Large Language Models [62.3458061002951]
本稿では,新たなスケール法であるFarseerを紹介した。
モデル損失曲面 $L(N,D)$ を体系的に構築することにより、Farseer は以前の法則よりも経験的データに非常によく適合する。
我々の手法は正確で頑健で、非常に一般化可能な予測をもたらし、優れた外挿能力を示す。
論文 参考訳(メタデータ) (2025-06-12T17:59:23Z) - Balancing the Budget: Understanding Trade-offs Between Supervised and Preference-Based Finetuning [18.381178799923514]
大規模言語モデルの訓練後、しばしば監視ファインタニング(SFT)のパイプラインと、優先度ファインタニング(PFT)が伴う。
本研究では,2段階間のトレーニングデータ予算を最適に割り当てる方法について検討する。
論文 参考訳(メタデータ) (2025-02-16T21:57:35Z) - Minor SFT loss for LLM fine-tune to increase performance and reduce model deviation [9.506166330956082]
最適化されたモデルと元のモデルとの差分を測定するためのSFTのトレーニング指標と、トレーニングの有効性を高めることができる損失関数MinorSFTを提案する。
本稿では,DPO と MinorDPO の知見を得て,最適化モデルとオリジナルモデルとの差分を測定するための SFT のトレーニング指標と,トレーニングの有効性を高めることができる損失関数 MinorSFT を提案する。
論文 参考訳(メタデータ) (2024-08-20T08:32:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。