論文の概要: From Rollouts to Recipes: Self-Contained Post-Training for LLMs
- arxiv url: http://arxiv.org/abs/2609.01422v1
- Date: Tue, 01 Sep 2026 15:36:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.806907
- Title: From Rollouts to Recipes: Self-Contained Post-Training for LLMs
- Title(参考訳): ロールアウトからレシピへ:LDMの自己完結型ポストトレーニング
- Authors: Yifei Li, Lingling Zhang, Muye Huang, Zihan Ma, Jiashuai Liu, Jun Liu,
- Abstract要約: セルフルーティング(Self-Routing)は、ロールアウトの正確性と信頼性を使用して、各サンプルの最適化方法を決定する、行動条件付きポストトレーニングフレームワークである。
本稿では, 均一なGRPO, 均一なOPSD, 固定混合, より単純なルーティングベースラインに対して, 自己追従は一貫して改善されることを示す。
- 参考スコア(独自算出の注目度): 11.440101032760042
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training large language models usually applies a single training recipe to all samples, even though the model's own rollouts reveal different sample-level learning states. We propose Self-Routing, a behavior-conditioned post-training framework that uses rollout correctness and confidence to decide how each sample should be optimized. Depending on its behavior state, a sample is routed to GRPO, on-policy self-distillation, regularization, or skipping, allowing training to adapt without external teachers, extra annotations, or additional sampling. Experiments on mathematical reasoning across Qwen3 and Qwen3.5 backbones show that Self-Routing consistently improves over uniform GRPO, uniform OPSD, fixed mixtures, and simpler routing baselines. Further analyses show that the routing distribution changes over training and reduces unnecessary updates on low-signal or already stable samples.
- Abstract(参考訳): トレーニング後の大規模言語モデルは通常、サンプルレベルの学習状態が異なるにもかかわらず、すべてのサンプルに対して単一のトレーニングレシピを適用する。
ロールアウトの正しさと信頼性を利用して,各サンプルの最適化方法を決定する,行動条件付きポストトレーニングフレームワークであるSelf-Routingを提案する。
動作状況によっては、サンプルはGRPO、オンラインの自己蒸留、正規化、スキップにルーティングされ、外部の教師や追加のアノテーション、追加のサンプリングなしにトレーニングが適応できる。
Qwen3 と Qwen3.5 のバックボーンでの数学的推論実験により、自己ルートは均一なGRPO、均一なOPSD、固定混合、より単純なルーティングベースラインよりも一貫して改善されている。
さらなる分析により、ルーティング分布はトレーニングによって変化し、低信号または既に安定しているサンプルの不要な更新を減らすことが示されている。
関連論文リスト
- Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior [58.751981587234916]
本稿では,Refinement Provenance Inference (RPI)監査タスクをRefinement Provenance Inference (RPI)として定式化する。
本稿では,ロジットレベルの信号で教師が強制する可能性機能を融合させるロジットベースのフレームワークであるReProを提案する。
トレーニング中、ReProはシャドウファインチューニングを通じて転送可能な表現を学び、訓練データアクセスなしで、見えない犠牲者の証明を推測するために軽量のリニアヘッドを使用する。
論文 参考訳(メタデータ) (2026-01-05T10:16:41Z) - Reinforce-Ada: An Adaptive Sampling Framework for Reinforce-Style LLM Training [47.26632817047513]
大規模言語モデル(LLM)に推論タスクに適用された強化学習は、不安定な勾配推定によってボトルネックとなることが多い。
LLMのオンラインRLポストトレーニングのための適応型サンプリングフレームワークであるReinforce-Adaを提案する。
従来の2段階配置法とは異なり、Reinforce-Adaはオンライン連続除去プロセスにおける推定とサンプリングをインターリーブする。
論文 参考訳(メタデータ) (2025-10-06T16:34:09Z) - AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners [35.730489673985936]
Self-Taughters (STaR)は、自己改善推論言語モデル(LM)のトレーニングパイプラインの不可欠な部分である。
本稿では,2つの適応サンプリング原理を組み込んだ新しいアルゴリズムであるAdaptive STaR(AdaSTaR)を紹介する。
AdaSTaRは全てのインスタンスで最高のテスト精度を達成し、幅広いベースラインリストに対して平均58.6%のトレーニングFLOPを削減している。
論文 参考訳(メタデータ) (2025-05-22T07:24:11Z) - Take the Bull by the Horns: Hard Sample-Reweighted Continual Training
Improves LLM Generalization [165.98557106089777]
大きな言語モデル(LLM)の能力を高めることが大きな課題だ。
本研究は,従来の事前学習データセットを用いたLCMの光連続訓練に関する実証的戦略から始まった。
次に、この戦略をインスタンス重み付け分散ロバスト最適化の原則化されたフレームワークに定式化します。
論文 参考訳(メタデータ) (2024-02-22T04:10:57Z) - Semantic Self-adaptation: Enhancing Generalization with a Single Sample [45.111358665370524]
セマンティックセグメンテーションのための自己適応型アプローチを提案する。
整合正則化を用いて畳み込み層のパラメータを入力画像に微調整する。
実験により, 自己適応は訓練時のモデル正規化の確立した実践を補完する可能性が示唆された。
論文 参考訳(メタデータ) (2022-08-10T12:29:01Z) - Distributionally Robust Models with Parametric Likelihood Ratios [123.05074253513935]
3つの単純なアイデアにより、より広いパラメトリックな確率比のクラスを用いてDROでモデルを訓練することができる。
パラメトリック逆数を用いてトレーニングしたモデルは、他のDROアプローチと比較して、サブポピュレーションシフトに対して一貫して頑健であることがわかった。
論文 参考訳(メタデータ) (2022-04-13T12:43:12Z) - One for More: Selecting Generalizable Samples for Generalizable ReID
Model [92.40951770273972]
本稿では,選択したサンプルを損失関数として一般化する1対3の学習目標を提案する。
提案した1対3のサンプルは,ReIDトレーニングフレームワークにシームレスに統合できる。
論文 参考訳(メタデータ) (2020-12-10T06:37:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。