論文の概要: Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training
- arxiv url: http://arxiv.org/abs/2608.09217v1
- Date: Mon, 10 Aug 2026 07:43:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.128124
- Title: Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training
- Title(参考訳): 可解性を超えて: LLM RL後のトレーニングの静的事前としてのタスク学習可能性
- Abstract要約: 強化学習(Reinforcement Learning, RL)は、大規模言語モデルにおける推論能力を引き出すための訓練後のパラダイムである。
本研究では,この残差軸をタスク学習可能性として検討する。
そこで我々はTrajValを提案する。TrajValは、短いプローブランと2つのエンドポイント評価からタスク毎の学習可能性を近似する軽量なプローブベース推定器である。
- 参考スコア(独自算出の注目度): 52.78248352851176
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has become a central post-training paradigm for eliciting reasoning capabilities in large language models, yet uniform task sampling allocates compute without regard to differences in how tasks respond to optimization. Existing task-valuation methods mostly rely on snapshot-based signals such as current pass rate or reward, which estimate how solvable a task is under the current policy. However, tasks with similar current solvability can still differ substantially in how positively they respond to further training. We study this residual axis as task learnability: a regime-conditional measure of expected positive response to continued training under a fixed RL post-training regime. By analyzing per-task reward trajectories, we find that learnability is reproducible across independently sampled training contexts and predictive of downstream utility. To make this signal practical before training begins, we propose TrajVal, a lightweight probe-based estimator that approximates per-task learnability from a short probe run and two endpoint evaluations. TrajVal can be used either as a standalone static prior for task sampling or as a multiplicative prior for existing online schedulers. Experiments on mathematical and logical reasoning benchmarks across multiple model scales show that TrajVal improves data efficiency over uniform sampling and provides complementary gains when combined with online scheduling methods.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、大規模言語モデルにおける推論能力を引き出すための訓練後の中心パラダイムとなっているが、一様タスクサンプリングは、タスクの最適化への応答方法の違いによらず、計算を割り当てている。
既存のタスク評価手法は主に現在のパスレートや報酬のようなスナップショットベースの信号に依存しており、現在のポリシーの下でタスクがどの程度解決可能かを見積もっている。
しかし、現在の可解性に類似したタスクは、さらなるトレーニングにどれほどポジティブに反応するかという点で、依然として大きく異なる可能性がある。
我々は,この残差軸をタスク学習性として検討し,一定のRL後学習体制下での継続トレーニングに対する期待された正の反応の条件を定めている。
タスクごとの報酬軌跡を解析することにより、個別にサンプル化したトレーニングコンテキスト間で学習可能性が再現可能であり、下流ユーティリティの予測が可能であることが判明した。
トレーニング開始前にこの信号を実用的なものにするために、短いプローブ実行と2つのエンドポイント評価からタスク毎の学習可能性を近似する軽量なプローブベース推定器であるTrajValを提案する。
TrajValは、タスクサンプリングのスタンドアロンの静的プリアとして、あるいは既存のオンラインスケジューラの乗算プリアとして、使用することができる。
複数のモデルスケールにわたる数学的および論理的推論ベンチマークの実験は、TrajValが一様サンプリングよりもデータ効率を向上し、オンラインスケジューリング手法と組み合わせて補完的な利得を提供することを示している。
関連論文リスト
- Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks [20.988724384459392]
評価の前に各モデルにタスク関連トレーニングを施すことにより、タスク親しみやすさを列車前テストで制御する。
列車前テストのための2段階テスト時強化学習(RL)アライメント手法を提案する。
論文 参考訳(メタデータ) (2026-03-13T10:24:19Z) - Zero-Shot Off-Policy Learning [9.729890516322781]
オフ政治学習法は、事前の相互作用の固定されたデータセットから直接最適なポリシーを導き出そうとする。
本研究では, 定常密度比に対する後継対策の理論的関連を見出すことにより, ゼロショット環境での政治外問題に対処する。
提案アルゴリズムは最適な重要度サンプリング比を推定し,任意のタスクに対して最適なポリシで定常分布補正を効果的に行う。
論文 参考訳(メタデータ) (2026-02-02T11:06:31Z) - BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning [82.925106913459]
強化微調整(Reinforcement Finetuning, RFT)は、大規模言語モデル(LLM)を人間の嗜好と整合させ、推論を強化するための重要な手法である。
RFT強化微調整におけるベイズオンラインタスク選択のための統合フレームワークBOTSを紹介する。
論文 参考訳(メタデータ) (2025-10-30T11:15:23Z) - Investigating task-specific prompts and sparse autoencoders for activation monitoring [0.0]
言語モデルの内部アクティベーションは、これに役立つ追加情報をエンコードする。
最近の研究は、単純線形探索を改善するいくつかのアプローチを提案している。
我々は,これらの手法の新たな改良を開発し,検証し,比較する。
論文 参考訳(メタデータ) (2025-04-28T21:28:17Z) - Exploring RL-based LLM Training for Formal Language Tasks with Programmed Rewards [49.7719149179179]
本稿では,PPOを用いた強化学習(RL)の実現可能性について検討する。
我々は,生成した出力の質を自動的に評価するために,明示的な報酬関数をプログラムできるプログラミングなどの形式言語で表されるタスクに焦点をあてる。
以上の結果から,2つの形式言語タスクに対する純粋なRLベースのトレーニングは困難であり,単純な算術タスクにおいても成功は限られていることがわかった。
論文 参考訳(メタデータ) (2024-10-22T15:59:58Z) - Model-Based Transfer Learning for Contextual Reinforcement Learning [5.5597941107270215]
文脈RL問題の解法としてモデルベーストランスファー学習を導入する。
理論的には,本手法は訓練作業数のサブリニアな後悔を示す。
都市交通と標準連続制御ベンチマークを用いて,提案手法を実験的に検証した。
論文 参考訳(メタデータ) (2024-08-08T14:46:01Z) - How Many Pretraining Tasks Are Needed for In-Context Learning of Linear Regression? [92.90857135952231]
様々なタスクで事前訓練されたトランスフォーマーは、顕著なインコンテキスト学習(ICL)能力を示す。
線形回帰のための線形パラメータ化単一層線形アテンションモデルの事前学習を行う。
論文 参考訳(メタデータ) (2023-10-12T15:01:43Z) - Supervised Pretraining Can Learn In-Context Reinforcement Learning [96.62869749926415]
本稿では,意思決定問題における変換器の文脈内学習能力について検討する。
本稿では,変換器が最適動作を予測する教師付き事前学習法であるDPT(Decision-Pretrained Transformer)を導入,研究する。
事前学習した変換器は、オンラインと保守主義の両方をオフラインで探索することで、コンテキスト内における様々なRL問題の解決に利用できる。
論文 参考訳(メタデータ) (2023-06-26T17:58:50Z) - Task-Customized Self-Supervised Pre-training with Scalable Dynamic
Routing [76.78772372631623]
セルフ教師付き事前トレーニングの一般的な実践は、できるだけ多くのデータを使用することである。
しかし、特定のダウンストリームタスクでは、事前トレーニングで無関係なデータを含むと、ダウンストリームのパフォーマンスが低下する可能性がある。
異なるタスクのための事前トレーニングで、異なるダウンストリームタスクにカスタマイズされたデータセットを使用することは、重荷であり、実現不可能である。
論文 参考訳(メタデータ) (2022-05-26T10:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。