論文の概要: Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning
- arxiv url: http://arxiv.org/abs/2607.27610v1
- Date: Thu, 30 Jul 2026 02:55:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.370455
- Title: Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning
- Title(参考訳): Kalman氏のCurriculum: 適応RLファインタニングのための効率的な動的プロンプト選択
- Authors: Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang,
- Abstract要約: 強化学習(Reinforcement Learning, RL)の微調整は、現在の政策に適切な困難を示すプロンプトを選択することに依存する。
評価ベースのアプローチは正確だがコストがかかる一方で、予測ベースのアプローチは効率的だが、通常は定常的な困難を前提としている。
動的状態推定問題としてプロンプト選択を再構成するカルマンガイド型プロンプト選択法(KGPS)を提案する。
- 参考スコア(独自算出の注目度): 28.677163084429164
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) finetuning significantly enhances the reasoning capabilities of large language models (LLMs), yet its effectiveness critically depends on selecting prompts of appropriate difficulty for the current policy. This is challenging because prompt difficulty evolves throughout training. Existing online methods therefore face a trade-off: evaluation-based approaches are accurate but expensive, while prediction-based approaches are efficient but typically assume stationary difficulty, making them ill-suited to RL's non-stationary training dynamics. To address these issues, we propose a Kalman-Guided Prompt Selection method (KGPS), which reformulates prompt selection as a dynamic state estimation problem rather than static difficulty prediction. KGPS models each prompt's latent success rate in logit space using a linear-Gaussian state-space model, with process noise coupled to the magnitude of policy updates so that uncertainty increases when the policy changes more substantially. A Kalman filter then maintains a calibrated Gaussian posterior over prompt difficulty, and prompts are selected by maximizing a posterior-expected training utility that favors intermediate-difficulty prompts while naturally revisiting uncertain ones. The resulting procedure is adaptive to policy drift and requires no additional rollouts beyond standard policy training. Extensive experiments across mathematics, planning, and geometry reasoning benchmarks, as well as multiple RL algorithms, show that KGPS consistently improves both final accuracy and rollout efficiency over strong baselines, establishing state-of-the-art performance among online prompt selection methods. For example, on DeepSeek-R1-Distill-7B, KGPS uses 83% fewer rollouts than DS while even improving the average performance by 0.12 point across six math reasoning benchmarks.
- Abstract(参考訳): 強化学習(RL)ファインタニングは,大規模言語モデル(LLM)の推論能力を大幅に向上させるが,その有効性は現行の政策に適する難易度を選択するプロンプトの選択に大きく依存する。
急激な困難はトレーニングを通じて進化するので、これは難しいです。
評価ベースのアプローチは正確だが高価であるのに対して、予測ベースのアプローチは効率的だが、通常は定常的な困難を前提としており、RLの非定常的なトレーニング力学には不適当である。
これらの問題に対処するために、静的な困難予測ではなく、動的状態推定問題としてプロンプト選択を再構成するKGPS(Kalman-Guided Prompt Selection)を提案する。
KGPSは、線形ガウス状態空間モデルを用いて、ロジット空間における各プロンプトの潜在成功率をモデル化する。
カルマンフィルタは、急激な困難に対して校正されたガウスの後部を維持し、不確実なことを自然に再考しながら、中間微分プロンプトを好む後部予測トレーニングユーティリティを最大化してプロンプトを選択する。
結果として得られた手順は、政策のドリフトに適応し、標準の政策トレーニング以外の追加のロールアウトを必要としない。
数学、計画、幾何推論ベンチマーク、および複数のRLアルゴリズムにわたる広範な実験により、KGPSは、強いベースラインよりも最終的な精度とロールアウト効率を一貫して改善し、オンラインプロンプト選択方法の最先端性能を確立していることが示された。
例えば、DeepSeek-R1-Distill-7Bでは、KGPSはDSよりも83%少ないロールアウトを使用し、6つの数学推論ベンチマークで平均パフォーマンスを0.12ポイント改善している。
関連論文リスト
- Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning [50.738952715864116]
表現的連続制御ポリシは、シミュレーションされた実ロボット制御のための模倣学習のスケーリングにおける進歩のバックボーンを形成する。
テスト時に完全にポリシー最適化を行うRLアルゴリズムであるQGF(Q-Guided Flow)を提案する。
実証的には、QGFはシングルタスクおよびゴール条件のオフラインRLベンチマークにおいて、以前のテスト時間RLメソッドよりも優れている。
論文 参考訳(メタデータ) (2026-06-09T16:45:57Z) - Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - Discrete Flow Matching for Offline-to-Online Reinforcement Learning [10.112779201155005]
DRIFTは、オフラインで事前訓練された連続時間マルコフ連鎖(CTMC)ポリシーを更新するオンラインの微調整手法である。
大規模離散的なアクション空間に対して、参照ポリシーロールアウトからサンプリングされたアクションの小さなサブセット上でアクターを更新する候補セット近似を導入する。
離散的動作RLタスクに対する実験により,本手法が全タスクに対して安定したオフライン-オンライン改善を実現することを示す。
論文 参考訳(メタデータ) (2026-05-12T16:44:02Z) - GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning [55.03441672267886]
強化学習のための勾配整列データ選択法GradAlignを提案する。
GradAlignは,信頼できない報酬信号,分散不均衡,低ユーティリティトレーニングコーパスの3つにまたがって評価する。
論文 参考訳(メタデータ) (2026-02-25T01:54:50Z) - Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding [59.60915947702282]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)の推論能力の向上に成功している。
既存のRLVR手法は、訓練データの困難さとモデルの能力のミスマッチにより、探索の非効率に悩まされることが多い。
本稿では,高効率領域に留まることの難易度を動的に調整する新しい監視支援RLVRフレームワークであるSEELEを提案する。
論文 参考訳(メタデータ) (2025-09-08T17:36:21Z) - Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models? [65.18157595903124]
本研究では任意のプロンプトの反復的近似評価について検討する。
Model Predictive Prompt Selection (MoPPS)はベイズにおけるリスク予測フレームワークである。
MoPPSは迅速な困難を確実に予測し、ロールアウトを大幅に削減したトレーニングを加速する。
論文 参考訳(メタデータ) (2025-07-07T03:20:52Z) - Optimal Sequential Decision-Making in Geosteering: A Reinforcement Learning Approach [0.0]
ジオステアリングと呼ばれる掘削プロセス全体の軌道調整決定は、その後の選択や情報収集に影響を与える。
本研究では,決定環境から直接学習するモデルフリー強化学習(RL)手法であるDeep Q-Network(DQN)手法を用いる。
これまでに2つの合成ジオステアリングシナリオに対して,RLは準最適ADPに匹敵する高品質な結果が得られることを示した。
論文 参考訳(メタデータ) (2023-10-07T10:49:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。