論文の概要: LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
- arxiv url: http://arxiv.org/abs/2607.04412v1
- Date: Sun, 05 Jul 2026 17:05:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.923794
- Title: LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL
- Title(参考訳): LLM-as-a-Tutor:不検証RLに対するポリシー対応プロンプト適応
- Abstract要約: 検証不能な指導のための強化学習は、報酬信号としてプロンプト固有のルーリックを持つ裁判官に依存している。
最近の手法は、トレーニング中にこれらのルーリックを進化するポリシーに適応させるが、トレーニングのプロンプト自体は静的のままである。
この静的なアプローチは、しばしば急激な困難と政策能力の間に重大なミスアライメントをもたらし、裁判官は差別的な報酬信号を取り戻すことができない。
- 参考スコア(独自算出の注目度): 64.4276583943816
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) for non-verifiable instruction following increasingly relies on LLM judges with prompt-specific rubrics as reward signals. While recent methods adapt these rubrics to the evolving policy during training, the training prompts themselves remain static, drawn from fixed corpora. This static approach often results in a critical misalignment between prompt difficulty and policy capability, leaving the judge unable to recover a discriminative reward signal when prompts fail to elicit quality variance among rollouts. To address this misalignment, we introduce LLM-as-a-Tutor, a framework that extends the LLM's role from judge to tutor: a single model serves as an examiner that pairwise-compares policy rollouts to detect non-challenging prompts, and as a generator that appends atomic constraints to them. This append-only design monotonically raises difficulty in step with the policy's capability, producing a self-calibrating training signal without external difficulty schedules. On three complex instruction-following benchmarks, our method consistently outperforms both policy-unaware baselines and prior policy-adaptive methods that adapt rubrics or rewrite prompts, suggesting prompt adaptation as a missing axis of policy-awareness in non-verifiable RL.
- Abstract(参考訳): 検証不能な指導のための強化学習(RL)は、報酬信号としてプロンプト特異的なルーリックを持つLLM審査員にますます依存している。
最近の手法では、これらのルーブリックをトレーニング中に進化するポリシーに適応させるが、トレーニングのプロンプトは固定されたコーパスから引き出された静的のままである。
この静的アプローチは、しばしば、迅速な難易度と政策能力の間に重大なミスアライメントをもたらし、プロンプトがロールアウト間で品質のばらつきを引き起こさない場合に、裁判官は差別的な報酬信号を回復できない。
このミスアライメントに対処するために、LLM-as-a-Tutor(LLMの役割を判断から教師へ拡張するフレームワーク)を紹介します。単一モデルは、不整合性プロンプトを検出するために、ポリシーロールアウトをペアで比較する検査器として機能し、それらに原子制約を付加するジェネレータとして機能します。
この追加のみの設計は、ポリシーの能力と歩調を単調に向上させ、外部の困難スケジュールを伴わずに自己校正訓練信号を生成する。
3つの複雑な命令追従ベンチマークにおいて,本手法は,ルーブリックや書き直しプロンプトを適応するポリシ非認識ベースラインと,それ以前のポリシー適応手法の両方を一貫して上回り,不検証RLにおけるポリシー認識の欠落軸として即時適応を示唆する。
関連論文リスト
- Enhancing Rubric-based RL via Self-Distillation [23.111278687216544]
本稿では, ルブリックをベースとしたRLをオンライン自己蒸留により強化するCriPO(Criterion-Distilled Policy Optimization)を提案する。
CriPOはルーブリックベースのRLを一貫して上回り、最適化手順を減らした約2ドルで、より強力な最終性能を実現している。
論文 参考訳(メタデータ) (2026-07-20T15:50:02Z) - Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning [1.6038757247653772]
強化学習(Reinforcement Learning、RL)の研究は、エージェントが人間の価値観に忠実な行動を学ぶように、アライメントに焦点を移している。
提案手法は,評価フィードバックを補正信号として活用し,模倣学習ポリシーの整合性を改善するアルゴリズム非依存の手法である。
我々は、安全体育館環境をアライメント評価のための原則的テストベッドに適合させ、改良された適性を示し、様々な模倣学習アルゴリズムで最大98%の誤調整を減らした。
論文 参考訳(メタデータ) (2026-07-08T18:47:29Z) - Stabilizing Reinforcement Learning with LLMs: Formulation and Practices [61.361819972410046]
本稿では,REINFORCEなどの政策勾配法において,真のシーケンスレベルの報酬を代用トークンレベルの目的によって最適化できる理由と条件を示す。
この洞察は、RLトレーニングの安定化において、広く採用されているいくつかのテクニックの重要な役割について、原則化された説明を提供する。
論文 参考訳(メタデータ) (2025-12-01T07:45:39Z) - One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient [16.05489579792086]
政策勾配法を用いてSFTを誘導する新しい微調整アルゴリズムであるワンツーケンロールアウト(OTR)を導入する。
OTRは、各トークン生成を1ステップ強化学習軌跡として扱うことにより、自己回帰学習プロセスを再構築する。
我々は,OTRを微調整LDMの強力で実用的な代替品として位置づけた。
論文 参考訳(メタデータ) (2025-09-30T14:25:56Z) - LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation [7.054214377609925]
強化学習(RL)は、様々な領域で顕著な成功を収めている。
複雑なタスクに対する効果的なポリシーの訓練は依然として難しい。
既存のトレーニングボトルネックを軽減するアプローチは、2つのカテゴリに分類される。
論文 参考訳(メタデータ) (2025-05-27T03:40:02Z) - Projected Off-Policy Q-Learning (POP-QL) for Stabilizing Offline
Reinforcement Learning [57.83919813698673]
Projected Off-Policy Q-Learning (POP-QL) は、政治外のサンプルを同時に重み付け、分散を防止し、価値近似誤差を減らすためにポリシーを制約する新しいアクタ批判アルゴリズムである。
我々の実験では、POP-QLは標準ベンチマーク上での競合性能を示すだけでなく、データ収集ポリシーがかなり最適化されていないタスクにおいて競合するメソッドよりも優れています。
論文 参考訳(メタデータ) (2023-11-25T00:30:58Z) - Coherent Soft Imitation Learning [17.345411907902932]
模倣学習法は、政策の行動クローニング(BC)や報酬の逆強化学習(IRL)を通じて専門家から学ぶ。
この研究は、BCとIRLの両方の強度を捉える模倣法に由来する。
論文 参考訳(メタデータ) (2023-05-25T21:54:22Z) - Curriculum Offline Imitation Learning [72.1015201041391]
オフラインの強化学習タスクでは、エージェントは、環境とのさらなるインタラクションなしに、事前にコンパイルされたデータセットから学ぶ必要がある。
我々は,適応的な近隣政策を模倣する経験的選択戦略を,より高いリターンで活用するテキストカリキュラムオフライン学習(COIL)を提案する。
連続制御ベンチマークでは、COILを模倣ベースとRLベースの両方の手法と比較し、混合データセット上で平凡な振る舞いを学ぶことを避けるだけでなく、最先端のオフラインRL手法と競合することを示します。
論文 参考訳(メタデータ) (2021-11-03T08:02:48Z) - DDPG++: Striving for Simplicity in Continuous-control Off-Policy
Reinforcement Learning [95.60782037764928]
過大評価バイアスが制御される限り、単純な決定論的政策勾配は著しく機能することを示す。
第二に、非政治的なアルゴリズムの典型であるトレーニングの不安定性を、欲張りのポリシー更新ステップに向ける。
第3に、確率推定文学におけるアイデアは、リプレイバッファからの重要サンプル遷移や、性能劣化を防ぐためのポリシー更新に利用できることを示す。
論文 参考訳(メタデータ) (2020-06-26T20:21:12Z) - Strictly Batch Imitation Learning by Energy-based Distribution Matching [104.33286163090179]
すなわち、強化信号へのアクセスがなく、遷移力学の知識がなく、環境とのさらなる相互作用もない。
1つの解決策は、既存のアルゴリズムをオフライン環境で動作させるために、見習いの学習に適合させることである。
しかし、このようなアプローチは、政治外の評価やオフラインモデルの推定に大きく依存しており、間接的で非効率である可能性がある。
優れたソリューションは、ポリシーを明示的にパラメータ化し、ロールアウトダイナミクスから暗黙的に学習し、完全にオフラインで運用できるべきだ、と私たちは主張する。
論文 参考訳(メタデータ) (2020-06-25T03:27:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。