論文の概要: LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks
- arxiv url: http://arxiv.org/abs/2607.18110v1
- Date: Mon, 20 Jul 2026 16:08:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.700491
- Title: LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks
- Title(参考訳): LLM-as-a-coach: 検証不可能なタスクに対する経験的学習
- Abstract要約: LLM-as-a-JudgeからLLM-as-a-Coachへのフィードバックモデルを再利用した経験的学習(EL)を提案する。
ELは、保持された未確認のオープンエンドタスクにおいて、ルブリックベースのRLを一貫して上回る。
これらの知見は、検証不可能なタスクのポストトレーニングにおいて、より豊かでより一般化可能な学習信号として経験的知識を確立した。
- 参考スコア(独自算出の注目度): 89.13372484640392
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) on open-ended tasks compresses an LLM's rubric-based evaluation into a scalar reward, discarding rich textual feedback and conflating responses with distinct quality profiles. We propose Experiential Learning (EL), which repurposes the feedback model from an LLM-as-a-Judge into an LLM-as-a-Coach. The coach distills its assessment of each on-policy response into transferable experiential knowledge, which conditions a teacher model and is internalized by the policy through on-policy context distillation. Compared with scalar rewards, this higher-bandwidth feedback channel provides dense supervision and preserves fine-grained preferences among high-quality responses. Across two policy families, with feedback from the policy itself or a proprietary model, EL consistently outperforms rubric-based RL on held-out and unseen open-ended tasks. Notably, EL generalizes better beyond the training distribution, and mitigates reward hacking. These findings establish experiential knowledge as a richer and more generalizable learning signal for post-training on non-verifiable tasks.
- Abstract(参考訳): オープンエンドタスクにおける強化学習(RL)は、LLMのルーブリックに基づく評価をスカラー報酬に圧縮し、リッチなテキストフィードバックを破棄し、応答を異なる品質プロファイルで膨らませる。
LLM-as-a-JudgeからLLM-as-a-Coachへのフィードバックモデルを再利用した経験的学習(EL)を提案する。
コーチは、各オンライン応答の評価をトランスファー可能な体験知識に蒸留し、教師モデルを条件とし、オン・ポリシーコンテキストの蒸留を通じて政策によって内部化される。
高い帯域幅のフィードバックチャネルは、スカラー報酬と比較して、密集した監視を提供し、高品質な応答間のきめ細かい好みを保っている。
ポリシー自体やプロプライエタリなモデルからフィードバックを受けた2つのポリシファミリ全体で、ELは、保持された未確認のオープンなタスクにおいて、ルリックベースのRLを一貫して上回ります。
特に、ELはトレーニングディストリビューション以上のものを一般化し、報酬のハッキングを軽減します。
これらの知見は、検証不可能なタスクのポストトレーニングにおいて、より豊かでより一般化可能な学習信号として経験的知識を確立した。
関連論文リスト
- Group-Reflective Self-Distillation for Agentic Reinforcement Learning [8.041052886037766]
GRSD(Group-Reflective Self-Distillation)は、政策が検証したロールアウトから、能力の整合性と結果の差別的なガイダンスを導出する。
GRSDは競争ベースラインを一貫して上回り、目に見えないタスクをより効果的に一般化する。
論文 参考訳(メタデータ) (2026-07-30T11:49:46Z) - Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation [50.696688705287755]
我々は、強化学習におけるスパース報酬課題を克服するために、相互情報自己評価を提案する。
MISEにより、エージェントは、疎外的信号を補う高密度な内部報酬から自律的に学習することができる。
我々は、後見自己評価報酬を利用することは、政策と代行報酬政策の間のKL分散項と相互情報を組み合わせた目的を最小化することと等価であることを示す。
論文 参考訳(メタデータ) (2026-04-13T15:18:51Z) - Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs [17.47321135631444]
HeRLは、強化学習フレームワークをガイドしたHindsightエクスペリエンスである。
我々は,HRLがLLMに対して,報酬に指定された望ましい振る舞いを明示的に示すことによって,効果的な探索を行う方法を示す。
論文 参考訳(メタデータ) (2026-03-20T15:32:06Z) - Learning in Context, Guided by Choice: A Reward-Free Paradigm for Reinforcement Learning with Transformers [55.33468902405567]
本稿では、事前学習とデプロイの両方が好みのフィードバックにのみ依存する新しい学習パラダイム、In-Context Preference-based Reinforcement Learning (ICPRL)を提案する。
ICPRLは、厳密なコンテキスト内一般化を可能にし、完全な報酬管理で訓練されたICRLメソッドに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-09T03:42:16Z) - LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs [73.27182315028021]
LANPOは、フィードバックの役割をきれいに分離するフレームワークである。
我々の研究は、歴史体験をLLM RLループに統合する堅牢な方法を提供し、より効果的でデータ効率のよい学習エージェントを作成します。
論文 参考訳(メタデータ) (2025-10-18T15:51:19Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - Post-Training Large Language Models via Reinforcement Learning from Self-Feedback [3.73824942136665]
大規模言語モデル(LLM)は、しばしば可算だが校正が不十分な回答を生成する。
本稿では,自己フィードバックによる強化学習(RLSF)について紹介する。
論文 参考訳(メタデータ) (2025-07-29T15:46:26Z) - Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective [6.069069082518759]
大規模言語モデル(LLM)の強化学習におけるゼロ・リワード推定について検討する。
反応レベル報酬モデルのみを用いて、真で未知のトークンレベルの報酬に基づくポリシー勾配を不偏に推定できることを示す。
我々は,新しいアルゴリズム,Token-Reinforced Policy Optimization (TRePO)を提案する。
論文 参考訳(メタデータ) (2025-06-03T07:44:31Z) - Bridging Supervised Learning and Reinforcement Learning in Math Reasoning [55.889740979706815]
強化学習(Reinforcement Learning, RL)は、二分検証信号による自己改善を可能にすることで、近年の数学能力の急上昇において中心的な役割を担っている。
本研究は,LLMが障害を反映し,外部教師なしで自律的に改善できる教師型アプローチである負認識ファインチューニング(NFT)を提案する。
論文 参考訳(メタデータ) (2025-05-23T17:17:40Z) - VinePPO: Refining Credit Assignment in RL Training of LLMs [66.80143024475635]
我々は,言語環境の柔軟性を利用してモンテカルロをベースとした推定値を計算する,簡単なアプローチであるVinePPOを提案する。
本手法は,MATHおよびGSM8Kデータセット間のPPOおよび他のベースラインをウォールクロック時間以下で連続的に上回る。
論文 参考訳(メタデータ) (2024-10-02T15:49:30Z) - Reinforcement Learning from LLM Feedback to Counteract Goal
Misgeneralization [0.0]
強化学習(RL)における目標誤一般化に対処する手法を提案する。
目標の誤一般化は、エージェントがその能力のアウト・オブ・ディストリビューションを維持しながら、意図したものよりもプロキシを追求する場合に発生する。
本研究では,大規模言語モデルを用いてRLエージェントを効率的に監視する方法を示す。
論文 参考訳(メタデータ) (2024-01-14T01:09:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。