論文の概要: Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation
- arxiv url: http://arxiv.org/abs/2607.05541v1
- Date: Mon, 06 Jul 2026 18:24:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.29954
- Title: Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation
- Title(参考訳): SRRL(Self-Review Reinforcement Learning)
- Authors: Muhammad Zain Amin, Kibele Sebnem Yildirim,
- Abstract要約: 強化学習(Reinforcement Learning)は、環境フィードバックを用いて大規模言語モデルを訓練するために一般的に用いられる。
トレーニングフレームワークであるセルフレビュー強化学習を導入し、各RLエピソードに明確な自己レビューステップを組み込む。
ファーストパス応答が失敗すると、モデルが自己レビューを生成して、何がうまくいかなかったかを識別する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement Learning is commonly used to train large language models using environmental feedback. In applied settings, the environment usually provides sparse or delayed feedback. This makes it difficult for the model to pinpoint which actions in its reasoning led to success or failure. So, learning effectively from these signals is hard because the model must determine how each failure should inform meaningful behavioral corrections in subsequent iterations. We introduce a training framework, Self-Review Reinforcement Learning, that embeds an explicit self-review step into each RL episode. When a first-pass response fails, the model generates a self-review to identify what went wrong, which conditions an improved second attempt. Unlike inference-time reflection approaches, such as Reflexion, the framework optimizes self-review with policy gradients and internalizes improvements into the base policy via selective distillation, ensuring they persist across future episodes. A cross-episode memory keeps successful self-reviews for reuse when encountering similar tasks in future episodes during training. We evaluate SRRL against a standard RLVR baseline using the GRPO optimizer across two language models, Qwen 3-4B and OLMo-3- 7B, on GSM8K benchmark. SRRL consistently outperforms the RLVR in final reward performance and achieves greater learning efficiency by successfully transforming feedback into behavioral improvement.
- Abstract(参考訳): 強化学習(Reinforcement Learning)は、環境フィードバックを用いて大規模言語モデルを訓練するために一般的に用いられる。
適用された設定では、通常、環境はスパースまたは遅延したフィードバックを提供する。
これにより、モデルがその推論でどのアクションが成功または失敗に繋がるかを特定するのが難しくなる。
したがって、これらの信号から効果的に学習することは困難である。
トレーニングフレームワークであるセルフレビュー強化学習を導入し、各RLエピソードに明確な自己レビューステップを組み込む。
ファーストパス応答が失敗すると、モデルが自己レビューを生成して、何がうまくいかなかったかを識別する。
Reflexionのような推論時のリフレクションアプローチとは異なり、このフレームワークはポリシー勾配による自己レビューを最適化し、選択的な蒸留によって基本ポリシーへの改善を内部化し、将来のエピソードにわたって継続することを保証している。
クロスエピソードメモリは、トレーニング中の将来のエピソードで同様のタスクに遭遇する際に、再利用のために自己レビューを成功させ続ける。
GSM8Kベンチマークを用いて,2つの言語モデルであるQwen 3-4BとOLMo-3-7BのGRPOオプティマイザを用いた標準RLVRベースラインに対するSRRLの評価を行った。
SRRLは最終報酬性能においてRLVRを一貫して上回り、フィードバックを行動改善に変換することで学習効率を向上させる。
関連論文リスト
- Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards [73.44333771806282]
RLVR(Reinforcement Learning with Verifiable Rewards)は,大規模言語モデルの推論能力向上に有効なパラダイムとして登場した。
本稿では,RLVRの簡易かつ効果的な拡張であるCIPO(Correction-Oriented Policy Optimization)を提案する。
CIPOは学習効率を向上し、モデルが自身のエラーを修正する能力を明示的に強化する。
論文 参考訳(メタデータ) (2026-05-14T08:22:21Z) - $\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving [75.29519604607111]
検証可能な報奨(RLVR)による強化学習は、大規模言語モデル(LLM)の推論性能を高めることを約束している。
チェーン・オブ・シークレット(CoT)の初期方向や品質が最適以下である場合、モデルが正しい答えに到達できないことがよく示される。
再解決による強化学習 (Reinforcement Learning with Re-solving, Re$2$) を導入し, LLM が非生産的推論経路を柔軟に放棄し,必要ならば解法を再開することを学ぶ。
論文 参考訳(メタデータ) (2026-03-07T13:17:46Z) - Experiential Reinforcement Learning [22.545003569634982]
経験的強化学習(英語: Experiential Reinforcement Learning, ERL)は、学習プロセスに明示的な経験的回帰・統合のループを組み込む訓練パラダイムである。
ERLは、強い強化学習ベースラインよりも学習効率と最終性能を一貫して改善する。
これらの結果は、明示的な自己回帰を政策訓練に統合することは、フィードバックを耐久性のある行動改善に変換するための実践的なメカニズムをもたらすことを示唆している。
論文 参考訳(メタデータ) (2026-02-15T01:23:48Z) - Reinforcement Learning via Self-Distillation [37.078107691613155]
大規模言語モデルは、コードや数学などの検証可能な領域で強化学習を施して、ポストトレーニングされている。
検証可能な報酬(RLVR)を用いた強化学習の現在の手法は、試みごとにスカラーな結果報酬からのみ学習し、深刻な信用割り当てボトルネックを生み出す。
我々は、この設定をリッチフィードバックによる強化学習として定式化し、自己蒸留政策最適化(SDPO)を導入する。
SDPOは、トークン化されたフィードバックを、外部教師や明示的な報酬モデルなしで、密集した学習信号に変換する。
論文 参考訳(メタデータ) (2026-01-28T17:45:12Z) - Teaching Large Reasoning Models Effective Reflection [62.73646680747003]
大規模推論モデル(LRM)は、最近、複雑な推論タスクにおいて印象的なパフォーマンスを示している。
しかし、すべてのリフレクションが有益であるとは限らない。
まず,自己批判のみを用いてモデルの反射的推論能力を高める訓練フレームワークである自己批判ファインチューニング(SCFT)を提案する。
論文 参考訳(メタデータ) (2026-01-19T04:51:53Z) - MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory [46.632646462295234]
提案するMemRLは,非パラメトリック強化学習をエピソードメモリ上で行うことで,エージェントの自己進化を可能にするフレームワークである。
MemRLは、セマンティックな関連性によって候補をフィルタリングし、学習したQ値に基づいて候補を選択する2相検索機構を採用している。
解析実験により,MemRLは安定性・塑性ジレンマを効果的に調整し,重み付けを伴わずに連続的なランタイム改善を可能にすることを確認した。
論文 参考訳(メタデータ) (2026-01-06T17:14:50Z) - RLoop: An Self-Improving Framework for Reinforcement Learning with Iterative Policy Initialization [65.23034604711489]
大規模な推論モデルをトレーニングするための自己改善フレームワークであるRLoopを紹介します。
RLoopはまず、RLを使用して所定のポリシからソリューション空間を探索し、成功したトラジェクトリをフィルタリングしてエキスパートデータセットを作成する。
実験の結果、RLoopsは一般化を忘れて大幅に改善し、平均精度は9%、pass@32はバニラRLに比べて15%以上向上した。
論文 参考訳(メタデータ) (2025-11-06T11:27:16Z) - ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs [32.13266235550995]
強化学習(RL)は、大規模言語モデル(LLM)の標準化の標準パラダイムとなっている。
人間の学習から得られた観察から着想を得て、検証可能な結果とモデル自身の信頼度推定を統合するRL手法を導入する。
論文 参考訳(メタデータ) (2025-09-22T13:00:35Z) - Post-Training Large Language Models via Reinforcement Learning from Self-Feedback [3.73824942136665]
大規模言語モデル(LLM)は、しばしば可算だが校正が不十分な回答を生成する。
本稿では,自己フィードバックによる強化学習(RLSF)について紹介する。
論文 参考訳(メタデータ) (2025-07-29T15:46:26Z) - Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning [55.36978389831446]
我々はベイズ適応RLフレームワークにおける反射探査を再放送する。
我々のアルゴリズムであるBARLは、観測結果に基づいて戦略を縫い替えるようにLLMに指示する。
論文 参考訳(メタデータ) (2025-05-26T22:51:00Z) - A Critical Evaluation of AI Feedback for Aligning Large Language Models [60.42291111149438]
教師が既存のRLAIFパイプラインより優れていることを示す。
より一般的には、RLAIFの利得は、ベースモデルファミリ、テスト時間評価プロトコル、批判モデルによって大きく異なることが分かる。
論文 参考訳(メタデータ) (2024-02-19T18:53:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。