論文の概要: RLTL;DR: Self-improvement by Internalizing Self-generated Feedback
- arxiv url: http://arxiv.org/abs/2609.37633v1
- Date: Tue, 29 Sep 2026 14:04:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.600802
- Title: RLTL;DR: Self-improvement by Internalizing Self-generated Feedback
- Title(参考訳): RLTL;DR:自己生成フィードバックの内部化による自己改善
- Abstract要約: RLTL;DRを導入し、エージェントがタスクに対して複数の試行を行なえるようにし、成功したタスクに向けて最適化する。
RLTL;DRは、トレーニング中のコンテキストの洞察で14-31%のPass@1を達成する。
これは、"この種のタスクにおいて、この種のことを心に留めて"という形式の、有望なコンパクトなトレーニングパラダイムを示している。
- 参考スコア(独自算出の注目度): 55.17395526164652
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The common paradigm of reinforcement learning with verifiable rewards (RLVR) is to let agents make multiple attempts at a task, and optimize towards the successful ones. This becomes problematic in the realms of self-improvement, where tasks are so difficult that the agent has a low or even no chance of success, and where there are no teacher models or example solutions to distill from. In this paper, we introduce RLTL;DR. After each failed attempt, we show the policy the verifier outputs and let it write its own feedback, in the form of a single TL;DR insight. The next rollout is conditioned on all previous insights, and we sequentially sample rollouts until a solution is found. Moreover, we enable backpropagation on the in-context insights to internalize a direct task to insight mapping. On challenging tool-calling and coding datasets (filtered to Pass@128=0), standard GRPO training of a Qwen 3.5 9B Thinking policy stays flat at a Pass@1 of 0% to 1%. RLTL;DR breaks through this learning barrier, achieving a Pass@1 of 14-31% with insights in context during training and, crucially, 12-13% when no insight is in context at eval time. We identify that the key is the task to insight internalization. To study this further, we reduce our approach to SFTL;DR, training only on (task, insight) tuples, without showing or backpropagating on any rollouts. Training on only 4k of these tuples recovers almost the full performance of RLTL;DR and classical SFT on full rollouts. This demonstrates a promising compacted training paradigm of the form "on this sort of task, keep this sort of thing in mind", which we hope to inspire future research on.
- Abstract(参考訳): 検証可能な報酬を伴う強化学習(RLVR)の一般的なパラダイムは、エージェントがタスクに対して複数の試行を行い、成功したものに向けて最適化できるようにすることである。
これは自己改善の領域において問題となり、タスクは非常に難しいため、エージェントは成功の見込みが低く、あるいは全くない。
本稿ではRLTL;DRを紹介する。
それぞれの試みが失敗した後、検証者が出力するポリシーを示し、単一のTL;DRインサイトとして独自のフィードバックを書けるようにします。
次のロールアウトは以前のすべての洞察に基づいており、ソリューションが見つかるまで順次ロールアウトをサンプリングします。
さらに、コンテキスト内インサイトに対するバックプロパゲーションを可能とし、インサイトマッピングへの直接タスクを内部化する。
挑戦的なツールコールとコーディングデータセット(Pass@128=0にフィルタされた)について、Qwen 3.5 9Bのシンキングポリシの標準GRPOトレーニングは、Pass@1から1%に一定である。
RLTL;DRはこの学習障壁を突破し、トレーニング中のコンテキストに関する洞察で14-31%のPass@1を達成する。
私たちは、鍵が内部化を洞察するタスクであることを認識します。
これをさらに研究するために、我々はSFTL;DRへのアプローチを減らし、(タスク、インテリジェンス)タプルのみをトレーニングし、ロールアウトの表示やバックプロパゲーションを行わない。
これらのタプルのうち4kのトレーニングは、フルロールアウト時のRLTL;DRと従来のSFTのほぼ全性能を回復させる。
これは、“この種のタスクを念頭に置いて、このようなことを念頭に置いて”、将来的な研究を刺激する、有望なコンパクトなトレーニングパラダイムを実証するものです。
関連論文リスト
- Shockingly Simple Self-retrospection Improves Agentic Models Without RL [56.88703385147974]
本研究は,説明のみの訓練がその後の行動に与える影響を分離するために,レトロスペクティブ・オンリー・ファインチューニングについて検討する。
Qwen3.5-4B を用いたソフトウェア工学実験では、ROFT は成功と失敗の混合したベースモデルの試行に関する問題で訓練されている。
また、64のサンプルベースモデル試みが失敗する個々のタスクの解決も学べる。
論文 参考訳(メタデータ) (2026-09-28T17:54:24Z) - Expanding the Capabilities of Reinforcement Learning via Text Feedback [49.561885700139676]
テキストフィードバックをトレーニング中に利用できるが、推論では利用できないマルチターンRLセットアップであるテキストフィードバック(RLTF)を形式化する。
そこで本研究では, 自己蒸留法(RLTF-SD)と, フィードバック条件付き第2ターン世代に適合するように単一ターンポリシーを訓練するフィードバックモデリング法(RLTF-FM)の2つの手法を提案する。
以上の結果から,両手法はベンチマークにおいて強いベースラインを一貫して上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-02-02T18:56:56Z) - Reinforcement Learning via Self-Distillation [37.078107691613155]
大規模言語モデルは、コードや数学などの検証可能な領域で強化学習を施して、ポストトレーニングされている。
検証可能な報酬(RLVR)を用いた強化学習の現在の手法は、試みごとにスカラーな結果報酬からのみ学習し、深刻な信用割り当てボトルネックを生み出す。
我々は、この設定をリッチフィードバックによる強化学習として定式化し、自己蒸留政策最適化(SDPO)を導入する。
SDPOは、トークン化されたフィードバックを、外部教師や明示的な報酬モデルなしで、密集した学習信号に変換する。
論文 参考訳(メタデータ) (2026-01-28T17:45:12Z) - Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations [103.16279860448874]
新たな二分探索強化報酬(RAR)を用いたオンライン強化学習手法を提案する。
オープンエンド世代では、バイナリRARは幻覚率を39.3%減少させる。
短い形式の質問応答では、モデルは、パラメトリック知識の不足に直面した時に、戦略的に"I don't know"を出力して、控えめに学習する。
論文 参考訳(メタデータ) (2025-10-20T16:45:43Z) - What Can You Do When You Have Zero Rewards During RL? [3.0795668932789515]
結果に基づく報酬を伴う強化学習(RL)は、複雑な推論タスクにおいて大きな言語モデル(LLM)を改善するのに有効であることが証明されている。
本稿では,Bachmann et al. (2024) で導入されたグラフ検索タスクを通じて,このシナリオを検証し,望ましいコンポーネントを組み込んだ最近の手法を評価する。
トレーニングセットに簡単なサンプルを追加するという単純なデータ中心の介入によって、報酬のゼロから始まるにもかかわらず、モデルが最終的に元のハードタスクを解決できることが分かりました。
論文 参考訳(メタデータ) (2025-10-04T23:10:38Z) - Simplifying Deep Reinforcement Learning via Self-Supervision [51.2400839966489]
自己改善強化学習(Self-Supervised Reinforcement Learning, SSRL)は、純粋に監督された損失を伴うポリシーを最適化する単純なアルゴリズムである。
SSRLは、より安定した性能と実行時間の少ない現代アルゴリズムと驚くほど競合することを示す。
論文 参考訳(メタデータ) (2021-06-10T06:29:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。