論文の概要: Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight
- arxiv url: http://arxiv.org/abs/2610.08077v1
- Date: Tue, 06 Oct 2026 10:06:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.928408
- Title: Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight
- Title(参考訳): セルフレトロスペクション蒸留 : ポストホック体験を予見する
- Abstract要約: 検証可能な報酬(RLVR)による強化学習は、エージェント体験を学習信号に変換する。
自己検査蒸留(Self-Retrospection Distillation, SRD)は、特権のある後見を同じ方針の軌跡の目視に蒸留する。
以上の結果から,ポストホックエージェント体験は,行動の評価や改善だけでなく,対話に先立って予測表現を形成する上でも有用であることが示唆された。
- 参考スコア(独自算出の注目度): 69.33075666165205
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) turns agent experience into learning signals primarily through scalar outcome rewards after interaction. For group-relative objectives, however, this signal vanishes when all rollouts receive the same reward, even though their trajectories may reveal useful information about what the task requires and how the agent fails. We ask a complementary question: can hindsight teach an agent what it could have anticipated before acting? We introduce prospective learning, which uses post-hoc experience to supervise foresight predictions from the pre-interaction view, and instantiate it with Self-Retrospection Distillation (SRD). Intuitively, a completed trajectory reveals knowledge that would have been useful and pitfalls that should be avoided; SRD distills this privileged hindsight into trajectory-blind foresight of the same policy. Foresight serves only as a training target and need not be explicitly generated at inference time. Across 10 tool-integrated reasoning and long-horizon agentic tasks, SRD complements RLVR and self-distillation baselines with gains of up to $24.2$ pp. Its advantage is especially pronounced when reward contrast is scarce: when $37$--$98\%$ of rollout groups are reward-uniform across model scales, yet SRD can still exploit learning signal from sampled trajectories. In the 2B setting, where $98\%$ of groups are all-failure, the RLVR training ends up at $0.0\%$ success, while adding SRD reaches $60.6\%$ under the same rollout budget. Our results suggest that post-hoc agent experience is useful not only for evaluating or improving behavior, but also for shaping predictive representations before available interaction.
- Abstract(参考訳): 検証可能な報酬(RLVR)による強化学習は、エージェント体験を主に相互作用後のスカラー結果報酬を通じて学習信号に変換する。
しかし、グループ相対的な目的のために、このシグナルは全てのロールアウトが同じ報酬を受けると消える。
エージェントが行動する前に何を期待できるかを後見で教えることができるのか?
本稿では,前向きの視点から前向きの予測を監視し,自己検査蒸留(Self-Retrospection Distillation, SRD)でインスタンス化する,ポストホックな経験を用いた予見学習を紹介する。
直感的には、完了した軌道は有用であったであろう知識と避けるべき落とし穴を明らかにする。
フォレストはトレーニングターゲットとしてのみ機能し、推論時に明示的に生成する必要はない。
SRDは10のツール統合推論と長い水平エージェントタスクで、RLVRと自己蒸留ベースラインを補完し、最大で24.2$ pp。
ロールアウトグループの37ドル~98ドル%がモデルスケール全体にわたって一様である場合、SRDはサンプリングされた軌跡からの学習信号を利用することができる。
2B設定では、9,8\%のグループが全失敗し、RLVRトレーニングは0.0\%の成功を収め、SRDの追加は60.6\%の予算で終わる。
以上の結果から,ポストホックエージェント体験は,行動の評価や改善だけでなく,対話に先立って予測表現を形成する上でも有用であることが示唆された。
関連論文リスト
- H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents [51.523913302114266]
TRACE(Turn-level Reward Assignment via Credit Estimation)は、エージェント強化学習のための高密度クレジットアサインメント手法である。
ツールコール境界における状態遷移としてロールアウトを表現し、凍結参照モデルからゴールド・アンサー・ログ確率を取得し、それらをログ比の状態値に変換し、それらの値の時間差変化としてアクション毎の報酬を導出する。
純粋なRLを用いたベースモデルツール使用能力を大幅に向上させ、冷間開始制御された微調整ステージ、エージェント訓練ステージ、ライブWebデータによるトレーニングを不要とした。
論文 参考訳(メタデータ) (2026-07-15T16:16:42Z) - How Far Can Unsupervised RLVR Scale LLM Training? [57.44753418846446]
検証可能な報酬を伴う教師なし強化学習(URLVR)は、監督ボトルネックを越えてLLMトレーニングをスケールするための経路を提供する。
最近の研究は、モデル固有の信号を活用し、期待できる早期の利得を示しているが、その可能性と限界は未だ不明である。
我々は、URLVRメソッドを報酬源に基づく固有対外部に分類し、統一された理論的枠組みを確立する。
論文 参考訳(メタデータ) (2026-03-09T17:38:11Z) - The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning [37.13807960501503]
検証可能な報酬を伴う強化学習(RLVR)は、言語モデル(LM)のトレーニングに有望なアプローチである
我々は学習信号を正しい応答の強化と正負の正負の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の正の
我々は、NSRが不正確な世代を抑え、確率質量を他の可算候補に向けて再分配することで、モデルの以前の信念に導かれることを示す。
論文 参考訳(メタデータ) (2025-06-02T06:10:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。