論文の概要: Prospective Hindsight: Self-Calibrating Reinforcement Learning via Prediction-Reality Gaps
- arxiv url: http://arxiv.org/abs/2610.02740v1
- Date: Fri, 02 Oct 2026 03:12:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.193232
- Title: Prospective Hindsight: Self-Calibrating Reinforcement Learning via Prediction-Reality Gaps
- Title(参考訳): 予測現実ギャップによる自己校正強化学習の展望
- Abstract要約: ロングホライゾンエージェントの強化学習は、純粋な振り返りトレーニング信号に依存している。
本稿では,自己校正学習の原則であるProspective Hindsight(PH)を紹介する。
PHはタスク性能とキャリブレーションの両方を改善し、モデルスケール間で一貫した利得を示す。
- 参考スコア(独自算出の注目度): 36.16230485322107
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning for long-horizon agents relies on purely retrospective training signals: credit is assigned only after observing environmental consequences, leaving the agent's belief at action time invisible to the gradient. We introduce Prospective Hindsight (PH), a self-calibrating training principle that augments any retrospective base method with a signal derived from the gap between the agent's prospective prediction (before feedback) and the retrospective evaluation (after feedback). This per-rollout surprise identifies samples where the agent's self-model is most inaccurate and amplifies their gradient contribution through a stop-gradient surprise-weighted advantage. Since the prospective predictor shares parameters with the policy, the two co-evolve, progressively shifting focus to the agent's remaining blind spots. We connect this principle to a privileged-information gap and show that minimizing the surprise residual provides a descent pathway on the agent's miscalibration rate; calibration thus emerges as a byproduct of optimization rather than from an added objective. On single-turn verifiable tasks and a multi-turn personal-agent task (under GRPO, on-policy distillation, and their combination), PH improves both task performance and calibration, with consistent gains across model scales. Notably, the dominant miscalibration mode shifts structurally between regimes, overconfident failures in single-turn, underconfident successes in multi-turn, yet the same training principle addresses both successfully.
- Abstract(参考訳): ロングホライゾンエージェントの強化学習は、純粋に振り返りの訓練信号に依存しており、クレジットは環境効果を観察した後にのみ割り当てられ、エージェントの信念は行動時に勾配に見えないまま残される。
エージェントの予測予測(フィードバック前)と振り返り評価(フィードバック後)のギャップから導かれる信号で,任意の振り返りベース手法を増強する自己校正学習原理であるProspective Hindsight(PH)を紹介する。
このロールアウト当たりのサプライズは、エージェントの自己モデルが最も不正確であるサンプルを特定し、停止段階のサプライズ重み付けの利点によって勾配のコントリビューションを増幅する。
予測因子はポリシーとパラメータを共有するため、2つの共進化は徐々にエージェントの残りの盲点に焦点を移す。
我々は、この原理を特権情報ギャップに結び付け、サプライズ残差を最小化することで、エージェントの誤校正率の降下経路が得られ、キャリブレーションは、追加の目的からではなく最適化の副産物として現れることを示す。
シングルターン検証タスクとマルチターン個人エージェントタスク(GRPO、オン・ポリケート蒸留およびそれらの組み合わせ)では、PHはタスク性能とキャリブレーションの両方を改善し、モデルスケール間で一貫した利得を得る。
特に、主流の誤校正モードは、体制、単一ターンでの過信失敗、マルチターンでの過信成功の間で構造的に変化しますが、同じトレーニング原則がどちらもうまく対処しています。
関連論文リスト
- ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning [53.48426046511836]
検証可能な報酬(RLVR)からの強化学習は、複数のポリシー更新のロールアウトを頻繁に再利用する。
本稿では,クリッピングをスムーズな2分岐シーケンスレベルカーネルに置き換えるReSPO(Reshaped Sequence Policy Optimization)を提案する。
本研究では,ReSPO が早期訓練中に長い肯定的推論軌道から効果的に学習できることを実証する。
論文 参考訳(メタデータ) (2026-09-28T15:38:29Z) - Taming CoT Obfuscation in VLMs: From Mechanistic Evidence to Activation Enforcement [74.92755267784983]
強化学習は、視覚言語モデルにおける推論を改善するが、チェーン・オブ・オファシケーションを誘発することができる。
本稿では, 行動フィードバックとテンプレート関連アクティベーションの標的抑制を組み合わせ, メカニスティック・エンハンスメント(TAME)を用いた標的的アンチ・オブファシケーションを提案する。
VIRL-39k、SPA-VL、および2つのモデルファミリの中で、TAMEはグループ相対政策最適化よりも最大30.9および16.7%のCoT監視性を改善している。
論文 参考訳(メタデータ) (2026-09-21T08:08:56Z) - FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience [18.64380706071327]
FlowBalanceは、完全応答上の正規化分布を学習する検証器による自己改善手法である。
オンラインの軌跡ごとに、同じポリシーの凍結されたトレーニングタイムビューは、特権付きコンテキストを使用してトークンレベルのログ確率ゲインを生成する。
分析では, 群内コントラスト保存, 最小値逆KL特性, 目標報酬の単調検証, 拒否応答に対する偽陽性自己誘導に対する正確な補正が確立された。
論文 参考訳(メタデータ) (2026-09-03T00:47:11Z) - CAFE: Self-Improving Search Agents Need Co-Evolving Feedback [64.5257526832476]
アウトカム管理された検索エージェントは、いつ、どのように証拠を回収するかを学習するが、端末の報酬は中間エラーのローカライズも、それらのエラーが複雑になる前に継続する軌道のリダイレクトもしない。
学習した軌道内での介入として修正的フィードバックを扱うことは、エージェントがいつフィードバックを要求し使用するかを決めなければならないのに対し、批評家は、エージェントが改善するにつれて障害パターンが変化する結果構築されたロールアウトから有用な修正を推測しなければならない。
論文 参考訳(メタデータ) (2026-08-25T16:39:00Z) - Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning [7.604367783364084]
Collaborative Weighting Actor-Critic (CWAC) は、価値推定における予測の不確実性を考慮に入れた統合フレームワークである。
CWACは最小限のオーバーヘッドで既存の外部アルゴリズムフレームワークにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-07-29T06:18:19Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - Uncertainty-Aware Reward Discounting for Mitigating Reward Hacking [0.0]
現実世界の目的はしばしば不確実であり、文脈に依存し、内部的に矛盾している。
このミスマッチは、報酬のハッキング、過度な最適化、過度に信頼された振る舞いなど、アライメントの失敗につながる可能性がある。
本稿では,評価の不確かさと人間の嗜好の不確実性の両方を明示的にモデル化する二元的不確実性認識報酬フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T07:14:01Z) - Less Approximates More: Harmonizing Performance and Confidence Faithfulness via Hybrid Post-Training for High-Stakes Tasks [52.81286869496811]
大規模な言語モデルは、自信を持って不正確な推論が現実世界の害を引き起こすような、ハイテイクなタスクにますますデプロイされている。
内的フィードバックからの教師なし強化学習と推論・トラス誘導型推論蒸留を併用して協調的に最適化することを提案する。
PRG方式のメトリクスを用いてRDとRLIFを適応的に重み付けするハイブリッドポストトレーニングフレームワークであるHyTuningを紹介する。
論文 参考訳(メタデータ) (2026-04-09T16:50:11Z) - Hindsight-DICE: Stable Credit Assignment for Deep Reinforcement Learning [11.084321518414226]
我々は,既存の重要度・重要度比推定手法をオフ政治評価に適用し,いわゆる後見政策手法の安定性と効率を大幅に向上させる。
我々の後視分布補正は、信用代入がベースライン手法を悩ませている広範囲の環境において、安定的で効率的な学習を容易にする。
論文 参考訳(メタデータ) (2023-07-21T20:54:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。