論文の概要: Rethinking Probability-Based Reinforcement Learning From Posterior Concentration
- arxiv url: http://arxiv.org/abs/2610.01458v2
- Date: Fri, 02 Oct 2026 04:54:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.992341
- Title: Rethinking Probability-Based Reinforcement Learning From Posterior Concentration
- Title(参考訳): 確率に基づく後部濃度からの強化学習の再考
- Abstract要約: 本研究は,PCP(Posterior concentration Phenomenon, Posterior concentration Phenomenon)と呼ばれる確率報酬の時間依存性の障害モードを特定する。
そこで我々は,RLCPR(Incent-Aware Posterior Rewards)を用いた強化学習を提案する。
- 参考スコア(独自算出の注目度): 42.541008426011494
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Verifier-free reinforcement learning with probability-based rewards offers a promising way to train LLMs on general reasoning tasks where external verifiers are unavailable. Yet the reliability of these rewards, especially in long-horizon reasoning, remains underexplored. This work identifies a length-dependent failure mode of probability rewards, which we call the Posterior Concentration Phenomenon (PCP). We show that the probability of a reference answer conditioned on a reasoning trace often collapses to a low-variance interval as the trace becomes lengthy. This phenomenon results in nearly indistinguishable rewards, which, under GRPO-based settings, makes probability-based policy optimization unstable and inefficient. Motivated by this, we propose Reinforcement Learning with Concentration-aware Posterior Rewards (RLCPR), a verifier-free RL framework to explicitly account for PCP for better optimization stability and token efficiency. It has two components: uncertainty-aware data sampling, which reduces concentration-prone rollouts before generation, and concentration-aware regularization, which penalizes unnecessarily long traces when posterior rewards collapse. Extensive experiments show that, alongside higher token efficiency, RLCPR outperforms the state-of-the-art verifier-free RL baseline by up to 4.0% on six of seven benchmarks, including general-domain and mathematical reasoning challenges.
- Abstract(参考訳): 確率に基づく報酬を伴う検証自由強化学習は、外部検証が不可能な一般的な推論タスクでLLMを訓練する有望な方法を提供する。
しかし、これらの報酬の信頼性、特にロングホライズン推論では、まだ未定である。
本研究は,PCP(Posterior concentration Phenomenon, Posterior concentration Phenomenon)と呼ばれる確率報酬の時間依存性の障害モードを特定する。
推理トレース上で条件付けられた参照応答の確率は、トレースが長くなるにつれてしばしば低分散間隔に崩壊することを示す。
この現象は、GRPOベースの設定下で、確率ベースのポリシー最適化を不安定かつ非効率にする、ほぼ区別不可能な報酬をもたらす。
そこで我々は,PCPの安定性とトークン効率を向上するために,PCPを明確に考慮する検証不要なRLフレームワークであるRLCPR(Reinforcement Learning with concentration-aware Posterior Rewards)を提案する。
不確実性を認識したデータサンプリングと、後続の報酬が崩壊した場合に不要な長いトレースをペナルティ化する集中認識正規化の2つのコンポーネントがある。
広範な実験により、RCCPRはより高いトークン効率とともに、一般領域や数学的推論を含む7つのベンチマークのうち6つのベンチマークにおいて、最先端の検証不要なRLベースラインを最大4.0%上回った。
関連論文リスト
- Observationally Informed Adaptive Causal Experimental Design [55.998153710215654]
本稿では,観測モデルを基礎的先行として活用する新たなパラダイムであるアクティブ残留学習を提案する。
このアプローチは、実験的な焦点を、目標因果量の学習から、観察バイアスの補正に必要な残差を効率的に推定するへとシフトさせる。
合成および半合成ベンチマークの実験は、R-Designがベースラインを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-03-04T06:52:37Z) - From SFT to RL: Demystifying the Post-Training Pipeline for LLM-based Vulnerability Detection [2.6678231901651723]
LLMに基づく脆弱性検出のための訓練後パイプラインに関する最初の包括的調査を行う。
本研究は,データキュレーション,ステージインタラクション,報酬メカニズム,評価プロトコルがモデルトレーニングと評価の有効性を総合的に規定するなど,実践的なガイドラインと洞察を明らかにする。
論文 参考訳(メタデータ) (2026-02-15T06:33:25Z) - VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction [55.04308051033549]
RLVR(Reinforcement Learning with Verifiable Rewards)は、LLM(Large Language Models)推論を向上するための主要なパラダイムとして登場した。
モデル固有の信頼性を活用して外部検証から独立したカリキュラムを構築するフレームワークであるVerifier-Independent Curriculum Reinforcement Learning (VI-CuRL)を紹介する。
論文 参考訳(メタデータ) (2026-02-13T03:40:52Z) - Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities [10.235183326885794]
RLVR(Reinforcement Learning with Verifiable Rewards)は、Large Language Models(LLMs)における推論の強化に欠かせないパラダイムとして登場した。
我々は、この問題をサンプリング確率力学の観点から分析し、標準目的が高次様相の経路を不均等に強化することを特定する。
提案手法は,すべての応答に対する信頼度を平衡化するための新しいアドバンテージ再重み付け機構 (ARM) を提案する。
論文 参考訳(メタデータ) (2026-02-05T04:06:55Z) - P2S: Probabilistic Process Supervision for General-Domain Reasoning Question Answering [51.04492568024515]
本稿では,プロセス報酬を微粒化するための新しいフレームワークである確率的プロセススーパービジョン(P2S)を紹介する。
P2Sは、個別の報酬モデルや人間に注釈を付けた推論ステップを必要とせずに、きめ細かいプロセス報酬を提供する。
論文 参考訳(メタデータ) (2026-01-28T14:35:20Z) - Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning [52.144281362465996]
本稿では,強化学習を長期シナリオに適用するためのEAPO(Evidence-Augmented Policy Optimization)を提案する。
最初にEvidence-Augmented Reasoningパラダイムを確立し、Tree-Structued Evidence Smplingを介して検証する。
次に、報酬モデルがグループ相対エビデンス・リワードを計算する特殊なRLアルゴリズムを導入する。
トレーニングを通して正確な監視を維持するため、適応的リワード・ポリティ共進化機構をさらに取り入れる。
論文 参考訳(メタデータ) (2026-01-15T11:40:57Z) - ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning [17.98065634130798]
固有信頼駆動型グループ相対選好最適化法(ICPO)を提案する。
ICPOは、複数の応答の相対生成確率を同一の入力プロンプトで比較することにより、各応答に対する優先優位スコアを算出する。
優先的優位性スコアは、粗大な報酬や報奨ノイズの問題を緩和するだけでなく、過度に信頼された誤りを効果的に抑制することを発見した。
論文 参考訳(メタデータ) (2025-11-26T03:10:15Z) - RLPR: Extrapolating RLVR to General Domains without Verifiers [103.14103272635893]
本稿では,RLVRを汎用ドメインに外挿するシンプルな検証不要なフレームワークであるRLPRを提案する。
このノイズの多い確率報酬の高分散に対処することが、それを機能させるためには不可欠である。
RLPRはGemma、Llama、Qwenベースのモデルの両方の領域における推論機能の改善を一貫して行っている。
論文 参考訳(メタデータ) (2025-06-23T02:56:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。