論文の概要: When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion
- arxiv url: http://arxiv.org/abs/2607.20543v1
- Date: Sun, 12 Jul 2026 17:17:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.22583
- Title: When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion
- Title(参考訳): RLVRが推論境界を縮小する: Pass@kインバージョンを診断する
- Abstract要約: 検証可能な報酬(RLVR)を用いた強化学習は、繰り返しサンプリング時にモデルを悪化させながら、一サンプル精度を向上させることができる。
トレーニング後、このポリシーはベースモデルよりも小さな問題を、大きな$k$で解決する可能性がある。
失敗は境界プロンプトに集中しており、ベースモデルにはサンプリングによって回復できる稀な正しい軌道が含まれており、有限のRLVRロールアウトグループに確実に現れるには小さすぎる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) can improve one-sample accuracy while making a model worse under repeated sampling. We study this pass@k inversion: after training, the policy may solve fewer distinct problems than its base model at large $k$. The failure concentrates on boundary prompts, where the base model contains rare correct trajectories that are recoverable by sampling but too sparse to reliably appear in finite RLVR rollout groups. We argue that a two-mode account explains this as an absence-of-evidence failure: rare correct trajectories may disappear before RLVR samples and reinforces them often enough. The main contribution is this diagnostic and mechanistic framing. Per-Problem Base Anchoring (PBA) is a deliberately simple proof-of-concept: sharpen prompts with sufficient frozen-base correct evidence, and anchor risky prompts to the base distribution. Across three training seeds on Omni-MATH-Test, with MATH500 as a secondary high-coverage validation benchmark, PBA improves both \PassK{1} and high-budget coverage over matched GRPO. A 3000-prompt regime-controlled diagnostic study is consistent across seeds with the expected signature: ordinary GRPO loses base-solvable boundary prompts, while PBA preserves rare verifier-positive trajectories. We use mathematical verifiers as a controlled testbed for verifier-guided optimization; the same pass@k inversion risk applies to ECCV-relevant vision-language agents when repeated visual, spatial, or chart-reasoning attempts are checked by external tools or verifiers. Reasoning post-training should decide not only how strongly to optimize, but which prompts are safe to optimize.
- Abstract(参考訳): 検証可能な報酬(RLVR)を用いた強化学習は、繰り返しサンプリング時にモデルを悪化させながら、一サンプル精度を向上させることができる。
トレーニング後、このポリシーはベースモデルよりも小さな問題を、大きな$k$で解決する可能性がある。
失敗は境界プロンプトに集中しており、ベースモデルにはサンプリングによって回復できる稀な正しい軌道が含まれており、有限のRLVRロールアウトグループに確実に現れるには小さすぎる。
RLVRのサンプルが見つかる前に、まれに正しい軌道が消えて、しばしば補強される可能性がある。
主な貢献は、この診断と機械的フレーミングである。
パープロブレムベースアンカリング(Per-Problem Base Anchoring, PBA)は、意図的に単純な概念実証である。
Omni-MATH-Testの3つのトレーニング種のうち、MATH500を二次的なハイカバレッジ検証ベンチマークとして、PBAは、マッチしたGRPOに対して \PassK{1} と高予算カバレッジの両方を改善している。
PBAは希少な検証器陽性の軌道を保っているが、通常のGRPOは基本解決可能な境界プロンプトを失う。
検証器誘導最適化のための制御テストベッドとして数式検証器を用いており、視覚的、空間的、チャート推論の繰り返し試行が外部ツールや検証器によってチェックされる場合、ECCV関連視覚言語エージェントに同じパス@k反転リスクが適用される。
トレーニング後の推論では、最適化の強みだけでなく、どのプロンプトを最適化しても安全かを判断する必要がある。
関連論文リスト
- Verifier-Induced Support Reshaping in On-Policy Optimization [27.782412748608255]
検証可能な報酬(RLVR)によるオンライン強化学習は、現在の目標を改善できる一方で、後の目標に対する行動の成功は、サンプリングや強化が極めて稀であることを示す。
我々は、この検証者によるサポートの再構築と呼び、有効な報奨支援を、固定されたロールアウト予算内で到達可能な軌道として定義する。
論文 参考訳(メタデータ) (2026-07-31T19:05:43Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Understanding Diversity Collapse in RLVR via the Lens of Overtraining [78.37408098404312]
検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルの推論能力を高めるための重要なアプローチとなっている。
我々は、この多様性の崩壊をエンフェーバートレーニングのレンズを通してフォーマルに定式化する
本稿では,各問題の限界寄与を推論境界に推定することにより,オーバートレーニングから最適化をリダイレクトするemphBayesian boundary Gating (BBG)を提案する。
論文 参考訳(メタデータ) (2026-06-13T20:13:37Z) - When Good Verifiers Go Bad: Self-Improving VLMs Can Regress on New Tasks [2.743683637024251]
検証者駆動型自己DPOは、自己改善型視覚言語モデルのための一般的なレシピである。
検証器の品質がタスク固有のため,この仮定は失敗する可能性がある。
本稿では,プログレッシブゲートリプレイとその方向ミスマッチ故障モードに対する分散定理を用いて,コンパクトなメカニスティックな説明を行う。
論文 参考訳(メタデータ) (2026-06-12T16:55:30Z) - When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL [10.399451281089318]
我々はMiniGridをコア評価として,MuJoCoを境界応力試験として用いたPPO訓練剤について検討した。
私たちの監査では、報酬の洪水とセマンティック/API誤解という、2つの主要なワンショット障害モードを見つけました。
本稿では,トレーニング診断と障害モード分類ガイドが報酬関数の修正を対象とする,診断駆動反復改善法を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:57:43Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning [17.384089089363382]
既存の手法が見落としている根本原因を同定する。
現在のアプローチでは、グループ内のすべての誤ったロールアウトを同一に扱う。
非対称信頼度を考慮した誤り罰(ACE)を提案する。
論文 参考訳(メタデータ) (2026-02-24T22:46:43Z) - Detecting RLVR Training Data via Structural Convergence of Reasoning [31.260852555788205]
検証可能な報酬(RLVR)による強化学習は、現代の推論モデルのトレーニングの中心である。
RLVRは特徴的な行動シグネチャを誘導することを示す。
この崩壊を定量化する単純なブラックボックス検出器であるMin-$k$NN Distanceを導入する。
論文 参考訳(メタデータ) (2026-02-12T10:17:32Z) - Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning [59.76691952347156]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上のための強力なフレームワークとして登場した。
既存のRLアプローチの多くは疎結果報酬に依存しており、部分的に成功した解では正しい中間段階を信用できない。
本稿では、PRMを用いてRL中の最初のエラーをローカライズする検証済み事前修正ポリシー最適化(VPPO)を提案する。
論文 参考訳(メタデータ) (2026-01-26T21:38:20Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。