論文の概要: Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR
- arxiv url: http://arxiv.org/abs/2608.03119v1
- Date: Tue, 04 Aug 2026 04:41:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.036372
- Title: Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR
- Title(参考訳): ラベルなしRLVRのためのアウトカム・マスク付きグループ相対的ポリシー最適化
- Authors: Yongshi Ye, Liang Zhang, Yidong Chen, Xiaodong Shi, Biao Fu,
- Abstract要約: 投票に基づくラベルフリーのRLVRは、金監督をモデルサンプルからの回答レベルのコンセンサスに置き換える。
政策最適化から報酬推定を分離するラベルフリーなRLVRフレームワークであるOM-GRPOを提案する。
- 参考スコア(独自算出の注目度): 21.781083492293913
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) improves LLM reasoning but typically relies on ground-truth (GT) answers, limiting scalability. Voting-based label-free RLVR replace gold supervision with answer-level consensus from model samples. However, collapse arises when the same answer-level signal is used both to estimate rewards and to drive token-level policy optimization, encouraging the model to directly reinforce answer tokens rather than improve reasoning. We propose OM-GRPO, a label-free RLVR framework that decouples reward estimation from policy optimization. OM-GRPO masks gradients on the answer span while retaining answer-level rewards through a soft consensus signal, shifting optimization pressure away from answer tokens. We further introduce Contrast-Augmented Reward, which refines reward estimation via low-cost pairwise comparisons over existing trajectories without additional rollouts. Across diverse reasoning benchmarks and three LLM backbones, OM-GRPO consistently outperforms existing label-free RLVR methods and matches supervised GT-reward training with stable optimization. This stability is particularly beneficial in the Test-Time Training setting, where OM-GRPO surpasses majority voting by 4.24 points.
- Abstract(参考訳): RLVR(Reinforcement Learning with Verifiable Rewards)は、LLM推論を改善するが、一般的にはGT( Ground-Truth)の回答に依存し、スケーラビリティを制限している。
投票に基づくラベルフリーのRLVRは、金監督をモデルサンプルからの回答レベルのコンセンサスに置き換える。
しかし、同じ応答レベル信号を使用して報酬を見積もり、トークンレベルのポリシー最適化を推進し、推論を改善するのではなく、直接応答トークンを強化するようモデルに促すと、崩壊が生じる。
政策最適化から報酬推定を分離するラベルフリーなRLVRフレームワークであるOM-GRPOを提案する。
OM-GRPOマスクは、解答レベルの報酬をソフトコンセンサス信号を通じて保持し、解答トークンから最適化圧力をシフトさせる。
さらにContrast-Augmented Rewardを導入し、追加のロールアウトなしで既存のトラジェクトリに対する低コストなペアワイズ比較による報酬推定を改良する。
OM-GRPOは様々な推論ベンチマークと3つのLCMバックボーンで、既存のラベルなしのRLVR法と、教師付きGT-リワードトレーニングと安定した最適化を一貫して上回っている。
この安定性は、OM-GRPOが過半数を4.24ポイント上回るテストタイムトレーニング環境で特に有益である。
関連論文リスト
- Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework [6.490241400619907]
内部フィードバックからの強化学習は、スケーラブルで教師なしの代替手段として最近登場した。
本稿では,学習信号を2つの補完成分に分解するマルチリワードRLIFフレームワークを提案する。
提案手法は,外部の地平監督に頼らずに,安定した長距離推論を支援することができることを示す。
論文 参考訳(メタデータ) (2026-05-21T15:30:47Z) - LamPO: A Lambda Style Policy Optimization for Reasoning Language Models [34.349722314481824]
検証可能な報酬付き強化学習(RLVR)は、数学、コーディング、科学的質問応答といったタスクにおける言語モデル推論の改善に有効なパラダイムとなっている。
我々は、スカラーグループの利点を emphPairwise De Advantage に置き換える textbfLambda-Style Policy Optimization 法である textbfLamPO を提案する。
AIME24, AIME25, MATH-500, GPQA-DiamondのQwen3-1.7B, Qwen3-4B, Phi-4-miniによる実験により, LamPOはGRPOよりも一貫して改善していることが示された。
論文 参考訳(メタデータ) (2026-05-20T14:24:11Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR [39.03968285406107]
JURY-RLはラベルのないRLVRフレームワークで、報酬処理から回答提案を分離する。
数学的推論ベンチマークにおいて、ラベルなしのベースラインを一貫して上回る。
Pass@1パフォーマンスは、教師付き地道トレーニングに匹敵する。
論文 参考訳(メタデータ) (2026-04-28T09:29:00Z) - CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR [10.821950260274066]
RLVRによる強化学習は大規模言語モデル(LLM)の推論能力を大幅に向上させた。
プロセスに反するが結果の正しいロールアウトのトレーニングは、幻覚と回答コピーにつながる可能性がある。
RLVRプロセスの一般化のために,コントラスト学習機構を政策最適化(CLIPO)に組み込んだ。
論文 参考訳(メタデータ) (2026-03-10T17:59:54Z) - Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR [25.56828724912418]
Reinforcement Learning with Verifiable Rewards (RLVR) の最近の進歩は、数学やプログラミングといった難解な推論課題に取り組むために、大規模言語モデル(LLM)に力を与えている。
約束にもかかわらず、RLVRパラダイムは大きな課題を生んでいる。
我々は,im$textbfP$licit $textbfA$ctor $textbfC$ritic couplingを実現する新しいRLVRフレームワークである$textbfPACS$を提案する。
論文 参考訳(メタデータ) (2025-09-02T17:22:46Z) - RLPR: Extrapolating RLVR to General Domains without Verifiers [103.14103272635893]
本稿では,RLVRを汎用ドメインに外挿するシンプルな検証不要なフレームワークであるRLPRを提案する。
このノイズの多い確率報酬の高分散に対処することが、それを機能させるためには不可欠である。
RLPRはGemma、Llama、Qwenベースのモデルの両方の領域における推論機能の改善を一貫して行っている。
論文 参考訳(メタデータ) (2025-06-23T02:56:36Z) - GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning [53.894789613838654]
我々は、複雑な実世界のビデオにバランスの取れた知覚と推論を必要とするベンチマークであるSEED-Bench-R1を紹介する。
SEED-Bench-R1を用いて、標準GRPOは解の精度を向上する一方で、推論ステップと解の論理的コヒーレンスを57.9%の一貫性で減少させる。
応答の正しさと推論コヒーレンスの両方を明示的な監督なしに最適化する整合性を考慮したRLフレームワークGRPO-CAREを提案する。
論文 参考訳(メタデータ) (2025-06-19T08:49:13Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。