論文の概要: Spurious Advantage Hidden in GRPO
- arxiv url: http://arxiv.org/abs/2609.04063v1
- Date: Thu, 03 Sep 2026 16:37:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.155581
- Title: Spurious Advantage Hidden in GRPO
- Title(参考訳): GRPOに隠されたすっきりしたアドバンテージ
- Abstract要約: グループ相対政策最適化は、検証可能な報酬を伴う強化学習のために研究される。
オーバールックされたケースは同じ表面を共有している: ロールアウトは推測によってその上に着地し、公式は依然として高い等級を割り当てている。
これは、小さな候補セットを持つ有界回答タスク、限定されたサブケースをホストするオープン・アンサーセット、予算が同じ答えに多くの経路を開くサーチエージェントの3つのケースで発生する。
検証器の符号を保ち、グローバルスケールを使用し、クラスごとの段階的再スケーリングによってゼロ平均バランスを復元する。
- 参考スコア(独自算出の注目度): 36.79136670827014
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Group Relative Policy Optimization (GRPO) is widely studied for reinforcement learning with verifiable rewards, where its advantage estimator assigns each rollout a magnitude from within-group reward statistics. In the common case, this magnitude rewards rollouts that reach the correct answer through reasoning. Yet, an overlooked case shares the same surface: a rollout may land on it by guessing, and the formula still assigns a high magnitude, which we identify as the spurious advantage. This arises in three cases: bounded-answer tasks with a small candidate set; open-answer sets hosting bounded sub-cases; and search agents whose budget opens many paths to the same answer. In all three, this misleads the policy toward guess-like behaviors. We propose SIGNBALANCE, whose magnitude is composition-free: it keeps the verifier sign, uses a global scale, and restores zero-mean balance via a stop-gradient per-class rescaling. Across math and search agent benchmarks at different scales, SIGNBALANCE matches GRPO on open-answer math and improves on bounded-answer math and search agents. Code will be released.
- Abstract(参考訳): グループ相対政策最適化(GRPO)は、検証可能な報酬を伴う強化学習のために広く研究されており、その利点推定器はグループ内報酬統計から各ロールアウトを1等級に割り当てている。
一般的な場合、この大きさは、推論を通じて正しい答えに達するロールアウトに報いる。
しかし、見過ごされがちなケースは同じ表面を共有している: ロールアウトは推測によってその上に着地し、公式は依然として高い等級を割り当てている。
これは、小さな候補セットを持つ有界回答タスク、限定されたサブケースをホストするオープン・アンサーセット、予算が同じ答えに多くの経路を開くサーチエージェントの3つのケースで発生する。
これら3つの中で、これは推測のような行動に対するポリシーを誤解させる。
SIGNBALANCEは,検証器の符号を保持し,グローバルスケールを使用し,ゼロ平均バランスを停止段階のクラス毎に再スケーリングすることで復元する。
数学とサーチエージェントのベンチマークでは、SIGNBALANCEはGRPOとオープン・アンサー数学で一致し、バウンド・アンサー数学とサーチエージェントで改善される。
コードはリリースされる。
関連論文リスト
- When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO [25.979415525596007]
検証可能な報酬(RLVR)を用いた強化学習
我々は、この挙動を多重性による構造レベルの信用集中として定式化する。
Cue-GRPOは補助モデル推論でこのルールをインスタンス化する。
論文 参考訳(メタデータ) (2026-08-04T11:02:26Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - The Sample Complexity of Multiclass and Sparse Contextual Bandits [106.74652380822778]
我々は,包括的フィードバックに基づいて,与えられたクラスからほぼ最適なポリシーを特定することを目的とする。
ゼロ・ワンの報酬を伴うバンド型マルチクラス分類に動機付けられ、emph$s$-sparse設定に焦点をあてる。
我々は、$s$-sparseの報酬で、誘導モデルクラスは、$s$でスケールするシャープなDEC境界を認め、直接最適なレートを得ることを示す。
論文 参考訳(メタデータ) (2026-05-28T09:12:20Z) - Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning [53.42577591449649]
グループ協力政策最適化は、トレーニングパラダイムをロールアウト競争からチーム協力へとシフトさせる。
GCPOは独立したロールアウトスコアをチームレベルのクレジット割り当てに置き換える。
チームへの平均的な限界貢献に従って、各ロールアウトに対して、グループチームの報酬を再分配する。
論文 参考訳(メタデータ) (2026-05-12T03:20:24Z) - CAPO: Counterfactual Credit Assignment in Sequential Cooperative Teams [6.8920524670882815]
本稿では,Aristocrat Utility(SeqAU)について紹介する。
批判のないポリシー段階のアルゴリズムであるCAPOを導出する。
論文 参考訳(メタデータ) (2026-04-20T01:14:59Z) - FlowRL: Matching Reward Distributions for LLM Reasoning [69.88820066093798]
大規模言語モデル(LLM)強化学習(RL)において、報酬を最大化する代わりに、フローバランシングによる全報酬分布をマッチングするフローRLを提案する。
我々はスカラー報酬を学習可能な分割関数を用いて正規化対象分布に変換し、その後、ポリシーと対象分布との逆KL分散を最小化する。
論文 参考訳(メタデータ) (2025-09-18T17:56:36Z) - Mean-Field Sampling for Cooperative Multi-Agent Reinforcement Learning [8.400105595501158]
我々は、新しい$textttSUBPLE-MFQ$(textbfSubsample$-$textbfMean-$textbfF$ield-$textbfQ$-learning)と、$n$エージェントを持つシステムの分散ランダム化ポリシーを提案する。
我々は、この学習されたポリシーが$tilde$O (1/sqrtk)$の順序の最適ポリシーに収束することを証明する。
論文 参考訳(メタデータ) (2024-12-01T03:45:17Z) - Efficient Reinforcement Learning for Global Decision Making in the Presence of Local Agents at Scale [5.3526997662068085]
本研究では,地域エージェントの存在下でのグローバル意思決定のための強化学習について検討する。
この環境では、状態空間のサイズのため、スケーラビリティは長年にわたる課題でした。
この学習されたポリシーは、サブサンプリングエージェントの数が増加するにつれて、$tildeO (1/sqrtk+epsilon_k,m)$の順序で最適ポリシーに収束することを示す。
論文 参考訳(メタデータ) (2024-03-01T01:49:57Z) - Towards Theoretical Understanding of Inverse Reinforcement Learning [45.3190496371625]
逆強化学習(IRL)は、専門家が示す振る舞いを正当化する報酬関数を回復するアルゴリズムの強力なファミリーである。
本稿では、生成モデルを用いた有限水平問題の場合のIRLの理論ギャップを解消する。
論文 参考訳(メタデータ) (2023-04-25T16:21:10Z) - The Price of Incentivizing Exploration: A Characterization via Thompson
Sampling and Sample Complexity [83.81297078039836]
インセンティブ付き探索(Incentivized Exploring)は、武器の選択を自給自足エージェントによって制御するマルチアーム・バンディットのバージョンである。
我々は、インセンティブの価格に焦点を合わせ、インセンティブの適合性のために、広く解釈された、パフォーマンスの喪失が引き起こされる。
論文 参考訳(メタデータ) (2020-02-03T04:58:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。