論文の概要: Range-GRPO: Policy Optimization via Pairwise Relations among Reward Intervals
- arxiv url: http://arxiv.org/abs/2610.01548v1
- Date: Thu, 01 Oct 2026 12:16:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.107887
- Title: Range-GRPO: Policy Optimization via Pairwise Relations among Reward Intervals
- Title(参考訳): Range-GRPO: Pairwise Relations of Reward Intervalsによる政策最適化
- Abstract要約: LLM-as-a-Judgeはラベルなし応答に対してスケーラブルな擬似リワードを提供するが、単一のポイントスコアは報酬の不確実性を表すものではない。
本研究では,制限付きラベル付きデータとラベルなしプロンプトを組み合わせた半教師付きポストトレーニングフレームワークであるRange-GRPOを提案する。
- 参考スコア(独自算出の注目度): 13.992999551683523
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As the use of large language models (LLMs) expands, post-training has become increasingly important for adapting them to downstream tasks. However, obtaining reliable supervision remains costly, especially in domains without reference answers or executable verifiers. LLM-as-a-Judge provides scalable pseudo-rewards for unlabeled responses, but a single point score does not explicitly represent reward uncertainty. This motivates representing pseudo-rewards as conformally calibrated reward ranges. We propose Range-GRPO, a semi-supervised post-training framework that combines limited labeled data with unlabeled prompts. In Group Relative Policy Optimization (GRPO), learning signals depend on relative reward comparisons within each rollout group. The proposed objective compares reward ranges pairwise rather than reducing them to point rewards, allowing interval uncertainty to affect both the magnitude and direction of these signals. Our theoretical analysis characterizes this distinction and shows that the proposed objective recovers the Dr.GRPO advantage when all reward ranges collapse to points. Empirically, Range-GRPO achieves the highest in-distribution and out-of-distribution average performance among the evaluated semi-supervised methods while requiring fewer training resources.
- Abstract(参考訳): 大規模言語モデル(LLM)の利用が拡大するにつれて、下流タスクに適応する上で、ポストトレーニングがますます重要になっている。
しかし、特に参照応答や実行可能検証のない領域では、信頼できる監視を得るのにコストがかかる。
LLM-as-a-Judgeはラベルなし応答に対してスケーラブルな擬似リワードを提供するが、単一のポイントスコアは報酬の不確実性を表すものではない。
これは、擬似逆転を共形校正された報酬範囲として表す動機である。
本研究では,制限付きラベル付きデータとラベルなしプロンプトを組み合わせた半教師付きポストトレーニングフレームワークであるRange-GRPOを提案する。
グループ相対政策最適化(GRPO)では、学習信号は各ロールアウトグループ内の相対的な報酬比較に依存する。
提案した目的は、報酬をポイント報酬に還元するのではなく、ペアワイズに比較し、間隔の不確実性がこれらの信号の大きさと方向の両方に影響を与えるようにする。
我々の理論解析は,この区別を特徴付け,全ての報酬範囲が点まで崩壊した場合に,提案した目的がDr.GRPOの優位性を取り戻すことを示す。
実験的に、Range-GRPOは、トレーニングリソースを少なくしながら評価された半教師付き手法の中で、最も高い分配量および分配平均性能を達成する。
関連論文リスト
- OR Else: A Differentiable Trust Region for Policy Optimization [2.51067108081605]
我々は、スムーズな片側飽和ルールである出力リセット(OR)が、大規模言語モデルのポストトレーニングに有用な代替手段であるかどうかを問う。
PPO-Clip と PPO-OR をGAE で比較し,GRPO-OR とGRPO-OR をグループ相対的優位性で比較した。
論文 参考訳(メタデータ) (2026-07-20T17:07:40Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning [53.42577591449649]
グループ協力政策最適化は、トレーニングパラダイムをロールアウト競争からチーム協力へとシフトさせる。
GCPOは独立したロールアウトスコアをチームレベルのクレジット割り当てに置き換える。
チームへの平均的な限界貢献に従って、各ロールアウトに対して、グループチームの報酬を再分配する。
論文 参考訳(メタデータ) (2026-05-12T03:20:24Z) - Relative Score Policy Optimization for Diffusion Language Models [29.344961499429257]
拡散大言語モデル(dLLMs)は、並列かつ効率的なテキスト生成への有望な経路を提供する。
抽出可能なシーケンスレベルのログ比の欠如により、既存の手法は高分散ELBOベースの近似に頼らざるを得なくなった。
textbfRelative textbfScore textbfPolicy textbfOptimization (RSPO)を提案する。
論文 参考訳(メタデータ) (2026-05-11T08:58:40Z) - WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning [67.45237332694025]
グループ相対政策最適化は、複雑な推論に基づいて言語モデルを訓練するのに効果的である。
Weakly Supervised GRPOを提案し、端末報酬を正当性を考慮したガイダンスに変換することにより、ロールアウト効率を向上させる。
論文 参考訳(メタデータ) (2026-02-19T02:43:35Z) - Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards [39.489554597919145]
グループ相対ポリシー最適化(GRPO)は、完了時にすべてのトークンに対して単一のスカラーの利点を割り当てる。
明確なセグメントと目的を持つ構造化世代では、このカップルはセグメント間で無関係な報酬信号を生成し、客観的な干渉と不正な信用につながる。
我々は、GRPO互換メソッドのファミリーであるBlockwise Advantage Estimationを提案し、それぞれの目的をそれぞれ独自の利点を割り当て、対応するテキストブロックのトークンにのみ適用する。
論文 参考訳(メタデータ) (2026-02-10T19:22:37Z) - Repurposing Synthetic Data for Fine-grained Search Agent Supervision [81.95597592711688]
LLMベースの検索エージェントは、エンティティ中心の合成データに基づいてますます訓練されている。
一般的なトレーニングメソッドは、このリッチなエンティティ情報を破棄し、代わりにスパースで結果に基づく報酬に依存します。
E-GRPO(Entity-Aware Group Relative Policy Optimization)は、高密度なエンティティ認識報酬関数を定式化する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-10-28T17:50:40Z) - Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents [28.145430029174577]
大規模言語モデル(LLM)ベースのエージェントは、外部環境と対話する能力を高めるために強化学習(RL)でますます訓練されている。
既存のアプローチは通常、最終回答でのみ提供される結果に基づく報酬に依存します。
本稿では,情報ゲインに基づくポリシー最適化(IGPO)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:59:32Z) - FlowRL: Matching Reward Distributions for LLM Reasoning [69.88820066093798]
大規模言語モデル(LLM)強化学習(RL)において、報酬を最大化する代わりに、フローバランシングによる全報酬分布をマッチングするフローRLを提案する。
我々はスカラー報酬を学習可能な分割関数を用いて正規化対象分布に変換し、その後、ポリシーと対象分布との逆KL分散を最小化する。
論文 参考訳(メタデータ) (2025-09-18T17:56:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。