論文の概要: PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR
- arxiv url: http://arxiv.org/abs/2608.11368v1
- Date: Tue, 11 Aug 2026 19:24:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.359779
- Title: PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR
- Title(参考訳): PAIR: RLVRにおける適応型ロールアウトアロケーションのためのペアワイズインクルージョンリヘアリング
- Authors: Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes,
- Abstract要約: 検証可能な報酬を伴う強化学習は、長い推論軌道の計算生成グループの大部分に費やしている。
最近のアロケータは、難易度やユーティリティのポイントワイズな概念に従って、プロンプト、ロールアウト、トークンに予算を割り当てることで、このコストを削減している。
グループ相対スコア勾配は、独立点寄与の総和ではなく、ロールアウト対に対する2次統計値である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) spends most of its compute generating groups of long reasoning trajectories. Recent allocators reduce this cost by assigning budgets to prompts, rollouts, or tokens according to a pointwise notion of difficulty or utility. We identify a statistical mismatch: the unclipped leave-one-out group-relative score gradient is not a sum of independent point contributions, but a second-order U-statistic over pairs of rollouts. Completing one rollout therefore reveals contrast with every other completed rollout, and adaptive endpoint selection changes which pair terms are observable. We introduce PAIR (Pairwise-Aware Inclusion Reweighting), which treats short rollout prefixes as vertices and pair-gradient terms as edges of a contrast graph. A prefix-only predictor estimates correctness and remaining token cost; a convex design chooses positive continuation probabilities under an expected suffix-token budget; and each edge induced by completed vertices is inverse-weighted by its logged joint inclusion probability. Under conditionally independent on-policy rollouts and an unclipped, unstandardized objective, the resulting estimator is design-unbiased for the complete candidate-pair gradient. Across compute-matched RLVR runs on Qwen3-1.7B/4B, PAIR improves average accuracy by +1.2 and +1.4 over the strongest pointwise allocator while using 51% and 52% fewer generated tokens than full-group GRPO. A frozen-population estimator audit confirms that unweighted adaptive selection is biased, whereas pair-inclusion correction recovers the complete-pair target at matched suffix cost.
- Abstract(参考訳): 検証可能な報酬(RLVR)による強化学習は、長い推論軌道の計算生成グループの大部分に費やしている。
最近のアロケータは、難易度やユーティリティのポイントワイズな概念に従って、プロンプト、ロールアウト、トークンに予算を割り当てることで、このコストを削減している。
グループ相対スコア勾配は、独立点寄与の総和ではなく、ロールアウト対に対する2次統計値である。
したがって、1つのロールアウトをコンパイルすると、他の完了したロールアウトとコントラストが示され、ペア項が観測可能な適応的なエンドポイント選択が変更される。
PAIR(Pairwise-Aware Inclusion Reweighting)を導入し、短いロールアウトプレフィックスを頂点として、ペアグレート項をコントラストグラフのエッジとして扱う。
プレフィックスのみ予測器は、正当性と残トークンコストを推定し、凸設計は、期待された接尾辞の予算の下で正の継続確率を選択し、完了した頂点によって誘導される各エッジは、そのログ化された関節包含確率によって逆重み付けされる。
条件付き独立なオン・ポリシーのロールアウトと、未定の未定の目的の下で、結果として得られる推定器は、完全な候補対ペア勾配に偏りなく設計される。
計算マッチングされたRLVRはQwen3-1.7B/4B上で動作し、PAIRは最強のポイントワイドアロケータよりも平均精度を+1.2と+1.4に改善し、フルグループGRPOよりも51%と52%少ない生成トークンを使用する。
凍結人口推定器監査は、未加重適応選択が偏りがあることを確認する一方、ペア包摂補正は一致した接尾辞コストで全対目標を回復する。
関連論文リスト
- Convex-Hull-Neighborhood Smooth Dual Generalization: Controlling Local Correction Propagation in Offline RL [7.803284875836737]
ブートストラップは オフライン強化学習における 推定誤差を増幅する
本稿では,ベルマンのバックアップをサンプル値のターゲットとして表現し,CHN局所補正を行うConvex Hull Neborhood Smooth Dual Generalizationを提案する。
Gym-MuJoCoとAntMazeの実験は、強力な集約性能と安定した値推定を示す。
論文 参考訳(メタデータ) (2026-08-04T04:30:02Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - When Individually Calibrated Models Become Collectively Miscalibrated [3.556355987197792]
本研究では,個別に調整した予測器が戦略的に相互作用した場合に集団的に誤判定されることを示す。
正の相関関係を持つブライアスコアに基づくアグリゲーションでは、各エージェントの個別に最適なレポートは、正のクラス確率を体系的に過小評価する。
対照的に、VCGベースのアグリゲーションは、限界貢献に報いることでインセンティブを調整し、支配的な戦略的なインセンティブ互換性とほぼ最適のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-14T05:25:16Z) - Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective [10.958642517467721]
RLVRにおけるコントラストシーケンスレベルのポリシー最適化のためのフレームワークを提案する。
ConSPOはGRPOのクリップされた比率ベースのスコアを、長さ正規化されたシーケンスログ確率に置き換える。
ConSPOは、挑戦的な数学的推論ベンチマークにおいて、いくつかの強力なRLVRベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-13T04:02:36Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - Semiparametric conformal prediction [79.6147286161434]
ベクトル値の非整合性スコアの結合相関構造を考慮した共形予測セットを構築する。
スコアの累積分布関数(CDF)を柔軟に推定する。
提案手法は,現実の回帰問題に対して,所望のカバレッジと競争効率をもたらす。
論文 参考訳(メタデータ) (2024-11-04T14:29:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。