論文の概要: RankBuffer: Efficient Ranking-Based Rewards for Open-Ended Generation
- arxiv url: http://arxiv.org/abs/2609.36652v1
- Date: Tue, 29 Sep 2026 03:51:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.167345
- Title: RankBuffer: Efficient Ranking-Based Rewards for Open-Ended Generation
- Title(参考訳): RankBuffer: オープンソース世代のための効率的なランク付けベースのリワード
- Abstract要約: Rank Bufferは、以前判断された応答の順序付きクエリ固有バッファを再利用可能な品質尺度として維持する。
オープンな4つのベンチマークで、Ranc Bufferは、すべてのポイントワイドベースラインを一貫して上回っている。
また、最強のランキングベースの報酬ベースラインでほぼ同等のパフォーマンスを達成し、判定コストを大幅に削減する。
- 参考スコア(独自算出の注目度): 23.078584675762134
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-ended generation lacks canonical answers, making pointwise rewards difficult to calibrate for group-based reinforcement learning. Directly ranking same-query rollouts provides a more suitable relative reward signal, but existing ranking-based reward methods can incur substantial judging cost. We introduce RankBuffer, which maintains an ordered, query-specific buffer of previously judged responses as a reusable quality scale. Each rollout is first inserted into an anchor interval through an independent coarse judgment, after which only rollouts assigned to the same interval undergo local fine ranking. The resulting complete order is converted into bounded rank rewards, while boundary expansion, local refinement, and inactive-anchor pruning adapt the buffer as the policy evolves. Across four open-ended benchmarks, RankBuffer consistently outperforms all pointwise baselines. It also achieves nearly on-par performance with the strongest ranking-based reward baseline while substantially reducing judging cost. Ablations demonstrate the importance of both local fine ranking and anchor response content, while buffer analyses show that rollout-derived anchors progressively extend and refine the covered quality scale. These results establish response reuse as an effective approach to efficient relative reward construction.
- Abstract(参考訳): オープンエンド・ジェネレーションは標準的回答に欠けており、グループベースの強化学習の校正が困難である。
同じクエリのロールアウトを直接ランク付けすることは、より適切な相対的な報酬信号を提供するが、既存のランク付けベースの報酬方法は、かなりのコストを発生させる可能性がある。
RankBufferは、以前判断された応答の順序付きクエリ固有のバッファを再利用可能な品質尺度として維持する。
各ロールアウトは、まず独立した粗い判断によってアンカーインターバルに挿入され、その後、同じインターバルに割り当てられたロールアウトのみが局所的な微調整を受ける。
結果として得られる完全順序は有界ランク報酬に変換されるが、境界展開、局所的な洗練、および非活性アンカープルーニングは、ポリシーが進化するにつれてバッファに適応する。
4つのオープンなベンチマークで、 RankBufferはすべてのポイントワイドベースラインを一貫して上回っている。
また、最強のランキングベースの報酬ベースラインでほぼ同等のパフォーマンスを達成し、判定コストを大幅に削減する。
アブレーションは局所的な微視的ランキングとアンカー応答の両方の重要性を示し、バッファ解析はロールアウト由来アンカーが徐々に拡大し、カバーされた品質尺度を洗練することを示している。
これらの結果は、効率的な相対報酬構築のための効果的なアプローチとして、応答再利用を確立する。
関連論文リスト
- ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement [49.49571101362551]
本稿では,ReCAST(Reward Credit Assignment across Timesteps)を提案する。
我々は、ReCASTがトレーニング報酬を超えて、その中核となる原則をサポートするために一般化する改善をもたらすことを示す。
論文 参考訳(メタデータ) (2026-09-11T18:41:09Z) - Convex-Hull-Neighborhood Smooth Dual Generalization: Controlling Local Correction Propagation in Offline RL [7.803284875836737]
ブートストラップは オフライン強化学習における 推定誤差を増幅する
本稿では,ベルマンのバックアップをサンプル値のターゲットとして表現し,CHN局所補正を行うConvex Hull Neborhood Smooth Dual Generalizationを提案する。
Gym-MuJoCoとAntMazeの実験は、強力な集約性能と安定した値推定を示す。
論文 参考訳(メタデータ) (2026-08-04T04:30:02Z) - Structure-aware Relative Policy Optimization for Ranking [35.05747484313467]
リストワイドランキングのためのtextbfStructure-aware textbfRelative textbfPolicy textbfOptimizationフレームワークであるSRPOを提案する。
これは、トップウェイトなケンダルタウ距離を用いてサンプル置換間の差を測定し、対応する距離によってそのペアの報酬差を正規化する。
2つのランキングシナリオにまたがる実験結果から、順列レベルの差を明示的にモデル化することで、リストワイドランキングの有効性と安定性が向上することが示された。
論文 参考訳(メタデータ) (2026-07-28T04:13:47Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents [48.80766702702854]
LLMベースの検索エージェントは、主に結果のみの報酬で訓練され、検索プロセス自体は監督されていない。
この信号は、全てのサンプル軌跡が同じ正当性を共有する結果同質な群に対して退化し、群内の優位性はゼロとなり、勾配は得られない。
ARBOR(Adaptive Buffer for Online Reward)は,クエリ間で共有されるルーリックメモリを維持する再利用可能なプロセス・リワードフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T06:58:54Z) - Prompt-Level Reward Specifications for Open-Ended Post-Training [43.215398565987265]
訓練後のオープンエンドのメリットは、迅速な成功条件を明確にする報酬である。
本稿では、報酬仕様と報酬仕様を分離するプロンプトレベル報酬仕様フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:52:06Z) - CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging [95.02210956333374]
本稿では,一対の選好評価にルーブリックに基づく判断を適応させる基準中心のフレームワークを提案する。
BigCodeRewardでは、CriterAlignはQwen2.5-VL-32Bモノリシック判事を60.4%から66.3%に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:59:19Z) - AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning [25.32049139462467]
既存の適応ルーブリックメソッドは、現在のバッチやインスタンスレベルの比較のようなローカルエビデンスから基準を更新する。
AMARIS(AMemory-Augmented Improvement System)を導入する。
AMARISはロールアウト分析、ステップレベルサマリー、ルーブリック更新レコードを永続的な評価メモリに格納し、更新に関連のある最近の履歴を検索する。
論文 参考訳(メタデータ) (2026-05-18T16:06:27Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。