論文の概要: Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
- arxiv url: http://arxiv.org/abs/2604.16335v1
- Date: Fri, 13 Mar 2026 02:23:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:13.9008
- Title: Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
- Title(参考訳): 可検証リワードを超えて:強化微調整SWE剤用ルブリック系GRM
- Abstract要約: よりリッチな学習信号を提供するジェネレーティブ・リワード・モデル(GRM)を導入する。
GRMには、特定の行動パターンを奨励または阻止するための基準を示す、人間によって設計されたルーリックが備わっている。
SWEタスク上でRFT(Reinforced Fine-Tuning)に使用する場合,本手法は終端スコアのみのリジェクションサンプリングよりも優れる。
- 参考スコア(独自算出の注目度): 9.505140329883762
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite recent progress in Large Language Model (LLM) Agents for Software Engineering (SWE) tasks, end-to-end fine-tuning typically relies on verifiable terminal rewards such as whether all unit tests pass. While these binary signals reflect whether the final solution is correct, they provide little guidance for shaping intermediate behaviors during multi-step interactions, thereby limiting improvements in the overall quality of the resolution process. To address this, we introduce a rubric-based Generative Reward Model (GRM) that provides richer learning signals. The GRM is equipped with human-designed rubrics that indicate criteria for encouraging or discouraging specific behavioral patterns, and we leverage this feedback for high-quality training data collection via trajectory filtration. When used for Reinforced Fine-Tuning (RFT) on SWE Tasks, our approach outperforms terminal-score-only rejection sampling: it more effectively suppresses undesirable patterns while promoting beneficial ones, as confirmed by case analyses, and it ultimately improves final test accuracy.
- Abstract(参考訳): 近年のLarge Language Model (LLM) Agents for Software Engineering (SWE)タスクの進歩にもかかわらず、エンドツーエンドの微調整は通常、すべてのユニットテストが通過するかどうかなどの検証可能な端末報酬に依存している。
これらのバイナリ信号は最終解が正しいかどうかを反映するが、多段階相互作用の中間動作を形作るためのガイダンスはほとんど提供されないため、分解プロセス全体の品質改善が制限される。
これを解決するために,よりリッチな学習信号を提供するルーリック・ベース・ジェネレーティブ・リワード・モデル(GRM)を導入する。
GRMは、特定の行動パターンを奨励または阻止するための基準を示す人間設計のルーリックを備えており、このフィードバックを軌道濾過による高品質なトレーニングデータ収集に活用する。
SWEタスク上でRFT(Reinforced Fine-Tuning)に使用する場合、この手法は端末スコアのみの拒否サンプリングよりも優れており、ケース分析で確認されたように、有利なパターンを推進しながら、望ましくないパターンを効果的に抑制し、最終的なテスト精度を向上する。
関連論文リスト
- ConsensusBench: Benchmark of Consensus Nodes for LLM Reasoning via Outcome Reward Densifying [45.2850302643347]
我々はConsensusPRという新しい強化学習信号を開発した。
長い推論軌跡にまたがる結果報酬の幅を、直接的に減少させる。
AIME 2024, AIME 2025, GSM8K, MATH-500および我々のConsensusBenchにおける実験により,提案手法がGRPOスタイルのアプローチを一貫して超越していることが実証された。
論文 参考訳(メタデータ) (2026-09-04T02:29:10Z) - ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - VeriGate: Verifier-Gated Step-Level Supervision for GRPO [51.26100506256885]
グループ相対政策最適化は、検証者に基づく結果報酬を伴う推論モデルをトレーニングするための効果的なレシピである。
GRPO の検証子付き拡張である VeriGate を提案し,これらの制限を3つの設計選択で解決する。
We show that VeriGate improves average accuracy around 20% and 12% for 1.5B and 7B models respectively。
論文 参考訳(メタデータ) (2026-05-28T18:20:32Z) - Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals [75.25256166997414]
本稿ではメタ認知に触発されたRLフレームワークであるメタ認知・アズ・リワード(MaR)を紹介する。
MaRは2つの一般的なプロセス次元を推論する。
MaRはモデル性能を継続的に改善し、ベースモデルよりも最大7.7%向上した。
論文 参考訳(メタデータ) (2026-05-22T08:54:37Z) - R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging [69.96389360650072]
解析精度は, 標準ラベルの精度を超えて, 下流RLHFの結果を高い精度で予測できることが示される。
我々は,金の判断でトレーニングを増強し,合理的アライメントを明示的に監督するR-Alignを提案する。
論文 参考訳(メタデータ) (2026-02-06T15:17:11Z) - Multimodal Reinforcement Learning with Agentic Verifier for AI Agents [131.46008226323423]
Argosは、エージェントタスクの推論モデルをトレーニングするための、原則化されたマルチモーダル報酬エージェントである。
エージェント検証をSFTデータとRLトレーニングの両方で活用することにより、我々のモデルは最先端の結果を得ることができる。
論文 参考訳(メタデータ) (2025-12-03T04:42:47Z) - Repurposing Synthetic Data for Fine-grained Search Agent Supervision [81.95597592711688]
LLMベースの検索エージェントは、エンティティ中心の合成データに基づいてますます訓練されている。
一般的なトレーニングメソッドは、このリッチなエンティティ情報を破棄し、代わりにスパースで結果に基づく報酬に依存します。
E-GRPO(Entity-Aware Group Relative Policy Optimization)は、高密度なエンティティ認識報酬関数を定式化する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-10-28T17:50:40Z) - Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense [36.71358559780692]
HEROは、検証者信号と報酬モデルスコアを構造化された方法で統合する強化学習フレームワークである。
HEROはRMのみのベースラインと検証者のみのベースラインを一貫して上回り、検証可能なタスクと検証しにくいタスクの両方で大きな利益を上げている。
論文 参考訳(メタデータ) (2025-10-08T17:09:41Z) - Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks [12.31210445905605]
ステップレベルの評価と結果の検証を統一するRLアプローチである原則プロセス・リワード(PPR)を導入する。
PPRは幅広いベンチマークで最先端のパフォーマンスを実現し、その顕著な堅牢性と一般化を実証している。
論文 参考訳(メタデータ) (2025-09-29T23:44:55Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。