論文の概要: Dr.Credit: Rubric-Grounded Process Credit Assignment for Deep Research Agents
- arxiv url: http://arxiv.org/abs/2609.34296v1
- Date: Mon, 28 Sep 2026 04:43:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 22:04:25.047242
- Title: Dr.Credit: Rubric-Grounded Process Credit Assignment for Deep Research Agents
- Title(参考訳): Dr.Credit:Dr.Credit: ディープリサーチエージェントのためのルーブリックなプロセスクレジットアサインメント
- Abstract要約: ルーブリックグラウンドのクレジットは、最終回答の評価とプロセスの監督のための共有リファレンスとしてタスク要求を使用する。
Dr.Creditは、深い研究エージェントのためのRLフレームワークで中間ツールターンを監督するために、ルーリックグラウンドのクレジットを使用している。
- 参考スコア(独自算出の注目度): 50.29411792939258
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Rubric-based tasks are increasingly addressed through reinforcement learning (RL), with rubric scores used as training rewards. However, these rewards typically supervise final answers without distinguishing the contributions of intermediate decisions. Many existing credit assignment methods rely on ground-truth answers to define process rewards, limiting their applicability to open-ended tasks without canonical solutions. To address this limitation, the proposed rubric-grounded credit uses task requirements as a shared reference for final answer evaluation and process supervision. The information returned by tools is assessed for the additional support it provides toward satisfying each rubric relative to that rubric's history of accepted support. By referencing these histories, credit distinguishes new support from evidence already present in the trajectory while recognizing partial support for each rubric. Dr.Credit uses rubric-grounded credit to supervise intermediate tool turns in an RL framework for deep research agents. The resulting process advantages are combined with GRPO outcome advantages to guide research decisions while retaining supervision of final-report quality. Evaluations on four in-domain and out-of-domain benchmarks show that Dr.Credit outperforms the evaluated open deep research baselines on every primary metric and submetric. Meanwhile, with an 8B-parameter backbone, the trained agent achieves average performance competitive with the evaluated frontier proprietary models. Further analyses suggest more efficient evidence acquisition and higher-quality reports under limited research-turn budgets, motivating the extension of rubric-grounded process supervision to a broader range of rubric-based tasks.
- Abstract(参考訳): ルーブリックベースのタスクは、強化学習(RL)を通じて、トレーニング報酬として使用されるルーブリックスコアによって、ますます解決される。
しかしながら、これらの報酬は通常、中間決定の貢献を区別することなく最終回答を監督する。
既存のクレジット代入手法の多くは、プロセス報酬を定義するために根本からの回答に依存しており、標準解を使わずに、オープンなタスクに適用可能であることを制限している。
この制限に対処するため、提案したルーリックグラウンドクレジットでは、最終回答評価とプロセス監視のための共有参照としてタスク要求を使用する。
ツールによって返される情報は、そのルーリックが受け入れたサポートの歴史に対して、それぞれのルーリックを満たすために提供される追加的なサポートのために評価される。
これらの歴史を参照することで、信用は、各ルーリックに対する部分的な支持を認識しながら、既に軌道に存在する証拠から新しい支持を区別する。
Dr.Creditは、深い研究エージェントのためのRLフレームワークで中間ツールターンを監督するために、ルーリックグラウンドのクレジットを使用している。
結果のプロセスの利点は、最終報告品質の監督を維持しながら研究決定を導くためのGRPO結果の利点と組み合わせられる。
4つのドメイン内および外部のベンチマークの評価は、Dr.Creditが評価されたオープンディープリサーチベースラインをすべてのプライマリメトリックとサブメトリックで上回っていることを示している。
一方、8Bパラメータのバックボーンでは、トレーニングされたエージェントは、評価されたフロンティアプロプライエタリモデルと平均的なパフォーマンスの競合を達成する。
さらなる分析は、限られた研究予算の下でのより効率的な証拠取得と高品質な報告を示唆し、より広範囲のルーリックベースのタスクへのルーリック基底プロセス監視の拡張を動機付けている。
関連論文リスト
- Dense Process Supervision for Search Agents via Fact Utility Estimation [39.89624659103789]
本稿では,実効性推定に基づくプロセス監視手法を提案する。
7つのシングルホップおよびマルチホップQAベンチマーク実験により,本手法が既存のベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-09-01T07:34:33Z) - ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment [66.45065414461274]
ロングホライゾン検索エージェントは、最終的な答えを得るために証拠を検索、検索、検証、統合するための複数のシーケンシャルなアクション(ステップ)をしなければならない。
本稿では,長距離検索エージェントを訓練するためのきめ細かい信用割当てフレームワークであるAnswer-Backtracked Credit Assignment (ABC)を提案する。
ABCは、スパース軌跡レベルの結果を、誤動作や冗長な動作を抑えながら、有用な動作(たとえ軌道が失敗しても)を報いるような、密度の高いステップレベルの監視に変換する。
論文 参考訳(メタデータ) (2026-08-05T17:41:31Z) - STAMP: Provenance-Guided Credit Assignment for Deep Search Agents [16.1299556246389]
ディープリサーチエージェントの強化学習は、主に軌道レベルのスコアリングに焦点を当てている。
本稿では、参照ベースの検証器が各引用文書がエンティティや関係をサポートするかどうかを判断するSTAMPを提案する。
BrowseComp、BrowseComp-ZH、xbench-DSでは、STAMPはGRPOのベースラインを+2.0/+5.5/+3.0ポイント改善している。
論文 参考訳(メタデータ) (2026-07-13T07:12:55Z) - From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent [52.42081442204093]
我々は、紙の不審な部分を積極的に調査する柔軟性の欠如が、重要な制限であると主張している。
本稿では,保守的かつ構造化されたレビューログによってガイドされた論文を積極的にレビューする,科学的ピアレビューエージェントであるProReviewerを提案する。
実験の結果,8Bバックボーンを持つProReviewerは教師付き微調整によって訓練され,強化学習によって最適化され,5つの品質次元で最高の平均スコアが得られることがわかった。
論文 参考訳(メタデータ) (2026-06-11T13:38:23Z) - Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents [6.89645931986174]
本稿では,ルーリック誘導型行動選択フレームワークCo-ReActを紹介する。
各決定ステップにおいて、Co-ReActはエージェントのコンテキストにルーブリックを注入し、次のReason-or-Act決定を導く。
我々は、GRPOで専用のルーリック発電機を訓練し、このガイダンスを信頼性の高いものにする。
論文 参考訳(メタデータ) (2026-05-22T12:59:16Z) - RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards [76.17893114021757]
長い形式のレポートを計画し、調査し、エビデンスを評価し、合成する深層研究システムには、根本的な答えがなく、多くのツール強化された決定にまたがる。
本研究では,ルーブリックは最終回答評価者だけでなく,ポリシーの実行,判断フィードバック,エージェントメモリを構成する共有インターフェースとして機能すべきである,と論じる。
我々は、段階的な政策分解とリフレクションに基づくメタ政治進化を組み合わせたルーリック誘導強化学習フレームワークEMを導入する。
論文 参考訳(メタデータ) (2026-05-11T17:40:38Z) - Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization [47.7937991619078]
本稿では,プロセスの監督をグループ相対的な政策最適化に統合するフレームワークであるコントリビューション重み付きGRPOを提案する。
CW-GRPOは、LLM判定器を用いて、検索ラウンド毎の検索ユーティリティと推論精度を評価し、ラウンド毎のコントリビューションスコアを生成する。
複数の知識集約型ベンチマークの実験では、CW-GRPOはQwen3-8Bでは5.0%、Qwen3-1.7Bでは6.3%、標準GRPOより優れていた。
論文 参考訳(メタデータ) (2026-04-15T17:37:59Z) - Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented Agents [24.080021799509847]
textscEvalAct (Evaluate-as-Action) は暗黙的な検索品質評価を明示的なアクションに変換する。
textscEvalActは、マルチホップタスクにおいて最も高い平均精度を達成する。
論文 参考訳(メタデータ) (2026-03-10T05:22:40Z) - Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards [60.0970117192627]
強化学習(Reinforcement Learning, RL)は, LLMに基づくディープサーチエージェントの強化に重要な手法である。
既存のアプローチは主にバイナリ結果の報酬に依存しており、エージェントの推論プロセスの包括性と事実性を捉えていない。
ディープサーチエージェントのための微粒化報酬フレームワークである textbfCitation-aware RL Rewards (CaRR) を提案する。
論文 参考訳(メタデータ) (2026-01-09T18:57:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。