論文の概要: Dense Process Supervision for Search Agents via Fact Utility Estimation
- arxiv url: http://arxiv.org/abs/2609.00833v1
- Date: Tue, 01 Sep 2026 07:34:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.434388
- Title: Dense Process Supervision for Search Agents via Fact Utility Estimation
- Title(参考訳): 実効性推定による検索エージェントのDense Process Supervision
- Authors: Rongzhi Zhu, Xiangyu Liu, Yi Liu, Shuo Zhang, Ruirui Zhang, Rui Wu, Tao Jiang, Zequn Sun, Wenhao Xu, Wei Hu,
- Abstract要約: 本稿では,実効性推定に基づくプロセス監視手法を提案する。
7つのシングルホップおよびマルチホップQAベンチマーク実験により,本手法が既存のベースラインを一貫して上回ることを示す。
- 参考スコア(独自算出の注目度): 39.89624659103789
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) for search agents typically relies on outcome rewards. However, it often fails to achieve effective credit assignment, due to the unclear value of intermediate steps. It is hard to separate their contributions from the final result. In this paper, we propose a dense process supervision method based on fact utility estimation, which models the reasoning process as the accumulation of discrete evidence facts. We first extract structured facts from raw observations and organize them into an explicit fact store. To support credit assignment, we then cluster semantically equivalent facts and infer the posterior utility of each fact cluster using Bayesian estimation over group rollouts. Finally, we convert the estimated fact utilities into dense step-level rewards to guide RL training. Experiments on seven single-hop and multi-hop QA benchmarks show that our method consistently outperforms existing baselines. Ablation studies validate clear relative improvements on multi-hop QA compared to outcome reward-only training.
- Abstract(参考訳): 検索エージェントのための強化学習(RL)は通常、結果報酬に依存する。
しかし、中間ステップの値が不明確であるため、効果的なクレジット割り当てを達成できない場合が多い。
彼らの貢献を最終結果から切り離すことは難しい。
本稿では, 個別の証拠事実の蓄積として推論過程をモデル化した, 実効性推定に基づく密集プロセス監視手法を提案する。
まず、生の観察から構造化された事実を抽出し、それらを明示的なファクトストアに整理する。
次に, グループロールアウトに対するベイズ推定を用いて, 意味論的に等価な事実をクラスタリングし, それぞれの事実クラスタの効用を推定する。
最後に、推定事実ユーティリティを高密度ステップレベルの報酬に変換してRLトレーニングを指導する。
7つのシングルホップおよびマルチホップQAベンチマーク実験により,本手法が既存のベースラインを一貫して上回ることを示す。
アブレーション研究は、結果報酬のみのトレーニングと比較して、マルチホップQAの相対的な改善が明らかであることを示す。
関連論文リスト
- TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning [11.926589875842359]
大言語モデル(LLM)に基づく検索エージェントは,知識集約型タスクの性能を大幅に向上させた。
既存の手法は、長期信用割り当てにおいて重要な課題に直面する。
累積探索の逐次過程として探索軌道を再構成するPivot-Based Credit Assignment (PiCA)を提案する。
論文 参考訳(メタデータ) (2026-05-10T03:21:47Z) - Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented Agents [24.080021799509847]
textscEvalAct (Evaluate-as-Action) は暗黙的な検索品質評価を明示的なアクションに変換する。
textscEvalActは、マルチホップタスクにおいて最も高い平均精度を達成する。
論文 参考訳(メタデータ) (2026-03-10T05:22:40Z) - Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning [32.295907409325615]
強化学習による検索エンジンの推論のための大規模言語モデルの訓練は、信用代行問題によって妨げられる。
2つの相補的なアイデアに基づいて構築されたフレームワークであるSLATEを提案する。
7つのQAベンチマークの実験では、SLATEがスパース・リワードとプロセス・リワードのベースラインを一貫して上回っていることが確認された。
論文 参考訳(メタデータ) (2026-02-26T19:05:40Z) - Local Coherence or Global Validity? Investigating RLVR Traces in Math Domains [13.626335241662977]
Reinforcement Learning with Verifiable Rewards (RLVR)-based post-training of Large Language Models (LLMs) は、推論タスクの精度を向上させることが示されている。
直接インセンティブのない中間トークンに対するRLポストトレーニングの効果について検討する。
論文 参考訳(メタデータ) (2025-10-20T23:58:31Z) - Scaling Test-Time Compute Without Verification or RL is Suboptimal [70.28430200655919]
RL法や検索法に基づく検証器ベース (VB) 手法による微調整は, 一定量の計算・データ予算を条件として, 蒸留・クローニングに基づく検証器フリー (VF) 手法よりもはるかに優れていることを示す。
我々は,3/8Bの事前学習型LLMのドクティクスと数学推論の両問題に対して,我々の理論を実証的に相関させ,テスト時間計算のスケーリングには検証が不可欠であることを確認した。
論文 参考訳(メタデータ) (2025-02-17T18:43:24Z) - Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning [90.23629291067763]
大規模言語モデルにおける推論を改善するための有望なアプローチは、プロセス報酬モデル(PRM)を使用することである。
PRMは多段階の推論トレースの各ステップでフィードバックを提供し、結果報酬モデル(ORM)よりも信用割当を改善する可能性がある。
PRMに対して探索を行ったり、強化学習(RL)の報酬として使ったりすることで、基本方針を改善するために、「プロセス報酬をどう設計すべきか?」と質問する。
理論的には,良質なプロデューサの集合を特徴付けるとともに,このようなプロデューサからのプロセス報酬の最適化が,テスト時間探索やオンラインRLの探索を改善することを示す。
論文 参考訳(メタデータ) (2024-10-10T17:31:23Z) - VinePPO: Refining Credit Assignment in RL Training of LLMs [66.80143024475635]
我々は,言語環境の柔軟性を利用してモンテカルロをベースとした推定値を計算する,簡単なアプローチであるVinePPOを提案する。
本手法は,MATHおよびGSM8Kデータセット間のPPOおよび他のベースラインをウォールクロック時間以下で連続的に上回る。
論文 参考訳(メタデータ) (2024-10-02T15:49:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。