論文の概要: Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.36178v1
- Date: Mon, 28 Sep 2026 19:48:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.97777
- Title: Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning
- Title(参考訳): エージェント強化学習におけるクレジットアサインメントのためのPivotal決定のターゲット
- Abstract要約: 本稿では,エージェント強化学習におけるきめ細かなクレジット割り当てを,潜在的に重要な決定対象とするフレームワークであるProVerを紹介する。
ProVerは、モデル判定のみを使用して検証の場所を選択することで、すべての中間状態を徹底的に評価することなく、観察結果のローカルクレジットを根拠にします。
ALFWorld、WebShop、SearchQAを通じて、ProVerは両方のモデルスケールで最高の平均パフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 39.325308642396244
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Group Relative Policy Optimization (GRPO) has become a promising approach for training large language model agents. However, its uniform assignment of trajectory-level advantages to all policy tokens fails to distinguish consequential decisions from less relevant ones, obscuring which intermediate decisions contributed to success. We introduce ProVer, a framework that targets potentially pivotal decisions for fine-grained credit assignment in agentic reinforcement learning. Given a rollout group, an agentic judge contrasts successful and failed trajectories to propose a segment potentially responsible for their divergent outcomes. Rather than directly trusting the judge's assessment, ProVer verifies the proposed segment by estimating its advantage from the difference in terminal success rates between current-policy continuations sampled before and after the segment. Positive estimates are then incorporated into the GRPO advantages of policy tokens within the proposed segment. By using model judgment only to select where to verify, ProVer grounds local credit in observed outcomes without exhaustively evaluating every intermediate state. Across ALFWorld, WebShop, and SearchQA, ProVer achieves the strongest average performance at both model scales, with relative improvements over GRPO of 9.91% and 7.12% for Qwen3.5-2B and Qwen3.5-4B, respectively. Further analyses demonstrate that informed segment selection improves policy training with modest additional generation overhead, even without a frontier-scale judge model, highlighting the effectiveness and efficiency of selectively targeting pivotal decisions for fine-grained credit assignment in agentic reinforcement learning.
- Abstract(参考訳): グループ相対政策最適化(GRPO)は、大規模言語モデルエージェントのトレーニングにおいて有望なアプローチとなっている。
しかしながら、全ての政策トークンに対する軌道レベルの優位性の均一な割り当ては、連続的な決定とより関係の低いものとの区別に失敗し、どの中間的な決定が成功に寄与したかを見極める。
本稿では,エージェント強化学習におけるきめ細かなクレジット割り当てを,潜在的に重要な決定対象とするフレームワークであるProVerを紹介する。
ロールアウト・グループを与えられたエージェント・ジャッジは、成功と失敗の軌跡を対比して、分岐した結果の原因となる可能性のあるセグメントを提案する。
ProVerは、裁判官の評価を直接信頼するのではなく、セグメントの前後でサンプリングされた現在の政治継続間の終端成功率の差から、その利点を推定することで、提案されたセグメントを検証している。
正の見積もりは、提案セグメント内のポリシートークンのGRPOアドバンテージに組み込まれる。
ProVerは、モデル判定のみを使用して検証の場所を選択することで、すべての中間状態を徹底的に評価することなく、観察結果のローカルクレジットを根拠にします。
ALFWorld、WebShop、SearchQAを通じて、ProVerは両方のモデルスケールで最も高い平均性能を達成し、それぞれQwen3.5-2BとQwen3.5-4BのGRPOを9.91%、相対的に7.12%改善した。
さらに、情報セグメント選択は、フロンティアスケールの判断モデルがなくても、わずかに付加的なオーバーヘッドでポリシートレーニングを改善し、エージェント強化学習におけるきめ細かな信用割当のための重要な決定を選択的にターゲットするの有効性と効率を強調した。
関連論文リスト
- PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks [41.82007055765541]
マルチターンエージェントタスクに対する潜在的誘導型ポリシー最適化を提案する。
各ロールアウトグループ内のアンカー状態群戻り統計から経験的状態ポテンシャルを推定する。
その後、隣接する状態間の潜在的な差異から行動上の利点を導き出し、軌道間クレジットの伝播を可能にする。
論文 参考訳(メタデータ) (2026-09-02T07:44:16Z) - Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization [13.354353071601379]
我々は、特権付き監督を成果ベースアクションクレジットに変換するTASPOを紹介する。
3つのエージェントベンチマークで、TASPOはGRPOよりも10.6%改善し、目に見えないタスクを一般化する。
論文 参考訳(メタデータ) (2026-08-31T16:51:50Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning [48.32628338889922]
グループ相対政策最適化は中間段階の無差別な信用割当に苦しむ。
モデルフリーで検証可能なプロセス監視を,モデルが正しい回答を信じているかどうかを判断することによって導入する。
このアプローチにより、よりターゲット的でサンプル効率の良いポリシー更新が可能になる。
論文 参考訳(メタデータ) (2026-04-22T15:08:58Z) - Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards [39.489554597919145]
グループ相対ポリシー最適化(GRPO)は、完了時にすべてのトークンに対して単一のスカラーの利点を割り当てる。
明確なセグメントと目的を持つ構造化世代では、このカップルはセグメント間で無関係な報酬信号を生成し、客観的な干渉と不正な信用につながる。
我々は、GRPO互換メソッドのファミリーであるBlockwise Advantage Estimationを提案し、それぞれの目的をそれぞれ独自の利点を割り当て、対応するテキストブロックのトークンにのみ適用する。
論文 参考訳(メタデータ) (2026-02-10T19:22:37Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization [50.91849555841057]
グループ相対政策最適化は大規模推論モデル(LRM)の強化学習手法である
差別学習の原則を基礎として, LRMの強化のための新たな差別的制約付き最適化フレームワークを導入する。
DisCO は GRPO と DAPO などの改良型を著しく上回り、GRPO の7%、DAPO の6% を平均的に上回っている。
論文 参考訳(メタデータ) (2025-05-18T11:08:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。