論文の概要: Process Reward Informed Tree Rollout for Effective Multi-Turn RL
- arxiv url: http://arxiv.org/abs/2607.15610v1
- Date: Fri, 17 Jul 2026 04:16:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.747108
- Title: Process Reward Informed Tree Rollout for Effective Multi-Turn RL
- Title(参考訳): 効率的なマルチターンRLのためのプロセスリワードインフォームツリーロールアウト
- Authors: Xintong Li, Sha Li, Yuwei Zhang, Changlong Yu, Rongmei Lin, Hongye Jin, Shuyi Guan, Xin Liu, Linwei Li, Qingyu Yin, Jingbo Shang,
- Abstract要約: 長期のエージェントタスクでは、均一なロールアウト戦略は、非形式的なデッドエンドの試みに予算を無駄にする可能性がある。
本稿では,マルチターンエージェントRLの品質を意識したロールアウトフレームワークであるProcess-Scorer Guided Adaptive Tree Rollout (PATR)を提案する。
PATRはタスクに適したプロセスフィードバックを使用して部分的軌跡をスコアし、将来性のある状態から選択的に分岐し、共有プレフィックスを再利用し、無駄なサンプリングを減らすために経路を保守的に停止する。
- 参考スコア(独自算出の注目度): 58.392997761968566
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) has become a key approach for training LLM agents, yet popular methods such as GRPO/RLOO rely on multiple independently sampled complete trajectories for advantage estimation. In long-horizon agentic tasks, such a uniform rollout strategy can waste budget on uninformative dead-end attempts, while promising intermediate states do not receive sufficient exploration. The multi-turn structure of agentic trajectories, with interleaved actions and observations, naturally supports organizing a trajectory group as a tree, where each turn serves as a decision point for exploration. This perspective reframes effective exploration as the problem of deciding where to branch. We propose Process-Scorer Guided Adaptive Tree Rollout (PATR), a quality-aware rollout framework for multi-turn agent RL. PATR uses task-appropriate process feedback to score partial trajectories, selectively branches from promising states, reuses shared prefixes, and conservatively stops degenerate paths to reduce wasted sampling. The resulting rollout groups remain compatible with standard policy optimization while providing more efficient exploration under the same training budget. We evaluate PATR on FrozenLake and the challenging SWE-Bench, which is largely unexplored by prior tree-rollout agent RL methods. Experiments show that PATR improves performance by up to +5.0 points on SWE-Bench and +9.3 points on FrozenLake, highlighting process-guided tree rollouts as an effective strategy for scalable multi-turn RL.
- Abstract(参考訳): 強化学習(RL)はLLMエージェントのトレーニングにおいて重要なアプローチとなっているが、GRPO/RLOOのような一般的な手法は、利点を推定するために複数の独立した完全な軌跡に依存している。
長期のエージェントタスクでは、このような一様ロールアウト戦略は非形式的なデッドエンドの試みに予算を浪費するが、中間状態は十分な調査を受けられない。
エージェント・トラジェクトリのマルチターン構造は、インターリーブド・アクションと観察によって、自然に、各ターンが探索の意思決定点となる木としてのトラジェクトリ・グループの編成を支援する。
この視点は、分岐する場所を決定する問題として、効果的な探索を再構築する。
本稿では,マルチターンエージェントRLの品質を意識したロールアウトフレームワークであるProcess-Scorer Guided Adaptive Tree Rollout (PATR)を提案する。
PATRはタスクに適したプロセスフィードバックを使用して、部分的軌跡をスコアし、有望な状態から選択的に分岐し、共有プレフィックスを再利用し、保守的に退行経路を停止し、無駄なサンプリングを減らす。
結果として得られたロールアウトグループは、同じトレーニング予算の下でより効率的な探索を提供しながら、標準方針の最適化と相容れないままである。
我々は,凍結浸漬におけるPATRとSWE-Benchについて検討した。
実験の結果、PATRはSWE-Benchで最大5.0ポイント、FrozenLakeで+9.3ポイントの性能向上を示し、スケーラブルなマルチターンRLのための効果的な戦略としてプロセス誘導木のロールアウトを強調した。
関連論文リスト
- TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents [31.795232330674413]
本稿では,TSR(Trajectory-Search Rollouts)を提案する。
我々は、最高のN、ビームルックサーチ、PPOとGRPOを組み合わせてTSRをインスタンス化し、最大15%のパフォーマンス向上と、Sokoban、FrozenLake、WebShopタスクでのより安定した学習を1回のトレーニング計算で達成する。
論文 参考訳(メタデータ) (2026-02-12T09:49:24Z) - TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG [71.06073770344732]
エージェント検索強化生成(RAG)は、推論と情報検索の多段階的な相互作用として質問応答を定式化する。
エージェントRAGのためのオンラインツリーベースRLフレームワークであるTreePS-RAGについて述べる。
論文 参考訳(メタデータ) (2026-01-11T14:07:30Z) - Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards [48.321707628011005]
Lookahead Tree-Based Rollouts (LATR) は、軌道レベルの多様性を明確に促進するために設計された新しいロールアウト戦略である。
LATRはポリシー学習を平均で131%加速し、最終パス@1パフォーマンスを4.2%向上させる。
論文 参考訳(メタデータ) (2025-10-28T11:12:02Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。