論文の概要: RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training
- arxiv url: http://arxiv.org/abs/2608.18682v1
- Date: Wed, 19 Aug 2026 08:33:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.344473
- Title: RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training
- Title(参考訳): RTPO:Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training
- Abstract要約: 強化学習(RL)を用いたマルチターンエージェントのトレーニングにより、大規模言語モデルでは複雑な推論を行い、外部ツールを使用し、単一ターン設定以上の反復探索を行うことができる。
しかし、マルチターンRLトレーニングは非常に不安定であり、ターン数が増加するにつれて性能が著しく低下することが多い。
不安定性の3つの厳密に結合された源は,ロールアウト学習コンテキストミスマッチ,スパース端末報酬によるターンレベルクレジット割り当ての弱さ,非同期ポリシドリフトである。
マルチターンロールアウトをスパース逆木として整理し,時相逆順でターンレベルのポリシー更新を行うRTPO(Reverse-Turn Policy Optimization)を提案する。
- 参考スコア(独自算出の注目度): 3.390485555273589
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training multi-turn agentic workflows with reinforcement learning (RL) enables large language models to perform complex reasoning, use external tools, and conduct iterative search beyond single-turn settings. Yet multi-turn RL training remains highly unstable, often causing severe performance degradation as the number of turns increases. Through theoretical analysis, we identify three tightly coupled sources of instability: rollout-training context mismatch, weak turn-level credit assignment under sparse terminal rewards, and asynchronous policy drift when short and long trajectories are optimized under different policy versions. We show that these issues share a common structural origin in flattened trajectory optimization and address them through a unified reverse-turn formulation. We propose Reverse-Turn Policy Optimization (RTPO), which organizes multi-turn rollouts as sparse reverse trees and performs turn-level policy updates in temporal reverse order, aligning each decision with its downstream continuation. RTPO enables causally consistent turn-level credit assignment and on-policy continuation to control asynchronous drift. We provide theoretical guarantees showing that RTPO eliminates context mismatch and asynchronous drift under the proposed turn-level formulation, reduces credit bias, and converges to recursive optimality. Experiments on multi-turn agentic RL benchmarks show that RTPO improves upon trajectory- and turn-level baselines by 21.50% and 10.76%, respectively, highlighting its potential to support more stable training for tool-using agents.
- Abstract(参考訳): 強化学習(RL)を用いたマルチターンエージェントワークフローのトレーニングにより、大規模な言語モデルで複雑な推論を実行したり、外部ツールを使用したり、シングルターン設定以上の反復探索を行うことが可能になる。
しかし、マルチターンRLトレーニングは非常に不安定であり、ターン数が増加するにつれて性能が著しく低下することが多い。
理論的解析により、ロールアウト学習コンテキストミスマッチ、スパース端末報酬によるターンレベルクレジット割り当ての弱さ、およびショートおよびロングトラジェクトリが異なるポリシーバージョンで最適化された場合の非同期ポリシードリフトの3つの厳密な結合源を同定する。
これらの問題は、平坦な軌道最適化において共通の構造的起源を共有し、統一された逆向きの定式化によってそれらに対処することを示す。
本稿では,マルチターンロールアウトをスパース逆木として整理し,ターンレベルのポリシー更新を時相逆順に行い,各決定を下流継続と整合させるRTPO(Reverse-Turn Policy Optimization)を提案する。
RTPOは、非同期ドリフトを制御するために、因果的に一貫したターンレベルのクレジット割り当てとオン・ポリシー継続を可能にする。
提案したターンレベルの定式化の下で,RTPOがコンテキストミスマッチや非同期ドリフトを排除し,信用バイアスを低減し,再帰的最適性に収束することを示す理論的保証を提供する。
マルチターンエージェントRLベンチマークの実験では、RTPOは、それぞれ21.50%、ターンレベルのベースラインが10.76%向上し、ツール使用エージェントのより安定したトレーニングをサポートする可能性を示している。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning [95.29291773706224]
Tool-Integrated Reasoningは、LLMエージェントが外部ツールと反復的に対話することで複雑なタスクを解決する機能である。
既存のアプローチは通常、一様軌跡レベルの利点を割り当て、全ての正しいツールコールを平等に扱う。
これは、自明なパターンと困難なツールの使用パターンを適切に区別しない不正確な学習信号につながる可能性がある。
論文 参考訳(メタデータ) (2026-08-22T09:14:15Z) - Contrastive Reinforced Policy Optimization via Privileged Self-Distillation [23.840537431318296]
対照的な学習の観点から,エージェント・オン・ポリシィ・セルフ・蒸留(OPSD)を再構成するCRPO(Contrastive Reinforced Policy Optimization)を導入する。
CRPOは、既存の強化学習と自己蒸留ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-07-30T11:14:11Z) - Process Reward Informed Tree Rollout for Effective Multi-Turn RL [58.392997761968566]
長期のエージェントタスクでは、均一なロールアウト戦略は、非形式的なデッドエンドの試みに予算を無駄にする可能性がある。
本稿では,マルチターンエージェントRLの品質を意識したロールアウトフレームワークであるProcess-Scorer Guided Adaptive Tree Rollout (PATR)を提案する。
PATRはタスクに適したプロセスフィードバックを使用して部分的軌跡をスコアし、将来性のある状態から選択的に分岐し、共有プレフィックスを再利用し、無駄なサンプリングを減らすために経路を保守的に停止する。
論文 参考訳(メタデータ) (2026-07-17T04:16:58Z) - Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning [85.02566758103008]
Group-Graph Policy Optimization (G2PO) は、マルチターンエージェントタスクに適したグループベースの強化学習アルゴリズムである。
G2POは最先端のプロンプトベースとRLベースラインを大幅に上回り、GRPOよりも最大22.2%の成功率の向上を達成した。
論文 参考訳(メタデータ) (2026-06-22T08:12:47Z) - GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization [54.596224644751565]
訓練後強化学習(RL)は多次元報酬に頼り、包括的能力を育成する。
これを解決するために、グループ報酬分離政策最適化(GDPO)のような既存の手法は、総合的なスコアを独立した報酬グループに分解し、各グループ内でRL損失を個別に計算する。
本稿では,GD$2$PO(Group-Dynamic reward-Decoupled Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-06-15T14:19:28Z) - CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents [53.765941044015854]
本稿では,ロールプレイングタスクで目的を実現するためのフレームワークCRPOを提案する。
CRPOは3つのメカニズムにより、タスクロジックをスタイリスティックな報酬から切り離して勾配競合を解消し、文字複雑性に基づいた最適化制約を動的に適応させ、一般的な応答を負のベースラインとして利用し、モデルが共通の分布に戻すのを防ぐ。
論文 参考訳(メタデータ) (2026-05-25T07:15:38Z) - Robust Adversarial Policy Optimization Under Dynamics Uncertainty [8.729531978655737]
強化学習(RL)ポリシーは、トレーニングとは異なるダイナミクスの下で失敗することが多い。
本稿では、ロバスト性-性能トレードオフを直接露呈する二重定式化を提案する。
結果として得られるフレームワークである、堅牢な逆ポリシー最適化(RAPO)は、ロバストなRLベースラインを上回っている。
論文 参考訳(メタデータ) (2026-04-13T04:23:54Z) - SeeUPO: Sequence-Level Agentic-RL with Convergence Guarantees [33.46730273409721]
強化学習(RL)は、大規模言語モデル(LLM)ベースのAIエージェントを訓練するための主要なパラダイムとして登場した。
既存のバックボーンRLアルゴリズムには、エージェントシナリオにおけるコンバージェンス保証が欠如している。
本研究では,マルチターンインタラクションに対する収束保証を備えた批判のないアプローチであるSeeeUPOを提案する。
論文 参考訳(メタデータ) (2026-02-06T09:57:23Z) - Empowering Multi-Turn Tool-Integrated Reasoning with Group Turn Policy Optimization [20.004150645050537]
Group Turn Policy Optimization (GTPO) は、多ターンツール統合推論タスクにおける大規模言語モデル(LLM)のトレーニング用に設計された、新しい強化学習アルゴリズムである。
GTPOは、各ターンに対してきめ細かいフィードバックを提供するターンレベルの報酬割り当て、リターンベースの利点推定、自己監督型報酬形成という3つの重要なイノベーションを導入している。
総合評価の結果、GTPOは様々な推論ベンチマークでGRPOを平均3.0%上回っていることがわかった。
論文 参考訳(メタデータ) (2025-11-18T19:01:16Z) - Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning [45.51804571136028]
強化学習(RL)は、大規模言語モデル(LLM)における推論の強化の中心となっている。
Slow-Fast Policy Optimization (SFPO)は,各ステップを3段階に分解することで,これらの制限に対処する,シンプルかつ効率的なフレームワークである。
SFPOは安定性を継続的に改善し、ロールアウトを低減し、推論RLトレーニングの収束を加速する。
論文 参考訳(メタデータ) (2025-10-05T07:22:54Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。