論文の概要: Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.04242v1
- Date: Sun, 05 Jul 2026 11:41:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.874597
- Title: Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning
- Title(参考訳): エージェント強化学習のための進捗・信頼性を考慮したグループポリシー最適化
- Authors: Mingxuan Fan, Peiyang Liu,
- Abstract要約: 本稿では,文脈整合性段階学習のための学習批判のないProGPOを提案する。
我々は,Qwen2.5-1.5B-Instruct を用いて,ALFWorld と WebShop という2つの困難なエージェントタスクにおける ProGPO の評価を行った。
- 参考スコア(独自算出の注目度): 5.952158244195666
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Group-based reinforcement learning (RL) has become an effective paradigm for improving large language model agents on long-horizon interactive tasks. To obtain finer-grained policy updates than trajectory-level optimization, recent work has moved toward step-level group-based RL, where intermediate steps are grouped and compared within a rollout batch. However, step-level advantage estimation is sensitive to how groups are formed: grouping by broad state keys improves coverage but may compare actions taken under different histories, while enforcing historical consistency yields fairer comparisons at the cost of fragmented groups and missing peer-comparison signal. In this paper, we propose ProGPO (Progress- and Reliability-Oriented Group Policy Optimization), a learned-critic-free method for context-consistent step-level learning. ProGPO keeps exact-prefix action comparison, and complements sparse peer comparisons with transition credit derived from rollout-based state potentials. To estimate these potentials reliably, ProGPO combines semantic expansion with inverse-variance fusion across history depths. We evaluate ProGPO on two challenging agentic tasks, ALFWorld and WebShop, with Qwen2.5-1.5B-Instruct. Results show that ProGPO improves over matched agentic RL baselines under comparable computational overhead, and additional Qwen2.5-3B-Instruct experiments further test the scalability of the proposed method.
- Abstract(参考訳): グループベース強化学習(RL)は,長期的対話型タスクにおいて,大規模言語モデルエージェントの改善に有効なパラダイムとなっている。
軌道レベルの最適化よりもきめ細かいポリシー更新を得るために、最近の研究は段階的なグループベースのRLに移行し、中間ステップはロールアウトバッチ内でグループ化され比較される。
しかし、ステップレベルの利点推定は、グループの形成方法に敏感である: 広い状態キーによるグループ化は、カバレッジを改善するが、異なる履歴の下で取られたアクションを比較することができる。
本稿では,ProGPO(Progress- and Reliability-Oriented Group Policy Optimization)を提案する。
ProGPOは、正確な事前修正動作の比較を保持し、ロールアウトベースの状態電位から派生した遷移クレジットとスパースピア比較を補完する。
これらのポテンシャルを確実に推定するために、ProGPOは意味展開と歴史深度をまたいだ逆分散融合を組み合わせる。
我々は,Qwen2.5-1.5B-Instruct を用いて,ALFWorld と WebShop という2つの困難なエージェントタスクにおける ProGPO の評価を行った。
その結果,ProGPOは同等の計算オーバーヘッド下でのエージェントRLベースラインよりも改善し,さらにQwen2.5-3B-Instruct実験により提案手法のスケーラビリティを検証した。
関連論文リスト
- Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning [85.02566758103008]
Group-Graph Policy Optimization (G2PO) は、マルチターンエージェントタスクに適したグループベースの強化学習アルゴリズムである。
G2POは最先端のプロンプトベースとRLベースラインを大幅に上回り、GRPOよりも最大22.2%の成功率の向上を達成した。
論文 参考訳(メタデータ) (2026-06-22T08:12:47Z) - AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO [78.36537400975298]
グループ相対政策最適化(GRPO)は、テキスト・ツー・イメージ(T2I)フローモデルと人間の嗜好の整合において顕著な成功を収めた。
我々は,現在のフローベースGRPOの学習ループが,学習者の現在の能力から根本的に切り離されていることを確認した。
本稿では,フローモデルに適した新しい能力認識型RLアルゴリズムであるAdaptive GRPO(AdaGRPO)を提案する。
論文 参考訳(メタデータ) (2026-06-05T02:07:08Z) - Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO [70.38763678943648]
検証可能な報酬(RLVR)による強化学習は、大規模言語モデルにおける推論とコード生成を改善するための中心的なパラダイムとなっている。
標準的なGRPOはシーケンスアグリゲーションを使用し、最近の研究はトークンアグリゲーションをより良い代替手段として提唱している。
トークンアグリゲーションは符号長結合を導入し、シーケンスアグリゲーションは暗黙的にダウンウェイトを延長する。
論文 参考訳(メタデータ) (2026-04-14T09:48:46Z) - Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks [23.119173310662365]
グループベース強化学習(RL)は、長期エージェントタスクにおける大規模言語モデルの能力を向上させる。
私たちは、ステップワイドな相対的優位性、すなわち、同じグループ内のステップが歴史的な文脈で異なる場合のコンテキスト不整合を推定する上で、重要な問題を見つけます。
歴史的文脈の整合性に応じて各ステップを複数の階層群に割り当てるHGPOを提案する。
論文 参考訳(メタデータ) (2026-02-26T09:58:10Z) - iGRPO: Self-Feedback-Driven LLM Reasoning [88.83313431248473]
大規模言語モデル(LLM)は複雑な数学的問題を解く上で有望であるが、正確で一貫したソリューションを生み出すには至っていない。
IGRPO(Iterative Group Relative Policy Optimization)は、モデル生成ドラフトを通じて動的自己条件を追加するGRPOの2段階拡張である。
一致するロールアウト予算の下では、iGRPOはGRPOをベースモデルで一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-09T18:45:11Z) - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition [52.232968183793986]
General Policy Composition (GPC) は、複数の事前学習されたポリシーの分布スコアを組み合わせることで、パフォーマンスを向上させる訓練のない手法である。
GPCは、さまざまなタスクセットにおけるパフォーマンスと適応性を一貫して改善します。
論文 参考訳(メタデータ) (2025-10-01T16:05:53Z) - GTPO: Trajectory-Based Policy Optimization in Large Language Models [42.60363805227946]
政策に基づく最適化は、今日の言語モデルのトレーニングとアライメントに広く採用されている。
本稿では,GRPOの2つの大きな限界を明らかにし,解析する。
コンフリクトトークンを識別するGTPOを導入する。
論文 参考訳(メタデータ) (2025-08-05T08:15:01Z) - Group-in-Group Policy Optimization for LLM Agent Training [17.243181792126563]
Group-in-Group Policy Optimization (GiGPO) は、LLMエージェントのきめ細かいクレジット割り当てを実現する新しいRLアルゴリズムである。
我々は, ALFWorld や WebShop などのエージェントベンチマークに対する GiGPO の評価と,検索強化されたQA タスクに対するツール統合推論を行った。
論文 参考訳(メタデータ) (2025-05-16T08:26:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。