論文の概要: Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks
- arxiv url: http://arxiv.org/abs/2607.22724v1
- Date: Wed, 22 Jul 2026 04:01:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.84339
- Title: Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks
- Title(参考訳): 長軸エージェントタスクのプログレッシブ条件付きグループポリシー最適化
- Abstract要約: グループベースのポリシー最適化は、粗末な結果報酬から大規模言語モデル(LLM)エージェントを訓練するために、ますます使われてきている。
本稿では,グループ内のすべてのサンプルが結果報酬をゼロにした場合にのみ,初回観察カバレッジを利用するプログレッシブ条件付きグループポリシー最適化(ProGPO)を提案する。
ALFWorldとWebShopとQwen2.5-1.5/7B-Instructの2つの挑戦的なエージェントベンチマークの実験は、ProGPOがグループベースのベースラインよりも一貫して改善されていることを示している。
- 参考スコア(独自算出の注目度): 17.832722956008656
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Group-based policy optimization has been increasingly used to train large language model (LLM) agents from sparse outcome rewards by comparing trajectories or steps within a group. However, on difficult long-horizon tasks, this comparison can suffer from a sampling imbalance: repeated or low-effect actions dominate the high-probability region of the policy while useful state-changing actions remain under-sampled. This imbalance produces many all-failed rollout groups, where outcome rewards provide no direction for correcting the policy. Together, these effects can form a self-reinforcing credit trap: failure-dominated sampling yields no outcome-based correction, allowing repeated low-effect actions to persist. To break this loop, we propose Progress-conditioned Group Policy Optimization (ProGPO), which uses first-visit observation coverage only when all samples in a group receive zero outcome reward. Specifically, within such groups, ProGPO assigns higher relative advantages to trajectories or steps that visit more new states since reaching new observations is a prerequisite for task success. Experiments on two challenging agentic benchmarks, ALFWorld and WebShop with Qwen2.5-1.5/7B-Instruct, show that ProGPO consistently improves over group-based baselines, with particularly large gains on hard tasks.
- Abstract(参考訳): グループベースのポリシー最適化は、グループ内の軌道やステップを比較することで、大きな言語モデル(LLM)エージェントをスパースな結果報酬からトレーニングするために、ますます使われている。
しかし、困難な長期的タスクでは、この比較はサンプリングの不均衡に悩まされる可能性がある: 繰り返しまたは低効果のアクションが政策の高確率領域を支配し、有用な状態変化アクションはアンダーサンプルのままである。
この不均衡は、結果報酬がポリシーの修正の指示を与えないような、完全失敗のロールアウトグループを多数生み出します。
これらの効果は、自己強化的な信用トラップを形成することができる: 失敗に支配されたサンプリングは結果に基づく修正を伴わず、繰り返し発生する低効果アクションが持続する。
このループを断ち切るために,グループ内の全てのサンプルがゼロ結果の報酬を受ける場合にのみ,初回観察カバレッジを利用するプログレッシブ条件付きグループポリシー最適化(ProGPO)を提案する。
特に、これらのグループの中では、ProGPOは、新しい観察に達することがタスク成功の前提条件であるため、より多くの新しい状態に訪れる軌道やステップに対して、より高い相対的な優位性を割り当てている。
ALFWorldとWebShopとQwen2.5-1.5/7B-Instructの2つの挑戦的なエージェントベンチマークの実験は、ProGPOがグループベースのベースラインよりも一貫して改善され、特にハードタスクにおいて大きな利益を得ていることを示している。
関連論文リスト
- PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks [41.82007055765541]
マルチターンエージェントタスクに対する潜在的誘導型ポリシー最適化を提案する。
各ロールアウトグループ内のアンカー状態群戻り統計から経験的状態ポテンシャルを推定する。
その後、隣接する状態間の潜在的な差異から行動上の利点を導き出し、軌道間クレジットの伝播を可能にする。
論文 参考訳(メタデータ) (2026-09-02T07:44:16Z) - RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts [84.20747697259326]
グループ相対政策最適化(GRPO)は、検証可能なフィードバックからの強化学習において大きな効果を示している。
我々は,直接正当性に基づく優位性構築を参照相対的比較に置き換えることでGRPOを一般化するtextbfReference-Relative Policy Optimization (RRPO)を提案する。
我々は,タスクベーストラス検証に頼らずに,ポリシー最適化全体を通じてアンカーベースのコントラスト的優位性を用いてRRPOを評価する。
論文 参考訳(メタデータ) (2026-07-20T19:40:25Z) - Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning [5.952158244195666]
本稿では,文脈整合性段階学習のための学習批判のないProGPOを提案する。
我々は,Qwen2.5-1.5B-Instruct を用いて,ALFWorld と WebShop という2つの困難なエージェントタスクにおける ProGPO の評価を行った。
論文 参考訳(メタデータ) (2026-07-05T11:41:46Z) - Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning [85.02566758103008]
Group-Graph Policy Optimization (G2PO) は、マルチターンエージェントタスクに適したグループベースの強化学習アルゴリズムである。
G2POは最先端のプロンプトベースとRLベースラインを大幅に上回り、GRPOよりも最大22.2%の成功率の向上を達成した。
論文 参考訳(メタデータ) (2026-06-22T08:12:47Z) - Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective [10.958642517467721]
RLVRにおけるコントラストシーケンスレベルのポリシー最適化のためのフレームワークを提案する。
ConSPOはGRPOのクリップされた比率ベースのスコアを、長さ正規化されたシーケンスログ確率に置き換える。
ConSPOは、挑戦的な数学的推論ベンチマークにおいて、いくつかの強力なRLVRベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-13T04:02:36Z) - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing [79.88256756334327]
自己蒸留政策最適化(SDPO)は、より密集したロジットレベルの監視を提供することによってこの問題に対処する。
サンプル制御ポリシー最適化(SRPO)を提案する。
SRPOは、試料をGRPOの報酬整合強化に向け、サンプルをSDPOの目標ロジットレベルの補正に向ける。
論文 参考訳(メタデータ) (2026-04-02T17:29:18Z) - WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning [67.45237332694025]
グループ相対政策最適化は、複雑な推論に基づいて言語モデルを訓練するのに効果的である。
Weakly Supervised GRPOを提案し、端末報酬を正当性を考慮したガイダンスに変換することにより、ロールアウト効率を向上させる。
論文 参考訳(メタデータ) (2026-02-19T02:43:35Z) - iGRPO: Self-Feedback-Driven LLM Reasoning [88.83313431248473]
大規模言語モデル(LLM)は複雑な数学的問題を解く上で有望であるが、正確で一貫したソリューションを生み出すには至っていない。
IGRPO(Iterative Group Relative Policy Optimization)は、モデル生成ドラフトを通じて動的自己条件を追加するGRPOの2段階拡張である。
一致するロールアウト予算の下では、iGRPOはGRPOをベースモデルで一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-09T18:45:11Z) - Anchoring Values in Temporal and Group Dimensions for Flow Matching Model Alignment [61.80228667422234]
VGPOは時間次元とグループ次元の両方で値の推定を再定義する。
スパース端末の報酬を密度の高いプロセス認識値推定に変換する。
標準群正規化を絶対値によって強化された新しいプロセスに置き換え、安定した最適化信号を維持する。
論文 参考訳(メタデータ) (2025-12-13T16:31:26Z) - GTPO: Trajectory-Based Policy Optimization in Large Language Models [42.60363805227946]
政策に基づく最適化は、今日の言語モデルのトレーニングとアライメントに広く採用されている。
本稿では,GRPOの2つの大きな限界を明らかにし,解析する。
コンフリクトトークンを識別するGTPOを導入する。
論文 参考訳(メタデータ) (2025-08-05T08:15:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。