論文の概要: Learning from Viable Failure Prefixes: Milestone Viability Potential Policy Optimization for Long-Horizon LLM Agents
- arxiv url: http://arxiv.org/abs/2609.37111v1
- Date: Tue, 29 Sep 2026 09:26:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.379154
- Title: Learning from Viable Failure Prefixes: Milestone Viability Potential Policy Optimization for Long-Horizon LLM Agents
- Title(参考訳): 生存可能な故障修正から学ぶ:長軸LLMエージェントのマイルストーン生存可能性ポリシー最適化
- Abstract要約: そこで本研究では,フェールプレフィックスから学習可能なポリシ最適化アルゴリズムを提案する。
MVPOは、Union-Find Viability領域上のプレフィックス電位を推定し、電位差の利点でゼロクレディット群を修復し、相対的な性能の進歩に応じてポテンシャル分岐を減衰する。
同じトレーニング期間でMVPOは、ALFWorldで+4.4成功点、WebShopで+5.3成功点を改良した。
- 参考スコア(独自算出の注目度): 3.8522502505645946
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon LLM agents require reinforcement learning methods that can assign credit to intermediate decisions under sparse and delayed rewards. Existing group-based methods such as GRPO and GiGPO alleviate this issue by comparing rollout returns or repeated anchor states, but they still fail when the compared returns have no variation. We identify this failure mode as zero-credit failure: during early training, many failed rollouts contain useful prefixes, yet existing methods assign them no task-discriminative advantage. To address this issue, we propose Milestone Viability Potential Policy Optimization (MVPO), a potential-routed policy optimization algorithm that learns from viable failure prefixes. MVPO estimates prefix potential over Union-Find viability regions, repairs zero-credit groups with potential-difference advantages, and attenuates the potential branch according to relative performance progress. Experiments with Qwen2.5-1.5B-Instruct show that MVPO outperforms eight strong baselines, including GRPO and GiGPO. Under the same training length, MVPO improves over the GiGPO baseline by +4.4 success points on ALFWorld and +5.3 on WebShop, while adding only 0.16%-0.20% advantage-construction overhead.
- Abstract(参考訳): ロングホライゾンLLMエージェントは、スパースおよび遅延報酬の下で中間決定に信用を割り当てることができる強化学習方法を必要とする。
GRPOやGiGPOのような既存のグループベースのメソッドは、ロールアウトリターンや繰り返しアンカー状態を比較することでこの問題を軽減するが、比較したリターンにばらつきがない場合は失敗する。
初期のトレーニングでは、多くのフェールしたロールアウトには有用なプレフィックスが含まれているが、既存のメソッドではタスク識別上の利点がない。
この問題に対処するために,本研究では,障害前置詞から学習する潜在的に悪用されたポリシー最適化アルゴリズムであるマイルストーン生存可能性政策最適化(MVPO)を提案する。
MVPOは、Union-Find Viability領域上のプレフィックス電位を推定し、電位差の利点でゼロクレディット群を修復し、相対的な性能の進歩に応じてポテンシャル分岐を減衰する。
Qwen2.5-1.5B-Instructの実験によると、MVPOはGRPOとGiGPOを含む8つの強力なベースラインを上回っている。
同じトレーニング期間でMVPOは、ALFWorldで+4.4、WebShopで+5.3、GGPOベースラインで+5.3に改善され、アドバンテージコンストラクションオーバーヘッドは0.16%-0.20%に留まった。
関連論文リスト
- PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks [41.82007055765541]
マルチターンエージェントタスクに対する潜在的誘導型ポリシー最適化を提案する。
各ロールアウトグループ内のアンカー状態群戻り統計から経験的状態ポテンシャルを推定する。
その後、隣接する状態間の潜在的な差異から行動上の利点を導き出し、軌道間クレジットの伝播を可能にする。
論文 参考訳(メタデータ) (2026-09-02T07:44:16Z) - Difficulty-Aware Semantic-ID Optimization for Generative Recommendation [16.980517358891422]
オンラインロールアウト配置問題に対するDASO(Difficulty-Aware Semantic-ID Optimization)を提案する。
DASOは、各現在のロールアウトグループをプレフィックスマッチ深さでプロファイルし、候補がターゲットパスを離れるボトルネックSIDレベルを特定する。
DASOは12項目中11項目でMiniOneRecスタイルのGRPOよりも改善され、12項目中9項目で最高の結果が得られる。
論文 参考訳(メタデータ) (2026-08-20T23:20:36Z) - VIMPO: Value-Implicit Policy Optimization for LLMs [106.88933849641272]
GRPOのようなグループ相対的手法は、批評家の訓練を避けるが、典型的には全てのトークンに軌道レベルの利点を割り当てる。
アクター批判的手法は、より密集した学習信号を提供するが、学習価値関数を自身のトレーニング不安定性で要求する。
本稿では,KL-正規化強化学習の最適条件からポリシ実装値関数を導出する,批判のないポリシ最適化手法であるVIMPOを紹介する。
論文 参考訳(メタデータ) (2026-06-18T09:44:12Z) - When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training [8.367896852036699]
Evidence-Calibrated Policy Optimization (ECPO) は、ポリシー更新の前にステップレベルのクレジットを校正する、批判のないポリシー最適化アルゴリズムである。
ECPOは強いベースラインを一貫して上回り、Qwen2.5-1.5BでALFWorld/WebShopでGGPOを+5.2/+7.3成功点で改善した。
論文 参考訳(メタデータ) (2026-06-04T08:54:09Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning [49.57517969069136]
Asymmetric Proximal Policy Optimization (AsyPPO) は、大規模なモデル設定で効率を保ちながら、批評家の役割を回復するシンプルでスケーラブルなフレームワークである。
AsyPPOは軽量のミニ批評家を採用しており、それぞれが切り離されたプロンプトシャードで訓練されている。
強力なベースラインを越えて、複数のベンチマークで学習の安定性とパフォーマンスを継続的に改善する。
論文 参考訳(メタデータ) (2025-10-02T04:24:27Z) - GTPO: Trajectory-Based Policy Optimization in Large Language Models [42.60363805227946]
政策に基づく最適化は、今日の言語モデルのトレーニングとアライメントに広く採用されている。
本稿では,GRPOの2つの大きな限界を明らかにし,解析する。
コンフリクトトークンを識別するGTPOを導入する。
論文 参考訳(メタデータ) (2025-08-05T08:15:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。