論文の概要: MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents
- arxiv url: http://arxiv.org/abs/2608.19803v2
- Date: Sat, 22 Aug 2026 03:12:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:42.973568
- Title: MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents
- Title(参考訳): MileGPO:長軸LDMエージェントのグラフベースのポリシー最適化のための局所的証拠付きマイルストーン推論
- Authors: Bo Qian, Yuting Wu, Shuang Zeng, Huaiyu Wan, Dalin Zhang, Jiqiang Liu,
- Abstract要約: プロセスレベルの信用を3つの設計を通じてグループ化されたオン・ポリティクス・ロールアウトから導き出すMileGPOを提案する。
MileGPOは補助モデルも追加の環境相互作用も必要としない。
- 参考スコア(独自算出の注目度): 26.262385802144323
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Credit assignment is challenging in long-horizon agentic reinforcement learning, where supervision often comes only from final rewards. Existing methods refine trajectory-level signals into step-level credits through step grouping or graph-based advantage estimation, but can overlook meaningful intermediate milestones. We propose MileGPO (Milestone Inference with Local Evidence for Graph-Based Policy Optimization), which derives process-level credit from grouped on-policy rollouts through three designs. Milestone Discovery identifies candidate milestones on successful rollouts and recurring traps on failed ones. Reliability-Calibrated Shaping (RCS) weights these candidates by outcome-based confidence, strengthening reliable milestones and traps while down-weighting uncertain ones. Progress-Contrastive Calibration (PCC) further tests whether a candidate reflects local progress and whether its incoming transition outperforms observed alternatives from the same state. MileGPO requires neither auxiliary models nor additional environment interaction. Experiments on ALFWorld and WebShop show state-of-the-art performance and a small in-distribution to out-of-distribution gap on ALFWorld. Ablations and credit diagnostics indicate that reliability weighting, local progress, and same-state branch evidence complement milestone discovery and resolve ambiguous intermediate credit.
- Abstract(参考訳): 長期のエージェントによる強化学習において、クレジットの割り当ては困難である。
既存の手法では、ステップグループ化やグラフベースの優位性推定によって、トラジェクトリレベルの信号をステップレベルクレジットに洗練するが、意味のある中間マイルストーンを見落としることができる。
そこで我々は,3つの設計を通じて,グループ化されたオン・ポリシー・ロールアウトからプロセスレベルの信用を導出するMileGPO(Milestone Inference with Local Evidence for Graph-Based Policy Optimization)を提案する。
Milestone Discoveryは、成功しているロールアウトと失敗する障害に対する繰り返しのトラップに関する、候補者のマイルストーンを特定する。
Reliability-Calibrated Shaping (RCS)は、これらの候補を結果ベースの信頼性によって重み付けし、信頼性の高いマイルストーンとトラップを強化し、不確実なものを重み付けします。
プログレッシブ・コントラシブ・キャリブレーション(PCC)は、候補が局所的な進歩を反映しているか、その遷移が同じ状態から観測された代替品よりも優れているかを更に検証する。
MileGPOは補助モデルも追加の環境相互作用も必要としない。
ALFWorldとWebShopの実験は、ALFWorldにおける最先端のパフォーマンスと、配布外ギャップに対する小さな分布を示している。
アブレーションと信用診断は、信頼性の重み付け、局所的な進展、および同状態分岐証拠がマイルストーン発見を補完し、あいまいな中間信用を解決していることを示している。
関連論文リスト
- AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning [58.76655851910778]
AgentOPSDは、エージェント強化学習におけるターンレベルのクレジット割り当てのための、批判のない再帰的手法である。
ALFWorld, WebShop, Search-QA上のAgentOPSDを2つのスケールでQwen2.5モデルを用いて評価する(3B, 7B)。
論文 参考訳(メタデータ) (2026-08-06T13:00:59Z) - TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning [10.917273110894469]
エージェント強化学習では、環境に配慮した行動にクレジットを割り当てる必要がある。
標準GRPOは全てのアクショントークンに対する一様優位性として最終検証結果を使用する。
本稿では,ロール型クレジット代入フレームワークであるTRIAGEを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:48:07Z) - PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment [35.978805768172656]
ロングホライゾンのエージェントタスクは、結果ベース強化学習の基本的なクレジット割り当て課題となる。
PBSD (Privileged Bayesian Self-Distillation) はベイズが校正した自己蒸留法である。
論文 参考訳(メタデータ) (2026-06-08T11:20:58Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents [67.03593791535786]
強化学習(Reinforcement Learning, RL)は、長期のデジタル環境においてGUIエージェントを改善するための有望なアプローチである。
この問題を軽減するため、最近の研究はプロセス・リワード・モデル(PRM)を導入している。
PRMは、グローバルマイルストーン検証やローカルステップレベルの評価を通じて、よりきめ細かいトレーニングフィードバックを提供する。
本稿では,GUIエージェントのためのエンティティ・スタンフロープロセス報酬モデルであるStainFlowを提案する。
論文 参考訳(メタデータ) (2026-06-05T08:17:28Z) - VeriGate: Verifier-Gated Step-Level Supervision for GRPO [51.26100506256885]
グループ相対政策最適化は、検証者に基づく結果報酬を伴う推論モデルをトレーニングするための効果的なレシピである。
GRPO の検証子付き拡張である VeriGate を提案し,これらの制限を3つの設計選択で解決する。
We show that VeriGate improves average accuracy around 20% and 12% for 1.5B and 7B models respectively。
論文 参考訳(メタデータ) (2026-05-28T18:20:32Z) - StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning [6.365332042924078]
本稿では,ロールアウト後の自己蒸留フレームワークであるStepOPSDについて紹介する。
StepOPSDは、軌跡をアクション中心のステップセグメントに分解し、後見豊かな教師コンテキスト下でそれらを再構成する。
より小さい_clipは広範囲に安定化された局所信頼領域として作用するが、最適な大域混合強度_mixはタスク依存のままである。
論文 参考訳(メタデータ) (2026-05-26T15:07:03Z) - Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers [26.97849381770806]
自己誘導型アウトカム電位は、最終回答のセマンティッククラスタを、ポテンシャルに基づくターンレベルのクレジット割り当てのための潜在的な将来の結果状態として扱う。
我々は,このフレームワークを形式化し,監督対象のゴールド・アンサー・リミットを特徴付けるとともに,SIOPが検証自由な結果レベルベースラインよりも平均性能を向上させることを示す。
論文 参考訳(メタデータ) (2026-05-06T14:38:48Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。