論文の概要: TIGPO: Temporal Instance-Graph Policy Optimization for Long-Horizon LLM Agents
- arxiv url: http://arxiv.org/abs/2609.03383v1
- Date: Thu, 03 Sep 2026 05:32:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.932692
- Title: TIGPO: Temporal Instance-Graph Policy Optimization for Long-Horizon LLM Agents
- Title(参考訳): TIGPO:LLMエージェントの時間インスタンス-グラフポリシー最適化
- Abstract要約: 本稿では,EmphTemporal Instance-Graph Policy Optimization (TIGPO)を提案する。
TIGPOは各タスクに対して永続的な遷移グラフを保持しており、異なるポリシーバージョンによって発見された有効な遷移は、現在のロールアウトのクレジットを共同で決定することができる。
ALFWorldとWebShopの実験は、TIGPOが従来のグループベースおよびグラフベースのポリシー最適化手法より一貫して優れていることを示した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Graph-based policy optimization improves credit assignment for long-horizon LLM agents by organizing rollout trajectories into state-transition graphs. However, existing methods construct graphs independently within each policy update, discarding transitions discovered by earlier policies and limiting advantage estimation to small, batch-local rollout groups. We propose \emph{Temporal Instance-Graph Policy Optimization} (TIGPO), which extends graph-based credit assignment across policy updates. TIGPO maintains a persistent transition graph for each task, allowing valid transitions discovered by different policy versions to jointly determine credit for current rollouts. To actively reconnect current exploration with historical experience, TIGPO allocates a fixed rollout budget between Exploration slots for ordinary task sampling and Revisit slots for delayed reattempts of previously explored tasks. For each revisit, TIGPO pairs the current rollout group with its corresponding earlier Exploration group to construct a cross-temporal reference. The enlarged reference is designed to stabilize relative advantage estimation under small rollout groups, while comparison on the same task directly captures policy improvement across training stages. Historical transitions and scores serve only as structural and detached statistical references and are never replayed in the policy loss. Experiments on ALFWorld and WebShop demonstrate that TIGPO consistently outperforms prior group-based and graph-based policy optimization methods.
- Abstract(参考訳): グラフベースのポリシー最適化は、ロールアウトトラジェクトリを状態遷移グラフに整理することにより、長期LLMエージェントのクレジット割り当てを改善する。
しかし、既存のメソッドはポリシー更新ごとにグラフを独立に構築し、以前のポリシーで発見された遷移を破棄し、小規模でバッチローカルなロールアウトグループに利点推定を制限する。
本稿では,TIGPO (emph{Temporal Instance-Graph Policy Optimization}) を提案する。
TIGPOは各タスクに対して永続的な遷移グラフを保持しており、異なるポリシーバージョンによって発見された有効な遷移は、現在のロールアウトのクレジットを共同で決定することができる。
現在の探索と過去の経験を積極的に再接続するために、TIGPOは通常のタスクサンプリングのためのExplorationスロットと、以前に検討されたタスクの遅延再試行のためのRevisitスロットの間に固定的なロールアウト予算を割り当てている。
各再訪について、TIGPOは現在のロールアウトグループとそれに対応する以前のExplorationグループをペアにして、時間横断参照を構築する。
拡張された基準は、小さなロールアウトグループ下での相対的優位性推定を安定化するために設計され、同じタスクにおける比較は、トレーニング段階間でのポリシー改善を直接キャプチャする。
歴史的変遷とスコアは、構造的および分離された統計参照としてのみ機能し、政策損失で再生されることはない。
ALFWorldとWebShopの実験は、TIGPOが従来のグループベースおよびグラフベースのポリシー最適化手法より一貫して優れていることを示した。
関連論文リスト
- RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts [84.20747697259326]
グループ相対政策最適化(GRPO)は、検証可能なフィードバックからの強化学習において大きな効果を示している。
我々は,直接正当性に基づく優位性構築を参照相対的比較に置き換えることでGRPOを一般化するtextbfReference-Relative Policy Optimization (RRPO)を提案する。
我々は,タスクベーストラス検証に頼らずに,ポリシー最適化全体を通じてアンカーベースのコントラスト的優位性を用いてRRPOを評価する。
論文 参考訳(メタデータ) (2026-07-20T19:40:25Z) - Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning [5.952158244195666]
本稿では,文脈整合性段階学習のための学習批判のないProGPOを提案する。
我々は,Qwen2.5-1.5B-Instruct を用いて,ALFWorld と WebShop という2つの困難なエージェントタスクにおける ProGPO の評価を行った。
論文 参考訳(メタデータ) (2026-07-05T11:41:46Z) - Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning [85.02566758103008]
Group-Graph Policy Optimization (G2PO) は、マルチターンエージェントタスクに適したグループベースの強化学習アルゴリズムである。
G2POは最先端のプロンプトベースとRLベースラインを大幅に上回り、GRPOよりも最大22.2%の成功率の向上を達成した。
論文 参考訳(メタデータ) (2026-06-22T08:12:47Z) - ReFPO: Reflow Regularization for Flow Matching Policy Gradients [58.32178725687043]
本稿では,フローマッチングポリシーに明示的なリフロー正規化を追加する,シンプルなオンラインRL手法を提案する。
ReFPOはGridWorld, MuJoCo Playground, および高次元ヒューマノイド制御タスクにおける平均性能と離散化を改善することを実験的に実証した。
論文 参考訳(メタデータ) (2026-06-19T04:23:10Z) - TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models [49.463896453707065]
VLA(Vision-Language-Action)モデルは目覚ましい進歩を遂げているが、展開時の分散シフトには弱いままである。
近年のVLAモデルは、プロンプトが政策行動の効率的なインターフェースとして機能することを示唆しているが、既存のプロンプトベースのステアリングは通常、外部ガイダンスに依存している。
VLAのテストタイムトレーニング(TTT)は、プロンプトの最適化によって実現可能か?
我々は、遅延プロンプト最適化(LPO)に基づくテスト時間トレーニングフレームワークであるTTT-VLAでこの問題に対処する。
論文 参考訳(メタデータ) (2026-06-02T04:10:39Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - OGPO: Sample Efficient Full-Finetuning of Generative Control Policies [53.42266064673132]
ジェネレーティブコントロールポリシー(GCP)は、ロボット学習に有効なパラメータ化として登場した。
この研究は、GCPを微調整するためのサンプル効率であるOGPO(Off-policy Generative Policy Optimization)を導入している。
OGPOはマルチタスク設定、高精度挿入、デクスタラス制御にまたがる操作タスクにおける最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-04T18:36:40Z) - Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks [23.119173310662365]
グループベース強化学習(RL)は、長期エージェントタスクにおける大規模言語モデルの能力を向上させる。
私たちは、ステップワイドな相対的優位性、すなわち、同じグループ内のステップが歴史的な文脈で異なる場合のコンテキスト不整合を推定する上で、重要な問題を見つけます。
歴史的文脈の整合性に応じて各ステップを複数の階層群に割り当てるHGPOを提案する。
論文 参考訳(メタデータ) (2026-02-26T09:58:10Z) - On the Theory and Practice of GRPO: A Trajectory-Corrected Approach with Fast Convergence [2.8165669455824696]
Group Relative Policy Optimizationは、批判のない強化学習アルゴリズムである。
GRPO更新規則は,現行の方針よりも旧方針の政策勾配を推定する。
軌道レベルの重要度補正 GRPO という新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-08-04T19:01:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。