論文の概要: TAPO: Transition-Aware Policy Optimization for LLM Agents
- arxiv url: http://arxiv.org/abs/2607.27973v1
- Date: Thu, 30 Jul 2026 10:17:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.50839
- Title: TAPO: Transition-Aware Policy Optimization for LLM Agents
- Title(参考訳): TAPO: LLMエージェントの遷移対応ポリシー最適化
- Abstract要約: TAPOは、政策最適化と移行監督を交互に行う統合トレーニングフレームワークである。
既存のエージェントRLアルゴリズムのための計算量的に軽量でプラグアンドプレイ拡張モジュールとして機能する。
我々はWebShopとALFWorldの体系的な実験を行い、様々なスケールの基礎モデルと異なるポリシー最適化アルゴリズムを統合する。
- 参考スコア(独自算出の注目度): 27.95488836373643
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, Reinforcement Learning (RL) has emerged as a crucial paradigm for the post-training of Large Language Model (LLM) agents. However, existing methods predominantly rely on sparse task rewards for policy optimization, failing to fully exploit another class of inherently dense supervisory signals naturally present during online interaction: environmental feedback following action execution. Recent theoretical studies suggest that generalization in multi-step, goal-oriented tasks hinges on predictive knowledge of environmental consequences. Inspired by this, we propose TAPO: Transition-Aware Policy Optimization for LLM Agents, a unified training framework that alternates between policy optimization and transition supervision. Beyond standard RL updates, TAPO repurposes rollout data to apply action-conditioned next-observation prediction supervision on a shared backbone model. This approach enhances the model's sensitivity to environmental transition dynamics and action consequences while concurrently optimizing the policy. It serves as a computationally lightweight, plug-and-play enhancement module for existing agent RL algorithms, requiring no additional expert data, extra sampling costs, or inference-time overhead. We conduct systematic experiments on WebShop and ALFWorld, integrating foundation models of various scales with different policy optimization algorithms. Empirical results demonstrate that TAPO consistently improves task performance over pure policy optimization baselines.
- Abstract(参考訳): 近年,大規模言語モデル(LLM)エージェントのポストトレーニングにおいて,強化学習(RL)が重要なパラダイムとして浮上している。
しかし、既存の手法は、主に政策最適化にスパースタスク報酬を頼りにしており、オンラインインタラクション中に自然に存在する自然に密集した監視信号(行動実行後の環境フィードバック)をフル活用することができない。
最近の理論的研究は、多段階の目標指向タスクにおける一般化が、環境影響の予測的知識に依存していることを示唆している。
政策最適化と移行監督を交互に行う一貫した訓練フレームワークであるLSMエージェントのための遷移対応政策最適化(Transition-Aware Policy Optimization for LLM Agents)を提案する。
標準的なRL更新以外にも、TAPOはロールアウトデータを再利用して、アクション条件付き次観測予測監視を共有バックボーンモデルに適用する。
このアプローチは、ポリシーを同時に最適化しながら、環境遷移ダイナミクスや行動結果に対するモデルの感度を高める。
既存のエージェントRLアルゴリズムのための計算軽量でプラグアンドプレイの拡張モジュールとして機能し、追加の専門家データ、追加のサンプリングコスト、推論時間オーバーヘッドを必要としない。
我々はWebShopとALFWorldの体系的な実験を行い、様々なスケールの基礎モデルと異なるポリシー最適化アルゴリズムを統合する。
実証的な結果から,TAPOは純粋ポリシー最適化ベースラインよりもタスク性能を一貫して向上することが示された。
関連論文リスト
- Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization [46.32504081845328]
モデルに基づく強化学習は、世界モデルを用いて、大規模に効果的に支援することができる。
我々は、既存の世界モデルアプローチにおける検索と価値学習の間の構造的ミスアライメントであるボトルネックを特定する。
拡散政策表現を通じて探索と政策最適化を統一するフレームワークである世界モデルにおけるモデルベース拡散政策最適化(MBDPO)を提案する。
論文 参考訳(メタデータ) (2026-05-25T19:06:51Z) - Poly-EPO: Training Exploratory Reasoning Models [62.82992914206963]
本稿では,学習後言語モデル(LM)の枠組みについて,楽観的な探索を明示的に奨励し,探索と搾取の相乗効果を促進する。
本稿では,この枠組みを探索と利用を明確に相乗化するための目的として,ポリクロミック探索政策最適化(Poly-EPO)を提案する。
論文 参考訳(メタデータ) (2026-04-19T22:54:19Z) - Soft Sequence Policy Optimization [0.0]
我々は,非政治強化学習の目的として,ソフトシーケンスポリシー最適化(SSPO)を導入する。
SSPOは、トークンレベルの確率比を超えるソフトゲーティング関数をシーケンスレベルの重要重みに組み込む。
数学推論タスクにおいて,SSPOはトレーニングの安定性と性能を向上させることを示す。
論文 参考訳(メタデータ) (2026-02-22T20:21:00Z) - ACPO: Adaptive Curriculum Policy Optimization for Aligning Vision-Language Models in Complex Reasoning [17.928214942495412]
ACPOは、安定的で、準政治的な探索段階から、効率的で、非政治的な搾取段階へ、原則的な移行を編成する動的カリキュラムを採用している。
我々は、MathVista、LogicVista、MMMU-Proなど、挑戦的なマルチモーダル推論ベンチマークのスイートで広範な実験を行う。
その結果,ACPOはDAPOやPAPOなどの強いベースラインを一貫して上回り,最先端性能,収束の促進,訓練安定性の向上を実現している。
論文 参考訳(メタデータ) (2025-10-01T09:11:27Z) - Agentic Reinforced Policy Optimization [66.96989268893932]
検証可能な報酬付き大規模強化学習(RLVR)は,大規模言語モデル(LLM)を単一ターン推論タスクに活用する効果を実証している。
現在のRLアルゴリズムは、モデル固有のロングホライゾン推論能力と、マルチターンツールインタラクションにおけるその習熟性のバランスが不十分である。
エージェント強化ポリシー最適化(ARPO: Agentic Reinforced Policy Optimization)は,マルチターンLDMエージェントを学習するためのエージェントRLアルゴリズムである。
論文 参考訳(メタデータ) (2025-07-26T07:53:11Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z) - Adaptive Augmentation Policy Optimization with LLM Feedback [3.038642416291856]
データ拡張はディープラーニングパイプラインの重要なコンポーネントであり、データセットの多様性を高めてモデルの一般化を強化する。
従来の拡張戦略は手動で設計した変換、分類サンプリング、あるいは自動検索ベースのアプローチに依存している。
本稿では,モデル性能フィードバックに基づいて拡張ポリシーを改良するLarge Language Model (LLM)誘導拡張最適化戦略を提案する。
論文 参考訳(メタデータ) (2024-10-17T11:26:10Z) - Meta-Reinforcement Learning with Universal Policy Adaptation: Provable Near-Optimality under All-task Optimum Comparator [9.900800253949512]
本稿では,メタRL(BO-MRL)の2段階最適化フレームワークを開発し,タスク固有のポリシー適応のためのメタプライヤを学習する。
提案手法の精度を実証的に検証し,提案アルゴリズムがベンチマークよりも優れていることを示す。
論文 参考訳(メタデータ) (2024-10-13T05:17:58Z) - Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement [67.1393112206885]
大規模言語モデル(LLM)は、対話的な意思決定タスクにおいてインテリジェントなエージェントとして期待されている。
本稿では,トークンレベルでのLLMの最適化に適したエントロピー拡張RL法である,エントロピー正規化トークンレベル最適化(ETPO)を導入する。
我々は,データサイエンスコード生成を多段階対話型タスクのシリーズとしてモデル化したシミュレーション環境におけるETPOの有効性を評価する。
論文 参考訳(メタデータ) (2024-02-09T07:45:26Z) - Reparameterized Policy Learning for Multimodal Trajectory Optimization [61.13228961771765]
本研究では,高次元連続行動空間における強化学習のためのパラメータ化政策の課題について検討する。
本稿では,連続RLポリシーを最適軌道の生成モデルとしてモデル化する原理的フレームワークを提案する。
本稿では,マルチモーダルポリシーパラメータ化と学習世界モデルを活用した実用的モデルベースRL手法を提案する。
論文 参考訳(メタデータ) (2023-07-20T09:05:46Z) - Acceleration in Policy Optimization [50.323182853069184]
我々は、楽観的かつ適応的な更新を通じて、政策改善のステップにフォレストを組み込むことにより、強化学習(RL)における政策最適化手法を加速するための統一パラダイムに向けて研究する。
我々は、楽観主義を、政策の将来行動の予測モデルとして定義し、適応性は、過度な予測や変化に対する遅延反応からエラーを軽減するために、即時かつ予測的な修正措置をとるものである。
我々は,メタグラディエント学習による適応型楽観的ポリシー勾配アルゴリズムを設計し,実証的なタスクにおいて,加速度に関連するいくつかの設計選択を実証的に強調する。
論文 参考訳(メタデータ) (2023-06-18T15:50:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。