論文の概要: Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents
- arxiv url: http://arxiv.org/abs/2607.06223v1
- Date: Tue, 07 Jul 2026 12:47:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.514462
- Title: Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents
- Title(参考訳): 情報ゲインに基づくロールアウトポリシー最適化:マルチターンLDMエージェントに対する適応木構造ロールアウトアプローチ
- Abstract要約: 強化学習は,長期探索タスクにおける大規模言語モデル (LLM) エージェントの改善に有望なパラダイムとなっている。
既存のメソッドは重要な制限に直面している。ロールアウト予算は、中間状態の有用性を明示的に評価することなく、しばしば割り当てられる。
本稿では,情報ゲインに基づくロールアウトポリシー最適化(IGRPO)を提案する。
- 参考スコア(独自算出の注目度): 38.00321502420564
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning has become a promising paradigm for improving large language model (LLM) agents on long-horizon search tasks, where the agent must make a sequence of intermediate decisions before receiving a final outcome. However, existing methods still face a key limitation: the rollout budget is often allocated without explicitly assessing the utility of intermediate states. As a result, substantial computation may be spent on low-value states, even though different branches can vary drastically in their informativeness. In this paper, we propose Information Gain-based Rollout Policy Optimization (IGRPO), a policy optimization framework that treats intermediate-state informativeness as the organizing principle of rollout collection. Specifically, IGRPO performs budget-aware tree-structured rollouts by allocating expansion budget according to node-level informativeness, so that more informative branches are expanded more frequently while unpromising branches are progressively suppressed. We further demonstrate that the information gain-based rollout induces an explicit limiting teacher distribution over trajectories, which naturally yields a clear policy optimization target, thereby unifying adaptive tree-structured exploration with principled policy learning under a single framework. Experiments on seven challenging search-augmented QA benchmarks demonstrate that IGRPO consistently outperforms strong baselines under the same rollout budget constraints, validating the effectiveness of leveraging the induced teacher distribution to guide policy optimization for long-horizon search agents.
- Abstract(参考訳): 強化学習は,大規模言語モデル (LLM) エージェントを長期探索タスクで改善する上で有望なパラダイムとなり,エージェントは最終結果を得る前に中間決定を行わなければならない。
しかしながら、既存のメソッドは依然として重要な制限に直面している。ロールアウト予算は、中間状態の有用性を明示的に評価することなく、しばしば割り当てられる。
結果として、異なる分岐がその情報性において劇的に異なるとしても、かなりの計算が低値の状態に費やされる可能性がある。
本稿では,情報ゲインに基づくロールアウトポリシー最適化(IGRPO)を提案する。
具体的には、IGRPOは、ノードレベルの情報量に応じて拡張予算を割り当てることにより、予算に配慮した木構造ロールアウトを行う。
さらに、情報ゲインに基づくロールアウトは、トラジェクトリに対する明示的な限定的な教師分布を誘導し、自然に明確なポリシー最適化目標を導き、単一のフレームワーク下での原則的ポリシー学習による適応的木構造探索を統一することを示した。
7つの挑戦的なQAベンチマーク実験により、IGRPOは、同じロールアウト予算制約の下で、強いベースラインを一貫して上回り、長い水平探索エージェントのポリシー最適化に誘導された教師分布を活用する効果を検証した。
関連論文リスト
- TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Ratio-Variance Regularized Policy Optimization [64.95520246570446]
ポリシ比の分散を明示的に制約することは、信頼領域の制約に対する原則的な局所近似をもたらすことを示す。
本稿では,この制約を実装したR2bf VPO$(Ratio-Variance Regularized Policy Optimization)を紹介する。
論文 参考訳(メタデータ) (2026-05-26T09:53:42Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Segment-Aligned Policy Optimization for Multi-Modal Reasoning [55.29606572822562]
本稿では、トークンや全シーケンスではなく、一貫性のある推論ステップをポリシー更新の基本単位として扱う新しい強化学習パラダイムを提案する。
代表的な推論ベンチマークの実験は、SAPOがトークンレベルおよびシーケンスレベルポリシー最適化手法を一貫して上回っていることを示している。
我々の研究は、強化学習の更新を推論の構造と整合させることの重要性を強調し、複雑な推論タスクにおけるより効率的でセマンティックに根ざした政策最適化の道を開く。
論文 参考訳(メタデータ) (2026-05-02T08:47:45Z) - Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization [47.7937991619078]
本稿では,プロセスの監督をグループ相対的な政策最適化に統合するフレームワークであるコントリビューション重み付きGRPOを提案する。
CW-GRPOは、LLM判定器を用いて、検索ラウンド毎の検索ユーティリティと推論精度を評価し、ラウンド毎のコントリビューションスコアを生成する。
複数の知識集約型ベンチマークの実験では、CW-GRPOはQwen3-8Bでは5.0%、Qwen3-1.7Bでは6.3%、標準GRPOより優れていた。
論文 参考訳(メタデータ) (2026-04-15T17:37:59Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - Learning Branching Policies for MILPs with Proximal Policy Optimization [0.0]
混合線形プログラム(MILP)における分岐境界法(B&B)
現在のアプローチはImitation Learning (IL)に依存しており、専門家によるデモンストレーションに過度に適合する傾向にあり、構造的に多様なインスタンスや目に見えないインスタンスに一般化するのに苦労している。
本研究では,RLアルゴリズムであるPPO(Proximal Policy Optimization)を用いて分岐ポリシーの学習を行う新しいフレームワークであるTree-Gate Proximal Policy Optimizationを提案する。
論文 参考訳(メタデータ) (2025-11-17T05:16:14Z) - Think Outside the Policy: In-Context Steered Policy Optimization [13.24687763539952]
In-context Steered Policy Optimizationは、既存のデータセットを使用した専門家のガイダンスを提供する。
ICPOは、数学的推論ベンチマークにおける強化学習性能と訓練安定性を一貫して向上させる。
論文 参考訳(メタデータ) (2025-10-30T14:14:15Z) - Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents [28.145430029174577]
大規模言語モデル(LLM)ベースのエージェントは、外部環境と対話する能力を高めるために強化学習(RL)でますます訓練されている。
既存のアプローチは通常、最終回答でのみ提供される結果に基づく報酬に依存します。
本稿では,情報ゲインに基づくポリシー最適化(IGPO)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:59:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。