論文の概要: Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2605.05262v1
- Date: Wed, 06 May 2026 06:17:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.325067
- Title: Maximizing Rollout Informativeness under a Fixed Budget: A Submodular View of Tree Search for Tool-Use Agentic Reinforcement Learning
- Title(参考訳): 固定予算下でのロールアウトインフォーマルネスの最大化:ツール・ユース・エージェント強化学習のための木探索のサブモジュール的視点
- Abstract要約: 予算によらない独立したサンプルは、予算に関わらず、ハードプロンプトのためにゼロから切り離された崩壊率に悩まされていることを実証する。
我々の不確実性認識上信頼境界(UUCB)用語は、この目的の閉形式的限界利得として生じる。
本稿では,UUCBとABA(Adaptive Budget Allocator)を結合した学習時間木探索フレームワークInfoTreeと,非同期投機拡張スキームを提案する。
- 参考スコア(独自算出の注目度): 21.974153439592317
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We formalize Rollout Informativeness under a Fixed Budget (RIFB) as the expected non-vanishing policy-gradient mass that a tool-use rollout set injects into Group Relative Policy Optimization (GRPO). We prove that any budget-agnostic independent sampler suffers a collapse rate bounded away from zero for hard prompts regardless of the budget. Motivated by this, we recast intermediate state selection as a monotone submodular maximization problem, where a greedy one-step selector enjoys a 1 minus 1/e approximation guarantee. Our Uncertainty-aware Upper Confidence Bound (UUCB) terms arise as closed-form marginal gains of this objective. This turns the token-level entropy bonus from an empirical trick into an analytic consequence of the formulation. We present InfoTree, a training-time tree-search framework coupling UUCB with a learned Adaptive Budget Allocator (ABA) and an asynchronous Speculative Expansion scheme. ABA rescues prompts whose initial tree is wasted on uniform outcomes, lifting the mixed-outcome ratio from 58.1 percent to 76.3 percent with less than 5 percent budget overhead. Speculative Expansion reduces wall-clock overhead from 14.3 percent to 4.8 percent by tolerating bounded staleness in UUCB scores. Across nine benchmarks spanning math reasoning (AIME 2024 and 2025, MATH-500, OlympiadBench, USAMO), web-search agents (GAIA, HLE-100, BrowseComp-lite), and tool-rich coding and OS agents (APPS-verified, AgentBench-OS), InfoTree outperforms flat GRPO, DeepSearch, Tree-GRPO, AT2PO, CW-GRPO, and RC-GRPO. Head-to-head compositions with Tree-GRPO prefix sharing and CW-GRPO contribution weights deliver further gains, confirming that our selector operates orthogonally to rollout reuse and trajectory re-weighting. A 5 by 5 by 5 robustness grid reveals that over three quarters of the hyperparameter space lies on a performance plateau, confirming UUCB robustness.
- Abstract(参考訳): 固定予算(RIFB)の下でのロールアウトインフォーマルネスを,ツール使用のロールアウトセットがグループ相対政策最適化(GRPO)に注入される,非消滅的な政策段階の質量として定式化する。
予算によらない独立したサンプルは、予算に関わらず、ハードプロンプトのためにゼロから切り離された崩壊率に悩まされていることを実証する。
そこで我々は,中間状態選択をモノトーン部分モジュラー最大化問題として再キャストし,グリーディワンステップセレクタが1マイナス1/e近似の保証を享受する。
我々の不確実性認識上信頼境界(UUCB)用語は、この目的の閉形式的限界利得として生じる。
これはトークンレベルのエントロピーボーナスを経験的なトリックから定式化の分析結果に変える。
本稿では,UUCBとABA(Adaptive Budget Allocator)を結合した学習時間木探索フレームワークInfoTreeと,非同期投機拡張スキームを提案する。
ABAは、初期ツリーが均一な結果に費やされるプロンプトを救済し、混合利益率を5%未満の予算オーバーヘッドで58.1%から76.3%に引き上げた。
投機的拡張は、UUCBスコアの有界安定性を許容することにより、壁面のオーバーヘッドを14.3%から4.8%に減らす。
数学推論(AIME 2024, 2025, MATH-500, OlympiadBench, USAMO)、Web検索エージェント(GAIA, HLE-100, BrowseComp-lite)、ツールリッチコーディングおよびOSエージェント(APPS-verified, AgentBench-OS)、InfoTreeがフラットなGRPO、DeepSearch、Tree-GRPO、AT2PO、CW-GRPO、RC-GRPOにまたがる9つのベンチマーク。
The head-to-head compositions with Tree-GRPO prefix sharing and CW-GRPO contributions weights deliver more gains, that our selector operate orthogonally to rollout reuse and trajectory re-weighting。
5×5のロバスト性格子は、ハイパーパラメータ空間の4分の3以上が性能台地にあり、UUCBのロバスト性を確認していることを示している。
関連論文リスト
- Why Sample What You Can Enumerate? Exact Policy Optimization for Genomic Tool Selection [23.92446384027772]
凍結した推論子による強化学習は、外部ツールが呼び出すポリシーを教える一般的なレシピとなっている。
本手法は, ツール・サブセット空間の完全化が可能な専門的な科学的環境において, 構造的に不一致となることを示す。
FGPOを導入し、すべてのツールサブセットをスコアし、正確なアクション期待を最適化します。
論文 参考訳(メタデータ) (2026-09-09T14:20:47Z) - Threshold-Based Selection for Continuous Optimization: A Leaf-Abscission Instantiation [1.827510863075184]
Leaf Abscission Optimization (LAO)は、ランクベースの強度、現象的季節信号、多様性変調、環境圧力、およびベース再成長カーネルを使用する。
本稿では,各既存成分が変動前に試験され,文脈圧力が強度を超える場合にのみ置換が生じて評価される評価ゲーティングアーキテクチャとして,しきい値に基づく選択を定式化する。
論文 参考訳(メタデータ) (2026-09-06T17:41:35Z) - Unifying Depth and Width Pruning for LLMs via Binary Knapsack Optimization [22.700846957818687]
構造化プルーニングは大規模言語モデル(LLM)の圧縮に有望なアプローチである
粗粒度成分に対するクナプサック最適化を解くための2段階構造化プルーニングフレームワークであるSNIPERを提案する。
SNIPERの6つの最先端プルーナーに対する平均性能維持とタスクレベルの安定性における一貫した改善を実証する。
論文 参考訳(メタデータ) (2026-08-13T08:32:18Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs [1.7470133607730627]
BLF (Bayesian Linguistic Forecaster) は二進予測のためのエージェントシステムである。
ForecastBenchのリーダーボードからの400のバックテスト質問に対して、BLFはすべての主要な公開メソッドを上回ります。
論文 参考訳(メタデータ) (2026-04-20T17:57:51Z) - Adaptive Query Routing: A Tier-Based Framework for Hybrid Retrieval Across Financial, Legal, and Medical Documents [0.0]
Retrieval-Augmented Generation (RAG) は、大規模言語モデルのアウトプットを外部知識で基礎付けるための標準パラダイムとなっている。
本稿では,3つの検索アーキテクチャ – ベクトルRAG,ツリー推論,およびAHR (Adaptive Hybrid Retrieval) を,財務法ドメイン全体にわたって評価することにより,その業務を拡大する。
論文 参考訳(メタデータ) (2026-04-14T10:48:13Z) - FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization [84.58281577727566]
本稿では,大規模言語モデルにおける推論ボトルネックを克服する強化学習アルゴリズムであるFuture-KL Influenced Policy Optimization (FIPO)を提案する。
FIPOは、割引先KLの分岐をポリシー更新に組み込むことでこの問題に対処し、その後の軌道行動への影響に基づいてトークンを再重み付けする密集した有利な定式化を作成する。
Qwen2.5-32Bで評価され、FIPOは平均チェーン長を約4,000から10,000以上のトークンに拡張し、AIME 2024 Pass@1の精度を50.0%から58.0%に向上させた。
論文 参考訳(メタデータ) (2026-03-20T10:24:50Z) - Spend Less, Reason Better: Budget-Aware Value Tree Search for LLM Agents [40.18150559561834]
Budget-Aware Value Tree (BAVT) は、動的検索ツリーとしてマルチホップ推論をモデル化するトレーニングフリーの推論時間フレームワークである。
BAVTは一貫して並列サンプリングベースラインを上回っている。
論文 参考訳(メタデータ) (2026-03-13T04:10:27Z) - Budget-Sensitive Discovery Scoring: A Formally Verified Framework for Evaluating AI-Guided Scientific Selection [0.0]
Budget-Sensitive Discovery Score (BSDS)は、各予算レベルで誤った発見を罰する。
Discovery Quality Score (DQS)は、チェリーピックされた予算でうまく機能することで、プロジェクタがインフレできないような、単一のサマリー統計を提供する。
フレームワークは、候補が予算制約と非対称なエラーコストの下で選択される任意の設定に適用されます。
論文 参考訳(メタデータ) (2026-03-12T18:09:53Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG [71.06073770344732]
エージェント検索強化生成(RAG)は、推論と情報検索の多段階的な相互作用として質問応答を定式化する。
エージェントRAGのためのオンラインツリーベースRLフレームワークであるTreePS-RAGについて述べる。
論文 参考訳(メタデータ) (2026-01-11T14:07:30Z) - AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search [19.443576967819684]
LLMエージェントは、内部推論と外部ツールの相互作用をインターリーブすることによって、マルチターンタスクに対処する強力なシステムとして登場した。
マルチターンエージェントRLのための統合フレームワークであるAT$2$POを提案する。
論文 参考訳(メタデータ) (2026-01-08T09:35:49Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models [57.304411396229035]
BranchGRPOは、ロールアウトプロセスを分岐木に再構成する手法である。
HPDv2.1イメージアライメントでは、BranchGRPOはDanceGRPOよりも最大でtextbf16%のアライメントスコアを改善する。
ハイブリッド版であるBranchGRPO-MixはDanceGRPOよりも4.7倍の速度でトレーニングを加速する。
論文 参考訳(メタデータ) (2025-09-07T12:53:06Z) - TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling [65.46347858249295]
TreePOは自己誘導型ロールアウトアルゴリズムで、シーケンス生成を木構造検索プロセスとして見る。
TreePOは基本的に、探索の多様性を保存または強化しながら、更新毎の計算負担を削減します。
論文 参考訳(メタデータ) (2025-08-24T16:52:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。