論文の概要: EPIG-Tree: Compute-Optimal Branching for Gradient-Efficient Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.20004v1
- Date: Thu, 17 Sep 2026 10:08:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.215698
- Title: EPIG-Tree: Compute-Optimal Branching for Gradient-Efficient Reinforcement Learning
- Title(参考訳): EPIG-Tree: 勾配効率の良い強化学習のための最適分岐
- Abstract要約: ツリーベースのロールアウト構成を政策段階推定のための計算割当問題として検討する。
我々の中心的な主張は、政策が単に不確実である場所ではなく、追加のブランチが不確実性を最も減少させる場所に置くべきだというものである。
オンラインのシングルターン数学では、ツリーローカルクレジットは平らなGRPOを上回り、分岐配置はトークンレベルのクレジット代入に二次的である。
- 参考スコア(独自算出の注目度): 2.173851537704397
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reward-based reinforcement learning for language models, exemplified by Group Relative Policy Optimization (GRPO), collapses an entire stochastic trajectory into a single scalar reward. This is clean and scalable, but it explores and allocates reward inefficiently: a trajectory may contain many causal decisions, recovery attempts, and environment-randomness events, yet every token or action inherits one trajectory-level advantage. We study tree-based rollout construction as a compute-allocation problem for policy-gradient estimation. Our central claim is that branches should be placed not where the policy is merely uncertain, but where an additional branch most reduces uncertainty about the policy gradient per unit of compute. From a law-of-total-variance decomposition of the local policy-gradient random variable, we derive two allocation laws: new branches reduce decision uncertainty, while repeated suffix rollouts reduce continuation uncertainty. The resulting EPIG-Tree score allocates branches using the already computed rollouts. It estimates occupancy- and score-weighted value uncertainty, along with a suffix law $n_e \propto w_e \|\nabla_θ\log π(a_e|h_e)\| σ_e / \sqrt{c_e}$. Empirically, EPIG reduces gradient MSE in cloned-state control, winning in all nine dense continuous-control environments of a 13-environment sweep and recovering the reference gradient direction near-perfectly, and it improves frozen-LLM gradient calibration relative to entropy branching. In online single-turn math, tree-local credit beats flat GRPO, while branch placement is secondary to token-level credit assignment. In online multi-turn Wordle, EPIG attains the highest final win rate (0.850), overtaking flat GRPO, which saturates early at 0.790, and entropy branching as training proceeds, confirming that the gradient-estimation advantage transfers to a stateful, large-action setting.
- Abstract(参考訳): Group Relative Policy Optimization (GRPO) によって実証された言語モデルのリワードベース強化学習は、確率的軌道全体を1つのスカラー報酬に分解する。
トラジェクトリには多くの因果決定、リカバリの試み、環境ランダムなイベントが含まれますが、トークンやアクションはすべて、1つのトラジェクトリレベルのアドバンテージを継承します。
ツリーベースのロールアウト構成を政策段階推定のための計算割当問題として検討する。
我々の中心的な主張は、ブランチは単にポリシーが不確実な場所ではなく、追加のブランチが計算単位当たりのポリシー勾配に関する不確実性を最も減少させる、というものである。
局所的な政策次数確率変数の法則-経時差分分解から、新しい分岐は決定の不確実性を減少させ、繰り返しサフィックスのロールアウトは継続の不確実性を減少させるという2つの割り当て法則を導出する。
EPIG-Treeスコアは、既に計算済みのロールアウトを使ってブランチを割り当てる。
占有率とスコア重み付き値の不確かさと、接尾辞法$n_e \propto w_e \|\nabla_θ\log π(a_e|h_e)\| σ_e / \sqrt{c_e}$を推定する。
実証的には、EPIGはクローン状態制御における勾配MSEを減少させ、13環境の9つの密集した連続制御環境すべてで勝利し、基準勾配方向をほぼ完璧に回復させ、エントロピー分岐に対する凍結-LLM勾配校正を改善する。
オンラインのシングルターン数学では、ツリーローカルクレジットは平らなGRPOを上回り、分岐配置はトークンレベルのクレジット代入に二次的である。
オンラインマルチターンワードルにおいて、EPIGは最高勝利率(0.850)に達し、0.790で早期に飽和する平坦なGRPOを上回り、トレーニングが進むにつれてエントロピーが分岐し、勾配推定の利点がステートフルで大きなアクション設定に移行することを確認する。
関連論文リスト
- Contrastive Branch Policy Optimization [16.16893757028268]
検証可能な報酬(RLVR)による強化学習は、言語モデルが外部ツールとのマルチターンインタラクションを学習することを可能にする。
既存の方法は、固定されたロールアウト予算を割り当て、分岐結果をトークンレベルのクレジットに変換する、という2つの異なる問題を分割する傾向があります。
本稿では,この2つの問題を解消し,それぞれに専用のメカニズムを割り当てる,コントラスト分岐政策最適化(CBPO)を紹介する。
論文 参考訳(メタデータ) (2026-08-25T09:25:55Z) - Risk-Sensitive Reinforcement Learning with Smoothed Quantile Objectives [2.153824429735596]
モデルに基づく楽観的学習アルゴリズムを開発し、遷移カーネルの信頼セットと低バッファの量子化基準を用いて計画する。
チューリング時間短縮の下で, 正確な点量子化評価と, 正確な低バッファ化量子化評価がPPハードであることを証明する。
論文 参考訳(メタデータ) (2026-08-23T05:41:32Z) - Convex-Hull-Neighborhood Smooth Dual Generalization: Controlling Local Correction Propagation in Offline RL [7.803284875836737]
ブートストラップは オフライン強化学習における 推定誤差を増幅する
本稿では,ベルマンのバックアップをサンプル値のターゲットとして表現し,CHN局所補正を行うConvex Hull Neborhood Smooth Dual Generalizationを提案する。
Gym-MuJoCoとAntMazeの実験は、強力な集約性能と安定した値推定を示す。
論文 参考訳(メタデータ) (2026-08-04T04:30:02Z) - Holder Policy Optimisation [26.521180498291717]
textbfHlderPOは、一般的なポリシー最適化フレームワークである。
トークンレベルの確率アグリゲーションをHlder平均を介して統一する。
複数の数学ベンチマークにおいて、最先端の平均精度は54.9%である。
論文 参考訳(メタデータ) (2026-05-12T12:45:03Z) - Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective [22.848847562976633]
トークンレベルのIS比は、PPOとGRPOが採用しているように、プレフィックス状態の分布ミスマッチを無視してバイアスを導入する。
我々は、累積トークンIS比と、累積対数比の自然な$sqrtt$成長に応じて、対数空間のクリップ境界を拡大する位置適応クリッピングを組み合わせたCTPOを提案する。
論文 参考訳(メタデータ) (2026-05-08T06:35:02Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Provably Efficient Algorithms for S- and Non-Rectangular Robust MDPs with General Parameterization [85.91302339486673]
我々は、s-正方形および非正方形不確実性集合の下で、一般的な政策パラメータ化を伴うロバストマルコフ決定過程(RMDP)について検討する。
無限状態空間に拡張する一般政策パラメタライゼーションに対する新しいリプシッツ・リプシッツ・スムースネス特性を証明した。
本研究では,S-正方形不確かさに対する勾配降下アルゴリズムと非正方形不確かさに対するFrank-Wolfeアルゴリズムを設計する。
論文 参考訳(メタデータ) (2026-02-11T21:44:20Z) - BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models [57.304411396229035]
BranchGRPOは、ロールアウトプロセスを分岐木に再構成する手法である。
HPDv2.1イメージアライメントでは、BranchGRPOはDanceGRPOよりも最大でtextbf16%のアライメントスコアを改善する。
ハイブリッド版であるBranchGRPO-MixはDanceGRPOよりも4.7倍の速度でトレーニングを加速する。
論文 参考訳(メタデータ) (2025-09-07T12:53:06Z) - Decentralized Nonconvex Composite Federated Learning with Gradient Tracking and Momentum [78.27945336558987]
分散サーバ(DFL)はクライアント・クライアント・アーキテクチャへの依存をなくす。
非滑らかな正規化はしばしば機械学習タスクに組み込まれる。
本稿では,これらの問題を解決する新しいDNCFLアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-04-17T08:32:25Z) - The Role of Baselines in Policy Gradient Optimization [83.42050606055822]
Emphstateのバリューベースラインが、オン・ポリティクスを可能にしていることを示す。
世界的な最適な政策勾配(NPG)に収束する。
O (1/t) レート勾配でのポリシー。
値ベースラインの主な効果は、その分散ではなく、更新のアグレッシブさをthabfreduceすることにある。
論文 参考訳(メタデータ) (2023-01-16T06:28:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。