論文の概要: Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization
- arxiv url: http://arxiv.org/abs/2605.28109v1
- Date: Wed, 27 May 2026 08:01:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.866654
- Title: Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization
- Title(参考訳): Long Live The Balance: Information Bottleneck駆動のツリーベースのポリシー最適化
- Authors: Hao Jiang, Shurui Li, Tianpeng Bu, Bowen Xu, Xin Liu, Qihua Chen, Hongtao Duan, Lulu Hu, Bin Yang, Minying Zhang,
- Abstract要約: IB-Scoreは、ステップレベルの推論多様性と正解と共有される相互情報のトレードオフを定量化し、政策の探索・探索バランスを評価する新しい指標である。
Information Bottleneck-driven Tree-based Policy Optimization (IB-TPO)を提案する。
我々の手法はGRPOベースラインを2.9%から3.6%上回り、また他の最先端のオンラインRLアプローチよりも優れています。
- 参考スコア(独自算出の注目度): 18.398968714754474
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in online reinforcement learning (RL) for large language models (LLMs) have demonstrated promising performance in complex reasoning tasks. However, they often exhibit an imbalanced exploration-exploitation trade-off, resulting in unstable optimization and sub-optimal performance. We introduce IB-Score, a novel metric grounded in Information Bottleneck theory that evaluates policy's exploration-exploitation balance by quantifying the trade-off between step-level reasoning diversity and mutual information shared with the correct answer. Analysis based on IB-Score shows that popular online RL approaches (e.g., GRPO) with common regularizers fail to consistently maintain balance during training with suboptimal results. To address this, we propose Information Bottleneck-driven Tree-based Policy Optimization (IB-TPO), a principled framework that formulates IB-Score as a fine-grained optimization objective and utilizes a novel IB-guided tree sampling strategy that not only improves the efficiency of online sampling with 50% more trajectories under the same token budget, but also reuses the tree structure for effective IB-Score Monte Carlo estimation. Extensive experiments across standard benchmarks show that our method significantly outperforms GRPO baseline by 2.9% to 3.6% and also outperforms other state-of-the-art online RL approaches. Our code is available at https://github.com/alibaba/EfficientRL.
- Abstract(参考訳): 大規模言語モデル(LLM)におけるオンライン強化学習(RL)の最近の進歩は、複雑な推論タスクにおいて有望な性能を示している。
しかし、それらはしばしば不均衡な探索・探索のトレードオフを示し、不安定な最適化と準最適性能をもたらす。
IB-Scoreは、ステップレベルの推論多様性と正解と共有される相互情報のトレードオフを定量化することにより、政策の探索・探索バランスを評価する、情報ボトルネック理論に基づく新しいメトリクスである。
IB-Scoreに基づく分析によると、一般的な正規化器を用いたオンラインRLアプローチ(例えばGRPO)は、準最適結果のトレーニング中に常にバランスを保たない。
そこで我々は,IB-TPO(Information Bottleneck-driven Tree-based Policy Optimization)を提案する。IB-TPO(Information Bottleneck-driven Tree-based Policy Optimization, IB-Score)は,ICB-Scoreを詳細な最適化目標として定式化し,同一のトークン予算下で50%以上のトラジェクトリでオンラインサンプリングの効率を向上するだけでなく,ICB-Score Monte Carlo推定のためにツリー構造を再利用する新しいICB誘導ツリーサンプリング戦略を利用する。
標準ベンチマークによる大規模な実験により、GRPOのベースラインは2.9%から3.6%と大幅に向上し、また、他の最先端のオンラインRLアプローチよりも優れた結果が得られた。
私たちのコードはhttps://github.com/alibaba/EfficientRL.comで利用可能です。
関連論文リスト
- Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models [14.130608036489336]
強化学習(Reinforcement Learning, RL)のポストトレーニングは、生成モデルと人間の嗜好の整合に不可欠であるが、その禁止的な計算コストは、広く普及する上で大きな障壁である。
textbfTreeGRPOは,探索木としてdenoisingプロセスを再キャストすることで,トレーニング効率を劇的に向上させる新しいRLフレームワークである。
論文 参考訳(メタデータ) (2025-12-09T01:17:34Z) - BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping [69.74252624161652]
適応クリッピング(BAPO)を用いたBAlanced Policy Optimizationを提案する。
BAPOはクリッピングバウンダリを動的に調整し、適応的に正と負のコントリビューションを再バランスさせ、エントロピーを保持し、RL最適化を安定化させる。
AIME 2024とAIME 2025ベンチマークでは、7B BAPOモデルがSkyWork-OR1-7Bのようなオープンソースモデルを上回っています。
論文 参考訳(メタデータ) (2025-10-21T12:55:04Z) - An Investigation of Batch Normalization in Off-Policy Actor-Critic Algorithms [9.999241269705744]
バッチ正規化(BN)は、トレーニング安定性を改善し、オーバーフィッティングを緩和し、より効果的な最適化を可能にすることによって、ディープラーニングの成功において重要な役割を担っている。
BNは深い強化学習環境において、特にその堅牢性と訓練の容易さによって、独特な優位性を維持している、と我々は主張する。
DRLパイプラインにおける頑健なBN統合のための実用的な提案を行うためのモード認識バッチ正規化(MA-BN)手法を提案する。
論文 参考訳(メタデータ) (2025-09-28T08:54:33Z) - Accelerating RL for LLM Reasoning with Optimal Advantage Regression [52.0792918455501]
本稿では,最適優位関数を直接近似する新しい2段階ポリシー最適化フレームワークを提案する。
A$*-POは、幅広い数学的推論ベンチマークで競合性能を達成する。
PPO、GRPO、REBELと比較して、トレーニング時間を最大2$times$、ピークメモリ使用率を30%以上削減する。
論文 参考訳(メタデータ) (2025-05-27T03:58:50Z) - Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning [55.96599486604344]
本稿では,Large Language Models (LLMs) の推論能力向上を目的とした,反復的な選好学習プロセスによるアプローチを提案する。
我々は、MCTS(Monte Carlo Tree Search)を用いて好みデータを反復的に収集し、そのルックアヘッド機能を利用して、インスタンスレベルの報酬をよりきめ細かいステップレベルの信号に分解する。
提案アルゴリズムはDPO(Direct Preference Optimization)を用いて,新たに生成されたステップレベルの優先度データを用いてLCMポリシーを更新する。
論文 参考訳(メタデータ) (2024-05-01T11:10:24Z) - Why So Pessimistic? Estimating Uncertainties for Offline RL through
Ensembles, and Why Their Independence Matters [35.17151863463472]
オフライン強化学習(RL)における悲観主義の根源として、Q$関数のアンサンブルをどのように活用できるかを、再検討する。
我々は、完全に独立したネットワークに基づいて、独立に計算されたターゲットと$Q$関数のアンサンブルを訓練する実用的なオフラインRLアルゴリズムMSGを提案する。
D4RL と RL Unplugged のオフライン RL ベンチマーク実験により,深いアンサンブルを持つMSG が高度に調整された最先端の手法を広いマージンで超えることを示した。
論文 参考訳(メタデータ) (2022-05-27T01:30:12Z) - On Effective Scheduling of Model-based Reinforcement Learning [53.027698625496015]
実データ比率を自動的にスケジュールするAutoMBPOというフレームワークを提案する。
本稿ではまず,政策訓練における実データの役割を理論的に分析し,実際のデータの比率を徐々に高めれば,より優れた性能が得られることを示唆する。
論文 参考訳(メタデータ) (2021-11-16T15:24:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。