論文の概要: DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off
- arxiv url: http://arxiv.org/abs/2604.13902v1
- Date: Wed, 15 Apr 2026 14:12:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-16 20:38:32.574276
- Title: DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off
- Title(参考訳): DiPO:細粒度探査・膨張貿易オフのための絡み合った複雑度政策最適化
- Abstract要約: Reinforcement Learning with Verifiable Rewards (RLVR)は、Large Language Models (LLMs)の推論能力に大きな進歩をもたらした。
本稿では, 訓練中の非常に硬く, 容易なサンプルの探索と利用のジレンマを十分に分析し, 新たな微細なトレードオフ機構を提案する。
- 参考スコア(独自算出の注目度): 87.58233482504308
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) has catalyzed significant advances in the reasoning capabilities of Large Language Models (LLMs). However, effectively managing the exploration and exploitation trade-off remains a critical challenge. In this paper, we fully analyze the exploration and exploitation dilemma of extremely hard and easy samples during the training and propose a new fine-grained trade-off mechanism. Concretely, we introduce a perplexity space disentangling strategy that divides the sample space into distinct exploration (high perplexity) and exploitation (low perplexity) subspaces, thereby mining fine-grained samples requiring exploration-exploitation trade-off. Subsequently, we propose a bidirectional reward allocation mechanism with a minimum impact on verification rewards to implement perplexity-guided exploration and exploitation, enabling more stable policy optimization. Finally, we have evaluated our method on two mainstream tasks: mathematical reasoning and function calling, and experimental results demonstrate the superiority of the proposed method, confirming its effectiveness in enhancing LLM performance by fine-grained exploration-exploitation trade-off.
- Abstract(参考訳): Reinforcement Learning with Verifiable Rewards (RLVR) は、Large Language Models (LLMs) の推論能力に大きな進歩をもたらした。
しかし、探検と搾取のトレードオフを効果的に管理することは依然として重要な課題である。
本稿では, 訓練中の非常に硬く, 容易なサンプルの探索と利用のジレンマを解析し, 新たな微細なトレードオフ機構を提案する。
具体的には,標本空間を別々に探索(高いパープレキシティ)と利用(低いパープレキシティ)のサブスペースに分割し,探索・探索のトレードオフを必要とする微細な試料をマイニングするパープレキシティ空間ディエンタング戦略を導入する。
次に、より安定した政策最適化を実現するために、両方向の報酬配分機構を提案し、検証報酬に最小限の影響を与える。
最後に,本手法を数学的推論と関数呼び出しという2つの主要なタスクで評価し,提案手法の優位性を実証した。
関連論文リスト
- Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward [33.74512650901766]
検証可能な報酬(RLVR)を用いた強化学習における探索・探索トレードオフについて検討する。
最近の研究は、RLVRがLarge Language Models (LLMs) において強力な数学的推論をもたらすことを示唆している。
本研究は、より効果的なRLVRトレーニングの原理として、スプリアス・リワード効果の背景にあるメカニズムを明らかにした。
論文 参考訳(メタデータ) (2025-12-18T18:59:27Z) - Diversity-Incentivized Exploration for Versatile Reasoning [63.653348177250756]
textbfDi-textbf Incentivized Exploration for textbfVersatiltextbfE textbfReasoningを提案する。
論文 参考訳(メタデータ) (2025-09-30T13:11:46Z) - Beyond the Exploration-Exploitation Trade-off: A Hidden State Approach for LLM Reasoning in RLVR [15.147456927849932]
RLVR(Reinforcement Learning for Verifiable Rewards)の一般的な見解は、探索・探索トレードオフのレンズを通して最近の進歩を解釈している。
我々はこの視点を再検討し、この認識されたトレードオフは基本的な制約ではなく、測定レベルの成果物である可能性を示唆している。
本稿では,相乗的探索・探索強化の原理を最初に運用する,Velocity-Exploiting Rank-Learning (VERL)を提案する。
論文 参考訳(メタデータ) (2025-09-28T11:14:58Z) - From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR [92.51110344832178]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデル(LLM)の推論能力を高めるための強力なパラダイムとして登場した。
本技術報告では,RLVRにおける探査能力の体系的調査について述べる。
論文 参考訳(メタデータ) (2025-08-11T01:26:16Z) - Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration [77.36486933055907]
我々は,ILDE(Imitation Learning with Double Exploration)と呼ばれる新しい模倣学習アルゴリズムを提案する。
ILDE は,(1) 専門家政策の収束性を高めるために高い不確実性を有する状態-作用対を報奨する探索ボーナスによる楽観的な政策最適化,(2) 実証軌道から逸脱した状態の好奇心駆動による探索により,経験以上の性能を得るという2つの側面で探索を実施している。
実験により、ILDEはサンプル効率の観点から最先端の模倣学習アルゴリズムより優れており、Atari や MuJoCo のタスクにおいて、従来の作業よりも少ない実演で、高度な性能を実現していることを示す。
論文 参考訳(メタデータ) (2025-06-25T10:39:32Z) - Reasoning with Exploration: An Entropy Perspective [111.0659496612249]
強化学習(RL)の中心的目標としてのバランシング探索と活用
エントロピーに基づく項による優位関数の増大という,1行のコードのみによる標準RLへの最小限の修正を導入する。
提案手法は,非常に大きなK値を用いて評価しても,Pass@K測定値において有意な利得が得られる。
論文 参考訳(メタデータ) (2025-06-17T17:54:03Z) - Navigate the Unknown: Enhancing LLM Reasoning with Intrinsic Motivation Guided Exploration [39.460202867967006]
そこで,本研究では,高密度報酬を付与し,RLに基づくパラダイムにおける探索を増幅するために,固有モチベーションギルド探索比N meThOd foR LLM推論(i-MENTOR)を提案する。
4つの公開データセットにわたる実験は、i-MENTORの有効性を示し、AIME 2024で22.23%改善した。
論文 参考訳(メタデータ) (2025-05-23T08:30:28Z) - Adaptive trajectory-constrained exploration strategy for deep
reinforcement learning [6.589742080994319]
深層強化学習 (DRL) は, まばらさや虚偽の報奨や大きな状態空間を持つタスクにおいて, ハード探索問題に対処する上で, 重大な課題に直面している。
DRLの最適軌道制約探索法を提案する。
2つの大きな2次元グリッドワールド迷路と複数のMuJoCoタスクについて実験を行った。
論文 参考訳(メタデータ) (2023-12-27T07:57:15Z) - Dynamic Exploration-Exploitation Trade-Off in Active Learning Regression
with Bayesian Hierarchical Modeling [4.132882666134921]
探査・探査を同時に検討する方法は、最適でないかもしれないトレードオフを制御するために、固定的またはアドホックな手段を同時に採用する。
我々は,BHEEMと呼ばれるベイズ的階層的アプローチを開発し,探査・探査のトレードオフを動的にバランスさせる。
論文 参考訳(メタデータ) (2023-04-16T01:40:48Z) - Rewarding Episodic Visitation Discrepancy for Exploration in
Reinforcement Learning [64.8463574294237]
本稿では,効率的かつ定量的な探索手法として,Rewarding Episodic Visitation Discrepancy (REVD)を提案する。
REVDは、R'enyiの発散に基づくエピソード間の訪問不一致を評価することによって、本質的な報酬を提供する。
PyBullet Robotics EnvironmentsとAtariゲームでテストされている。
論文 参考訳(メタデータ) (2022-09-19T08:42:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。