論文の概要: Explore Beyond the Boundary Using Entropic Information
- arxiv url: http://arxiv.org/abs/2607.29419v1
- Date: Fri, 31 Jul 2026 13:41:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.756263
- Title: Explore Beyond the Boundary Using Entropic Information
- Title(参考訳): エントロピー情報を用いた境界を越えた探索
- Abstract要約: 強化学習では、スパースと遅延報酬による探索が大きな課題となる。
本研究では, エージェントのインセンティブを付与し, 状態分布を超えて探索する新たな手法である Entropic Information for Exploration (ENTINEX) を提案する。
- 参考スコア(独自算出の注目度): 7.589048964013273
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In reinforcement learning, exploration with sparse and delayed rewards presents a significant challenge due to the limited feedback available for guiding the learning process. Addressing this issue requires extensive exploration in the state space to discover valuable reward signals. In this paper, we propose Entropic Information for Exploration (ENTINEX), a novel method that enhances exploration by incentivizing agents to explore beyond the boundaries of the state distribution. ENTINEX achieves this by assigning intrinsic rewards to these boundaries, leveraging entropic information to identify them effectively. Through extensive experimentation, we demonstrate that ENTINEX consistently improves exploration performance in environments characterized by sparse and delayed rewards. Our experimental results show that ENTINEX outperforms existing exploration methods, highlighting its effectiveness in both sparse and delayed reward scenarios.
- Abstract(参考訳): 強化学習では、スパースと遅延報酬による探索は、学習プロセスの指導に利用可能なフィードバックが限られているため、大きな課題となる。
この問題に対処するには、価値ある報奨信号を見つけるために州空間を広範囲に探究する必要がある。
本稿では,エージェントにインセンティブを与えて探索を促進させる手法であるEntropic Information for Exploration (ENTINEX)を提案する。
ENTINEXはこれらの境界に固有の報酬を割り当て、エントロピー情報を有効に識別することでこれを達成している。
広汎な実験により,ENTINEXはスパースと遅延報酬を特徴とする環境における探索性能を一貫して向上することを示した。
実験の結果,ENTINEXは既存の探索手法よりも優れており,スパースと遅延報酬の両シナリオにおける有効性を強調した。
関連論文リスト
- Clearing the Fog: Towards Installing and Refining Proactive Exploration Capabilities in LLM Agents [108.55958466397932]
我々の手法は 先進的な探索を 具現化し 精巧にするための 新たな方法だ
本研究は,(1)標準実証の近視バイアスを軽減するために,探索に富んだ軌道を合成する探索データ構築,(2)コントラスト信号誘導を用いたRL最適化,そして,対照的な軌道対を利用して冗長な航法から生産的な航法を区別する。
論文 参考訳(メタデータ) (2026-08-14T14:24:50Z) - DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off [87.58233482504308]
Reinforcement Learning with Verifiable Rewards (RLVR)は、Large Language Models (LLMs)の推論能力に大きな進歩をもたらした。
本稿では, 訓練中の非常に硬く, 容易なサンプルの探索と利用のジレンマを十分に分析し, 新たな微細なトレードオフ機構を提案する。
論文 参考訳(メタデータ) (2026-04-15T14:12:10Z) - Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration [77.36486933055907]
我々は,ILDE(Imitation Learning with Double Exploration)と呼ばれる新しい模倣学習アルゴリズムを提案する。
ILDE は,(1) 専門家政策の収束性を高めるために高い不確実性を有する状態-作用対を報奨する探索ボーナスによる楽観的な政策最適化,(2) 実証軌道から逸脱した状態の好奇心駆動による探索により,経験以上の性能を得るという2つの側面で探索を実施している。
実験により、ILDEはサンプル効率の観点から最先端の模倣学習アルゴリズムより優れており、Atari や MuJoCo のタスクにおいて、従来の作業よりも少ない実演で、高度な性能を実現していることを示す。
論文 参考訳(メタデータ) (2025-06-25T10:39:32Z) - Beyond the Destination: A Novel Benchmark for Exploration-Aware Embodied Question Answering [87.76784654371312]
Embodied Question Answeringでは、エージェントが動的に3D環境を探索し、視覚情報を積極的に収集し、質問に答えるために多段階の推論を行う必要がある。
既存のデータセットはしばしばバイアスや事前の知識を導入し、非身体的推論につながる。
探索能力と推論能力の両方を評価するために特別に設計された最大のデータセットを構築します。
論文 参考訳(メタデータ) (2025-03-14T06:29:47Z) - MaxInfoRL: Boosting exploration in reinforcement learning through information gain maximization [91.80034860399677]
強化学習アルゴリズムは、現在のベスト戦略の活用と、より高い報酬につながる可能性のある新しいオプションの探索のバランスを図ることを目的としている。
我々は本質的な探索と外生的な探索のバランスをとるためのフレームワークMaxInfoRLを紹介する。
提案手法は,マルチアームバンディットの簡易な設定において,サブリニアな後悔を実現するものである。
論文 参考訳(メタデータ) (2024-12-16T18:59:53Z) - Information Content Exploration [1.7034813545878589]
本稿では,探索行動の体系的定量化と状態カバレッジの促進を図った本質的な報奨を提案する。
情報理論的報酬は,様々なゲームにおいて,効率的な探索や性能向上をもたらすことを示す。
論文 参考訳(メタデータ) (2023-10-10T16:51:32Z) - Never Explore Repeatedly in Multi-Agent Reinforcement Learning [40.35950679063337]
我々は「リビジョン」と戦うための動的報酬スケーリング手法を提案する。
Google Research FootballやStarCraft IIのマイクロマネジメントタスクのような需要のある環境におけるパフォーマンスの向上を示す。
論文 参考訳(メタデータ) (2023-08-19T05:27:48Z) - Successor-Predecessor Intrinsic Exploration [18.440869985362998]
本研究は,内因性報酬を用いた探索に焦点を当て,エージェントが自己生成型内因性報酬を用いて外因性報酬を過渡的に増強する。
本研究では,先進情報と振り返り情報を組み合わせた新たな固有報酬に基づく探索アルゴリズムSPIEを提案する。
本研究は,SPIEが競合する手法よりも少ない報酬とボトルネック状態の環境において,より効率的かつ倫理的に妥当な探索行動をもたらすことを示す。
論文 参考訳(メタデータ) (2023-05-24T16:02:51Z) - Rewarding Episodic Visitation Discrepancy for Exploration in
Reinforcement Learning [64.8463574294237]
本稿では,効率的かつ定量的な探索手法として,Rewarding Episodic Visitation Discrepancy (REVD)を提案する。
REVDは、R'enyiの発散に基づくエピソード間の訪問不一致を評価することによって、本質的な報酬を提供する。
PyBullet Robotics EnvironmentsとAtariゲームでテストされている。
論文 参考訳(メタデータ) (2022-09-19T08:42:46Z) - Perturbation-based exploration methods in deep reinforcement learning [0.0]
政策・報酬空間における摂動がエージェントの探索行動に及ぼす影響について検討する。
ソフトマックス層の直前にポリシーを摂動させ,ドメインに散発的な報酬ボーナスを導入することで,探索を大幅に促進できることを示す。
論文 参考訳(メタデータ) (2020-11-10T22:57:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。