論文の概要: Mastering Atari 2600 Games with Discovered Options
- arxiv url: http://arxiv.org/abs/2610.03604v1
- Date: Fri, 02 Oct 2026 17:05:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.499935
- Title: Mastering Atari 2600 Games with Discovered Options
- Title(参考訳): Atari 2600のマスタリングオプション発見
- Abstract要約: しばしばオプションとしてインスタンス化される一時的な抽象化は、クレジット割り当てを加速するメカニズムとして長い間見なされてきた。
提案するWayfarerはドメインに依存しないオンラインディープRLエージェントで,ラプラシアン表現によるオプションの発見を行う。
結果として得られる選択肢は探索と信用割当の促進を同時に改善し、見当たらない設定に効果的に一般化することを示します。
- 参考スコア(独自算出の注目度): 14.390952817249746
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Temporal abstractions, often instantiated as options, have long been regarded as a mechanism for accelerating credit assignment, facilitating exploration, and enabling generalisation in reinforcement learning (RL). However, developing general option discovery methods that are effective in large-scale, high-dimensional domains remains a fundamental challenge. Existing option discovery methods are either confined to relatively simple domains, depend on handcrafted or quasi-symbolic representations, or offer little improvement over learning without options. We present Wayfarer, a general, domain-agnostic, online deep RL agent that discovers options through Laplacian representation learning from high-dimensional observations and leverages them for control. We show that the resulting options simultaneously improve exploration, accelerate credit assignment, and generalise effectively to unseen settings, enabling substantially faster learning of complex policies. Wayfarer achieves state-of-the-art performance among single-stream agents on the most challenging Atari 2600 games, with the largest gains in games that require long-horizon exploration and strategic behaviour, such as Montezuma's Revenge and Private Eye.
- Abstract(参考訳): 時間的抽象化は、しばしばオプションとしてインスタンス化され、信用割り当てを加速し、探索を容易にし、強化学習(RL)の一般化を可能にするメカニズムとして長い間見なされてきた。
しかし, 大規模高次元領域に有効な一般オプション発見手法の開発は, 依然として根本的な課題である。
既存のオプション発見手法は比較的単純なドメインに限られており、手工芸や準記号表現に依存している。
ドメインに依存しないオンライン深層RLエージェントであるWayfarerは、高次元観測から学習したラプラシア表現を通して選択肢を発見し、それらを制御に活用する。
結果として得られた選択肢が探索を改善し、信用割当を加速し、見当たらない設定に効果的に一般化し、複雑なポリシーの学習を大幅に高速化することを示します。
Wayfarerは、最も挑戦的なAtari 2600ゲームにおいて、シングルストリームエージェントの最先端のパフォーマンスを達成し、モンテズマのRevengeやPrivate Eyeのような、長期の探検と戦略的行動を必要とするゲームで最大の利益を得ている。
関連論文リスト
- Going Beyond State-Reaching: Learning Abstractions for Intrinsically Motivated Option Discovery [14.225187205646328]
本稿では,各サブゴールの少数の特徴を学習し,広範に一般化し探索を高速化するアルゴリズムを提案する。
提案手法は,アタリゲームMontezumasRevsengeを含む3つのスパース・リワード・イメージベース領域において,抽象的,転送可能な選択肢と迅速な探索を実現する。
論文 参考訳(メタデータ) (2026-09-29T01:33:18Z) - Decoupling Exploration and Policy Optimization: Uncertainty Guided Tree Search for Hard Exploration [12.531650952835493]
本稿では,探査段階におけるRLの活用と回避を明確に分離する新たなパラダイムを提案する。
政策最適化のオーバーヘッドを取り除くことにより,本手法は,ハードなAtariベンチマーク上での本質的なモチベーションベースラインよりも,桁違いに効率よく探索する。
得られた軌跡を既存の教師付き後方学習アルゴリズムを用いて,展開可能なポリシに抽出できることを実証した。
論文 参考訳(メタデータ) (2026-03-23T17:56:52Z) - MaxInfoRL: Boosting exploration in reinforcement learning through information gain maximization [91.80034860399677]
強化学習アルゴリズムは、現在のベスト戦略の活用と、より高い報酬につながる可能性のある新しいオプションの探索のバランスを図ることを目的としている。
我々は本質的な探索と外生的な探索のバランスをとるためのフレームワークMaxInfoRLを紹介する。
提案手法は,マルチアームバンディットの簡易な設定において,サブリニアな後悔を実現するものである。
論文 参考訳(メタデータ) (2024-12-16T18:59:53Z) - Open-World Reinforcement Learning over Long Short-Term Imagination [91.28998327423295]
高次元オープンワールドにおける視覚的強化学習エージェントの訓練は、大きな課題を呈している。
LS-Imagineは、有限個の状態遷移ステップにおいて、イマジネーションの地平線を拡大する。
我々の手法は、MineDojoの最先端技術よりも大幅に改善されていることを示す。
論文 参考訳(メタデータ) (2024-10-04T17:17:30Z) - Long-Term Exploration in Persistent MDPs [68.8204255655161]
RbExplore (Rollback-Explore) と呼ばれる探査手法を提案する。
本稿では,マルコフ決定過程を永続的に決定する手法であるロールバック・エクスロア (RbExplore) を提案する。
我々は,ペルシャのプリンス・オブ・ペルシャゲームにおいて,報酬やドメイン知識を伴わずに,我々のアルゴリズムを検証した。
論文 参考訳(メタデータ) (2021-09-21T13:47:04Z) - Reannealing of Decaying Exploration Based On Heuristic Measure in Deep
Q-Network [82.20059754270302]
本稿では,再熱処理の概念に基づくアルゴリズムを提案し,必要なときにのみ探索を促進することを目的とする。
我々は、訓練を加速し、より良い政策を得る可能性を示す実証的なケーススタディを実施している。
論文 参考訳(メタデータ) (2020-09-29T20:40:00Z) - Never Give Up: Learning Directed Exploration Strategies [63.19616370038824]
そこで我々は,多岐にわたる探索政策を学習し,ハード・サーベイ・ゲームを解決するための強化学習エージェントを提案する。
エージェントの最近の経験に基づいて,k-アネレスト隣人を用いたエピソード記憶に基づく本質的な報酬を構築し,探索政策を訓練する。
自己教師付き逆動力学モデルを用いて、近くのルックアップの埋め込みを訓練し、エージェントが制御できる新しい信号をバイアスする。
論文 参考訳(メタデータ) (2020-02-14T13:57:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。