論文の概要: TopoExplore: Topological Discrimination for Archive-Based Exploration
- arxiv url: http://arxiv.org/abs/2607.09971v1
- Date: Fri, 10 Jul 2026 20:55:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.267051
- Title: TopoExplore: Topological Discrimination for Archive-Based Exploration
- Title(参考訳): TopoExplore: アーカイブベースの探索のためのトポロジカル識別
- Authors: Jason Carlson,
- Abstract要約: TopoExploreは周期的なトポロジカルパスでGo-Explore細胞選択を増強する。
ビジターセット占有グリッドの囲われた未探索領域(ボイド)は、洪水充填によって検出される。
TopoExploreは、Go-Exploreの正確なアブレーションよりも、中央ステップから第一エントリーでの1.52倍の幾何平均スピードアップを達成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Archive-based exploration methods such as Go-Explore select which visited state to return to using visitation rarity, and frontier methods return to the boundary of the unknown; neither asks whether the unexplored region behind a boundary is enterable at all. Exploration is not just about finding reward - it is about collecting a structurally complete experience for downstream learning and planning. We introduce TopoExplore, which augments Go-Explore cell selection with a periodic topological pass: enclosed unexplored regions (voids) of the visited-set occupancy grid are detected by flood fill (the H1 classes of its cubical complex), and a decaying selection bonus is placed only on their strict entrances (gap or door cells), so sealed regions are never targeted and entered regions retire. On a controlled 18-environment MiniGrid suite (15 seeds, frozen hyperparameters) TopoExplore attains a 1.52x geometric-mean speedup in median steps-to-first-entry over its exact Go-Explore ablation, versus 1.37x for a frontier baseline; frontier exploration degrades when sealed decoy structure appears (0.83-1.48x on decoy environments vs. 1.65-2.11x for TopoExplore), while TopoExplore holds its largest win on hard multi-interaction doors (10.9x). We report an honest negative on Montezuma's Revenge - without wall knowledge, unreachable occupancy artifacts capture the bonus and performance degrades as it grows, isolating the wall-aware entrance test as the load-bearing component - and a preliminary positive on HM3D scanned buildings, where the speedup over Go-Explore tracks scene difficulty (r=0.69) even as frontier selection dominates blanket coverage. The evidence supports a deliberately scoped claim: topology-aware selection pays off where enclosed structure must be discriminated, and remains competitive at open coverage, where frontier methods are strongest, despite not being tuned for that regime.
- Abstract(参考訳): Go-Exploreのようなアーカイブベースの探索手法では、訪問の希薄さを活かすために訪問した状態を選択し、フロンティアメソッドは未知の境界に戻る。
探索は報酬を見つけることだけではなく、下流の学習と計画のための構造的に完全な経験を集めることです。
TopoExploreを導入し, 周期的トポロジカルパスでGo-Explore細胞選択を増強し, 訪問集合占有グリッドの未探索領域(ボイド)をフラッドフィル(その立方体複合体のH1クラス)で検出し, 厳密な入り口(ギャップやドアセル)にのみ崩壊する選択ボーナスを配置した。
制御された18環境のMiniGridスイート(15種、凍結したハイパーパラメータ)では、TopoExploreは正確なGo-Exploreアブレーションよりも中央値の1.52倍、フロンティアベースラインは1.37倍、封印されたデコイ構造が出現するとフロンティア探索は劣化する(デコイ環境では0.83-1.48倍、TopoExploreは1.65-2.11倍、TopoExploreはハードマルチアクションドアでは10.9倍)。
我々は,モンテズマのリベンジにおいて,壁知識が無く,到達不能な乗員アーティファクトがボーナスと性能の低下を捉え,壁面認識の入り口試験を負荷負担成分として分離し,Go-Exploreのスピードアップがシーンの難易度(r=0.69)をトラックするHM3Dスキャンされた建物に対して,前向きな肯定的な肯定を報告した。
トポロジを意識した選択は、封じ込められた構造を区別しなければならない場所で支払い、フロンティアの手法が最強であり、その体制のために調整されていないにもかかわらず、オープンな範囲で競争力を維持する。
関連論文リスト
- Exploitation Is All You Need... for Exploration [0.0]
実験対象を最大化するために訓練されたエージェントは, にもかかわらず, 創発的な探索行動を示すことができることを示す。
適切な前提条件の下では、探索と搾取は目的として扱われる必要はないが、統一的な報酬-最大化プロセスから生まれる可能性がある。
論文 参考訳(メタデータ) (2025-08-02T09:42:59Z) - FrontierNet: Learning Visual Cues to Explore [54.8265603996238]
この研究は、3Dマップからゴールポーズを抽出する制限に対処するため、効率的な自律探索に2Dビジュアルキューを活用することを目的としている。
本稿では、FrontierNetをコアコンポーネントとする、視覚のみのフロンティアベースの探索システムを提案する。
提案手法は,既存の3次元目標抽出手法に代わるもので,早期探索効率の15%向上を実現している。
論文 参考訳(メタデータ) (2025-01-08T16:25:32Z) - Intelligent Go-Explore: Standing on the Shoulders of Giant Foundation Models [5.404186221463082]
Go-Exploreは、ハード探索問題を解決するために設計されたアルゴリズムの強力なファミリーである。
本稿では,従来の Go-Explore の範囲を大きく広げる Intelligent Go-Explore (IGE) を提案する。
IGEには人間のような能力があり、新しい状態がいかに面白く、あるいは有望であるかを直感的に識別する能力がある。
論文 参考訳(メタデータ) (2024-05-24T01:45:27Z) - First Go, then Post-Explore: the Benefits of Post-Exploration in
Intrinsic Motivation [7.021281655855703]
Go-Exploreは、低報酬の強化学習(RL)タスクにおいて画期的なパフォーマンスを達成した。
Go-Exploreの主な洞察は、調査を成功させるためには、エージェントが最初に興味深い状態に戻る必要があります。
目標達成後の探査を「後探査」と呼ぶ。
論文 参考訳(メタデータ) (2022-12-06T18:56:47Z) - BYOL-Explore: Exploration by Bootstrapped Prediction [49.221173336814225]
BYOL-Exploreは、視覚的に複雑な環境で好奇心を駆使した探索のための概念的には単純だが一般的なアプローチである。
BYOL-Explore は DM-HARD-8 において有効であることを示す。
論文 参考訳(メタデータ) (2022-06-16T17:36:15Z) - Multi-Stage Episodic Control for Strategic Exploration in Text Games [16.897326154822135]
本研究は,各エピソードにおいてこれらの2つの戦略を明示的に切り離す多段階アプローチを用いて,探索-vs-exploitジレンマに取り組むことを提案する。
eXploit-Then-eXplore (XTX)と呼ばれる我々のアルゴリズムは、過去の有望な軌跡を模倣したエクスプロイトポリシーを用いて各エピソードを開始する。
提案手法は,Jerrichoベンチマークによる12ゲームの平均正規化スコアを27%,11%向上させた。
論文 参考訳(メタデータ) (2022-01-04T17:19:52Z) - Landmark-Guided Subgoal Generation in Hierarchical Reinforcement
Learning [64.97599673479678]
ランドマークによる階層的強化学習(HIGL)について紹介する。
HIGLは、ランドマークでガイドされたアクションスペースを削減した、ハイレベルなポリシーをトレーニングするための新しいフレームワークである。
我々の実験は、我々のフレームワークが様々な制御タスクで先行技術より優れていることを示した。
論文 参考訳(メタデータ) (2021-10-26T12:16:19Z) - Long-Term Exploration in Persistent MDPs [68.8204255655161]
RbExplore (Rollback-Explore) と呼ばれる探査手法を提案する。
本稿では,マルコフ決定過程を永続的に決定する手法であるロールバック・エクスロア (RbExplore) を提案する。
我々は,ペルシャのプリンス・オブ・ペルシャゲームにおいて,報酬やドメイン知識を伴わずに,我々のアルゴリズムを検証した。
論文 参考訳(メタデータ) (2021-09-21T13:47:04Z) - BeBold: Exploration Beyond the Boundary of Explored Regions [66.88415950549556]
本稿では,本質的報酬(IR)の簡便かつ効果的な基準として,逆訪問回数の規制的差異を提案する。
この基準は、エージェントが探索された地域の境界を越えて探索し、短視力や分離などのカウントベースの方法の一般的な問題を緩和するのに役立ちます。
その結果得られたBeBoldは、MiniGridの12の最も難しい手続き的タスクを、カリキュラムの学習なしにわずか120万の環境ステップで解決する。
論文 参考訳(メタデータ) (2020-12-15T21:26:54Z) - Fast active learning for pure exploration in reinforcement learning [48.98199700043158]
1/n$でスケールしたボーナスはより高速な学習率をもたらし、地平線への依存に関して既知の上限を改善します。
また, 停止時間の解析を改良することにより, 最良政体識別設定におけるサンプルの複雑さを$H$で改善できることも示している。
論文 参考訳(メタデータ) (2020-07-27T11:28:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。