論文の概要: ATLAS: Adaptive Topological Learning with Abstract Successors for Continual Learning
- arxiv url: http://arxiv.org/abs/2608.04334v1
- Date: Wed, 05 Aug 2026 01:21:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.683502
- Title: ATLAS: Adaptive Topological Learning with Abstract Successors for Continual Learning
- Title(参考訳): ATLAS: 連続学習のための抽象的継承子を用いた適応的トポロジカルラーニング
- Authors: R. Blake Lawlor, Daniel S. Brown,
- Abstract要約: 本稿では,これらの課題に対処するために,ATLAS(Adaptive Topological Learning with Abstract Successors)を提案する。
ATLASは新しい目標にほぼ瞬時に適応し、正の後方移動を示す。
- 参考スコア(独自算出の注目度): 11.403605512454218
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Contemporary model-free reinforcement learning algorithms can achieve very high performance, but have low sample efficiency and are not robust to changes in the environment. Model-based algorithms have much higher sample efficiency, but still fail when the environment shifts. This paper introduces Adaptive Topological Learning with Abstract Successors (ATLAS) to combat these challenges. ATLAS uses a Grow When Required network with Successor Features in order to achieve high sample efficiency while also robustly tackling catastrophic forgetting. We evaluate ATLAS in spatial navigation tasks, benchmarking its performance against common on-policy and off-policy algorithms. Our empirical results demonstrate that by structurally decoupling transition dynamics from the reward signal, ATLAS achieves near-instantaneous adaptation to new goals and can exhibit positive backward transfer, significantly outperforming baseline methods in non-stationary environments.
- Abstract(参考訳): 現代のモデルフリー強化学習アルゴリズムは非常に高い性能を達成できるが、サンプル効率は低く、環境の変化に対して堅牢ではない。
モデルベースのアルゴリズムはサンプリング効率がはるかに高いが、環境が変化しても失敗する。
本稿では,これらの課題に対処するために,ATLAS(Adaptive Topological Learning with Abstract Successors)を提案する。
ATLASは、高いサンプル効率を達成するために、継承機能を備えたGrow When Requiredネットワークを使用している。
我々は、空間ナビゲーションタスクにおけるATLASの評価を行い、その性能を一般的なオン・ポリティクスおよびオフ・ポリティクス・アルゴリズムと比較した。
実験の結果,ATLASは報酬信号から遷移ダイナミクスを構造的に分離することにより,新たな目標への即時適応を達成し,非定常環境におけるベースライン法よりも有意に優れていることを示す。
関連論文リスト
- Direct Advantage Estimation for Scalable and Sample-efficient Deep Reinforcement Learning [54.916555668983726]
遷移確率を効率的に近似する離散潜在力学モデルを導入する。
DAEは高い試料効率を維持しつつ,関数近似器の容量で効果的にスケールすることがわかった。
論文 参考訳(メタデータ) (2026-06-18T15:58:48Z) - Dynamic Class-Aware Active Learning for Unbiased Satellite Image Segmentation [1.299941371793082]
動的クラス認識不確実性に基づくアクティブラーニング(DCAU-AL)を提案する。
DCAU-ALは、リアルタイムなクラスワイドパフォーマンスギャップに基づくサンプル選択を優先し、クラスバランス問題を克服する。
論文 参考訳(メタデータ) (2026-04-10T05:08:57Z) - Open-World Test-Time Adaptation with Hierarchical Feature Aggregation and Attention Affine [17.151364853811128]
テスト時間適応(TTA)とは、サンプル分布の変化に対処するため、テストフェーズ中にモデルを調整することを指す。
本稿では,すべてのトランスフォーマー層に集約されたクラストークンからOOD特徴を抽出する階層ラダーネットワークを提案する。
また、トークン情報に基づく自己認識機構を適応的に洗練し、ドメインのドリフトに適応するアテンションアフィンネットワーク(AAN)を導入する。
論文 参考訳(メタデータ) (2025-11-16T14:05:23Z) - Contractive Dynamical Imitation Policies for Efficient Out-of-Sample Recovery [3.549243565065057]
模倣学習(imitation learning)は、専門家の行動からポリシーを学ぶための、データ駆動型アプローチである。
OOS(Out-of-sample)領域では信頼性の低い結果が出る傾向がある。
本稿では,契約型力学系をモデルとした政策学習フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-10T14:28:18Z) - Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement [67.1393112206885]
大規模言語モデル(LLM)は、対話的な意思決定タスクにおいてインテリジェントなエージェントとして期待されている。
本稿では,トークンレベルでのLLMの最適化に適したエントロピー拡張RL法である,エントロピー正規化トークンレベル最適化(ETPO)を導入する。
我々は,データサイエンスコード生成を多段階対話型タスクのシリーズとしてモデル化したシミュレーション環境におけるETPOの有効性を評価する。
論文 参考訳(メタデータ) (2024-02-09T07:45:26Z) - Enhancing Plasticity for First Session Adaptation Continual Learning [20.62749699589017]
クラスインクリメンタルラーニング(PLASTIC)における塑性強化テスト時間適応の導入
PLASTICはモデル安定性を維持しながら可塑性をCILに再蓄積する。
従来型と最先端のPTMベースのCILアプローチを一貫して上回ります。
論文 参考訳(メタデータ) (2023-10-17T13:06:39Z) - Learning Objective-Specific Active Learning Strategies with Attentive
Neural Processes [72.75421975804132]
学び アクティブラーニング(LAL)は、アクティブラーニング戦略自体を学ぶことを提案し、与えられた設定に適応できるようにする。
能動学習問題の対称性と独立性を利用した新しい分類法を提案する。
私たちのアプローチは、筋電図から学ぶことに基づいており、モデルに標準ではない目的に適応する能力を与えます。
論文 参考訳(メタデータ) (2023-09-11T14:16:37Z) - Improving Music Performance Assessment with Contrastive Learning [78.8942067357231]
本研究では,既存のMPAシステムを改善するための潜在的手法として,コントラスト学習について検討する。
畳み込みニューラルネットワークに適用された回帰タスクに適した重み付きコントラスト損失を導入する。
この結果から,MPA回帰タスクにおいて,コントラッシブ・ベースの手法がSoTA性能に適合し,超越できることが示唆された。
論文 参考訳(メタデータ) (2021-08-03T19:24:25Z) - DEALIO: Data-Efficient Adversarial Learning for Imitation from
Observation [57.358212277226315]
観察ifoからの模倣学習において、学習エージェントは、実演者の生成した制御信号にアクセスせずに、実演行動の観察のみを用いて実演エージェントを模倣しようとする。
近年、逆模倣学習に基づく手法は、ifO問題に対する最先端のパフォーマンスをもたらすが、データ非効率でモデルなしの強化学習アルゴリズムに依存するため、サンプルの複雑さに悩まされることが多い。
この問題は、サンプルの収集が時間、エネルギー、およびリスクの面で高いコストを被る可能性がある現実世界の設定に展開することは非現実的です。
よりデータ効率の高いifOアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-03-31T23:46:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。