論文の概要: Continual Reinforcement Learning with Neuroevolution
- arxiv url: http://arxiv.org/abs/2610.01583v2
- Date: Fri, 02 Oct 2026 09:18:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.994951
- Title: Continual Reinforcement Learning with Neuroevolution
- Title(参考訳): 神経進化を伴う連続強化学習
- Abstract要約: ニューロエボリューション (NE) アルゴリズムは, ニューラルネットワークの個体群に対する突然変異と選択を通じて, 重み空間を直接探索することを示した。
ESは安定性と塑性のトレードオフを常に達成し,GAは最もプラスチックな方法であるが,ES以上のことは忘れてはならない。
これらの結果から, NE は連続的タスク変化下での RL の代替品として成立し, 重み空間の摂動下でのトレーニングが, より広範に学習するための有用なメカニズムである可能性が示唆された。
- 参考スコア(独自算出の注目度): 6.450037005484835
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite many studies about causes and remedies of plasticity loss in Reinforcement Learning (RL) under continual task changes, no RL method has yet consistently achieved a good balance between adaptation and forgetting. Here we turn to an alternative optimization paradigm, neuroevolution (NE): algorithms that search directly in weight space through mutation and selection over a population of neural networks. Across a wide array of environments and environmental changes, with policies ranging from a few hundred parameters to million-parameter networks, we compare evolution strategies (ES) and genetic algorithms (GAs) against state-of-the-art continual RL variants and population-based RL. ES most consistently achieves a good stability-plasticity trade-off, while the GA is the most plastic method but forgets more than ES. To explain this, we study the return landscape around each method's solutions. ES finds the widest neighborhoods, i.e.\ regions of weight space in which perturbed policies still solve the task, and the size of the overlap between the neighborhoods of consecutive tasks correlates with a method's stability-plasticity trade-off. Rewarding behavioral diversity in a GA through novelty search makes the population even more plastic, at the cost of forgetting. Finally, symptoms of plasticity loss commonly reported in RL do not transfer to NE. Overall, these results establish NE as a competitive alternative to RL under continual task changes, and suggest that training under perturbations in weight space may be a useful mechanism for continual learning more broadly.
- Abstract(参考訳): 連続的なタスク変化下での強化学習(RL)における可塑性損失の原因と対策に関する多くの研究にもかかわらず、RL法はまだ適応と忘れのバランスを保っていない。
ここでは、ニューラルネットワークの個体群に対する突然変異と選択を通じて重量空間を直接探索するアルゴリズム、Neuroevolution(NE)という代替最適化パラダイムに目を向ける。
進化戦略(ES)と遺伝的アルゴリズム(GA)を、最先端の連続RL変異体や人口ベースRLと比較する。
ESは安定性と塑性のトレードオフを常に達成し、GAは最もプラスチックな方法であるがES以上のことを忘れている。
これを説明するために,各手法の解に関する回帰景観について検討する。
ESは、最も広い領域、すなわち、摂動政策がまだタスクを解決している重量空間の領域、および連続するタスクの近傍の重複の大きさは、メソッドの安定性と塑性のトレードオフと相関している。
斬新な探索によってGAの行動多様性を抑えることで、人口はさらにプラスチックになり、忘れてしまう。
最後に、RLで一般的に報告される可塑性損失の症状はNEに転移しない。
これらの結果は,連続的な課題変化下でのRLの代替としてNEが確立され,重み空間の摂動下でのトレーニングが,より広範に学習する上で有用なメカニズムであることが示唆された。
関連論文リスト
- The Rank and Gradient Lost in Non-stationarity: Sample Weight Decay for Mitigating Plasticity Loss in Reinforcement Learning [62.72522261010872]
深部強化学習(RL)は、非定常性の性質により、可塑性の喪失に苦しむ。
ネットワーク最適化の理論的観点から, 可塑性損失問題について検討する。
勾配等級を復元する軽量な手法であるサンプル重み決定法を提案する。
論文 参考訳(メタデータ) (2026-04-02T11:29:46Z) - AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization [61.535567824938205]
本稿では,LLMによる進化を階層的適応最適化問題として再構成するフレームワークであるAdaEvolveを紹介する。
AdaEvolveは185の異なるオープンエンド最適化問題において、オープンエンドベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-23T18:45:31Z) - Discovering Multiagent Learning Algorithms with Large Language Models [8.649235365712004]
我々は,大規模言語モデルを用いた進化的符号化エージェントであるAlphaEvolveを用いて,新しいマルチエージェント学習アルゴリズムを自動発見する。
ゲーム理論学習の2つの異なるパラダイムのための新しい変種を進化させることにより、この枠組みの一般化を実証する。
論文 参考訳(メタデータ) (2026-02-18T22:41:00Z) - Synergizing Reinforcement Learning and Genetic Algorithms for Neural Combinatorial Optimization [25.633698252033756]
本稿では,DRLの学習効率をGAのグローバル検索能力と相乗化するための進化的拡張機構を提案する。
EAMは、学習されたポリシーからソリューションを生成し、クロスオーバーや突然変異といったドメイン固有の遺伝子操作によってそれらを精製することで機能する。
EAMは、アテンションモデル、POMO、SymNCOのような最先端のDRLソルバとシームレスに統合できる。
論文 参考訳(メタデータ) (2025-06-11T05:17:30Z) - Evolutionary Policy Optimization [47.30139909878251]
オンライン強化学習(RL)アルゴリズムは、高いパフォーマンスとトレーニング安定性のために広く利用されているが、より大きなバッチサイズでスケールするのに苦労している。
本稿では、EAのスケーラビリティと多様性と、政策勾配の性能と安定性を組み合わせたハイブリッドである進化的政策最適化(EPO)を提案する。
論文 参考訳(メタデータ) (2025-03-24T18:08:54Z) - Survival of the Fittest: Evolutionary Adaptation of Policies for Environmental Shifts [0.15889427269227555]
進化ゲーム理論(EGT)にインスパイアされた適応的再学習アルゴリズムを開発する。
ERPOは、ポリシー適応の高速化、平均報酬の向上、およびポリシー適応の計算コストの削減を示す。
論文 参考訳(メタデータ) (2024-10-22T09:29:53Z) - Agent based modelling for continuously varying supply chains [4.163948606359882]
本稿では, エージェントが様々なサプライチェーン問題を制御できるかどうかを検討する。
最先端の強化学習(RL)アルゴリズムを2つ比較した。
結果は、バッチ環境で採用されるリーン戦略が、さまざまな製品を持つ環境で採用されている戦略と異なることを示している。
論文 参考訳(メタデータ) (2023-12-24T15:04:46Z) - Variance-Reduced Gradient Estimation via Noise-Reuse in Online Evolution
Strategies [50.10277748405355]
Noise-Reuse Evolution Strategies (NRES) は、非バイアスのオンライン進化戦略の一般的なクラスである。
NRESの結果は既存のAD法やES法よりも早く,様々なアプリケーションにまたがるウォールクロック時間とステップ数で収束することを示す。
論文 参考訳(メタデータ) (2023-04-21T17:53:05Z) - Evolving Pareto-Optimal Actor-Critic Algorithms for Generalizability and
Stability [67.8426046908398]
汎用性と安定性は,実世界における強化学習(RL)エージェントの運用において重要な2つの目的である。
本稿では,アクター・クリティック・ロス関数の自動設計法であるMetaPGを提案する。
論文 参考訳(メタデータ) (2022-04-08T20:46:16Z) - Edge Rewiring Goes Neural: Boosting Network Resilience via Policy
Gradient [62.660451283548724]
ResiNetは、さまざまな災害や攻撃に対する回復力のあるネットワークトポロジを発見するための強化学習フレームワークである。
ResiNetは複数のグラフに対してほぼ最適のレジリエンス向上を実現し,ユーティリティのバランスを保ちながら,既存のアプローチに比べて大きなマージンを持つことを示す。
論文 参考訳(メタデータ) (2021-10-18T06:14:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。