論文の概要: Continual Evolution Strategies in Control Tasks
- arxiv url: http://arxiv.org/abs/2608.13600v1
- Date: Mon, 03 Aug 2026 19:05:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-23 14:54:39.912721
- Title: Continual Evolution Strategies in Control Tasks
- Title(参考訳): 制御課題における継続的進化戦略
- Authors: Nicola Pitzalis, Eleni Nisioti, Antonio Carta, Davide Bacciu, Andrea Cossu,
- Abstract要約: 進化戦略(ES: Evolution Strategies)は、エージェントが従来のタスクを忘れることなくタスクの変更に適応しなければならない連続的な制御のための手法である。
リプレイは保持を大幅に改善し、ポジティブな転送を誘発する一方、より大きなリプレイ予算は可塑性を低下させる。
- 参考スコア(独自算出の注目度): 19.59222384773641
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study Evolution Strategies (ES) for continual control, where agents must adapt to changing tasks without forgetting previous ones. On sequential MuJoCo locomotion tasks, naive ES suffers from severe catastrophic forgetting. Replay substantially improves retention and can induce positive transfer, while larger replay budgets reduce plasticity. Overall, these results show that ES can support continual adaptation in control and that replay is an effective mechanism for mitigating forgetting.
- Abstract(参考訳): 進化戦略(ES: Evolution Strategies)は、エージェントが従来のタスクを忘れることなくタスクの変更に適応しなければならない連続的な制御のための手法である。
連続した MuJoCo の移動タスクでは、ナイーブESは深刻な破滅的な忘れ込みに悩まされる。
リプレイは保持を大幅に改善し、ポジティブな転送を誘発する一方、より大きなリプレイ予算は可塑性を低下させる。
これらの結果から,ESは制御の連続的適応をサポートし,リプレイは忘れの軽減に有効なメカニズムであることが示唆された。
関連論文リスト
- HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation [71.16738415436458]
本稿では、生の障害フィードバックを補正管理のアクティブソースに変換するフレームワークであるReflection-Enhanced Self-Distillation(RESD)を紹介する。
RESDは、局所的なエラーを診断するために振り返りリフレクションを生成し、持続的なグローバルなプレイブックをキュレートすることで、障害の軌跡を解釈する。
複数の連続学習課題に対する実証的な評価は、RESDが標準の自己蒸留ベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-12T20:46:05Z) - Do Self-Evolving Agents Forget? Capability Degradation and Preservation in Lifelong LLM Agent Adaptation [29.927620139561327]
新たなタスク分布に適応することで、すべての主要な進化チャネルにおいて、以前獲得した能力を段階的に劣化させることができることを示す。
本稿では, 連続適応時の破壊能力ドリフトを制約する一般的な安定化原理であるemphCapability-Preserving Evolution (CPE)を提案する。
以上の結果から, 安定な長期自己進化剤は, 新たな能力を得るだけでなく, 学習済みのものを明示的に保存する必要があることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T04:20:24Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - CHIP: Adaptive Compliance for Humanoid Control through Hindsight Perturbation [70.5382178207975]
hIsight Perturbation (CHIP)は、制御可能なエンドエフェクタ剛性を実現するプラグイン・アンド・プレイモジュールである。
CHIPの実装は簡単で、データ拡張も追加の報酬チューニングも必要ありません。
そこで本研究では,CHIPでトレーニングした汎用モーショントラッキングコントローラが,多種多様な操作タスクを実行できることを示す。
論文 参考訳(メタデータ) (2025-12-16T18:56:04Z) - Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal [54.93261535899478]
強化学習のロボット制御のような現実世界の応用では、タスクが変化し、新しいタスクが順次発生する。
この状況は、タスクの変更に適応し、獲得した知識を保持するエージェントを訓練する上で、可塑性-安定トレードオフという新たな課題を生じさせる。
本研究では,連続拡散器(Continuous diffuser,CoD)と呼ばれるリハーサルに基づく連続拡散モデルを提案する。
論文 参考訳(メタデータ) (2024-09-04T08:21:47Z) - Growing Q-Networks: Solving Continuous Control Tasks with Adaptive Control Resolution [51.83951489847344]
ロボット工学の応用において、スムーズな制御信号はシステム摩耗とエネルギー効率を減らすために一般的に好まれる。
本研究では,離散的な動作空間を粗い状態から細かい制御分解能まで拡大することにより,この性能ギャップを埋めることを目的とする。
我々の研究は、値分解とアダプティブ・コントロール・リゾリューションが組み合わさることで、単純な批判のみのアルゴリズムが得られ、連続制御タスクにおいて驚くほど高い性能が得られることを示唆している。
論文 参考訳(メタデータ) (2024-04-05T17:58:37Z) - Reset & Distill: A Recipe for Overcoming Negative Transfer in Continual Reinforcement Learning [26.922046048997306]
本研究では,連続強化学習アルゴリズムにおける負の伝達問題を克服するため,Reset & Distill (R&D) を開発した。
R&Dは、エージェントのオンラインアクターと批評家ネットワークをリセットして新しいタスクを学ぶ戦略と、オンラインアクターから知識を抽出するオフライン学習ステップを組み合わせる。
本研究は,CRLの陰性移行を検討することの重要性を強調し,その有害性を軽減するためにR&Dのような堅牢な戦略の必要性を強調した。
論文 参考訳(メタデータ) (2024-03-08T05:37:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。