論文の概要: Evolutionary Warm-Starts for Reinforcement Learning in Industrial Continuous Control
- arxiv url: http://arxiv.org/abs/2603.26750v1
- Date: Mon, 23 Mar 2026 11:17:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:44.570864
- Title: Evolutionary Warm-Starts for Reinforcement Learning in Industrial Continuous Control
- Title(参考訳): 産業連続制御における強化学習のための進化的ワームスター
- Authors: Tom Maus, Stephan Frank, Tobias Glasmachers,
- Abstract要約: 強化学習(Reinforcement Learning, RL)は, 実環境において信頼性のあるエージェントの訓練が難しいこともあって, 産業制御に応用されることは稀である。
本研究は,産業ソートベンチマークの連続的な制御適応を導入することにより,RLの進化戦略がそのような環境でどのようにサポートできるかを考察する。
CMA-ESアルゴリズムは、RLエージェントを温めるための高品質なデモンストレーションを生成するために使用される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Reinforcement learning (RL) is still rarely applied in industrial control, partly due to the difficulty of training reliable agents for real-world conditions. This work investigates how evolution strategies can support RL in such settings by introducing a continuous-control adaptation of an industrial sorting benchmark. The CMA-ES algorithm is used to generate high-quality demonstrations that warm-start RL agents. Results show that CMA-ES-guided initialization significantly improves stability and performance. Furthermore, the demonstration trajectories generated with the CMA-ES provide a strong oracle reference performance level, which is of interest in its own right. The study delivers a focused proof of concept for hybrid evolutionary-RL approaches and a basis for future, more complex industrial applications.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は, 実環境において信頼性のあるエージェントの訓練が難しいこともあって, 産業制御に応用されることは稀である。
本研究は,産業ソートベンチマークの連続的な制御適応を導入することにより,RLの進化戦略がそのような環境でどのようにサポートできるかを考察する。
CMA-ESアルゴリズムは、RLエージェントを温めるための高品質なデモンストレーションを生成するために使用される。
その結果, CMA-ES誘導初期化は安定性と性能を著しく向上させることがわかった。
さらに、CMA-ESで生成されたデモトラジェクトリは、強いオラクル参照パフォーマンスレベルを提供する。
この研究は、ハイブリッド進化RLアプローチの概念の集中的な証明と、より複雑な産業応用の基礎を提供する。
関連論文リスト
- Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning [26.103428215400697]
低ランク適応 (LoRA) の簡単なシーケンスファインチューニング (Seq. FT) は極めて強い。
VLAモデルを用いた連続RL法としてシーケンスファインタニング(Sequential Fine-Tuning)を応用した。
論文 参考訳(メタデータ) (2026-03-12T08:22:39Z) - ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning [75.73135757250806]
エージェント強化学習(ARL)は、複雑で多段階の対話的なタスクを解決するためのトレーニングエージェントにとって有望なパラダイムとして急速に注目を集めている。
初期の成果を奨励しているにもかかわらず、ARLは非常に不安定であり、しばしばトレーニングの崩壊につながる。
本稿では,制御された再現可能な環境下でのトレーニング安定性を検証した,安定したトレーニングレシピと系統的分析フレームワークであるARLArenaを提案する。
論文 参考訳(メタデータ) (2026-02-25T03:43:34Z) - ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment [20.498600810211293]
本稿では,最適強化学習ポリシーから直接サンプルを採取する学習自由推論手法を提案する。
我々のアルゴリズムであるETS (Energy-Guided Test-Time Scaling) は、オンラインモンテカルロによる重要なエネルギーの項を証明可能な収束率で推定する。
ETSはサンプリング品質を確実に保ちながら、推論遅延を大幅に低減する。
論文 参考訳(メタデータ) (2026-01-29T10:06:52Z) - Tailored Primitive Initialization is the Secret Key to Reinforcement Learning [61.29280885291581]
強化学習(RL)は、大規模言語モデル(LLM)の推論能力を高めるための強力なパラダイムとして登場した。
多様な,高品質な推論プリミティブによるLLMの初期化は,安定かつサンプル効率のよいRLトレーニングを実現する上で不可欠である,と我々は主張する。
そこで我々は,新しい推論プリミティブを自動的に発見し,キュレートする微調整パイプラインであるTailorを提案する。
論文 参考訳(メタデータ) (2025-11-16T03:12:40Z) - Revisiting Entropy in Reinforcement Learning for Large Reasoning Models [54.96908589622163]
検証可能な報酬(RLVR)を用いた強化学習で訓練した大規模言語モデルのエントロピーダイナミクスについて検討する。
以上の結果から,RLVRでトレーニングしたLDMのエントロピーに影響を及ぼす重要な要因として,非政治的更新数,トレーニングデータの多様性,最適化目標におけるクリッピング閾値が示唆された。
論文 参考訳(メタデータ) (2025-11-08T12:50:41Z) - From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR [92.51110344832178]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデル(LLM)の推論能力を高めるための強力なパラダイムとして登場した。
本技術報告では,RLVRにおける探査能力の体系的調査について述べる。
論文 参考訳(メタデータ) (2025-08-11T01:26:16Z) - Leveraging Genetic Algorithms for Efficient Demonstration Generation in Real-World Reinforcement Learning Environments [0.8602553195689513]
強化学習(Reinforcement Learning, RL)は、特定の実世界の産業応用において大きな可能性を証明している。
本研究では,遺伝的アルゴリズム(GA)をRL性能向上のメカニズムとして活用することを検討した。
本稿では,GAによる専門家による実証実験を政策学習の強化に活用する手法を提案する。
論文 参考訳(メタデータ) (2025-07-01T14:04:17Z) - GuideLight: "Industrial Solution" Guidance for More Practical Traffic Signal Control Agents [12.497518428553734]
強化学習(RL)に基づく交通信号制御(TSC)法は,従来の手法よりも優れていることが証明されている。
しかし、ほとんどのRL法は、入力、出力、サイクル-フロー関係という3つの要因により、実世界で適用した場合に困難に直面している。
我々は、RLエージェントをガイドする業界ソリューションを提案する。
論文 参考訳(メタデータ) (2024-07-15T15:26:10Z) - Surrogate Empowered Sim2Real Transfer of Deep Reinforcement Learning for
ORC Superheat Control [12.567922037611261]
本稿では,ORCスーパーヒート制御のためのSim2Real転送学習型DRL制御法を提案する。
実験結果から,ORC制御問題におけるDRLのトレーニング速度を大幅に向上することがわかった。
論文 参考訳(メタデータ) (2023-08-05T01:59:44Z) - Towards Standardizing Reinforcement Learning Approaches for Stochastic
Production Scheduling [77.34726150561087]
強化学習はスケジューリングの問題を解決するのに使える。
既存の研究は、コードが利用できない複雑なシミュレーションに依存している。
から選ぶべきRLの設計の広大な配列があります。
モデル記述の標準化 - 生産セットアップとRL設計の両方 - と検証スキームは前提条件です。
論文 参考訳(メタデータ) (2021-04-16T16:07:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。