論文の概要: Accelerating Reinforcement Learning for Wind Farm Control via Expert Demonstrations
- arxiv url: http://arxiv.org/abs/2604.22794v1
- Date: Mon, 13 Apr 2026 12:25:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:14.187476
- Title: Accelerating Reinforcement Learning for Wind Farm Control via Expert Demonstrations
- Title(参考訳): 専門家による風力発電制御のための強化学習の高速化
- Authors: Marcus Binder Nilsen, Julian Quick, Tuhfe Göçmen, Nikolay Dimitrov, Pierre-Elouan Réthoré,
- Abstract要約: 本研究では、定常覚醒モデルからのドメイン知識がトレーニングを加速し、初期制御性能を向上させることができるかどうかを検討する。
本稿では,PyWakeをベースとした定常状態を動的覚醒シミュレーションに配置することにより,専門家によるデモンストレーションを生成する事前学習手法を提案する。
2x2ウィンドファームの実験では、事前学習がコストのかかる初期学習フェーズをなくすことが示されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) offers a promising approach for adaptive wind farm flow control, yet its practical deployment is hindered by slow training convergence and poor initial performance, factors that could translate to years of reduced power output if an untrained agent were deployed directly. This work investigates whether domain knowledge from steady-state wake models can accelerate RL training and improve initial controller performance. We propose a pretraining methodology in which expert demonstrations are generated by deploying a PyWake-based steady-state optimizer within a dynamic wake simulation (WindGym), then used to initialize both the actor and critic networks of a Soft Actor-Critic agent via behavior cloning. Experiments on a 2x2 wind farm show that pretraining eliminates the costly initial learning phase: while an untrained agent underperforms the greedy zero-yaw baseline by approximately 12%, pretraining raises initial performance to near-baseline levels. During online fine-tuning, all configurations converge within 250,000 environment steps to achieve similar performance, ultimately exceeding that of a lookup-table controller, which reaches approximately 7% power gain after 500,000 steps.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、適応型風力発電フロー制御のための有望なアプローチを提供するが、その実践的展開は、訓練の収束が遅く、初期性能が低かったために妨げられる。
本研究では、定常ウェイクモデルからのドメイン知識がRLトレーニングを加速し、初期制御性能を向上させることができるかどうかを検討する。
動的ウェイクシミュレーション(WindGym)にPyWakeベースの定常状態オプティマイザを配置し,ソフトアクタ・クリティカルエージェントのアクタネットワークと批評家ネットワークの両方を動作クローンにより初期化する事前学習手法を提案する。
2x2ウィンドファームの実験では、プレトレーニングはコストのかかる初期学習フェーズを排除し、未訓練のエージェントがグリーディゼロヨーベースラインを約12%過小評価する一方で、プレトレーニングは初期性能をほぼベースラインレベルまで向上させる。
オンラインの微調整では、すべての構成が25万の環境ステップに収まり、同様のパフォーマンスを達成する。
関連論文リスト
- From Prior to Pro: Efficient Skill Mastery via Distribution Contractive RL Finetuning [17.846597717733058]
DICE-RLは、強化学習を用いて事前訓練された生成ロボットポリシーを洗練するフレームワークである。
事前訓練された行動は、オンラインのフィードバックから高精度な行動を強化することで、ハイパフォーマンスな「プロ」ポリシーに転換する。
実験と解析により,DICE-RLは高い安定性と試料効率で性能を確実に向上することが示された。
論文 参考訳(メタデータ) (2026-03-10T22:49:46Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - First Order Model-Based RL through Decoupled Backpropagation [10.963895023346879]
勾配計算から軌道生成を分離する手法を提案する。
本手法は,SHACなどの特殊な移動のサンプル効率と速度を実現する。
我々は、ベンチマーク制御タスクにおける勾配アルゴリズムを実証的に検証し、実際のGo2四足歩行ロボット上での有効性を実証する。
論文 参考訳(メタデータ) (2025-08-29T19:55:25Z) - Fast Adaptation with Behavioral Foundation Models [82.34700481726951]
教師なしゼロショット強化学習は、行動基礎モデルの事前学習のための強力なパラダイムとして登場した。
有望な結果にもかかわらず、ゼロショットポリシーは、教師なしのトレーニングプロセスによって引き起こされるエラーにより、しばしば準最適である。
本稿では,事前訓練されたBFMの低次元タスク埋め込み空間を探索し,ゼロショットポリシーの性能を急速に向上させる高速適応手法を提案する。
論文 参考訳(メタデータ) (2025-04-10T16:14:17Z) - ExPLoRA: Parameter-Efficient Extended Pre-Training to Adapt Vision Transformers under Domain Shifts [52.1635661239108]
本稿では,事前学習された視覚変換器(ViT)のドメインシフト下での伝達学習を改善するために,ExPLoRAを提案する。
我々の実験は、衛星画像の最先端の成果を実証し、完全な事前学習や微調整のViTよりも優れています。
論文 参考訳(メタデータ) (2024-06-16T15:14:56Z) - Efficient Stagewise Pretraining via Progressive Subnetworks [53.00045381931778]
一般的な見方では、レイヤのドロップのような段階的なドロップ戦略は、スタック方式のアプローチと比べて効果がない。
本稿では, 適切な設計で, 戦略の廃止は, 積み重ね手法よりも競争力があることを示すことによって, この概念に挑戦する。
本稿では,各ステップでランダムサブネットワークのみを選択し,訓練し,段階的に拡大するランダムパートトレーニング(RAPTR)を提案する。
論文 参考訳(メタデータ) (2024-02-08T18:49:09Z) - Accelerating Training of Transformer-Based Language Models with
Progressive Layer Dropping [24.547833264405355]
提案手法は, サンプルあたり平均24%の時間短縮を実現し, プレトレーニングをベースラインの2.5倍の速度で行うことができる。
トレーニング済みのモデルでは,より高速ながら,強力な知識伝達能力を備え,ベースラインよりも高いGLUEスコアを達成できる。
論文 参考訳(メタデータ) (2020-10-26T06:50:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。