論文の概要: Counter-Dyna: Data-Efficient RL-Based HVAC Control using Counterfactual Building Models
- arxiv url: http://arxiv.org/abs/2605.04555v1
- Date: Wed, 06 May 2026 06:58:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.685077
- Title: Counter-Dyna: Data-Efficient RL-Based HVAC Control using Counterfactual Building Models
- Title(参考訳): Counter-Dyna:非現実的建物モデルを用いたデータ効率の良いRLベースHVAC制御
- Authors: Jan Marco Ruiz de Vargas, Fabian Raisch, Zoltan Nagy, Pierre Pinson, Christoph Goebel,
- Abstract要約: モデルベース強化学習(MBRL)は、建物におけるデータ効率のよいエネルギー管理に有望なアプローチを提供する。
Counter-DynaはDynaのデータ効率を高める方法である。
本結果から, 仮想展開シナリオにおけるコスト削減ポテンシャルは5.3%から17.0%であった。
- 参考スコア(独自算出の注目度): 2.08239023124927
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Model-based reinforcement learning (MBRL) offers a promising approach for data-efficient energy management in buildings, combining the strengths of predictive modeling and reinforcement learning. While previous MBRL methods applied to HVAC control have reduced training data requirements, they still require several months of interaction with the building to learn a satisfactory control policy. A key reason is that existing surrogate models attempt to predict the entire state-space, including weather and electricity prices that are unaffected by control actions, or completely ignore these variables. Addressing these issues, we propose Counter-Dyna, a method that enhances the data-efficiency of Dyna, an MBRL method. We create data-efficient counterfactual surrogate models (CSM) by leveraging invariances in the state-space. Using a CSM in Dyna speeds up RL training measured in environment interaction data compared to previous results. In comparison with previous state-of-the-art that used 6-12 months of environment interactions, our method needs only 5 weeks. We evaluate our method in a large simulation study using the literature standard BOPTEST framework and proximal policy algorithm (PPO) as the RL algorithm. Our results show cost-saving potentials of 5.3% to 17.0% in a hypothetical deployment scenario. Our work is a significant step towards making real-world deployment of RL algorithms in HVAC control practically viable.
- Abstract(参考訳): モデルベース強化学習(MBRL)は、予測モデリングと強化学習の強みを組み合わせることで、建物内のデータ効率のよいエネルギー管理に有望なアプローチを提供する。
HVAC制御に適用される従来のMBRLメソッドは、トレーニングデータ要求を減らしているが、良好な制御ポリシーを学ぶためには、建物との数ヶ月のインタラクションが必要である。
主要な理由は、既存のサロゲートモデルが、コントロールアクションの影響を受けない天気や電力価格など、州全体の予測を試みることや、これらの変数を完全に無視することである。
MBRL法であるDynaのデータ効率を向上させる手法であるCounter-Dynaを提案する。
状態空間の不変性を利用して、データ効率の良い反ファクト的代理モデル(CSM)を作成する。
ダイナでCSMを使用することで、環境相互作用データで測定されたRLトレーニングを以前の結果と比較して高速化する。
6~12ヶ月の環境相互作用を用いた従来の最先端技術と比較して,本手法は5週間しか必要としなかった。
文献標準BOPTESTフレームワークとPPOをRLアルゴリズムとして用いた大規模シミュレーション研究において,本手法の評価を行った。
本結果から, 仮想展開シナリオにおけるコスト削減ポテンシャルは5.3%から17.0%であった。
我々の研究は,HVAC制御における実世界のRLアルゴリズムの展開を実現するための重要なステップである。
関連論文リスト
- Data-Efficient RLVR via Off-Policy Influence Guidance [84.60336960383867]
本研究は,学習目標に対する各データポイントの寄与を推定するために,影響関数を用いた理論的基礎的アプローチを提案する。
textbfCurriculum textbfRL with textbfOff-textbfPolicy textInfluence Guide (textbfCROPI) は多段階のRLフレームワークで、現在のポリシーにおいて最も影響力のあるデータを反復的に選択する。
論文 参考訳(メタデータ) (2025-10-30T13:40:52Z) - Comparative Field Deployment of Reinforcement Learning and Model Predictive Control for Residential HVAC [6.84547325352035]
強化学習(Reinforcement Learning)は、自動化と適応性の向上を約束するが、現実の住宅環境における実践的応用は、ほとんど実証されていない。
実験の結果,RLは工学的オーバーヘッドを低減させるが,モデル精度と運用上の堅牢性において,実用的なトレードオフをもたらすことがわかった。
論文 参考訳(メタデータ) (2025-10-01T21:36:04Z) - Experimental evaluation of offline reinforcement learning for HVAC control in buildings [12.542463083734614]
建物における動的HVAC制御のために, 強化学習(RL)技術がますます研究されている。
本稿では,最先端のオフラインRLアルゴリズムの長所と短所を包括的に評価する。
論文 参考訳(メタデータ) (2024-08-15T07:25:52Z) - Go Beyond Black-box Policies: Rethinking the Design of Learning Agent
for Interpretable and Verifiable HVAC Control [3.326392645107372]
熱力学モデルと過去のデータから抽出した決定木を用いてHVACコントローラを再設計することでボトルネックを克服する。
本手法は68.4%のエネルギーを節約し, 人間の快適度を14.8%向上させる。
論文 参考訳(メタデータ) (2024-02-29T22:42:23Z) - Data-Efficient Task Generalization via Probabilistic Model-based Meta
Reinforcement Learning [58.575939354953526]
PACOH-RLはメタ強化学習(Meta-RL)アルゴリズムである。
既存のMeta-RLメソッドは豊富なメタ学習データを必要とし、ロボット工学などの設定で適用性を制限する。
実験の結果,PACOH-RLはモデルベースRLおよびモデルベースMeta-RLベースラインよりも高い性能を示し,新しい動的条件に適応することがわかった。
論文 参考訳(メタデータ) (2023-11-13T18:51:57Z) - Efficient Learning of Voltage Control Strategies via Model-based Deep
Reinforcement Learning [9.936452412191326]
本稿では,電力系統の短期電圧安定性問題に対する緊急制御戦略を設計するためのモデルベース深部強化学習(DRL)手法を提案する。
近年, モデルフリーDRL方式の電力系統への適用が期待できるが, モデルフリー方式はサンプル効率の低下と訓練時間に悩まされている。
本稿では,Deep Neural Network(DNN)に基づく動的代理モデルを用いた新しいモデルベースDRLフレームワークを提案する。
論文 参考訳(メタデータ) (2022-12-06T02:50:53Z) - Mastering the Unsupervised Reinforcement Learning Benchmark from Pixels [112.63440666617494]
強化学習アルゴリズムは成功するが、エージェントと環境の間の大量の相互作用を必要とする。
本稿では,教師なしモデルベースRLを用いてエージェントを事前学習する手法を提案する。
我々はReal-Word RLベンチマークにおいて、適応中の環境摂動に対する抵抗性を示唆し、堅牢な性能を示す。
論文 参考訳(メタデータ) (2022-09-24T14:22:29Z) - An Experimental Design Perspective on Model-Based Reinforcement Learning [73.37942845983417]
環境からの状態遷移を観察するのは費用がかかる。
標準RLアルゴリズムは通常、学習するために多くの観測を必要とする。
本稿では,マルコフ決定過程について,状態-作用対がどの程度の情報を提供するかを定量化する獲得関数を提案する。
論文 参考訳(メタデータ) (2021-12-09T23:13:57Z) - Development of a Soft Actor Critic Deep Reinforcement Learning Approach
for Harnessing Energy Flexibility in a Large Office Building [0.0]
本研究は,Soft Actor Critic'(SAC)に基づくDeep Reinforcement Learning(DRL)の新規適用と研究に関するものである。
SACは、連続的なアクションスペースを処理できるモデルフリーのDRL技術です。
論文 参考訳(メタデータ) (2021-04-25T10:33:35Z) - Information Theoretic Model Predictive Q-Learning [64.74041985237105]
本稿では,情報理論的MPCとエントロピー正規化RLとの新たな理論的関連性を示す。
バイアスモデルを利用したQ-ラーニングアルゴリズムを開発した。
論文 参考訳(メタデータ) (2019-12-31T00:29:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。