論文の概要: Sample-Efficient Pareto Front Modeling for Energy-Aware Reinforcement Learning Using Bayesian Optimization
- arxiv url: http://arxiv.org/abs/2607.03140v1
- Date: Fri, 03 Jul 2026 09:28:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.53128
- Title: Sample-Efficient Pareto Front Modeling for Energy-Aware Reinforcement Learning Using Bayesian Optimization
- Title(参考訳): ベイズ最適化を用いたエネルギーを考慮した強化学習のためのサンプル効率の良いパレートフロントモデリング
- Authors: Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender,
- Abstract要約: この研究は、最適なトレードオフポリシーを見つけるために、ウェイトセレクションプロセスを自動化するという課題に対処する。
重み選択過程を多目的ベイズ最適化(MOBO)問題として定式化する。
1-DoFピッチ制御のための物理クアンサー・エアロ2テストベッドを用いて,本実験の結果から,望まれる超体積改善(qEHVI)獲得関数を用いたMOBOアプローチが一様グリッドサンプリングより一貫して優れていることが示された。
- 参考スコア(独自算出の注目度): 0.40831821256838124
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Industrial automation increasingly demands control strategies that balance operational performance with strict energy efficiency requirements. A common approach to solving this multi-objective problem, particularly within the framework of reinforcement learning (RL), is to formulate a single, scalar reward function that linearly combines the competing objectives. However, the manual weighting of these different objectives is heavily reliant on domain intuition, incredibly time-consuming, prone to human bias, and frequently fails to uncover optimal trade-off solutions. This work addresses the critical challenge of automating the weight selection process to systematically and efficiently discover the Pareto front of optimal trade-off policies. We formulate the weight selection process as a multi-objective Bayesian optimization (MOBO) problem and evaluate its sample efficiency against a standard uniform grid search baseline. Using a physical Quanser Aero 2 testbed configured for 1-DoF pitch control, our results demonstrate that the MOBO approach, utilizing the expected hypervolume improvement (qEHVI) acquisition function, consistently outperforms uniform grid sampling. MOBO achieves superior hypervolume and maximum spread, successfully identifying high-quality, diverse trade-off policies with a reduced evaluation budget, thereby enabling highly efficient energy-aware control in complex mechatronic systems.
- Abstract(参考訳): 産業自動化は、運用性能と厳格なエネルギー効率要件のバランスをとる制御戦略をますます要求する。
この多目的問題の解法は、特に強化学習(RL)の枠組みにおいて、競合する目的を線形に組み合わせた単一のスカラー報酬関数を定式化するのが一般的である。
しかしながら、これらの異なる目的を手動で重み付けすることは、ドメインの直感に大きく依存し、信じられないほど時間がかかり、人間の偏見に悩まされがちで、しばしば最適なトレードオフソリューションを明らかにするのに失敗する。
この研究は、最適トレードオフポリシーのParetoフロントを系統的かつ効率的に発見するために、ウェイトセレクションプロセスを自動化するという重要な課題に対処する。
重み選択過程を多目的ベイズ最適化(MOBO)問題として定式化し、そのサンプル効率を標準の一様グリッド探索ベースラインに対して評価する。
1-DoFピッチ制御のための物理クアンサー・エアロ2テストベッドを用いて,本実験の結果から,望まれる超体積改善(qEHVI)獲得関数を用いたMOBOアプローチが一様グリッドサンプリングより一貫して優れていることが示された。
MOBOは優れたハイパーボリュームと最大展開を実現し、評価予算の削減による高品質で多様なトレードオフポリシーの特定に成功し、複雑なメカトロニクス系における高効率なエネルギー認識制御を実現する。
関連論文リスト
- A Multi-Agent system for Multi-Objective constrained optimization [0.22561862507101035]
本稿では,マルチエージェントRLによるバランス問題へのアプローチであるMAMOを提案する。
MAMOは、学習問題として報酬重みの選択を定式化することにより、目的設計からタスク実行を分離する。
論文 参考訳(メタデータ) (2026-06-18T13:47:28Z) - Towards Pareto-Optimal Tool-Integrated Agents with Pareto Ranking Policy Optimization [54.855135506924775]
ツールを用いた大規模言語モデル(LLM)を競合する目的の下で整列するための2段階多目的最適化フレームワークを提案する。
この設計は、複数の矛盾する目的に対してきめ細かいアクションレベルの最適化を可能にする。
論文 参考訳(メタデータ) (2026-06-15T01:58:07Z) - An Online Machine Learning Multi-resolution Optimization Framework for Energy System Design Limit of Performance Analysis [0.24629531282150877]
本稿では,達成可能な性能のアーキテクチャ固有の上限を推定する,オンライン・機械学習高速化型マルチレゾリューション最適化フレームワークを提案する。
提案したマルチレゾリューション戦略により,ルールベースのコントローラと比較して,アーキテクチャと運用性能のギャップを最大42%削減できることを示す。
論文 参考訳(メタデータ) (2026-04-01T18:19:45Z) - PCHC: Enabling Preference Conditioned Humanoid Control via Multi-Objective Reinforcement Learning [50.63196995993855]
多目的強化学習(MORL)を活用してPCHC(Preference-Conditioned Humanoid Control)を実現する新しいフレームワークを提案する。
当社のフレームワークは、単一の嗜好条件のポリシーを多種多様な行動を示すために有効である。
論文 参考訳(メタデータ) (2026-03-25T07:55:37Z) - Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization [61.55616421408666]
低高度経済ネットワーク(LAENets)は、航空監視、環境検知、セマンティックデータ収集など、様々な応用を可能にしている。
オンボードビジョン(VLM)は、リアルタイムな推論を提供するが、オンボードの動的ネットワーク条件は限られている。
動的LEENet条件下での通信効率を向上させるUAV対応LEENetシステムを提案する。
論文 参考訳(メタデータ) (2025-10-11T05:11:21Z) - TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making [75.29820290660065]
本稿では,効果的な具体的意思決定のための思考中心推論最適化(TCPO)を提案する。
モデルの中間的推論プロセスの整合性を強調し、モデル劣化の問題を緩和する。
ALFWorld環境での実験では、平均成功率は26.67%であり、RL4VLMよりも6%向上している。
論文 参考訳(メタデータ) (2025-09-10T11:16:21Z) - Preference Optimization for Combinatorial Optimization Problems [54.87466279363487]
強化学習(Reinforcement Learning, RL)は、ニューラルネットワーク最適化のための強力なツールとして登場した。
大幅な進歩にもかかわらず、既存のRLアプローチは報酬信号の減少や大規模な行動空間における非効率な探索といった課題に直面している。
統計的比較モデルを用いて定量的報酬信号を定性的選好信号に変換する新しい手法であるPreference Optimizationを提案する。
論文 参考訳(メタデータ) (2025-05-13T16:47:00Z) - Pontryagin Optimal Control via Neural Networks [19.546571122359534]
我々は,ニューラルネットワークをポントリャーギンの最大原理(PMP)と統合し,NN-PMP-Gradient の効率的なフレームワークを提案する。
結果として生じるコントローラは、未知の複雑な力学を持つシステムに実装することができる。
モデルフリーおよびモデルベース強化学習(RL)アルゴリズムと比較して, NN-PMP-Gradientは, 制御目的の観点から高いサンプル効率と性能を実現する。
論文 参考訳(メタデータ) (2022-12-30T06:47:03Z) - Efficient Model-Based Multi-Agent Mean-Field Reinforcement Learning [89.31889875864599]
マルチエージェントシステムにおける学習に有効なモデルベース強化学習アルゴリズムを提案する。
我々の理論的な貢献は、MFCのモデルベース強化学習における最初の一般的な後悔の限界である。
コア最適化問題の実用的なパラメトリゼーションを提供する。
論文 参考訳(メタデータ) (2021-07-08T18:01:02Z) - Multi-Level Evolution Strategies for High-Resolution Black-Box Control [0.2320417845168326]
本稿では進化戦略(ES)にマルチレベル(m-lev)機構を導入する。
これは、決定変数の詳細な離散化の恩恵を受けることができる、グローバルな最適化問題のクラスに対処する。
論文 参考訳(メタデータ) (2020-10-04T09:24:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。