論文の概要: Efficient Heteroscedastic Bayesian Optimization for Risk-Aware AutoRL
- arxiv url: http://arxiv.org/abs/2607.26680v1
- Date: Wed, 29 Jul 2026 09:31:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.612036
- Title: Efficient Heteroscedastic Bayesian Optimization for Risk-Aware AutoRL
- Title(参考訳): リスクを考慮したオートRLのための効率よいヘテロセダスティックベイズ最適化
- Authors: Mingxuan Che, Tsung-Yuan Tseng, Theresa Eimer, Marius Lindauer, Alexander von Rohr,
- Abstract要約: 強化学習(Reinforcement Learning, RL)は、様々な複雑なタスクにおいて顕著な成功を収めている。
学習結果の平均値と分散値の両方をモデル化するために, 効率よく, リスクに配慮したヘテロセダスティックベイズ最適化(ERAHBO)を提案する。
ERAHBOは、トレーニング実行間のばらつきを低減しつつ、高い平均リターンを達成するHP構成を特定することを目的としている。
- 参考スコア(独自算出の注目度): 45.55893751499794
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) has shown remarkable success across a wide range of complex tasks. However, RL outcomes can be highly stochastic, and both expected performance and variability often depend on hyperparameter (HP) configurations. We propose efficient and risk-averse heteroscedastic Bayesian Optimization (ERAHBO), a Bayesian optimization method that models both the mean and variance of learning outcomes as functions of the HP configurations. ERAHBO aims to identify HP configurations that achieve high average return while reducing variability across training runs, and it improves the sample efficiency of the HP optimization via adaptive re-sampling rather than a fixed budget per HP. Empirical evaluations across diverse RL algorithms and environments demonstrate that ERAHBO generally outperforms both risk-neutral and risk-averse baselines, delivering improved sample efficiency for risk-averse returns.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、様々な複雑なタスクにおいて顕著な成功を収めている。
しかし、RLの結果は非常に確率的であり、期待される性能と可変性は、しばしばハイパーパラメータ(HP)構成に依存する。
我々は,HP 構成の関数として学習結果の平均値と分散値の両方をモデル化するベイズ最適化手法である,効率よく,かつ,非侵襲的ベイズ最適化 (ERAHBO) を提案する。
ERAHBOは、トレーニング実行間のばらつきを低減しつつ、高い平均リターンを達成するHP構成を特定し、HP当たりの固定予算ではなく、適応的な再サンプリングによってHP最適化のサンプル効率を改善することを目的としている。
多様なRLアルゴリズムと環境に対する実証的な評価は、ERAHBOが一般的にリスクニュートラルとリスクアバースベースラインの両方を上回り、リスクアバースリターンのサンプル効率が向上していることを示している。
関連論文リスト
- Efficient Hyperparameter Optimization for LLM Reinforcement Learning [9.333551082741506]
大規模言語モデル(LLM)の強化学習は、ハイパーパラメータ設定に非常に敏感である。
既存のHPO法は、大規模モデルスケールと資源集約的なトレーニングサイクルのため、LLM RLでは非効率である。
本稿では,モデルサイズとトレーニング予算の両方を忠実度として同時に適応させるJF-HPO(Joint Fidelity Hyper Parameters Optimization)を提案する。
JF-HPOは、各トライアルの計算効率(最大14.9倍)を著しく改善し、同じ時間予算でより良いまたは競争的な予測精度を達成する。
論文 参考訳(メタデータ) (2026-06-02T03:02:06Z) - Preference Optimization for Combinatorial Optimization Problems [54.87466279363487]
強化学習(Reinforcement Learning, RL)は、ニューラルネットワーク最適化のための強力なツールとして登場した。
大幅な進歩にもかかわらず、既存のRLアプローチは報酬信号の減少や大規模な行動空間における非効率な探索といった課題に直面している。
統計的比較モデルを用いて定量的報酬信号を定性的選好信号に変換する新しい手法であるPreference Optimizationを提案する。
論文 参考訳(メタデータ) (2025-05-13T16:47:00Z) - A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning [61.403275660120606]
強化学習(Reinforcement Learning, RL)に基づく微調整は, 拡散モデルとブラックボックスの目的を整合させる強力なアプローチとして登場した。
拡散微調整のための新しいRLであるLOOP(Left-one-out PPO)を提案する。
以上の結果から, LOOPは様々なブラックボックス対象の拡散モデルを効果的に改善し, 計算効率と性能のバランスを良くすることを示す。
論文 参考訳(メタデータ) (2025-03-02T13:43:53Z) - Hybrid Reinforcement Learning for Optimizing Pump Sustainability in
Real-World Water Distribution Networks [55.591662978280894]
本稿では,実世界の配水ネットワーク(WDN)のリアルタイム制御を強化するために,ポンプスケジューリング最適化問題に対処する。
我々の主な目的は、エネルギー消費と運用コストを削減しつつ、物理的な運用上の制約を遵守することである。
進化に基づくアルゴリズムや遺伝的アルゴリズムのような伝統的な最適化手法は、収束保証の欠如によってしばしば不足する。
論文 参考訳(メタデータ) (2023-10-13T21:26:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。