論文の概要: Control-Oriented Scenario Tree Construction through Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.09335v1
- Date: Mon, 10 Aug 2026 09:13:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.179203
- Title: Control-Oriented Scenario Tree Construction through Reinforcement Learning
- Title(参考訳): 強化学習による制御指向シナリオツリーの構築
- Authors: Fabio Pavirani, Bert Claessens, Pierre Pinson, Chris Develder,
- Abstract要約: 本稿では,下流決定に対する影響から直接シナリオツリー構築を学習する制御指向アプローチを提案する。
リスク・アバース・バッテリ仲裁問題の解法について検討する。
- 参考スコア(独自算出の注目度): 4.2329543571238615
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multistage stochastic model predictive control (MPC) handles uncertainty by optimizing over a scenario tree, a finite branching approximation of future outcomes constructed from sampled forecasts. To build such a tree, conventional methods focus on matching the underlying probability distribution---e.g., via Wasserstein-based scenario reduction---but improved distributional accuracy does not necessarily yield better control performance. We propose a control-oriented approach that learns scenario tree construction directly from its impact on downstream decisions. Fixing the tree topology, we formulate tree construction as a sequential assignment of sampled scenarios to leaves. This assignment is parameterized by an attention-based policy over the scenario set and trained using reinforcement learning, with closed-loop control profit as the objective. Training is stabilized by an asymmetric critic that leverages realized future trajectories. We evaluate the method on a risk-averse battery arbitrage problem. Across a range of forecast set sizes, the learned construction consistently achieves the highest profit, outperforming classical forward and backward reduction methods and certainty-equivalent (single-trajectory forecast) control. The learned policy also exhibits greater robustness on challenging instances, consistently demonstrating better tail-risk characteristics. Analysis of the resulting trees indicates that our method constructs compact, selectively branching structures that capture high-impact events while keeping most trajectories nearly deterministic. These findings highlight that the value of a scenario tree depends critically on the decisions it supports, and provide an effective framework to train scenario tree constructors merely based on the closed-loop control optimization signal.
- Abstract(参考訳): 多段階確率モデル予測制御(MPC)は、シナリオツリーを最適化することで不確実性を扱う。
このような木を構築するために、従来の手法では、Wassersteinベースのシナリオリダクションを通じて、基礎となる確率分布のマッチングに重点を置いているが、分布精度の改善は、必ずしも制御性能を向上するとは限らない。
本稿では,下流決定に対する影響から直接シナリオツリー構築を学習する制御指向アプローチを提案する。
木のトポロジーを固定し、木構築を葉にサンプルシナリオの逐次的な割り当てとして定式化する。
この課題は、強化学習を用いて訓練されたシナリオセットに対する注意ベースのポリシーによってパラメータ化され、その目的としてクローズドループ制御利益がある。
訓練は、実現された将来の軌道を利用する非対称な批評家によって安定化される。
リスク・アバース・バッテリ仲裁問題の解法について検討する。
一連の予測セットサイズにわたって、学習された構築物は、常に最高利益を達成し、古典的な前方および後方縮小法と一定の等価(単軌道予測)制御を上回ります。
学習されたポリシーは、挑戦するインスタンスに対してより堅牢性を示し、常により良いテールリスク特性を示す。
その結果,提案手法は,ほとんどの軌道をほぼ決定論的に保ちながら,高影響イベントを捕捉する,コンパクトで選択的に分岐する構造を構築できることが示唆された。
これらの知見は,シナリオツリーの価値がサポートする決定に大きく依存していること,およびクローズドループ制御最適化信号に基づいてシナリオツリーコンストラクタをトレーニングするための効果的なフレームワークを提供する。
関連論文リスト
- Handling Missing Data in Probabilistic Regression Trees [0.0]
本稿ではPRTreeフレームワークを拡張し,木構築時の予測値の不足に対処する。
利用可能な情報をそれぞれ異なる方法で活用する3つの戦略が提案されている。
確率的木構築の有効性は、観測不足の処理に強く依存する。
論文 参考訳(メタデータ) (2026-08-06T15:54:12Z) - On Multi-Step Theorem Prediction via Non-Parametric Structural Priors [50.16583672681106]
本研究では,インコンテキスト学習(ICL)のレンズによる学習自由な定理予測について検討する。
本稿では,過去の解の時間的依存関係を有向グラフとしてエンコードし,推論中に探索空間を効果的に引き起こす明示的なトポロジ的制約を課すTheorem Precedence Graphsを提案する。
FormalGeo7kベンチマークの実験から,本手法は89.29%の精度を実現し,ICLベースラインを著しく上回り,最先端の教師付きモデルに適合することがわかった。
論文 参考訳(メタデータ) (2026-03-05T06:08:50Z) - Bridging the Gap Between Bayesian Deep Learning and Ensemble Weather Forecasts [100.26854618129039]
天気予報は、大気のカオス的な性質によって根本的に挑戦されている。
ベイジアンディープラーニング(BDL)の最近の進歩は、有望だがしばしば非接続な代替手段を提供する。
気象予報のための統合型BDLフレームワークにより,これらのパラダイムを橋渡しする。
論文 参考訳(メタデータ) (2025-11-18T07:49:52Z) - Diffusion-Based Scenario Tree Generation for Multivariate Time Series Prediction and Multistage Stochastic Optimization [16.795461001108098]
Diffusion Scenario Tree (DST) は多変量予測タスクのためのシナリオツリーを構築するための一般的なフレームワークである。
ニューヨーク州の日頭電力市場におけるエネルギー仲裁の最適化に関する枠組みを評価する。
論文 参考訳(メタデータ) (2025-09-18T10:49:05Z) - Tree-OPO: Off-policy Monte Carlo Tree-Guided Advantage Optimization for Multistep Reasoning [3.6333725470852443]
我々は,モンテカルロ木探索を緩和して,嗜好に基づく強化学習における政策最適化を改善する方法について検討する。
本稿では,部分的に明らかにされたMCTSロールアウトから完成度を導出するGRPOトレーニングパラダイムを提案する。
最初の結果は、構造化された利点推定は推論品質を安定させ、より良く反映できるが、利点飽和や報奨信号の崩壊といった課題は残ることを示唆している。
論文 参考訳(メタデータ) (2025-09-11T09:18:07Z) - TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling [65.46347858249295]
TreePOは自己誘導型ロールアウトアルゴリズムで、シーケンス生成を木構造検索プロセスとして見る。
TreePOは基本的に、探索の多様性を保存または強化しながら、更新毎の計算負担を削減します。
論文 参考訳(メタデータ) (2025-08-24T16:52:37Z) - Adaptive Conformal Prediction Intervals Over Trajectory Ensembles [50.31074512684758]
将来の軌道は、自律運転、ハリケーン予測、疫病モデルといった領域で重要な役割を果たしている。
本稿では,サンプル軌道を理論的カバレッジ保証付き校正された予測区間に変換する共形予測に基づく統一的なフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-18T21:14:07Z) - Learning Decision Trees as Amortized Structure Inference [59.65621207449269]
本稿では,予測決定木アンサンブルを学習するためのハイブリッドアモータイズされた構造推論手法を提案する。
提案手法であるDT-GFNは,標準分類ベンチマークにおける最先端決定木やディープラーニング手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-03-10T07:05:07Z) - Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z) - On Uncertainty Estimation by Tree-based Surrogate Models in Sequential
Model-based Optimization [13.52611859628841]
予測不確実性推定の観点から,ランダム化木の様々なアンサンブルを再検討し,その挙動について検討する。
BwO林と呼ばれる無作為な樹木のアンサンブルを構築するための新しい手法を提案する。
実験により,既存の樹木モデルに対するBwO林の有効性と性能について様々な状況で検証した。
論文 参考訳(メタデータ) (2022-02-22T04:50:37Z) - Optimal randomized classification trees [0.0]
分類と回帰木(英: Classification and Regression Trees、CART)は、現代の統計学と機械学習における既成の技術である。
CARTはgreedyプロシージャによって構築され、分割予測変数と関連するしきい値を逐次決定する。
この強欲なアプローチは、木を非常に高速に木に分類するが、その性質上、それらの分類精度は他の最先端の手順と競合しないかもしれない。
論文 参考訳(メタデータ) (2021-10-19T11:41:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。