論文の概要: Pick-to-Learn Calibration of an MPC Policy for an Origin-to-Destination Flight Problem
- arxiv url: http://arxiv.org/abs/2607.16084v1
- Date: Fri, 17 Jul 2026 16:14:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.897054
- Title: Pick-to-Learn Calibration of an MPC Policy for an Origin-to-Destination Flight Problem
- Title(参考訳): オリジン・ツー・デスティネーション飛行問題に対するMPC政策のピック・ツー・ラーン校正
- Abstract要約: 本稿では,モデル予測制御ポリシの校正に応用したPick-to-Learn手法について述べる。
この例は、不確実なクロスウインドや避けるべき低接続ゾーンの存在下で、原点から目的地まで飛行する航空機に関するものである。
- 参考スコア(独自算出の注目度): 5.901309581539199
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper illustrates the Pick-to-Learn methodology applied to the calibration of a Model Predictive Control policy. While developed around a specific example, the presentation is meant to highlight a methodology of broad applicability. The example concerns an aircraft traveling from an origin point to a destination point in the presence of uncertain crosswinds and a low-connectivity zone that should be avoided. The MPC policy is parameterized by two hyperparameters, which are selected from data by the P2L procedure. Starting from a dataset of 400 wind realizations, also called scenarios, P2L identifies a final compression set containing only two informative scenarios. The resulting MPC policy avoids the low-connectivity zone on all available scenarios and, according to the P2L theory, satisfies a probabilistic risk bound of $4.8\%$ at confidence level $1-10^{-5}$, where the risk is the probability of entering the low-connectivity zone in a future flight under a new wind realization not included in the sample.
- Abstract(参考訳): 本稿では,モデル予測制御ポリシの校正に応用したPick-to-Learn手法について述べる。
特定の例を中心に開発されたプレゼンテーションは、幅広い適用可能性の方法論を強調することを目的としている。
この例は、不確実なクロスウインドや避けるべき低接続ゾーンの存在下で、原点から目的地まで飛行する航空機に関するものである。
MPCポリシは2つのハイパーパラメータによってパラメータ化され、P2Lプロシージャによってデータから選択される。
シナリオとも呼ばれる400の風速実現のデータセットから、P2Lは2つの情報的シナリオのみを含む最終的な圧縮セットを特定する。
P2L理論によれば、MPCポリシーはすべての利用可能なシナリオにおいて低接続性ゾーンを回避し、信頼性レベル1-10^{-5}$で4.8\%の確率的リスクバウンドを満たす。
関連論文リスト
- Safer Reasoning Traces: Measuring and Mitigating Chain-of-Thought Leakage in LLMs [5.834576254792341]
CoT(Chain-of-Thought)プロンプトは、個人識別可能な情報(PII)をプロンプトから推論トレースと出力に変換することで、プライバシーリスクを増大させる。
モデルに依存しないフレームワークを用いて, 直接的, 推論時のPIIリークについて検討する。
論文 参考訳(メタデータ) (2026-03-05T19:20:44Z) - The Decoupled Risk Landscape in Performative Prediction [3.904855396113132]
Performative Predictionは、モデルのデプロイが入力データの分散シフトを誘導するシナリオに対処する。
本稿では,2段階の予測プロセスにインスパイアされた,単純な疎結合型リスク可視化手法を提案する。
我々は,意思決定と異なるモデルに分布が反応するシナリオをキャプチャする,新しい設定,拡張パーフォーマティブ予測を導入する。
論文 参考訳(メタデータ) (2025-06-10T17:58:39Z) - A Planning Framework for Adaptive Labeling [8.883000217198843]
本稿では,バッチで計測作業を再配置できる適応ラベリングフレームワークを提案する。
1段階のルックアヘッドポリシーでさえ、一般的な適応ラベルよりも大幅に優れることを示す。
本稿では,従来の非微分可能MDPのスムーズなバージョンに基づいて,直接バックプロパゲーションに基づくSmoothed-Autodiffを提案する。
論文 参考訳(メタデータ) (2025-02-10T00:01:08Z) - Statistical Analysis of Policy Space Compression Problem [54.1754937830779]
政策探索手法は強化学習において重要であり、継続的な状態反応と部分的に観察可能な問題に対処するための枠組みを提供する。
政策圧縮による政策空間の削減は、学習プロセスを加速するための強力で報酬のないアプローチとして現れます。
この手法は方針空間をより小さく代表的な集合に凝縮し、元の効果のほとんどを維持している。
論文 参考訳(メタデータ) (2024-11-15T02:46:55Z) - Certifiably Robust Policies for Uncertain Parametric Environments [57.2416302384766]
本稿ではパラメータ上の未知分布を持つパラメトリックマルコフ決定プロセス(MDP)に基づくフレームワークを提案する。
パラメータによって誘導される未知のサンプル環境に対するIMDPの学習と解析を行う。
当社のアプローチは,信頼度の高い政策のパフォーマンスに厳密な拘束力をもたらすことを示す。
論文 参考訳(メタデータ) (2024-08-06T10:48:15Z) - Data-Adaptive Tradeoffs among Multiple Risks in Distribution-Free Prediction [55.77015419028725]
しきい値とトレードオフパラメータが適応的に選択された場合、リスクの有効な制御を可能にする手法を開発する。
提案手法は単調なリスクとほぼ単調なリスクをサポートするが,それ以外は分布的な仮定はしない。
論文 参考訳(メタデータ) (2024-03-28T17:28:06Z) - High-probability sample complexities for policy evaluation with linear function approximation [88.87036653258977]
本研究では,2つの広く利用されている政策評価アルゴリズムに対して,最適線形係数の予め定義された推定誤差を保証するために必要なサンプル複素量について検討する。
高確率収束保証に縛られた最初のサンプル複雑性を確立し、許容レベルへの最適依存を実現する。
論文 参考訳(メタデータ) (2023-05-30T12:58:39Z) - An Offline Risk-aware Policy Selection Method for Bayesian Markov
Decision Processes [0.0]
Exploitation vs. Caution (EvC) はベイズ形式主義のモデル不確実性をエレガントに取り入れたパラダイムである。
我々は,多種多様なMDPクラスを提供する異なる離散的かつシンプルな環境において,最先端のアプローチでEvCを検証する。
テストシナリオでは、EvCは堅牢なポリシーを選択することができ、実践者にとって有用なツールとして際立っている。
論文 参考訳(メタデータ) (2021-05-27T20:12:20Z) - Sparse Feature Selection Makes Batch Reinforcement Learning More Sample
Efficient [62.24615324523435]
本稿では,スパース線形関数近似を用いた高次元バッチ強化学習(RL)の統計的解析を行う。
候補となる機能が多数存在する場合,提案手法がバッチRLをより効率的にサンプリングできるという事実に光を当てる。
論文 参考訳(メタデータ) (2020-11-08T16:48:02Z) - PC-PG: Policy Cover Directed Exploration for Provable Policy Gradient
Learning [35.044047991893365]
本研究は,政策カバーグラディエント(PC-PG)アルゴリズムを導入し,政策(政策カバー)のアンサンブルを用いて,探索対搾取トレードオフのバランスをとる。
我々は,PC-PG が標準最悪の場合である $ell_infty$ の仮定を超越したモデル不特定性の下で強い保証を持つことを示す。
また、報酬なしと報酬駆動の両方の設定において、様々な領域にまたがる経験的評価で理論を補完する。
論文 参考訳(メタデータ) (2020-07-16T16:57:41Z) - Minimax-Optimal Off-Policy Evaluation with Linear Function Approximation [49.502277468627035]
本稿では,関数近似を用いたバッチデータ強化学習の統計的理論について検討する。
記録履歴から新たな対象政策の累積値を推定するオフ・ポリティクス評価問題を考察する。
論文 参考訳(メタデータ) (2020-02-21T19:20:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。