論文の概要: Robust Control under Stationary Ambiguity
- arxiv url: http://arxiv.org/abs/2608.04832v1
- Date: Wed, 05 Aug 2026 13:34:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.941099
- Title: Robust Control under Stationary Ambiguity
- Title(参考訳): 定常曖昧性を考慮したロバスト制御
- Authors: Konrad J. Mueller, Amira Akkari, Ben Wood, Lukas Gonon,
- Abstract要約: シミュレーションに最適化された制御ポリシーは、シミュレータのパラメータが限られたデータから推定される場合、実システムではうまく機能しない。
システムの状態によってあいまいさが変化するが、時間とともに体系的に減衰しないシミュレータにおけるトレーニングポリシーを提案する。
このようなシミュレータの構築方法を示し,定常的あいまいさの下で訓練された政策が時間とともに潜伏要因に対する堅牢性を維持することを示す。
- 参考スコア(独自算出の注目度): 5.394466899760558
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Control policies optimized in simulation can perform poorly in the real system when the parameters $x$ of the simulator are estimated from limited data but the resulting parameter uncertainty is not represented inside the simulation. A common way to incorporate such ambiguity is to simulate each trajectory of the system under a randomly drawn value for $x$. Since the policy cannot observe the drawn value, it must initially choose controls that perform well across many possible parameter values. However, if the policy progressively observes the system, it can often gradually infer the value of $x$, so that ambiguity vanishes. Over time, the policy then specializes to its estimate of $x$ and loses its robustness. This is undesirable in many real systems, where latent factors are expected to shift. In financial markets, for example, a policy hedging a derivative payoff should remain robust to changes in the volatility regime. To induce such continual robustness, we propose training policies in simulators where ambiguity varies with the system's state but does not systematically decay over time. We formalize this requirement as stationary ambiguity: the simulator should induce a stationary filter process over the latent state. We show how to construct such simulators and demonstrate, on hedging problems, that policies trained under stationary ambiguity preserve robustness to latent factors over time, leading to strong performance on real market data. As a modeling principle, stationary ambiguity informs many simulator design decisions: which models make realistic simulators, how their parameters should be randomized, and how simulator and policy should be initialized. While our experiments focus on hedging, stationary ambiguity may also be useful for other sequential control problems driven by exogenous stochastic processes with shifting latent structure.
- Abstract(参考訳): シミュレーションで最適化された制御ポリシーは、シミュレータのパラメータ$x$が限られたデータから推定されるが、結果として生じるパラメータの不確実性はシミュレーション内では表現されない場合、実際のシステムではうまく機能しない。
そのような曖昧さを組み込む一般的な方法は、システムの各軌跡をランダムに描画された値で$x$でシミュレートすることである。
ポリシーは、描画された値を観測できないため、最初は、多くの可能なパラメータ値に対してうまく機能するコントロールを選択する必要がある。
しかし、ポリシーが漸進的にシステムを観察している場合、しばしばx$の値を徐々に推測し、曖昧さは消える。
時間が経つにつれて、このポリシーはx$の見積もりに特化し、ロバストさを失う。
これは、潜在要因がシフトすると予想される多くの実システムでは望ましくない。
例えば金融市場では、デリバティブ・ペイオフ(デリバティブ・ペイオフ)を取り巻く政策は、ボラティリティ(変動性)体制の変化に対して堅固でなければならない。
このような連続的ロバスト性を誘導するために,システムの状態によってあいまいさが変化するが,時間とともに体系的に減衰しないシミュレータにおけるトレーニングポリシーを提案する。
我々はこの条件を定常的曖昧さとして定式化し、シミュレータは定常的なフィルタプロセスを潜時状態に誘導するべきである。
このようなシミュレータの構築方法を示し、定常的曖昧性の下で訓練された政策が時間とともに潜伏要因に対する堅牢性を維持し、実際の市場データに高いパフォーマンスをもたらすことを示す。
モデル原理として、定常曖昧性は、どのモデルが現実的なシミュレータを作るか、どのようにパラメータがランダム化されるべきか、どのようにシミュレータとポリシーが初期化されるべきか、といった多くのシミュレータ設計決定を通知する。
我々の実験はヘッジに重点を置いているが、定常曖昧性は、潜伏構造の変化を伴う外因性確率過程によって引き起こされる他の逐次制御問題にも有用である。
関連論文リスト
- How Should a Simulation-to-Reality Transfer Budget Be Spent? [0.0]
本稿では,システム識別と領域ランダム化の間の実ロボット計測時間を割当てることに焦点をあてる。
私たちがテストした現実のギャップとノイズレベル全体にわたって、測定予算は作業の大部分を完了しました。
全体として,sim-to-realパイプラインは,まずパラメータを計測し,残されている不確実性に対してランダム化を予備的に行うべきである。
論文 参考訳(メタデータ) (2026-06-20T14:23:34Z) - Sim2Act: Robust Simulation-to-Decision Learning via Adversarial Calibration and Group-Relative Perturbation [54.29523408543184]
シミュレーションと意思決定の学習は、現実世界の展開を危険にさらすことなく、デジタル環境で安全なポリシートレーニングを可能にする。
既存のアプローチでは、平均的なシミュレーションの忠実さを改善するか、保守的な正規化を採用するかに重点を置いている。
提案するSim2Actは,シミュレータとポリシーのロバスト性の両方に対処するロバストなシミュレーション・トゥ・意思決定フレームワークである。
論文 参考訳(メタデータ) (2026-03-10T00:51:47Z) - ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation [72.78362530982109]
ARTIS(Agenic Risk-Aware Test-Time Scaling via Iterative Simulation)は、コミットメントから探索を分離するフレームワークである。
LLMをベースとした簡易シミュレータは, 希少かつ高インパクトな障害モードの捕捉に苦慮していることを示す。
本稿では,障害発生行動の忠実度を強調するリスク認識ツールシミュレータを提案する。
論文 参考訳(メタデータ) (2026-02-02T06:33:22Z) - Reliable and Scalable Robot Policy Evaluation with Imperfect Simulators [9.868826622074899]
SureSimは、比較的小さな実世界のテストで大規模なシミュレーションを強化するためのフレームワークである。
我々は,非漸近平均推定アルゴリズムを利用して,平均政策性能に対する信頼区間を提供する。
当社のアプローチは,同様のポリシ性能の限界を達成するため,ハードウェア評価作業の20~25%以上を節約する。
論文 参考訳(メタデータ) (2025-10-05T20:37:53Z) - G-Sim: Generative Simulations with Large Language Models and Gradient-Free Calibration [48.948187359727996]
G-Simは、厳密な経験的校正によるシミュレータ構築を自動化するハイブリッドフレームワークである。
信頼性のある因果的インフォームドシミュレータを生成し、データ効率を軽減し、堅牢なシステムレベルの介入を可能にする。
論文 参考訳(メタデータ) (2025-06-10T22:14:34Z) - Robust Visual Sim-to-Real Transfer for Robotic Manipulation [79.66851068682779]
シミュレーションにおけるビジュモータポリシーの学習は、現実世界よりも安全で安価である。
しかし、シミュレーションデータと実データとの相違により、シミュレータ訓練されたポリシーは実際のロボットに転送されると失敗することが多い。
視覚的なsim-to-real領域ギャップを埋める一般的なアプローチは、ドメインランダム化(DR)である。
論文 参考訳(メタデータ) (2023-07-28T05:47:24Z) - Policy Learning for Robust Markov Decision Process with a Mismatched
Generative Model [42.28001762749647]
医療や自動操縦といった高度なシナリオでは、オンラインの実験データを収集してエージェントを訓練するのは危険か不可能です。
本稿では,ロバスト・マルコフ決定過程(RMDP)に対する政策学習について考察する。
我々のゴールは、さらなる技術的困難をもたらす、摂動テスト環境に対するほぼ最適のロバストなポリシーを特定することです。
論文 参考訳(メタデータ) (2022-03-13T06:37:25Z) - Robust Value Iteration for Continuous Control Tasks [99.00362538261972]
シミュレーションから物理システムへ制御ポリシを転送する場合、そのポリシは、動作の変動に対して堅牢でなければならない。
本稿では、動的プログラミングを用いて、コンパクトな状態領域上での最適値関数を計算するRobust Fitted Value Iterationを提案する。
より深い強化学習アルゴリズムや非ロバストなアルゴリズムと比較して、ロバストな値の方が頑健であることを示す。
論文 参考訳(メタデータ) (2021-05-25T19:48:35Z) - Auto-Tuned Sim-to-Real Transfer [143.44593793640814]
シミュレーションで訓練されたポリシーは、しばしば現実世界に移されるときに失敗する。
ドメインのランダム化のようなこの問題に取り組む現在のアプローチには、事前の知識とエンジニアリングが必要である。
実世界に合わせてシミュレータシステムパラメータを自動的にチューニングする手法を提案する。
論文 参考訳(メタデータ) (2021-04-15T17:59:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。