論文の概要: Structured Representation Learning for Behavior Cloning: How can we learn to safely control a nuclear power plant?
- arxiv url: http://arxiv.org/abs/2610.06211v1
- Date: Mon, 05 Oct 2026 12:22:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 17:51:57.535872
- Title: Structured Representation Learning for Behavior Cloning: How can we learn to safely control a nuclear power plant?
- Title(参考訳): 行動クローニングのための構造的表現学習 : 原子力発電所の安全管理をどうやって学べるか?
- Abstract要約: 本研究では,加圧水炉の負荷追従に専門家の予測制御ポリシーを模倣した行動閉鎖タスクについて検討する。
本稿では,各時間スケールの変数を別個の潜在空間に符号化し,システムの物理的分解を反映した構造化アーキテクチャを提案する。
分割埋め込みは,共有埋め込みベースラインと比較して,精度と実現可能性の両方を向上することを示した。
- 参考スコア(独自算出の注目度): 2.680173240079266
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learned models for industrial control are usually judged by aggregate accuracy, but accuracy at the component level does not guarantee safety once it is embedded in the system it is meant to serve. We study this gap on a behavior-cloning task: imitating an expert Nonlinear Model Predictive Control (NMPC) policy for load-following of a Pressurized Water Reactor (PWR), an industrial system with tight safety constraints. We propose a structured architecture encoding variables from each timescale into separate latent spaces, reflecting the physical decomposition of the system, before training a controller to imitate the expert on the product latent space. On long-horizon rollouts, separated embeddings improve both accuracy and feasibility compared with a shared-embedding baseline. Sensitivity analysis further shows that our model yields interpretable representations aligned with the system's physics. However, standalone deployment still leaves several percent of trajectories infeasible regardless of the architecture. Using our method to warmstart the NMPC optimizer rather than acting standalone, we recover full feasibility and near-optimal cost while still cutting computation time by $\sim$15% relative to the expert controller, and even more for abrupt operating changes.
- Abstract(参考訳): 産業制御の学習モデルは、通常、集約精度で判断されるが、コンポーネントレベルでの精度は、システムに組み込まれれば安全を保証しない。
本研究では, 安全制約の厳しい産業システムである加圧水炉 (PWR) の負荷追従のための非線形モデル予測制御 (NMPC) ポリシを模倣する。
本稿では,各時間スケールの変数を別個の潜在空間に符号化し,システムの物理的分解を反映した構造化アーキテクチャを提案する。
ロングホライズンロールアウトでは、分割埋め込みは、共有埋め込みベースラインと比較して精度と実現可能性の両方を改善している。
さらに、感度解析により、我々のモデルは系の物理と整合した解釈可能な表現が得られることを示す。
しかしながら、スタンドアローンのデプロイメントでは、アーキテクチャに関わらず、数パーセントのトラジェクトリが利用できないままである。
独立動作ではなく,NMPCオプティマイザをウォームスタートさせる手法を用いて,計算時間を専門家のコントローラに対して$$\sim$15%削減し,さらに急激な操作変更のために,完全な実現可能性とほぼ最適コストを回復する。
関連論文リスト
- Safe Ergodic Control for Multi-Robot Systems via Quadratic Programming [8.512867189292056]
エルゴディック制御は、ロボットが関心の分布に比例して各地域で時間を過ごすように促す。
既存の安全なエルゴードコントローラは、オフラインの客観的最適化や階層アーキテクチャに依存している。
本稿では、エルゴディディティと安全性を両立させる2次プログラミング(QP)ベースの制御器を提案する。
論文 参考訳(メタデータ) (2026-10-04T14:30:04Z) - Marginal Calibration Does Not Compose: Hidden Dependence in Modular Robot Navigation [0.0]
また, よく校正されたコンポーネントインタフェースは, 合成後の下流のキャリブレーション動作を必ずしも生成しないことを示した。
独立が過度に自信を持てるか 必要以上に保守的であると仮定する
論文 参考訳(メタデータ) (2026-09-20T16:15:42Z) - IPM-FM: A Foundation Model with Consensus Feature Selection for Industrial Process Monitoring [59.59850511287819]
産業プロセス監視基盤モデル(IPM-FM)を提案する。
まず、自己教師付き事前学習を通じて、ラベルのない産業プロセスデータから汎用的な表現を学習する。
少数のタスクラベル付きデータを使用して特定の監視タスクに適応し、最終的に校正された予測を生成する。
論文 参考訳(メタデータ) (2026-09-08T07:43:04Z) - AI-Augmented Model Predictive Control for Safe and Adaptive Rendezvous and Proximity Operations [2.787067333542931]
本研究は,多エージェント対逆シナリオにおける自律宇宙船RPOのための適応型モデル予測制御(MPC)フレームワークを提案する。
このフレームワークは、モンテカルロシミュレーションにより、公式のKSPDG(Kerbal Space Program Differential Game)で評価された。
論文 参考訳(メタデータ) (2026-07-18T04:20:23Z) - Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration [72.0672328514289]
マルチモーダル学習は、しばしば低品質データの課題に悩まされる。
コンフォーマル予測自己校正(Conformal Predictive Self-Calibration)と呼ばれる統合フレームワークを提案する。
私たちのフレームワークは、既存の最先端メソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-05T14:48:52Z) - Beyond Static Datasets: Robust Offline Policy Optimization via Vetted Synthetic Transitions [4.359780028396042]
静的データセットと学習ポリシ間の分散シフトに対処するモデルベースのフレームワークであるMoReBRACを提案する。
本研究では,変分オートエンコーダ(VAE)モデル検出,モデル感度解析,モンテカルロ(MC)ドロップアウトを統合した階層的不確実性パイプラインを実装した。
D4RL Gym-MuJoCoベンチマークの結果,特にランダム'とサブ最適'のデータ構造において,大幅な性能向上が示された。
論文 参考訳(メタデータ) (2026-01-26T03:38:27Z) - Distribution-Free Uncertainty-Aware Virtual Sensing via Conformalized Neural Operators [1.7864593554171284]
Conformalized Monte Carlo Operator (CMCO)は、ニューラルネットワークに基づく仮想センシングを、キャリブレーションされた、分布のない予測間隔で変換する。
CMCOは、リトレーニング、アンサンブル、カスタムロス設計なしで、空間的に解決された不確実性推定を達成する。
このブレークスルーは、ニューラル演算子のための汎用的なプラグアンドプレイUQソリューションを提供し、デジタルツインにおけるリアルタイムで信頼性の高い推論をアンロックし、センサーフュージョン、安全クリティカルな監視を提供する。
論文 参考訳(メタデータ) (2025-07-15T04:26:40Z) - Unifying Synergies between Self-supervised Learning and Dynamic
Computation [53.66628188936682]
SSLとDCのパラダイム間の相互作用に関する新しい視点を提示する。
SSL設定において、スクラッチから高密度かつゲートされたサブネットワークを同時に学習することは可能であることを示す。
密集エンコーダとゲートエンコーダの事前学習における共進化は、良好な精度と効率のトレードオフをもたらす。
論文 参考訳(メタデータ) (2023-01-22T17:12:58Z) - Layer Pruning on Demand with Intermediate CTC [50.509073206630994]
我々はコネクショニスト時間分類(CTC)に基づくASRの訓練と刈り取り方法を提案する。
本稿では,Transformer-CTCモデルをオンデマンドで様々な深さでプルーニングできることを示し,GPU上でのリアルタイム係数を0.005から0.002に改善した。
論文 参考訳(メタデータ) (2021-06-17T02:40:18Z) - Federated Learning with Unreliable Clients: Performance Analysis and
Mechanism Design [76.29738151117583]
Federated Learning(FL)は、分散クライアント間で効果的な機械学習モデルをトレーニングするための有望なツールとなっている。
しかし、低品質のモデルは信頼性の低いクライアントによってアグリゲータサーバにアップロードすることができ、劣化やトレーニングの崩壊につながる。
クライアントの信頼できない振る舞いをモデル化し、このようなセキュリティリスクを軽減するための防御メカニズムを提案する。
論文 参考訳(メタデータ) (2021-05-10T08:02:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。