論文の概要: Reinforcement Learning Techniques for the Optimization of Target Polarization in Nuclear Physics Scattering Experiments
- arxiv url: http://arxiv.org/abs/2610.02452v1
- Date: Thu, 01 Oct 2026 20:22:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.077121
- Title: Reinforcement Learning Techniques for the Optimization of Target Polarization in Nuclear Physics Scattering Experiments
- Title(参考訳): 核物理散乱実験における目標偏極最適化のための強化学習技術
- Abstract要約: 核物理学実験における動的偏極ターゲットの動作は、放射線損傷と進化する材料特性を補うためにマイクロ波周波数の連続的なチューニングに依存する。
本研究では,サロゲートモデリングと強化学習を組み合わせたデータ駆動制御フレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.6052883752929522
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The operation of dynamically polarized targets in nuclear physics experiments relies on continuous tuning of the microwave frequency to compensate for radiation damage and evolving material properties, a task that is traditionally performed through manual trial-and-error by expert operators. This work presents a data-driven control framework that combines surrogate modeling with reinforcement learning to optimize the target polarization. Using operational data from the APOLLO cryogenic target system, we train and evaluate multilayer perceptron and Gaussian process regression models to predict polarization as a function of microwave frequency, beam current, and accumulated radiation dose. We show that Gaussian process-based models provide calibrated uncertainty estimates and reliably identify regions outside the training distribution, while MLPs exhibit limited sensitivity to distributional shift. To enable learning and control across multiple target samples, we introduce a Gaussian process approximation and embed the surrogate model within a standardized simulation environment. A reinforcement learning agent is trained using a lower-confidence-bound reward formulation that balances performance maximization against uncertainty. We are able to show an almost 2x improvement on the operators actions utilizing our RL agent.
- Abstract(参考訳): 核物理学実験における動的偏極ターゲットの動作は、マイクロ波周波数の連続的なチューニングに頼り、放射線損傷と進化する材料特性を補う。
本研究では,サロゲートモデリングと強化学習を組み合わせたデータ駆動制御フレームワークを提案する。
本稿では,APOLLOの低温ターゲットシステムからの運転データを用いて多層パーセプトロンおよびガウス過程回帰モデルを訓練・評価し,マイクロ波周波数,ビーム電流,蓄積放射線線量などの関数として偏光を予測した。
我々は,ガウス過程に基づくモデルが,トレーニング分布外の領域を精度良く同定する上で,分布シフトに対する感度に制限があることを示す。
複数の対象サンプルの学習と制御を可能にするため,ガウス過程近似を導入し,シュロゲートモデルを標準化されたシミュレーション環境に組み込む。
強化学習エージェントは、不確実性に対する性能最大化のバランスをとる低信頼度対応報酬定式化を用いて訓練される。
RLエージェントを用いて演算子動作の約2倍の改善を示すことができる。
関連論文リスト
- Human-Machine Collaboration on Generative Meta-Learning: Model and Algorithm [22.212135025785244]
機械学習モデルをトレーニングディストリビューションとは異なる環境に一般化することは、依然として重要なハードルである。
本稿では,データ合成の指導に専門家の直観を活用することによって,この領域のギャップを埋める新しいフレームワークであるGMHF(Generative Meta-Learning with Human Feedback)を提案する。
論文 参考訳(メタデータ) (2026-07-01T13:29:54Z) - Be Your Own Teacher: Steering Protein Language Models via Unsupervised Reward Optimization [85.4863852505905]
タンパク質言語モデル(PLM)の教師なし報酬最適化を導入する。
我々の重要な洞察は、本質的なモデルの不確実性とタンパク質表現モデルによって誘導される意味的整合性を組み合わせたタスク非依存報酬は、ベースモデルと温度レギュレーションの制御可能性指標と強い相関を示すことである。
我々のフレームワークは、ラベル付けされた好みや実験的なフィードバックが不足したり、利用できないような環境で、制御可能な生体分子設計へのスケーラブルな経路を提供する。
論文 参考訳(メタデータ) (2026-06-17T11:42:01Z) - Machine learning based radiative parameterization scheme and its performance in operational reforecast experiments [21.24990493675443]
本研究では、ディープニューラルネットワークを数値予測モデルに組み込むハイブリッド予測フレームワークに固有の制約について検討する。
残留畳み込みニューラルネットワークを用いて、中国気象庁のグローバル運用システム内での一般循環モデル(RRTMG)のラピッシブトランスファーモデル(Rapidive Transfer Model)を近似する。
リアルタイムな演算処理に適したLibTorchベースの結合方式が提案されている。
論文 参考訳(メタデータ) (2026-01-20T04:45:45Z) - Self-Refining Training for Amortized Density Functional Theory [5.5541132320126945]
そこで本稿では,自己修復学習戦略を導入することにより,大規模な事前コンパイルデータセットに対するアモータイズDFTソルバの依存性を低減する手法を提案する。
本手法は, 生成試料と基底状態エネルギーで定義される対象ボルツマン分布との差分を測定するKL偏差の変動上界の最小化として導出する。
論文 参考訳(メタデータ) (2025-06-02T00:32:32Z) - Bellman Diffusion: Generative Modeling as Learning a Linear Operator in the Distribution Space [72.52365911990935]
本稿では,MDPの線形性を維持する新しいDGMフレームワークであるBellman Diffusionを紹介する。
この結果から,ベルマン拡散は分布RLタスクにおける従来のヒストグラムベースベースラインよりも1.5倍高速に収束し,精度の高い画像生成装置であることがわかった。
論文 参考訳(メタデータ) (2024-10-02T17:53:23Z) - Reduced Order Modeling of a MOOSE-based Advanced Manufacturing Model
with Operator Learning [2.517043342442487]
先進的製造(AM)は、核材料への潜在的な応用について、原子力コミュニティに多大な関心を集めている。
1つの課題は、実行時に製造プロセスを制御することによって、望ましい材料特性を得ることである。
深部強化学習(DRL)に基づくインテリジェントAMは、最適な設計変数を生成するためのプロセスレベルの自動制御機構に依存している。
論文 参考訳(メタデータ) (2023-08-18T17:38:00Z) - Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z) - Improving and generalizing flow-based generative models with minibatch
optimal transport [90.01613198337833]
連続正規化フロー(CNF)のための一般条件流整合(CFM)技術を導入する。
CFMは、拡散モデルのフローをトレーニングするために使用されるような安定した回帰目標を特徴としているが、決定論的フローモデルの効率的な推論を好んでいる。
我々の目的の変種は最適輸送CFM (OT-CFM) であり、訓練がより安定し、より高速な推論をもたらすより単純なフローを生成する。
論文 参考訳(メタデータ) (2023-02-01T14:47:17Z) - A Reinforcement Learning based approach for Multi-target Detection in
Massive MIMO radar [12.982044791524494]
本稿では,MMIMO(Multiple input Multiple output)認知レーダ(CR)におけるマルチターゲット検出の問題点について考察する。
本稿では,未知の外乱統計の存在下での認知的マルチターゲット検出のための強化学習(RL)に基づくアルゴリズムを提案する。
定常環境と動的環境の両方において提案したRLアルゴリズムの性能を評価するため, 数値シミュレーションを行った。
論文 参考訳(メタデータ) (2020-05-10T16:29:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。