Fugu-MT 論文翻訳(概要): Pruning the Way to Reliable Policies: A Multi-Objective Deep Q-Learning Approach to Critical Care

論文の概要: Pruning the Way to Reliable Policies: A Multi-Objective Deep Q-Learning Approach to Critical Care

arxiv url: http://arxiv.org/abs/2306.08044v2
Date: Thu, 13 Jul 2023 20:23:43 GMT
ステータス: 翻訳完了
システム内更新日: 2023-07-18 21:50:38.579724
Title: Pruning the Way to Reliable Policies: A Multi-Objective Deep Q-Learning Approach to Critical Care
Title（参考訳）: 信頼政策への道を開く: 批判的ケアに対する多目的深いQ-Learningアプローチ
Authors: Ali Shirali, Alexander Schubert, Ahmed Alaa
Abstract要約: 我々は、より信頼性の高いクリティカルケアポリシーを得ることができる深いQ-ラーニングアプローチを導入する。まず、利用可能なすべての報酬に基づいてアクションセットを抽出し、次に、スパース主報酬に基づいて最終モデルを訓練し、制限されたアクションセットで達成する。
参考スコア（独自算出の注目度）: 68.8204255655161
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Most medical treatment decisions are sequential in nature. Hence, there is substantial hope that reinforcement learning may make it possible to formulate precise data-driven treatment plans. However, a key challenge for most applications in this field is the sparse nature of primarily mortality-based reward functions, leading to decreased stability of offline estimates. In this work, we introduce a deep Q-learning approach able to obtain more reliable critical care policies. This method integrates relevant but noisy intermediate biomarker signals into the reward specification, without compromising the optimization of the main outcome of interest (e.g. patient survival). We achieve this by first pruning the action set based on all available rewards, and second training a final model based on the sparse main reward but with a restricted action set. By disentangling accurate and approximated rewards through action pruning, potential distortions of the main objective are minimized, all while enabling the extraction of valuable information from intermediate signals that can guide the learning process. We evaluate our method in both off-policy and offline settings using simulated environments and real health records of patients in intensive care units. Our empirical results indicate that pruning significantly reduces the size of the action space while staying mostly consistent with the actions taken by physicians, outperforming the current state-of-the-art offline reinforcement learning method conservative Q-learning. Our work is a step towards developing reliable policies by effectively harnessing the wealth of available information in data-intensive critical care environments.
Abstract（参考訳）: ほとんどの医療上の決定は自然界で順次行われる。したがって、強化学習によって正確なデータ駆動治療計画を定式化できるという大きな期待がある。しかし、この分野のほとんどのアプリケーションにとって重要な課題は、主に死亡率に基づく報酬関数の欠如であり、オフライン推定の安定性が低下する。本研究では,より信頼性の高いクリティカルケアポリシを実現するためのQ-ラーニングアプローチを提案する。この方法は、関心の主な結果(例えば、患者生存)の最適化を損なうことなく、関連するがノイズの多い中間バイオマーカー信号を報酬仕様に統合する。まず、利用可能なすべての報酬に基づいてアクションセットを抽出し、次に、スパース主報酬に基づいて最終モデルを訓練し、制限されたアクションセットで達成する。アクションプルーニングによる正確で近似的な報酬を解消することにより、学習プロセスを導くことのできる中間信号から貴重な情報を抽出することができるとともに、主目的の潜在的な歪みを最小化する。本手法は,集中治療室の患者をシミュレーションした環境と実際の健康記録を用いて,オフラインとオフラインの両方で評価する。実験の結果,プルーニングは医師の行動とほぼ一致しながら,動作空間を著しく縮小し,現在最先端のオフライン強化学習法である保守的Q-ラーニングよりも優れていた。私たちの仕事は、データ集約的クリティカルケア環境で利用可能な情報の豊富な活用によって、信頼できるポリシーを開発するための一歩です。

関連論文リスト

Guardian-regularized Safe Offline Reinforcement Learning for Smart Weaning of Mechanical Circulatory Devices [19.512275639322638]
心原性ショック患者における機械的循環補助装置の自動織りに関するシーケンシャル意思決定問題について検討した。オフライン強化学習は、シーケンシャルな意思決定タスクで成功している。 2つの重要なコントリビューションを持つエンドツーエンドの機械学習フレームワークを開発します。
論文参考訳（メタデータ） (2025-11-08T19:32:31Z)
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment [0.4998632546280975]
本研究は,臨床医の意図を反映した報酬関数の開発に焦点をあてる。限られたデータから専門家の意図を含むパラメータ化された報酬関数を学習する。このアプローチはヘパリン服薬問題だけでなく、一般のRLベースの薬物服薬タスクにも広く利用することができる。
論文参考訳（メタデータ） (2024-09-20T07:51:37Z)
Sample Complexity of Preference-Based Nonparametric Off-Policy Evaluation with Deep Networks [58.469818546042696]
我々は、OPEのサンプル効率を人間の好みで研究し、その統計的保証を確立する。 ReLUネットワークのサイズを適切に選択することにより、マルコフ決定過程において任意の低次元多様体構造を活用できることが示される。
論文参考訳（メタデータ） (2023-10-16T16:27:06Z)
Deep Offline Reinforcement Learning for Real-world Treatment Optimization Applications [3.770564448216192]
オフラインRLトレーニングにおける動作不均衡に対処するための,実践的かつ理論的に基礎的な遷移サンプリング手法を提案する。糖尿病と敗血症治療最適化のための2つの現実的課題について広範な実験を行った。本提案手法は, 様々な原則および臨床関連指標を用いて, 期待される健康影響を大幅に改善できることを示す。
論文参考訳（メタデータ） (2023-02-15T09:30:57Z)
Offline Reinforcement Learning with Instrumental Variables in Confounded Markov Decision Processes [93.61202366677526]
未測定の共同設立者を対象にオフライン強化学習(RL)について検討した。そこで本稿では, 最適クラスポリシーを見つけるための, 有限サンプルの準最適性を保証した多種多様なポリシー学習手法を提案する。
論文参考訳（メタデータ） (2022-09-18T22:03:55Z)
Uncertainty-Based Offline Reinforcement Learning with Diversified Q-Ensemble [16.92791301062903]
本稿では,Q値予測の信頼性を考慮した不確実性に基づくオフラインRL手法を提案する。意外なことに、カットされたQ-ラーニングとともにQ-networksの数を単純に増やすことで、既存のオフラインRLメソッドを様々なタスクで大幅に上回ります。
論文参考訳（メタデータ） (2021-10-04T16:40:13Z)
Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning [63.53407136812255]
オフライン強化学習は、探索を必要とせずに、事前に収集された静的データセットから効果的なポリシーを学ぶことを約束する。既存のQラーニングとアクター批判に基づくオフポリティクスRLアルゴリズムは、アウト・オブ・ディストリビューション(OOD)アクションや状態からのブートストラップ時に失敗する。我々は,OOD状態-動作ペアを検出し,トレーニング目標への貢献度を下げるアルゴリズムであるUncertainty Weighted Actor-Critic (UWAC)を提案する。
論文参考訳（メタデータ） (2021-05-17T20:16:46Z)
Non-asymptotic Confidence Intervals of Off-policy Evaluation: Primal and Dual Bounds [21.520045697447372]
オフ・ポリティィ・アセスメント(OPE)は、以前異なるポリシーの下で収集されたオフラインデータに基づいて、所定のポリシーの期待される報酬を推定するタスクである。本研究は,非漸近的信頼区間を無限ホリゾンオフポリシー評価で構築する問題を考える。原始双対最適化に基づく実践的アルゴリズムを開発した。
論文参考訳（メタデータ） (2021-03-09T22:31:20Z)
Scalable Bayesian Inverse Reinforcement Learning [93.27920030279586]
我々はAVRIL(Adroximate Variational Reward Imitation Learning)を紹介する。本手法は,逆強化学習問題の誤った性質に対処する。本手法を従来の制御シミュレーションと並行して実際の医療データに適用し,現在の手法の範囲を超えた環境におけるベイズ報酬推論を実証する。
論文参考訳（メタデータ） (2021-02-12T12:32:02Z)
Semi-Supervised Off Policy Reinforcement Learning [3.48396189165489]
健康状態の情報はよくコード化されておらず、臨床記録に埋め込まれることが多い。そこで本研究では,実測結果を持つ小さなラベル付きデータを効率よく活用する半教師付き学習(SSL)手法と,結果サロゲートを持つ大規模ラベル付きデータを提案する。提案手法は,少なくとも教師付きアプローチと同じくらい効率的であり,またインプテーションモデルの誤特定にも頑健である。
論文参考訳（メタデータ） (2020-12-09T00:59:12Z)
Reliable Off-policy Evaluation for Reinforcement Learning [53.486680020852724]
シーケンシャルな意思決定問題において、非政治評価は、目標政策の期待累積報酬を推定する。本稿では、1つまたは複数のログデータを用いて、ロバストで楽観的な累積報酬推定を提供する新しいフレームワークを提案する。
論文参考訳（メタデータ） (2020-11-08T23:16:19Z)
Optimizing Medical Treatment for Sepsis in Intensive Care: from Reinforcement Learning to Pre-Trial Evaluation [2.908482270923597]
本研究の目的は, 介入を最適化する強化学習(RL)が, 学習方針の治験に対する規制に適合する経路を遡及的に得る枠組みを確立することである。我々は,死の主な原因の一つであり,複雑で不透明な患者動態のため治療が困難である集中治療室の感染症に焦点を当てた。
論文参考訳（メタデータ） (2020-03-13T20:31:47Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。