論文の概要: Evaluating covariate balance for long time horizon Markov decision processes
- arxiv url: http://arxiv.org/abs/2607.15080v1
- Date: Thu, 16 Jul 2026 14:49:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.142844
- Title: Evaluating covariate balance for long time horizon Markov decision processes
- Title(参考訳): 長期水平マルコフ決定過程における共変量バランスの評価
- Abstract要約: その結果、既存のオフラインRL研究には、治療勧告のためのバイアスの高いリスクがあることが示されている。
以上の結果から,より方法論的に堅牢なオフラインRLを治療勧告問題に適用するための今後の研究の方向性が示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This article explores the application of covariate balance diagnostics for detecting the presence of hidden confounding/model miss-specification in studies applying offline reinforcement learning (RL) to deriving optimal treatment recommendations. The results demonstrate that, either there is a high risk of bias within existing offline RL studies for treatment recommendations or, existing covariate balance metrics are not sufficient to assess such studies. Regardless, existing offline RL studies cannot be concluded as being statistically robust. The conclusions propose future research directions for obtaining more methodologically robust applications of offline RL to treatment recommendation problems.
- Abstract(参考訳): 本稿では, オフライン強化学習(RL)を応用し, 最適治療勧告を導出する研究において, 隠れコンバウンディング/モデルミス特定の存在を検出するために, 共変量バランス診断の適用について検討する。
その結果、既存のオフラインRL研究に治療勧告のためのバイアスの高いリスクがあるか、あるいは既存の共変量バランス指標がそのような研究を評価するのに不十分であることが示された。
いずれにせよ、既存のオフラインRL研究は統計的に堅牢であると結論付けることはできない。
以上の結果から,より方法論的に堅牢なオフラインRLを治療勧告問題に適用するための今後の研究方向性が示唆された。
関連論文リスト
- Causal Flow Q-Learning for Robust Offline Reinforcement Learning [53.63254824501714]
構築された実演から表現型フローマッチングポリシーを学習する実践的実装を提案する。
提案手法は,最先端のオフラインRL法よりも120%の成功率を達成する。
論文 参考訳(メタデータ) (2026-02-02T21:50:52Z) - Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models [30.267708813420587]
データ汚染は大規模言語モデル(LLM)の信頼性評価に重大な脅威をもたらす
この問題は、ベンチマークサンプルが必然的にトレーニングセットに現れ、報告されたパフォーマンスの有効性を損なうことになる。
本稿では,RLポストトレーニングのための特殊汚染検出手法として,自己批判を提案する。
論文 参考訳(メタデータ) (2025-10-10T10:58:50Z) - Unsupervised Data Generation for Offline Reinforcement Learning: A Perspective from Model [57.20064815347607]
オフライン強化学習(RL)は、最近RL研究者から関心が高まりつつある。
オフラインRLの性能は、オンラインRLのフィードバックによって修正できる配布外問題に悩まされる。
本稿では、まず、バッチデータとオフラインRLアルゴリズムの性能を理論的に橋渡しする。
タスクに依存しない環境では、教師なしのRLによって訓練された一連のポリシーは、パフォーマンスギャップにおける最悪の後悔を最小限に抑えることができることを示す。
論文 参考訳(メタデータ) (2025-06-24T14:08:36Z) - SUMO: Search-Based Uncertainty Estimation for Model-Based Offline Reinforcement Learning [27.701895830821197]
代案としてtextbfModel ベースの textbfOffline RL (SUMO) に対する textbfSearch ベースの textbfUncertainty 推定法を提案する。
私たちのコードは利用可能で、さらなる研究と開発のためにオープンソースになります。
論文 参考訳(メタデータ) (2024-08-23T10:36:08Z) - Reinforcement Learning in Dynamic Treatment Regimes Needs Critical Reexamination [7.162274565861427]
動的治療体制におけるオフライン強化学習は 前例のない機会と課題が混在している。
不整合性や潜在的に決定的でない評価指標などの懸念を引用して、動的治療体制におけるRLの適用の再評価を論じる。
評価指標の変化やマルコフ決定過程(MDP)の定式化によって,RLアルゴリズムの性能が著しく変化することを示した。
論文 参考訳(メタデータ) (2024-05-28T20:03:18Z) - Deep Offline Reinforcement Learning for Real-world Treatment
Optimization Applications [3.770564448216192]
オフラインRLトレーニングにおける動作不均衡に対処するための,実践的かつ理論的に基礎的な遷移サンプリング手法を提案する。
糖尿病と敗血症治療最適化のための2つの現実的課題について広範な実験を行った。
本提案手法は, 様々な原則および臨床関連指標を用いて, 期待される健康影響を大幅に改善できることを示す。
論文 参考訳(メタデータ) (2023-02-15T09:30:57Z) - Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement
Learning [125.8224674893018]
オフライン強化学習(RL)は、環境を探索することなく、以前に収集したデータセットからポリシーを学ぶことを目的としている。
オフポリシーアルゴリズムをオフラインRLに適用することは、通常、オフ・オブ・ディストリビューション(OOD)アクションによって引き起こされる外挿エラーによって失敗する。
本稿では,PBRL(Pepsimistic Bootstrapping for offline RL)を提案する。
論文 参考訳(メタデータ) (2022-02-23T15:27:16Z) - Importance of Empirical Sample Complexity Analysis for Offline
Reinforcement Learning [55.90351453865001]
オフラインデータから学習するサンプルの数に依存しているかどうかを問う。
我々の目的は、オフラインRLのサンプル複雑性の研究が重要であり、既存のオフラインアルゴリズムの有用性を示す指標である点を強調することである。
論文 参考訳(メタデータ) (2021-12-31T18:05:33Z) - Pessimistic Model Selection for Offline Deep Reinforcement Learning [56.282483586473816]
深層強化学習(DRL)は多くのアプリケーションにおいてシーケンシャルな意思決定問題を解決する大きな可能性を示している。
主要な障壁の1つは、DRLが学んだ政策の一般化性の低下につながる過度に適合する問題である。
理論的保証のあるオフラインDRLに対する悲観的モデル選択(PMS)手法を提案する。
論文 参考訳(メタデータ) (2021-11-29T06:29:49Z) - False Correlation Reduction for Offline Reinforcement Learning [115.11954432080749]
本稿では,実効的かつ理論的に証明可能なアルゴリズムであるオフラインRLに対するfalSe Correlation Reduction (SCORE)を提案する。
SCOREは、標準ベンチマーク(D4RL)において、様々なタスクにおいて3.1倍の高速化でSoTA性能を達成することを実証的に示す。
論文 参考訳(メタデータ) (2021-10-24T15:34:03Z) - Instabilities of Offline RL with Pre-Trained Neural Representation [127.89397629569808]
オフライン強化学習(RL)では、オフラインデータを利用して、評価対象のポリシーのそれとは大きく異なる分布からデータが収集されるシナリオでポリシーを評価する(または学習する)ことを目指しています。
最近の理論的進歩は、そのようなサンプル効率の良いオフラインRLが確かにある強い表現条件が保持されることを示した。
本研究は,オフラインrlメソッドの安定性を評価するために,経験的視点からこれらの問題を考察する。
論文 参考訳(メタデータ) (2021-03-08T18:06:44Z) - Trajectory Inspection: A Method for Iterative Clinician-Driven Design of
Reinforcement Learning Studies [5.5302127686575435]
モデルベースRL研究において,臨床医を反復的設計プロセスに組み込むための簡単なアプローチであるトラジェクトリ・インスペクション(trajectory inspection)を強調した。
モデルが予想外のアグレッシブな治療を推奨するか、あるいはその推奨から驚くほどポジティブな結果を期待するかを特定します。
論文 参考訳(メタデータ) (2020-10-08T22:03:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。