論文の概要: Near-Equivalent Q-learning Policies for Dynamic Treatment Regimes
- arxiv url: http://arxiv.org/abs/2603.19440v1
- Date: Thu, 19 Mar 2026 20:08:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.862075
- Title: Near-Equivalent Q-learning Policies for Dynamic Treatment Regimes
- Title(参考訳): 動的治療レジームのためのほぼ等価Q-ラーニングポリシー
- Authors: Sophia Yazzourh, Erica E. M. Moodie,
- Abstract要約: 最悪の許容基準を導入することで、振り返りデータのためのQラーニングフレームワークを拡張します。
提案手法は、最適の制御された近傍で性能が維持されるような、$varepsilon$-optimal Policyの集合を構成することを示す。
決定境界付近の差分領域をハイライトする単一ステージ問題と、シミュレーションオンコロジーモデルに基づく多段階決定プロセスの2つの設定で説明する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Precision medicine aims to tailor therapeutic decisions to individual patient characteristics. This objective is commonly formalized through dynamic treatment regimes, which use statistical and machine learning methods to derive sequential decision rules adapted to evolving clinical information. In most existing formulations, these approaches produce a single optimal treatment at each stage, leading to a unique decision sequence. However, in many clinical settings, several treatment options may yield similar expected outcomes, and focusing on a single optimal policy may conceal meaningful alternatives. We extend the Q-learning framework for retrospective data by introducing a worst-value tolerance criterion controlled by a hyperparameter $\varepsilon$, which specifies the maximum acceptable deviation from the optimal expected value. Rather than identifying a single optimal policy, the proposed approach constructs sets of $\varepsilon$-optimal policies whose performance remains within a controlled neighborhood of the optimum. This formulation shifts Q-learning from a vector-valued representation to a matrix-valued one, allowing multiple admissible value functions to coexist during backward recursion. The approach yields families of near-equivalent treatment strategies and explicitly identifies regions of treatment indifference where several decisions achieve comparable outcomes. We illustrate the framework in two settings: a single-stage problem highlighting indifference regions around the decision boundary, and a multi-stage decision process based on a simulated oncology model describing tumor size and treatment toxicity dynamics.
- Abstract(参考訳): 精密医療は、患者の個々の特性に合わせて治療決定を調整することを目的としている。
この目的は、統計的および機械学習手法を用いて、進化する臨床情報に適応したシーケンシャルな決定規則を導出する動的治療体制を通じて、一般的に定式化されている。
既存の多くの定式化において、これらの手法は各段階で一つの最適処理を生成し、一意な決定順序をもたらす。
しかし、多くの臨床試験では、いくつかの治療法が同様の期待された結果をもたらす可能性があり、一つの最適なポリシーに焦点を合わせることで、意味のある選択肢を隠蔽することができる。
最適値から許容できる最大偏差を指定するハイパーパラメータ$\varepsilon$によって制御される最低値耐性基準を導入することで、振り返りデータに対するQラーニングフレームワークを拡張した。
提案手法は、一つの最適ポリシーを特定するのではなく、最適化の制御された近傍で性能が維持されるような、$\varepsilon$-optimal Policyのセットを構築する。
この定式化は、Q-ラーニングをベクトル値表現から行列値表現にシフトさせ、後方再帰時に複数の許容値関数が共存できるようにする。
このアプローチは、ほぼ等価な治療戦略の家族を生み出し、いくつかの決定が同等の結果を得る治療の無関心領域を明確に特定する。
この枠組みは, 判定境界付近の差分領域を強調する単段階問題と, 腫瘍の大きさと治療毒性の動態を模擬した腫瘍学モデルに基づく多段階決定プロセスである。
関連論文リスト
- An incremental preference elicitation-based approach to learning potentially non-monotonic preferences in multi-criteria sorting [53.36437745983783]
まず最適化モデルを構築し,非単調な選好をモデル化する。
本稿では,情報量測定手法と質問選択戦略を考案し,各イテレーションにおいて最も情報に富む選択肢を特定する。
2つのインクリメンタルな選好に基づくアルゴリズムは、潜在的に単調な選好を学習するために開発された。
論文 参考訳(メタデータ) (2024-09-04T14:36:20Z) - Deterministic Policy Gradient Primal-Dual Methods for Continuous-Space Constrained MDPs [82.34567890576423]
我々は,非漸近収束を伴う最適決定主義政策を求めるための決定主義的政策勾配原始双対法を開発した。
D-PGPDの一次-双対反復は、最適正則化原始-双対にサブ線形速度で収束することが証明された。
これは連続空間制約型MDPに対する決定論的ポリシー探索法を提案する最初の研究である。
論文 参考訳(メタデータ) (2024-08-19T14:11:04Z) - Likelihood Ratio Confidence Sets for Sequential Decision Making [51.66638486226482]
確率に基づく推論の原理を再検討し、確率比を用いて妥当な信頼シーケンスを構築することを提案する。
本手法は, 精度の高い問題に特に適している。
提案手法は,オンライン凸最適化への接続に光を当てることにより,推定器の最適シーケンスを確実に選択する方法を示す。
論文 参考訳(メタデータ) (2023-11-08T00:10:21Z) - Stage-Aware Learning for Dynamic Treatments [3.6923632650826486]
動的治療体制のための新しい個別化学習法を提案する。
観測軌道が最適処理と完全に一致しなければならないという制約を緩和することにより,本手法はIPWE法における試料効率と安定性を大幅に改善する。
論文 参考訳(メタデータ) (2023-10-30T06:35:31Z) - High-probability sample complexities for policy evaluation with linear function approximation [88.87036653258977]
本研究では,2つの広く利用されている政策評価アルゴリズムに対して,最適線形係数の予め定義された推定誤差を保証するために必要なサンプル複素量について検討する。
高確率収束保証に縛られた最初のサンプル複雑性を確立し、許容レベルへの最適依存を実現する。
論文 参考訳(メタデータ) (2023-05-30T12:58:39Z) - Asymptotic Inference for Multi-Stage Stationary Treatment Policy with Variable Selection [13.202945240520986]
動的治療体制またはポリシーは、個々の特徴に合わせた複数の段階にわたる決定機能の連続である。
実際の治療方針の1つの重要なクラス、すなわち多段階定常治療政策は、複数の段階にわたって同じ決定関数を用いて治療課題を規定する。
動的治療ポリシーに関連する値関数に対する有効な推論を構築することについては、広範な文献があるが、ポリシー自体に焦点をあてる研究はほとんどない。
論文 参考訳(メタデータ) (2023-01-29T22:00:53Z) - Optimal discharge of patients from intensive care via a data-driven
policy learning framework [58.720142291102135]
退院課題は、退院期間の短縮と退院決定後の退院や死亡のリスクとの不確実なトレードオフに対処することが重要である。
本研究は、このトレードオフを捉えるためのエンドツーエンドの汎用フレームワークを導入し、最適放電タイミング決定を推奨する。
データ駆動型アプローチは、患者の生理的状態を捉えた同種で離散的な状態空間表現を導出するために用いられる。
論文 参考訳(メタデータ) (2021-12-17T04:39:33Z) - Estimation of Optimal Dynamic Treatment Assignment Rules under Policy Constraints [0.0]
本研究は,各段階の個人に対して,その履歴に基づいて最適な治療課題を導出する最適動的治療体制の推定について検討する。
提案手法は, 下位帰納的帰納的帰納的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属的帰属
論文 参考訳(メタデータ) (2021-06-09T12:42:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。