論文の概要: OncoSynth: Synthetic data generation for treatment effect estimation in oncology
- arxiv url: http://arxiv.org/abs/2606.25762v1
- Date: Wed, 24 Jun 2026 12:37:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.327181
- Title: OncoSynth: Synthetic data generation for treatment effect estimation in oncology
- Title(参考訳): OncoSynth: 腫瘍学における治療効果推定のための合成データ生成
- Authors: Octavia-Andreea Ciora, Julian Welzel, Dennis Frauen, Maresa Schröder, Marie Brockschmidt, Harry Amad, Thomas Callender, Mihaela van der Schaar, Stefan Feuerriegel,
- Abstract要約: Inco Synthは,合成コホートを生成するために設計された,生成的,因果認識型機械学習フレームワークである。
Onco Synthは、現実世界の患者、治療、および結果の分布を保存する高忠実な合成患者コホートを生成する。
特に、Onco Synthは、患者レベルの治療効果のエラーを最大66%減らし、患者レベルの治療効果のエラーを最大58%減らして、既存のアプローチよりも治療効果の見積もりを改善する。
- 参考スコア(独自算出の注目度): 69.49073258158747
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In oncology, access to patient-level data is often restricted. Synthetic data provides an alternative for analyzing treatment effectiveness, but existing methods for synthetic data generation fail to preserve the causal relationships between covariates, treatments, and outcomes, thereby leading to biased estimates of treatment effects. Here, we introduce OncoSynth, a generative, causally-aware machine learning framework designed to produce synthetic cohorts that enable accurate estimation of population- and patient-level treatment effects. OncoSynth uses a diffusion-based sequential approach to model how covariates influence treatment assignment and how treatment affects survival. We evaluate OncoSynth using large lung (N = 37,128) and breast cancer (N = 17,046) cohorts. Our results show that OncoSynth generates high-fidelity synthetic patient cohorts that preserve real-world patient, treatment, and outcome distributions. Notably, OncoSynth improves treatment effect estimation over existing approaches, by reducing population-level treatment effect error by up to 66%, and patient-level treatment effect error by up to 58%. Thereby, OncoSynth supports reliable evidence generation for precision oncology in settings where data sharing is restricted.
- Abstract(参考訳): 腫瘍学では、患者レベルのデータへのアクセスは、しばしば制限される。
合成データは、治療効果を分析する代替手段を提供するが、既存の合成データ生成法では、共変量、治療、結果の因果関係を保たないため、治療効果の偏りが生じる。
IncoSynthは、人口および患者レベルの治療効果の正確な推定を可能にする合成コホートを生成するために設計された、生成的、因果認識機械学習フレームワークである。
OncoSynthは拡散に基づくシーケンシャルアプローチを使用して、共変が治療の割り当てにどのように影響するか、そして治療が生存にどのように影響するかをモデル化する。
大肺(N=37,128)と乳癌(N=17,046)を用いたOncoSynthの評価を行った。
以上の結果から,OncoSynthは実世界の患者,治療,結果の分布を保ちながら,高忠実度な患者コホートを生成することが示唆された。
OncoSynthは、患者レベルの治療効果の誤差を最大66%減らし、患者レベルの治療効果の誤差を最大58%減らして、既存のアプローチよりも治療効果の見積もりを改善する。
これにより、OncoSynthは、データ共有が制限された環境での精度オンコロジーのための信頼できるエビデンス生成をサポートする。
関連論文リスト
- Generative Synthetic Data for Causal Inference: Pitfalls, Remedies, and Opportunities [4.144744763257738]
合成データは、プライバシ保護データリリース、拡張、シミュレーションのための有望なツールを提供する。
しかし、因果推論での使用には、予測的忠実性以上のものを保存する必要がある。
GANとLCMをベースとしたモデルを含む,完全生成型表層合成器は,強い合成・テスト・オン・リアルな性能を実現することができることを示す。
論文 参考訳(メタデータ) (2026-04-26T22:38:23Z) - Improving the Generation and Evaluation of Synthetic Data for Downstream Medical Causal Inference [89.5628648718851]
因果推論は医療介入の開発と評価に不可欠である。
現実の医療データセットは、規制障壁のためアクセスが難しいことが多い。
本稿では,医学における治療効果分析のための新しい合成データ生成法STEAMを提案する。
論文 参考訳(メタデータ) (2025-10-21T16:16:00Z) - Valid Inference with Imperfect Synthetic Data [39.10587411316875]
モーメントの一般化法に基づく新しい推定器を提案する。
合成データのモーメント残差と実データのモーメント間の相互作用は、対象パラメータの推定を大幅に改善できることがわかった。
論文 参考訳(メタデータ) (2025-08-08T18:32:52Z) - Enhancing Treatment Effect Estimation via Active Learning: A Counterfactual Covering Perspective [61.284843894545475]
治療効果推定のための複雑なアルゴリズムは、不十分なラベル付きトレーニングセットを扱う際には効果がない。
我々は,最適化目標をtextitFactual と textitCounterfactual Coverage Maximization に変換して,データ取得時の有効半径削減を実現するFCCMを提案する。
FCCMを他のベースラインに対してベンチマークすることは、完全に合成されたデータセットと半合成されたデータセットの両方にその優位性を示す。
論文 参考訳(メタデータ) (2025-05-08T13:42:00Z) - Generating Reliable Synthetic Clinical Trial Data: The Role of Hyperparameter Optimization and Domain Constraints [0.0]
本研究は,8つの生成モデルにまたがる4つのHPO戦略を系統的に評価する。
以上の結果から,HPOはTVAE,CTGAN,CTAB-GAN+をそれぞれ60%,39%,38%改善した。
HPOだけでは、すべてのモデルが基本的な生存制限に違反しているため、臨床的に有効な合成データを保証するには不十分である。
論文 参考訳(メタデータ) (2025-05-08T07:51:36Z) - TarDiff: Target-Oriented Diffusion Guidance for Synthetic Electronic Health Record Time Series Generation [26.116599951658454]
時系列生成は臨床機械学習モデルの進歩に不可欠である。
観測データのみに対する忠実性は、モデル性能の向上を保証するものではない、と我々は主張する。
タスク固有のインフルエンスガイダンスを統合した,新たなターゲット指向拡散フレームワークであるTarDiffを提案する。
論文 参考訳(メタデータ) (2025-04-24T14:36:10Z) - SynFER: Towards Boosting Facial Expression Recognition with Synthetic Data [78.70620682374624]
ハイレベルなテキスト記述に基づく表情画像データの合成のための新しいフレームワークであるSynFERを紹介する。
合成データの質と信頼性を確保するため,セマンティックガイダンス手法と擬似ラベル生成手法を提案する。
その結果, 提案手法の有効性と合成データの有効性が検証された。
論文 参考訳(メタデータ) (2024-10-13T14:58:21Z) - CATE Estimation With Potential Outcome Imputation From Local Regression [24.97657507206549]
本研究では,条件付き平均処理効果推定のためのモデルに依存しないデータ拡張手法を提案する。
このアイデアにインスパイアされた我々は、潜在的に欠落する可能性を確実に示唆する対照的な学習手法を提案する。
提案手法の有効性を実証する理論的保証と広範な数値的研究の両方を提供する。
論文 参考訳(メタデータ) (2023-11-07T00:36:51Z) - DeepRite: Deep Recurrent Inverse TreatmEnt Weighting for Adjusting
Time-varying Confounding in Modern Longitudinal Observational Data [68.29870617697532]
時系列データにおける時間変化の相違に対するDeep Recurrent Inverse TreatmEnt重み付け(DeepRite)を提案する。
DeepRiteは、合成データから基底的真理を復元し、実際のデータから偏りのない処理効果を推定する。
論文 参考訳(メタデータ) (2020-10-28T15:05:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。