Fugu-MT 論文翻訳(概要): Synthesising Electronic Health Records: Cystic Fibrosis Patient Group

論文の概要: Synthesising Electronic Health Records: Cystic Fibrosis Patient Group

arxiv url: http://arxiv.org/abs/2201.05400v1
Date: Fri, 14 Jan 2022 11:35:18 GMT
ステータス: 翻訳完了
システム内更新日: 2022-01-17 19:04:42.752530
Title: Synthesising Electronic Health Records: Cystic Fibrosis Patient Group
Title（参考訳）: 電子健康記録の合成:嚢胞性線維症患者グループ
Authors: Emily Muller, Xu Zheng, Jer Hayes
Abstract要約: 本稿では,患者電子健康記録を合成する合成データ生成機能について検討する。本研究では, 患者結果分類のための合成データの有用性を検証し, 不均衡なデータセットを合成データで拡張する際の予測性能の向上を検証した。
参考スコア（独自算出の注目度）: 3.255030588361125
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Class imbalance can often degrade predictive performance of supervised learning algorithms. Balanced classes can be obtained by oversampling exact copies, with noise, or interpolation between nearest neighbours (as in traditional SMOTE methods). Oversampling tabular data using augmentation, as is typical in computer vision tasks, can be achieved with deep generative models. Deep generative models are effective data synthesisers due to their ability to capture complex underlying distributions. Synthetic data in healthcare can enhance interoperability between healthcare providers by ensuring patient privacy. Equipped with large synthetic datasets which do well to represent small patient groups, machine learning in healthcare can address the current challenges of bias and generalisability. This paper evaluates synthetic data generators ability to synthesise patient electronic health records. We test the utility of synthetic data for patient outcome classification, observing increased predictive performance when augmenting imbalanced datasets with synthetic data.
Abstract（参考訳）: クラス不均衡はしばしば教師付き学習アルゴリズムの予測性能を低下させる。バランスの取れたクラスは、正確なコピーをオーバーサンプリングしたり、ノイズを付けたり、近隣の(従来のSMOTEメソッドのように)補間することで得る。コンピュータビジョンタスクで典型的である拡張を用いた表形式のデータのオーバーサンプリングは、深い生成モデルによって達成できる。深層生成モデル(deep generative models)は、複雑な分布をキャプチャする能力があるため、効果的なデータ合成器である。医療における合成データは、患者のプライバシーを確保することで、医療提供者間の相互運用性を高めることができる。医療における機械学習は、小さな患者グループをうまく表現できる大規模な合成データセットを備えており、バイアスと一般化可能性の現在の課題に対処することができる。本稿では患者電子健康記録を合成する合成データ生成機能について検討する。患者結果分類のための合成データの有用性を検証し、不均衡なデータセットを合成データで増強する際の予測性能の向上を観察する。

関連論文リスト

MedEqualizer: A Framework Investigating Bias in Synthetic Medical Data and Mitigation via Augmentation [8.526339099878962]
MIMIC-IIIデータセットを用いたGANモデルを用いて合成データの公平性を評価する。 MedEqualizerはモデルに依存しない拡張フレームワークで、合成データ生成の前に表現されていない部分群を豊かにする。
論文参考訳（メタデータ） (2025-11-02T19:16:50Z)
Improving the Generation and Evaluation of Synthetic Data for Downstream Medical Causal Inference [89.5628648718851]
因果推論は医療介入の開発と評価に不可欠である。現実の医療データセットは、規制障壁のためアクセスが難しいことが多い。本稿では,医学における治療効果分析のための新しい合成データ生成法STEAMを提案する。
論文参考訳（メタデータ） (2025-10-21T16:16:00Z)
Prototype-Guided Diffusion for Digital Pathology: Achieving Foundation Model Performance with Minimal Clinical Data [6.318463500874778]
本研究では,高忠実度合成病理データを大規模に生成するプロトタイプ誘導拡散モデルを提案する。我々のアプローチは、生成したデータの生物学的、診断学的に有意義な変動を保証します。我々は、大規模な実世界のデータセットでトレーニングされたモデルよりも60倍-760倍少ないデータを使用しても、我々の合成データセットでトレーニングされた自己教師機能によって競争性能が向上することを示した。
論文参考訳（メタデータ） (2025-04-15T21:17:39Z)
Scaling Laws of Synthetic Data for Language Models [132.67350443447611]
プレトレーニングコーパスを多種多様な高品質な合成データセットに変換するスケーラブルなフレームワークであるSynthLLMを紹介した。提案手法は,グラフアルゴリズムを用いて複数の文書にまたがるハイレベルな概念を自動的に抽出し,再結合することで実現している。
論文参考訳（メタデータ） (2025-03-25T11:07:12Z)
Cancer-Net SCa-Synth: An Open Access Synthetically Generated 2D Skin Lesion Dataset for Skin Cancer Classification [65.83291923029985]
アメリカ合衆国では、皮膚がんが最も一般的に診断されるがんと位置づけられており、公衆衛生上の問題となっている。データセットのキュレーションとディープラーニングの進歩により、皮膚がんの迅速かつ正確な検出が期待できる。 Cancer-Net SCa- Synthは、皮膚がん分類のためのオープンアクセス合成された2D皮膚病変データセットである。
論文参考訳（メタデータ） (2024-11-08T02:04:21Z)
Unveiling the Flaws: Exploring Imperfections in Synthetic Data and Mitigation Strategies for Large Language Models [89.88010750772413]
大規模言語モデル(LLM)の学習における高品質なデータ不足問題に対する解決法として,合成データを提案する。我々の研究は、Q-A(Q-A)ペア、一般的な合成データに関連するこれらの特定の欠陥を掘り下げ、これらの欠陥を軽減するための未学習技術に基づく方法を提案する。我々の研究は、より堅牢で効率的なLLMトレーニングを促進することを目的として、合成データの効果的な利用に関する重要な洞察を得た。
論文参考訳（メタデータ） (2024-06-18T08:38:59Z)
Synthetic Oversampling: Theory and A Practical Approach Using LLMs to Address Data Imbalance [16.047084318753377]
不均衡な分類と急激な相関は、データサイエンスと機械学習における一般的な課題である。近年の進歩は、大規模言語モデルの柔軟性と生成能力を生かして合成サンプルを生成することを提案した。本稿では,不均衡な分類とスプリアス相関に対処する上で,合成試料の役割を体系的に研究する新たな理論基盤を開発する。
論文参考訳（メタデータ） (2024-06-05T21:24:26Z)
Bt-GAN: Generating Fair Synthetic Healthdata via Bias-transforming Generative Adversarial Networks [3.3903891679981593]
本稿では,医療領域に特化して設計されたGANベースの合成データジェネレータであるBias-transforming Generative Adversarial Networks (Bt-GAN)について述べる。以上の結果から,Bt-GANはSOTA精度を向上し,公平性とバイアスの最小化を図った。
論文参考訳（メタデータ） (2024-04-21T12:16:38Z)
Unconditional Latent Diffusion Models Memorize Patient Imaging Data: Implications for Openly Sharing Synthetic Data [2.1375651880073834]
生成型AIモデルは、オープンデータの共有を容易にするために注目を集めている。これらのモデルは、新規な合成サンプルの代わりに患者データコピーを生成する。我々は,合成データ生成のためのCT,MR,X線データセット上で2次元および3次元潜時拡散モデルを訓練する。
論文参考訳（メタデータ） (2024-02-01T22:58:21Z)
Let's Synthesize Step by Step: Iterative Dataset Synthesis with Large Language Models by Extrapolating Errors from Small Models [69.76066070227452]
※データ合成*はラベル付きデータの少ない小さなモデルをトレーニングするための有望な方法です。本稿では,この分散ギャップを縮めるデータ合成フレームワークであるStep* (**S3**) による合成ステップを提案する。提案手法は,合成データセットと実データとのギャップを小さくすることで,小型モデルの性能を向上させる。
論文参考訳（メタデータ） (2023-10-20T17:14:25Z)
How Good Are Synthetic Medical Images? An Empirical Study with Lung Ultrasound [0.3312417881789094]
生成モデルを使用して合成トレーニングデータを追加することで、データの不足に対処するための低コストな方法が提供される。合成データと実データの両方によるトレーニングは、実データのみによるトレーニングよりも優れていることを示す。
論文参考訳（メタデータ） (2023-10-05T15:42:53Z)
TREEMENT: Interpretable Patient-Trial Matching via Personalized Dynamic Tree-Based Memory Network [54.332862955411656]
臨床試験は薬物開発に不可欠であるが、しばしば高価で非効率な患者募集に苦しむ。近年,患者と臨床試験を自動マッチングすることで患者採用を高速化する機械学習モデルが提案されている。本稿では,TREement という名前の動的ツリーベースメモリネットワークモデルを導入する。
論文参考訳（メタデータ） (2023-07-19T12:35:09Z)
Synthetic data, real errors: how (not) to publish and use synthetic data [86.65594304109567]
生成過程が下流MLタスクにどのように影響するかを示す。本稿では、生成プロセスモデルパラメータの後方分布を近似するために、Deep Generative Ensemble (DGE)を導入する。
論文参考訳（メタデータ） (2023-05-16T07:30:29Z)
Evaluation of the Synthetic Electronic Health Records [3.255030588361125]
本研究は、合成データセットのサンプルワイズ評価のための類似性と特異性という2つの指標を概説する。本研究は,Cystic Fibrosis (CF) 患者の電子的健康記録を合成するために,いくつかの最先端の遺伝子モデルを用いて提案された概念を実証する。
論文参考訳（メタデータ） (2022-10-16T22:46:08Z)
The Health Gym: Synthetic Health-Related Datasets for the Development of Reinforcement Learning Algorithms [2.032684842401705]
Health Gymは、機械学習アルゴリズムのプロトタイプ、評価、比較に自由にアクセス可能な、合成医療データセットのコレクションである。このデータセットはGAN(Generative Adversarial Network)を用いて作成された。合成データセットの公開分布に関連する機密情報開示のリスクは非常に低いと推定される。
論文参考訳（メタデータ） (2022-03-12T07:28:02Z)
Bootstrapping Your Own Positive Sample: Contrastive Learning With Electronic Health Record Data [62.29031007761901]
本稿では,新しいコントラスト型正規化臨床分類モデルを提案する。 EHRデータに特化した2つのユニークなポジティブサンプリング戦略を紹介します。私たちのフレームワークは、現実世界のCOVID-19 EHRデータの死亡リスクを予測するために、競争の激しい実験結果をもたらします。
論文参考訳（メタデータ） (2021-04-07T06:02:04Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。