論文の概要: A Pipeline for Generating Longitudinal Synthetic Clinical Notes Using Large Language Models
- arxiv url: http://arxiv.org/abs/2606.26879v2
- Date: Fri, 26 Jun 2026 10:20:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 13:57:07.336303
- Title: A Pipeline for Generating Longitudinal Synthetic Clinical Notes Using Large Language Models
- Title(参考訳): 大規模言語モデルを用いた経時的臨床ノート作成のためのパイプライン
- Abstract要約: この研究は、臨床AIツールの開発を支援するために設計された、合成臨床ノートパイプラインとデータセットを導入している。
データセットは、構造化された患者生成、半構造化された患者旅行シミュレーション、非構造化された臨床ノート生成を組み合わせたモジュールパイプラインを使用して生成される。
本研究は,70名の総合患者を対象とし,全入院期間に20~50名の臨床ノートを添付したデータセットを作成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthetic data is increasingly used to enable the development and evaluation of AI systems in domains where access to real-world data is restricted. In healthcare, clinical documentation presents particular challenges due to its sensitivity. This work introduces a synthetic clinical notes pipeline and dataset designed to support the development of clinical AI tools while avoiding the privacy risks associated with real patient data. The dataset is generated using a modular pipeline that combines structured patient generation, semi-structured patient journey simulation, and unstructured clinical note generation using large language models. The pipeline is designed to prioritise internal consistency across longitudinal patient records, while also capturing variation in writing style, note structure, and clinical detail. Additional mechanisms, including LLM-based validation and augmentation steps, are used to improve faithfulness, realism, and diversity of the generated notes. We release a dataset of 70 synthetic patients, each associated with 20-50 clinical notes spanning a full hospital journey. The dataset is provided at multiple levels of validation, enabling users to balance realism and scalability depending on their use case. This dataset supports the development, testing, and evaluation of clinical AI systems, including summarisation tools, coding models, and decision support systems, without reliance on real patient data.
- Abstract(参考訳): 合成データは、現実世界のデータへのアクセスが制限された領域におけるAIシステムの開発と評価を可能にするために、ますます利用されている。
医療において、臨床文書は、その感受性のために特定の課題を提示する。
この研究は、臨床AIツールの開発を支援するために設計された合成臨床ノートパイプラインとデータセットを導入し、実際の患者データに関連するプライバシーリスクを回避する。
データセットは、構造化患者生成、半構造化患者旅行シミュレーション、および大規模言語モデルを用いた非構造化臨床ノート生成を組み合わせたモジュールパイプラインを使用して生成される。
このパイプラインは、患者の長期記録にまたがる内部の一貫性を優先し、書き込みスタイル、メモ構造、臨床詳細の変動を捉えるように設計されている。
LLMに基づく検証と拡張ステップを含む追加のメカニズムは、生成したノートの忠実性、リアリズム、多様性を改善するために使用される。
本研究は,70名の総合患者を対象とし,全入院期間に20~50名の臨床ノートを添付したデータセットを作成した。
データセットは、複数のレベルのバリデーションで提供されており、ユーザはユースケースに応じて、リアリズムとスケーラビリティのバランスをとることができる。
このデータセットは、実際の患者データに頼ることなく、要約ツール、コーディングモデル、意思決定支援システムを含む、臨床AIシステムの開発、テスト、評価をサポートする。
関連論文リスト
- Future Querying: Can LLMs Serve as Implicit Medical World Models? [3.3341114691426257]
我々は,大規模言語モデル(LLM)が暗黙の医療世界モデルとして機能するかどうかを探索するパラダイムである,未来のクエリーを導入する。
本フレームワークは,エンドポイントに依存しないトレーニングを用いて,非構造的臨床文書を運用する。
局所的に微調整された小型オープンウェイトモデルは、より大きなプロプライエタリなシステムにマッチまたはアプローチ可能であることを示す。
論文 参考訳(メタデータ) (2026-08-24T13:41:12Z) - PatTree: a novel approach for automated creation of multimodal, graph-based patient representations for medical classification tasks [0.13999481573773073]
PatTreeは、実際の臨床データから得られるグラフベースの患者の表現である。
本稿では,PatTreeによる患者の分類が,最先端の分類性能に到達できることを実証する。
論文 参考訳(メタデータ) (2026-08-03T09:44:35Z) - Improving Cardiac Risk Prediction Using Data Generation Techniques [37.94487163156369]
本研究は,実世界の観測と整合したリアルな臨床記録の合成のためのアーキテクチャを提案する。
主な目的は、心的リスク予測モデルの性能を高めるため、利用可能なデータセットのサイズと多様性を高めることである。
論文 参考訳(メタデータ) (2025-12-19T10:17:00Z) - CURENet: Combining Unified Representations for Efficient Chronic Disease Prediction [24.569877750738286]
CURENetは、構造化されていない臨床ノート、検査結果、患者の時系列データを統合するマルチモーダルモデルである。
CURENetは、さまざまな臨床データ間の複雑な相互作用を捉え、慢性疾患のより信頼性の高い予測モデルを作成することができる。
論文 参考訳(メタデータ) (2025-11-14T15:52:22Z) - Improving the Generation and Evaluation of Synthetic Data for Downstream Medical Causal Inference [89.5628648718851]
因果推論は医療介入の開発と評価に不可欠である。
現実の医療データセットは、規制障壁のためアクセスが難しいことが多い。
本稿では,医学における治療効果分析のための新しい合成データ生成法STEAMを提案する。
論文 参考訳(メタデータ) (2025-10-21T16:16:00Z) - Patient-Zero: A Unified Framework for Real-Record-Free Patient Agent Generation [11.75912414451272]
実際の医療記録を必要としない現実的な患者生成フレームワークであるPatent-Zeroを提案する。
patient-Zeroはまず、医療に整合したマルチステップ生成アーキテクチャを導入し、実際の医療記録を使わずに階層的な医療知識注入を通じて包括的な患者記録を構築する。
本フレームワークは,適応的対話戦略とリアルタイム臨床的妥当性検証によって支援され,厳密な医療コヒーレンスを維持しつつ,文脈的に多様な患者記録の生成を可能にする。
論文 参考訳(メタデータ) (2025-09-14T03:56:00Z) - A Comprehensive Review of Datasets for Clinical Mental Health AI Systems [55.67299586253951]
本稿では,AIを活用した臨床アシスタントの訓練・開発に関連する臨床精神保健データセットの総合的調査を行う。
本調査では, 縦断データの欠如, 文化・言語表現の制限, 一貫性のない収集・注釈基準, 合成データのモダリティの欠如など, 重要なギャップを明らかにした。
論文 参考訳(メタデータ) (2025-08-13T13:42:35Z) - SynRL: Aligning Synthetic Clinical Trial Data with Human-preferred Clinical Endpoints Using Reinforcement Learning [22.667682393222986]
患者データ生成装置の性能向上のために強化学習を活用するSynRLを提案する。
提案手法は,生成したデータの品質を評価するためのデータ値批判機能と,データジェネレータとユーザニーズを整合させる強化学習を利用する。
論文 参考訳(メタデータ) (2024-11-11T19:19:46Z) - TrialBench: Multi-Modal Artificial Intelligence-Ready Clinical Trial Datasets [54.98321887435557]
本稿では, マルチモーダル入力特徴と臨床治験設計における8つの重要な予測課題を網羅した, 精巧にキュレートされた23個のAI対応データセットについて述べる。
データセットのユーザビリティと信頼性を確保するため、各タスクに基本的な検証方法を提供する。
このようなオープンアクセスデータセットが利用可能になることは、臨床試験設計のための高度なAIアプローチの開発を促進することを期待する。
論文 参考訳(メタデータ) (2024-06-30T09:13:10Z) - Clairvoyance: A Pipeline Toolkit for Medical Time Series [95.22483029602921]
時系列学習は、データ駆動の*クリニカルな意思決定支援のパンとバターである*
Clairvoyanceは、ソフトウェアツールキットとして機能する、統合されたエンドツーエンドのオートMLフレンドリなパイプラインを提案する。
Clairvoyanceは、臨床時系列MLのための包括的で自動化可能なパイプラインの生存可能性を示す最初のものである。
論文 参考訳(メタデータ) (2023-10-28T12:08:03Z) - TREEMENT: Interpretable Patient-Trial Matching via Personalized Dynamic
Tree-Based Memory Network [54.332862955411656]
臨床試験は薬物開発に不可欠であるが、しばしば高価で非効率な患者募集に苦しむ。
近年,患者と臨床試験を自動マッチングすることで患者採用を高速化する機械学習モデルが提案されている。
本稿では,TREement という名前の動的ツリーベースメモリネットワークモデルを導入する。
論文 参考訳(メタデータ) (2023-07-19T12:35:09Z) - Modular Clinical Decision Support Networks (MoDN) -- Updatable,
Interpretable, and Portable Predictions for Evolving Clinical Environments [46.434488407226155]
我々はModular Clinical Decision Support Networks (MoDN)を提案する。
MoDNは、IIOデータセット間で柔軟なプライバシ保護学習を可能にする。
患者の動的パーソナライズされた表現を生成し、診断の複数の予測を行うことができる。
論文 参考訳(メタデータ) (2022-11-12T11:10:46Z) - Trajectories, bifurcations and pseudotime in large clinical datasets:
applications to myocardial infarction and diabetes data [94.37521840642141]
混合データ型と欠落値を特徴とする大規模臨床データセット分析のための半教師付き方法論を提案する。
この手法は、次元の減少、データの可視化、クラスタリング、特徴の選択と、部分的に順序付けられた観測列における測地距離(擬時)の定量化のタスクを同時に扱うことのできる弾性主グラフの適用に基づいている。
論文 参考訳(メタデータ) (2020-07-07T21:04:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。