論文の概要: Knowledge-Guided Retrieval-Augmented Generation for Zero-Shot Psychiatric Data: Privacy Preserving Synthetic Data Generation
- arxiv url: http://arxiv.org/abs/2603.25186v1
- Date: Thu, 26 Mar 2026 08:52:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.195265
- Title: Knowledge-Guided Retrieval-Augmented Generation for Zero-Shot Psychiatric Data: Privacy Preserving Synthetic Data Generation
- Title(参考訳): ゼロショット精神データのための知識ガイド付き検索型検索生成:合成データ生成のためのプライバシ保護
- Authors: Adam Jakobsen, Sushant Gautam, Hugo Lewi Hammer, Susanne Olofsdotter, Miriam S Johanson, Pål Halvorsen, Vajira Thambawita,
- Abstract要約: 大規模言語モデル(LLMs)は精神障害の診断・統計マニュアル(DSM-5)を用いて検索・拡張生成によって構成される
プライバシ保存型合成データを生成するために,異なる知識ベースの組み合わせを用いて実験を行った。
6つの不安関連疾患(特定恐怖症、社会的不安障害、アダラポビア、一般不安障害、分離不安障害、パニック障害)について評価を行った。
- 参考スコア(独自算出の注目度): 2.1555091946459854
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI systems in healthcare research have shown potential to increase patient throughput and assist clinicians, yet progress is constrained by limited access to real patient data. To address this issue, we present a zero-shot, knowledge-guided framework for psychiatric tabular data in which large language models (LLMs) are steered via Retrieval-Augmented Generation using the Diagnostic and Statistical Manual of Mental Disorders (DSM-5) and the International Classification of Diseases (ICD-10). We conducted experiments using different combinations of knowledge bases to generate privacy-preserving synthetic data. The resulting models were benchmarked against two state-of-the-art deep learning models for synthetic tabular data generation, namely CTGAN and TVAE, both of which rely on real data and therefore entail potential privacy risks. Evaluation was performed on six anxiety-related disorders: specific phobia, social anxiety disorder, agoraphobia, generalized anxiety disorder, separation anxiety disorder, and panic disorder. CTGAN typically achieves the best marginals and multivariate structure, while the knowledge-augmented LLM is competitive on pairwise structure and attains the lowest pairwise error in separation anxiety and social anxiety. An ablation study shows that clinical retrieval reliably improves univariate and pairwise fidelity over a no-retrieval LLM. Privacy analyses indicate that the real data-free LLM yields modest overlaps and a low average linkage risk comparable to CTGAN, whereas TVAE exhibits extensive duplication despite a low k-map score. Overall, grounding an LLM in clinical knowledge enables high-quality, privacy-preserving synthetic psychiatric data when real datasets are unavailable or cannot be shared.
- Abstract(参考訳): 医療研究におけるAIシステムは、患者のスループットを高め、臨床医を支援する可能性があるが、実際の患者データへのアクセス制限によって進歩が制限されている。
そこで本研究では,大規模言語モデル (LLM) を精神障害の診断・統計マニュアル (DSM-5) と国際疾患分類 (ICD-10) を用いて検索・拡張生成(Retrieval-Augmented Generation, DSM-5) によって管理する,ゼロショット・知識誘導型精神表型データのためのフレームワークを提案する。
プライバシ保存型合成データを生成するために,異なる知識ベースの組み合わせを用いて実験を行った。
得られたモデルは、2つの最先端のディープラーニングモデル、すなわちCTGANとTVAEでベンチマークされた。
6つの不安関連疾患(特定恐怖症、社会的不安障害、アダラポビア、一般不安障害、分離不安障害、パニック障害)について評価を行った。
CTGANは通常、最高の限界と多変量構造を達成し、知識を増強したLLMは、ペアワイズ構造と競合し、分離不安と社会的不安において最低のペアワイズ誤差を達成している。
アブレーション研究は、臨床検索が非検索LDMよりも一変量および一対忠実度を確実に改善することを示した。
プライバシ分析では、実際のデータフリーLLMはCTGANと同等の平均リンクリスクがやや重なり、一方TVAEはk-mapスコアが低いにもかかわらず広範囲に重複していることが示された。
全体として、臨床知識でLLMを基盤にすることで、実際のデータセットが利用できない、あるいは共有できない場合に、高品質でプライバシー保護された合成精神医学データを実現できる。
関連論文リスト
- Toward Valid Generative Clinical Trial Data with Survival Endpoints [4.7846041866823965]
既存の生成的アプローチは、主にGANベースであり、データハングリーであり、不安定であり、独立検閲のような強い前提に依存している。
独立検閲を前提とせず,混合型共変数と生存結果とを協調的に生成する変分オートエンコーダ(VAE)を導入する。
本手法は,タイプIエラーとパワーの系統的誤校正を図りながら,忠実度,ユーティリティ,プライバシの指標に基づいてGANの基準線を上回ります。
論文 参考訳(メタデータ) (2025-11-20T17:03:38Z) - DualAlign: Generating Clinically Grounded Synthetic Data [9.87164447021602]
両アライメントによる統計的忠実度と臨床的妥当性を高めるフレームワークであるDualAlignを紹介する。
アルツハイマー病(AD)をケーススタディとして、DualAlignは文脈的症状レベルの文章を生成する。
LLaMA 3.1-8BモデルとDualAlign生成データと人間アノテーションデータの組み合わせを微調整すると、大幅な性能向上が得られる。
論文 参考訳(メタデータ) (2025-09-05T18:04:38Z) - A Comprehensive Review of Datasets for Clinical Mental Health AI Systems [55.67299586253951]
本稿では,AIを活用した臨床アシスタントの訓練・開発に関連する臨床精神保健データセットの総合的調査を行う。
本調査では, 縦断データの欠如, 文化・言語表現の制限, 一貫性のない収集・注釈基準, 合成データのモダリティの欠如など, 重要なギャップを明らかにした。
論文 参考訳(メタデータ) (2025-08-13T13:42:35Z) - MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis [58.67342568632529]
MoodAngelsは、気分障害の診断のための最初の特殊なマルチエージェントフレームワークである。
MoodSynは、合成精神医学の1,173件のオープンソースデータセットである。
論文 参考訳(メタデータ) (2025-06-04T09:18:25Z) - A Case Study Exploring the Current Landscape of Synthetic Medical Record Generation with Commercial LLMs [1.1645633237702129]
合成データを生成する商用大規模言語モデルの現状を評価する。
我々の主な発見は、LLMが小さな特徴のサブセットに対して確実に合成された健康記録を生成できる一方で、データの次元が増加するにつれて、現実的な分布と相関を維持するのに苦労していることである。
論文 参考訳(メタデータ) (2025-04-20T15:37:05Z) - Towards Privacy-aware Mental Health AI Models: Advances, Challenges, and Opportunities [58.61680631581921]
メンタルヘルス障害は、深い個人的・社会的負担を生じさせるが、従来の診断はリソース集約的でアクセシビリティが制限される。
本稿では、これらの課題を考察し、匿名化、合成データ、プライバシー保護トレーニングを含む解決策を提案する。
臨床的な意思決定をサポートし、メンタルヘルスの結果を改善する、信頼できるプライバシを意識したAIツールを進化させることを目標としている。
論文 参考訳(メタデータ) (2025-02-01T15:10:02Z) - FedCVD: The First Real-World Federated Learning Benchmark on Cardiovascular Disease Data [52.55123685248105]
心臓血管疾患(CVD)は、現在世界でも主要な死因であり、早期診断と治療の要点を浮き彫りにしている。
機械学習(ML)手法はCVDの早期診断に役立つが、その性能は高品質なデータへのアクセスに依存している。
本稿では、FedCVDという心臓血管疾患検出のための、世界初の実世界のFLベンチマークを示す。
論文 参考訳(メタデータ) (2024-10-28T02:24:01Z) - The Health Gym: Synthetic Health-Related Datasets for the Development of
Reinforcement Learning Algorithms [2.032684842401705]
Health Gymは、機械学習アルゴリズムのプロトタイプ、評価、比較に自由にアクセス可能な、合成医療データセットのコレクションである。
このデータセットはGAN(Generative Adversarial Network)を用いて作成された。
合成データセットの公開分布に関連する機密情報開示のリスクは非常に低いと推定される。
論文 参考訳(メタデータ) (2022-03-12T07:28:02Z) - Bootstrapping Your Own Positive Sample: Contrastive Learning With
Electronic Health Record Data [62.29031007761901]
本稿では,新しいコントラスト型正規化臨床分類モデルを提案する。
EHRデータに特化した2つのユニークなポジティブサンプリング戦略を紹介します。
私たちのフレームワークは、現実世界のCOVID-19 EHRデータの死亡リスクを予測するために、競争の激しい実験結果をもたらします。
論文 参考訳(メタデータ) (2021-04-07T06:02:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。