論文の概要: PARHAF, a human-authored corpus of clinical reports for fictitious patients in French
- arxiv url: http://arxiv.org/abs/2603.20494v1
- Date: Fri, 20 Mar 2026 20:48:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:38.93776
- Title: PARHAF, a human-authored corpus of clinical reports for fictitious patients in French
- Title(参考訳): PARHAF : フランスにおける架空の患者に対する臨床報告の人為的認可コーパス
- Authors: Xavier Tannier, Salam Abbara, Rémi Flicoteaux, Youness Khalil, Aurélie Névéol, Pierre Zweigenbaum, Emmanuel Bacry,
- Abstract要約: PARHAFは、現実的で完全に架空の患者を記述した専門家による臨床報告を含む。
このコーパスには、幅広い医療・外科専門の5009人の患者を対象とする7394の臨床報告が含まれている。
ドキュメントはCC-BYのオープンライセンスの下でリリースされ、一部は一時的に禁止され、制御された条件下での将来のベンチマークを可能にする。
- 参考スコア(独自算出の注目度): 3.8714930361784816
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The development of clinical natural language processing (NLP) systems is severely hampered by the sensitive nature of medical records, which restricts data sharing under stringent privacy regulations, particularly in France and the broader European Union. To address this gap, we introduce PARHAF, a large open-source corpus of clinical documents in French. PARHAF comprises expert-authored clinical reports describing realistic yet entirely fictitious patient cases, making it anonymous and freely shareable by design. The corpus was developed using a structured protocol that combined clinician expertise with epidemiological guidance from the French National Health Data System (SNDS), ensuring broad clinical coverage. A total of 104 medical residents across 18 specialties authored and peer-reviewed the reports following predefined clinical scenarios and document templates. The corpus contains 7394 clinical reports covering 5009 patient cases across a wide range of medical and surgical specialties. It includes a general-purpose component designed to approximate real-world hospitalization distributions, and four specialized subsets that support information-extraction use cases in oncology, infectious diseases, and diagnostic coding. Documents are released under a CC-BY open license, with a portion temporarily embargoed to enable future benchmarking under controlled conditions. PARHAF provides a valuable resource for training and evaluating French clinical language models in a fully privacy-preserving setting, and establishes a replicable methodology for building shareable synthetic clinical corpora in other languages and health systems.
- Abstract(参考訳): 臨床自然言語処理(NLP)システムの開発は、特にフランスや欧州連合において、厳格なプライバシー規制の下でのデータ共有を制限する医療記録の繊細な性質によって著しく妨げられている。
このギャップに対処するために、我々は、フランス語で書かれた大規模な臨床文書のオープンソースコーパスであるPARHAFを紹介した。
PARHAFは、現実的で完全に架空の患者を記述した専門家による臨床報告で構成されており、匿名であり、設計によって自由に共有できる。
このコーパスは、臨床専門知識とフランス国立健康データシステム(SNDS)の疫学的ガイダンスを組み合わせた構造化されたプロトコルを用いて開発された。
18の専門分野にまたがる合計104人の医療関係者が、事前に定義された臨床シナリオと文書テンプレートに従って報告を執筆し、査読した。
このコーパスには、幅広い医療・外科専門の5009人の患者を対象とする7394の臨床報告が含まれている。
現実の入院分布を近似するために設計された汎用コンポーネントと、腫瘍学、感染症、診断コーディングにおける情報抽出ユースケースをサポートする4つの特別なサブセットを含んでいる。
ドキュメントはCC-BYのオープンライセンスの下でリリースされ、一部は一時的に禁止され、制御された条件下での将来のベンチマークを可能にする。
PARHAFは、完全なプライバシー保護設定でフランスの臨床言語モデルをトレーニングし評価するための貴重なリソースを提供し、他の言語や医療システムで共有可能な臨床コーパスを構築するためのレプリカ可能な方法論を確立している。
関連論文リスト
- SynGP500: A Clinically-Grounded Synthetic Dataset of Australian General Practice Medical Notes [0.0]
SynGP500は, オーストラリアにおける500の総合医療ノートのクリニカル・カレードコレクションである。
このデータセットは、カリキュラムベースの臨床幅(RACGP 2022 Curriculum)、疫学的に校正された有病率(BEACH study)、多様な相談コンテキストを統合している。
論文 参考訳(メタデータ) (2025-12-17T10:04:36Z) - Enabling Doctor-Centric Medical AI with LLMs through Workflow-Aligned Tasks and Benchmarks [72.89088985703748]
大きな言語モデル(LLM)の台頭は、臨床ガイダンスを提供することで医療に変化をもたらしたが、患者への直接の展開は安全性のリスクをもたらす。
我々は,患者と直接対話するのではなく,経験豊富な医師と協力する臨床助手としてLLMを再配置することを提案する。
我々は、22の臨床的タスクと27の専門分野にわたる92,000のQ&Aインスタンスからなる大規模な中国の医療データセットであるDoctorFLANを構築した。
論文 参考訳(メタデータ) (2025-10-13T06:18:27Z) - ClinText-SP and RigoBERTa Clinical: a new set of open resources for Spanish Clinical NLP [0.5325390073522079]
ClinText-SPと最新の臨床エンコーダ言語モデルであるRigoBERTa Clinicalをリリースする。
本研究のコーパスは,医療雑誌の症例や共有タスクからの注釈付きコーパスなど,様々なオープンソースから慎重にキュレートされた。
RigoBERTa Clinicalは、ドメイン適応型事前トレーニングによって開発され、複数のNLPベンチマークで既存のモデルよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-03-24T11:52:17Z) - Clinical Document Corpora -- Real Ones, Translated and Synthetic Substitutes, and Assorted Domain Proxies: A Survey of Diversity in Corpus Design, with Focus on German Text Data [2.6936101156436956]
ドイツの厳格なデータプライバシー法により、これらのリソースは安全な臨床データ空間に保管され、臨床外部研究者に対してロックされている。
この状況は、自然言語処理の分野において、データ収集の容易なアクセシビリティと再利用が一般的な実践であるのとは対照的である。
論文 参考訳(メタデータ) (2024-11-29T19:56:58Z) - Large Language Models in the Clinic: A Comprehensive Benchmark [63.21278434331952]
診療所の大規模言語モデル(LLM)をよりよく理解するためのベンチマークであるClimateBenchを構築した。
まず、さまざまな臨床言語の生成、理解、推論タスクを含む11の既存のデータセットを収集します。
次に,現実の実践において複雑だが一般的である6つの新しいデータセットと臨床タスクを構築した。
ゼロショット設定と少数ショット設定の両方で、20個のLDMを広範囲に評価する。
論文 参考訳(メタデータ) (2024-04-25T15:51:06Z) - ClinicalMamba: A Generative Clinical Language Model on Longitudinal
Clinical Notes [6.921652448124103]
本研究は,マンバ語モデルの特殊版であるクリニカルマンバについて概説する。
1億3000万のパラメータと280億のパラメータを持つクリニカルマンバは、テキストの長さを延ばす臨床言語をモデル化する上で優れたパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-03-09T04:58:25Z) - Development and validation of a natural language processing algorithm to
pseudonymize documents in the context of a clinical data warehouse [53.797797404164946]
この研究は、この領域でツールやリソースを共有する際に直面する困難を浮き彫りにしている。
臨床文献のコーパスを12種類に分類した。
私たちは、ディープラーニングモデルと手動ルールの結果をマージして、ハイブリッドシステムを構築します。
論文 参考訳(メタデータ) (2023-03-23T17:17:46Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z) - An NLP Solution to Foster the Use of Information in Electronic Health
Records for Efficiency in Decision-Making in Hospital Care [0.26340862968426904]
このプロジェクトは、ポルトガル語で書かれたフリーテキスト臨床記録内の属性を自動的に識別するためのルールを定義し、技術的ソリューションを開発することを目的としている。
プロジェクトの目標は、臨床医、疫学者、計算言語学者、機械学習研究者、ソフトウェアエンジニアを含む複数の学際的なチームによって達成された。
論文 参考訳(メタデータ) (2022-02-24T15:52:59Z) - Towards more patient friendly clinical notes through language models and
ontologies [57.51898902864543]
本稿では,単語の単純化と言語モデリングに基づく医療用テキストの自動作成手法を提案する。
我々は,公開医療文のデータセットペアと,臨床医による簡易化版を用いている。
本手法は,医学フォーラムデータに基づく言語モデルを用いて,文法と本来の意味の両方を保存しながら,より単純な文を生成する。
論文 参考訳(メタデータ) (2021-12-23T16:11:19Z) - Benchmarking Automated Clinical Language Simplification: Dataset,
Algorithm, and Evaluation [48.87254340298189]
我々はMedLaneという名の新しいデータセットを構築し、自動化された臨床言語簡易化手法の開発と評価を支援する。
我々は,人間のアノテーションの手順に従い,最先端のパフォーマンスを実現するDECLAREと呼ばれる新しいモデルを提案する。
論文 参考訳(メタデータ) (2020-12-04T06:09:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。