論文の概要: Where Does the Signal Live? A Web Data Recipe for Medical Encoder Pretraining
- arxiv url: http://arxiv.org/abs/2606.22079v1
- Date: Sat, 20 Jun 2026 14:54:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 21:48:34.225082
- Title: Where Does the Signal Live? A Web Data Recipe for Medical Encoder Pretraining
- Title(参考訳): 医療エンコーダ事前学習のためのWebデータ準備
- Authors: Bofeng Huang, Jacques Sun, Diane Bouchacourt, Nicolas Barascud, Fajwel Fogel,
- Abstract要約: データキュレーションを改善するために2つのレバーを導入する。
医用期間密度フィルタは、下流医療タスクにおいて広く使用されている教育用品質フィルタより優れる。
このレシピは、フランスの医療事前訓練コーパスであるFineMedと、最先端のフランスの医療エンコーダファミリーであるDoctoBERTを生産する。
- 参考スコア(独自算出の注目度): 6.842113983694166
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Web data curation has been widely studied for decoder Large Language Model (LLM) pretraining. Encoders for dense-terminology domains such as medicine, by contrast, are pretrained on small, manually-curated corpora that limit scalability and writing style diversity, a bottleneck even more severe in non-English clinical settings. Whether web-scale data curation also benefits encoder Masked Language Modeling (MLM) in a dense-terminology domain remains an open question. To address this, we introduce two complementary levers. Medical-term density filtering selects documents rich in medical terms. Signal-amplifying rephrasing uses an LLM to rewrite documents into denser variants with broader entity contexts. We instantiate the recipe on French medical NLP. The medical-term density filter outperforms the widely-used educational quality filter on downstream medical tasks, and the two complement each other. Signal-amplifying rephrasing alone improves on raw web data, and mixing it with filtered web data produces the largest gain. The recipe yields FineMed, a French medical pretraining corpus, and DoctoBERT, a state-of-the-art French medical encoder family evaluated on both the public benchmark DrBenchmark and a proprietary clinical Named Entity Recognition (NER) task.
- Abstract(参考訳): Webデータキュレーションは、デコーダのLarge Language Model(LLM)プリトレーニングのために広く研究されている。
対照的に、医学のような密度の高い用語領域のエンコーダは、拡張性と書体スタイルの多様性を制限する小さな手作業によるコーパスで事前訓練されている。
WebスケールのデータキュレーションがエンコーダのMasked Language Modeling(MLM)にも役立つかどうかは未解決のままである。
これを解決するために,2つの補足レバーを紹介する。
医用時間密度フィルタリングは、医学用語に富んだ文書を選択する。
信号増幅の言い換えは LLM を使って文書をより広いエンティティコンテキストでより密度の高い変種に書き換える。
フランスの医療用NLPのレシピをインスタンス化する。
医用期間密度フィルタは、下流医療タスクにおいて広く使用されている教育用品質フィルタよりも優れており、両者が補完している。
信号増幅式だけでは、生のWebデータを改善することができ、それをフィルタリングしたWebデータと混ぜることで、最大の利益をもたらす。
このレシピは、フランスの医療事前訓練コーパスであるFineMedと、現在最先端のフランスの医療エンコーダファミリーであるDoctoBERTを、公開ベンチマークDrBenchmarkと独自の臨床名付きエンティティ認識(NER)タスクの両方で評価する。
関連論文リスト
- ClinicalEncoder26AM: A Multlilingual Diagnosable ColBERT Model; Evidences from the MultiClinNER Shared Task [1.6904475483445454]
ClinicalEncoder26AMは、臨床およびバイオメディカルテキストのための多言語診断可能なColBERTである。
患者症状, 障害, 手術スパンに対するBIOタグを微調整し, マルチClinNER共有タスクにおけるモデルの評価を行った。
論文 参考訳(メタデータ) (2026-05-27T14:20:45Z) - MedVerse: Efficient and Reliable Medical Reasoning via DAG-Structured Parallel Execution [63.128360383691295]
複雑な医学推論のための推論フレームワークであるMedVerseを提案する。
データ作成には、知識に基づく医学推論経路を合成するMedVerse Curatorを導入する。
我々は、追加のオーバーヘッドを伴わずに並列実行をサポートするカスタマイズされた推論エンジンを開発した。
論文 参考訳(メタデータ) (2026-02-07T12:54:01Z) - Leveraging Large Language Models to Extract and Translate Medical Information in Doctors' Notes for Health Records and Diagnostic Billing Codes [0.0]
本論文では,オープンウェイトなLarge Language Models (LLMs) を用いて医師ノートから臨床情報を抽出し,クラウドベースのサービスに依存しないICD-10-CM診断コードに変換する。
複数のオープンウェイトモデルを評価するために、Ollama、LangChain、コンテナ化された環境を使用して、プライバシを重視したパイプラインが開発された。
その結果、厳密なスキーマ適用は100%近いコンプライアンスを達成したが、より小さなモデルでは、特定の診断符号の正確な生成は困難であることが判明した。
論文 参考訳(メタデータ) (2026-01-14T12:21:12Z) - MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data [32.65971100171597]
セグメンテーションリソースを高品質な医療参照基盤データに変換する自動パイプラインであるMedGroundを紹介する。
我々はまた、MedGround-35Kという新しいマルチモーダル医療データセットを提示する。
論文 参考訳(メタデータ) (2026-01-11T10:34:18Z) - TheBlueScrubs-v1, a comprehensive curated medical dataset derived from the internet [1.4043931310479378]
BlueScrubs-v1は、広範囲のインターネットコーパスから得られた2500億以上の医療トークンの収集されたデータセットである。
各テキストには、医療関連性、精度、事実の詳細、安全性と倫理基準を含む3つのLCMベースの品質スコアが割り当てられている。
このData Descriptorは、データセットの作成と検証について詳述し、医療AI研究の潜在的有用性について説明している。
論文 参考訳(メタデータ) (2025-04-01T22:25:19Z) - A comparison of data filtering techniques for English-Polish LLM-based machine translation in the biomedical domain [2.490363177524421]
本稿では,バイオメディカルドメイン内の英語・ポーランド語翻訳におけるデータフィルタリング手法の影響について検討する。
我々はmBART50モデルを微調整するために様々なデータセットサイズを作成し、SacreBLEU測定値を用いて評価した。
この結果から,LASERとMUSEはどちらも,性能の維持や向上を図りながら,データセットサイズを大幅に削減できることがわかった。
論文 参考訳(メタデータ) (2025-01-27T22:12:09Z) - ChiMed-GPT: A Chinese Medical Large Language Model with Full Training Regime and Better Alignment to Human Preferences [51.66185471742271]
我々は中国医学領域向けに明示的に設計されたベンチマークLSMであるChiMed-GPTを提案する。
ChiMed-GPTは、事前訓練、SFT、RLHFを含む総合的な訓練体制を実施。
我々は,ChiMed-GPTを患者識別に関する態度尺度の実行を促すことによって,潜在的なバイアスを分析した。
論文 参考訳(メタデータ) (2023-11-10T12:25:32Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z) - A Meta-embedding-based Ensemble Approach for ICD Coding Prediction [64.42386426730695]
国際疾病分類 (icd) は、世界中で臨床コーディングに使われているデファクトコードである。
これらのコードにより、医療提供者は償還を請求し、診断情報の効率的な保管と検索を容易にします。
提案手法は,日常的な医学データと科学論文の外部知識を用いて,効果的に単語ベクトルを訓練することにより,神経モデルの性能を高める。
論文 参考訳(メタデータ) (2021-02-26T17:49:58Z) - Learning Contextualized Document Representations for Healthcare Answer
Retrieval [68.02029435111193]
コンテキスト談話ベクトル(英: Contextual Discourse Vectors、CDV)は、長文からの効率的な回答検索のための分散文書表現である。
本モデルでは,階層型LSTMレイヤとマルチタスクトレーニングを併用したデュアルエンコーダアーキテクチャを用いて,臨床エンティティの位置と文書の談話に沿った側面をエンコードする。
我々の一般化モデルは、医療パスランキングにおいて、最先端のベースラインを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2020-02-03T15:47:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。