論文の概要: OpenExtract: Automated Data Extraction for Systematic Reviews in Health
- arxiv url: http://arxiv.org/abs/2603.13338v1
- Date: Fri, 06 Mar 2026 22:12:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:42.317587
- Title: OpenExtract: Automated Data Extraction for Systematic Reviews in Health
- Title(参考訳): OpenExtract: ヘルスのシステムレビューのための自動データ抽出
- Authors: Jim Achterberg, Bram Van Dijk, Jing Meng, Saif Ul Islam, Gregory Epiphaniou, Carsten Maple, Xuefei Ding, Theodoros N. Arvanitis, Simon Brouwer, Marcel Haas, Marco Spruit,
- Abstract要約: OpenExtractは、体系的な文献レビューにおいて、自動データ抽出のためのオープンソースのパイプラインである。
これは、科学論文の関連するセクションに基づいてデータエントリを予測するために、大きな言語モデルに問い合わせる。
0.8の精度とリコールスコアを達成し、自動的に効率的にデータを抽出できることを示す。
- 参考スコア(独自算出の注目度): 14.553566357404799
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This study presents OpenExtract, an open-source pipeline for automated data extraction in large-scale systematic literature reviews. The pipeline queries large language models (LLMs) to predict data entries based on relevant sections of scientific articles. To test the efficacy of OpenExtract, we apply it to a systematic literature review in digital health and compare its outputs with those of human researchers. OpenExtract achieves precision and recall scores of > 0.8 in this task, indicating that it can be effective at extracting data automatically and efficiently. OpenExtract: https://github.com/JimAchterbergLUMC/OpenExtract.
- Abstract(参考訳): 本研究では,大規模な体系的文献レビューにおいて,自動データ抽出のためのオープンソースのパイプラインであるOpenExtractを提案する。
パイプラインは、科学論文の関連するセクションに基づいてデータエントリを予測するために、大きな言語モデル(LLM)をクエリする。
OpenExtractの有効性を検証するため、デジタルヘルスの体系的な文献レビューに応用し、その成果と人間の研究者の成果を比較した。
OpenExtractは、このタスクにおいて 0.8 の精度とリコールスコアを達成し、自動的に効率的にデータを抽出できることを示す。
OpenExtract: https://github.com/JimAchterbergLUMC/OpenExtract
関連論文リスト
- MOLE: Metadata Extraction and Validation in Scientific Papers Using LLMs [48.73595915402094]
MOLEは、アラビア語以外の言語のデータセットをカバーする科学論文からメタデータ属性を自動的に抽出するフレームワークである。
本手法では,複数の入力形式にまたがって文書全体を処理し,一貫した出力に対する堅牢な検証機構を組み込む。
論文 参考訳(メタデータ) (2025-05-26T10:31:26Z) - Leveraging Vision Capabilities of Multimodal LLMs for Automated Data Extraction from Plots [0.0]
現在の大規模言語モデルでは,プロットから正確にデータを抽出することが可能であることを示す。
この能力は事前訓練されたモデルに固有のものであり、ゼロショットのプロンプトのチェーン・オブ・シークエンスで達成できる。
論文 参考訳(メタデータ) (2025-03-16T02:41:43Z) - MedPromptExtract (Medical Data Extraction Tool): Anonymization and Hi-fidelity Automated data extraction using NLP and prompt engineering [1.0470286407954037]
方法:急性腎不全(AKI)患者のKDAH(Kkilaben Dhirubhai Ambani Hospital)からデータソースが流出した。
高忠実度情報抽出に半教師付き学習技術を活用した既存ツールEIGENを用いてDSの匿名化を行った。
自然言語処理(NLP)は、通常のフィールドからデータを抽出するために用いられた。
論文 参考訳(メタデータ) (2024-05-04T13:25:06Z) - Detecting automatically the layout of clinical documents to enhance the
performances of downstream natural language processing [53.797797404164946]
我々は,臨床用PDF文書を処理し,臨床用テキストのみを抽出するアルゴリズムを設計した。
このアルゴリズムは、PDFを使った最初のテキスト抽出と、続いてボディテキスト、左書き、フッタなどのカテゴリに分類される。
それぞれのセクションのテキストから興味ある医学的概念を抽出し,医療的パフォーマンスを評価した。
論文 参考訳(メタデータ) (2023-05-23T08:38:33Z) - Extracting Accurate Materials Data from Research Papers with
Conversational Language Models and Prompt Engineering [0.0]
ChatExtractは、初期作業とバックグラウンドを最小限にして、非常に正確なデータ抽出を完全に自動化することができる。
材料データに対するテストでは、最高の会話型LLMから90%近い精度とリコールが得られます。
論文 参考訳(メタデータ) (2023-03-07T17:54:53Z) - Towards Relation Extraction From Speech [56.36416922396724]
本稿では,新たな聴取情報抽出タスク,すなわち音声関係抽出を提案する。
本研究では,音声合成システムによる音声関係抽出のための訓練データセットを構築し,英語母語話者によるクラウドソーシングによるテストデータセットを構築した。
我々は,音声関係抽出における課題を識別するための包括的実験を行い,今後の探索に光を当てる可能性がある。
論文 参考訳(メタデータ) (2022-10-17T05:53:49Z) - Prompt-driven efficient Open-set Semi-supervised Learning [52.30303262499391]
オープンセット半教師付き学習(OSSL)は関心を集めており、未ラベルデータにのみOOD(Out-of-distribution)サンプルが組み込まれているというより実践的なシナリオを調査している。
我々はOpenPromptと呼ばれる,プロンプト駆動の効率的なOSSLフレームワークを提案する。
論文 参考訳(メタデータ) (2022-09-28T16:25:08Z) - Scaling Systematic Literature Reviews with Machine Learning Pipelines [57.82662094602138]
体系的なレビューは、科学的文書からデータを抽出する。
これらの側面をそれぞれ自動化するパイプラインを構築し、多くの人間時間対システム品質トレードオフを実験します。
人間の専門的アノテーションの2週間だけで、パイプラインシステム全体の驚くほどの精度と一般性が得られることが分かりました。
論文 参考訳(メタデータ) (2020-10-09T16:19:42Z) - At Which Level Should We Extract? An Empirical Analysis on Extractive
Document Summarization [110.54963847339775]
本研究は,全文を抽出する際,不必要な問題や冗長性が存在することを示す。
選挙区解析木に基づくサブセグメント単位の抽出を提案する。
論文 参考訳(メタデータ) (2020-04-06T13:35:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。