論文の概要: A Living Benchmark for Information Retrieval from Electronic Health Records
- arxiv url: http://arxiv.org/abs/2609.30205v1
- Date: Thu, 24 Sep 2026 17:41:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.174812
- Title: A Living Benchmark for Information Retrieval from Electronic Health Records
- Title(参考訳): 電子健康記録からの情報検索のためのリビングベンチマーク
- Abstract要約: 大規模言語モデル(LLM)ベースの臨床アシスタントは電子健康記録(EHR)システムに統合されつつある。
本稿では,縦 EHR ノートから質問応答ペアを自動的に生成するフレームワークを提案する。
19人の臨床医がベンチマークジェネレータを検証し、ERHにおける情報検索ベンチマーク(BRIE)を作成している。
- 参考スコア(独自算出の注目度): 3.2237816065050455
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM)-based clinical assistants are increasingly being integrated into electronic health record (EHR) systems, transforming how clinicians retrieve and synthesize information from patient records. Their safety and utility depend on rigorous evaluation, yet existing benchmarks are manually curated, costly to update, and rapidly become obsolete with evolving technological advancements. We present a scalable framework that automatically generates question--answer pairs from longitudinal EHR notes. Nineteen clinicians validate the benchmark generator, producing the Benchmark for Retrieving Information in EHRs (BRIE), a continuously maintainable evaluation dataset. Across nine LLMs and five inference strategies, state-of-the-art systems frequently omit clinically important information, particularly for questions requiring synthesis across multiple documents and encounters. Because the generator itself is validated, BRIE supports evaluations that static benchmarks cannot, including the generation of multiple answers that reflect variation in clinician reasoning for robust performance assessment and continuously refreshing benchmark content to guard against leakage. Our results demonstrate that scalable benchmark generation enables rigorous, up-to-date evaluation of clinical LLMs as they are deployed in rapidly evolving healthcare settings.
- Abstract(参考訳): 大規模言語モデル(LLM)ベースの臨床アシスタントは電子健康記録(EHR)システムに統合されつつある。
安全性と実用性は厳格な評価に依存しているが、既存のベンチマークは手作業でキュレーションされ、更新にコストがかかり、進化する技術進歩によって急速に時代遅れになっている。
本稿では,縦 EHR ノートから質問応答ペアを自動的に生成するスケーラブルなフレームワークを提案する。
9人の臨床医がベンチマークジェネレータを検証し、継続的に維持可能な評価データセットであるERH(BRIE)における情報検索のためのベンチマークを生成する。
9つのLSMと5つの推論戦略のうち、最先端のシステムは臨床上重要な情報を省略することが多い。
ジェネレータ自体が検証されているため、BRIEは静的ベンチマークではできない評価をサポートしており、堅牢なパフォーマンス評価のための臨床的推論のバリエーションを反映した複数の回答の生成や、リーク防止のためにベンチマークコンテンツを継続的に更新している。
以上の結果から,スケーラブルなベンチマーク生成により,急速に発展する医療環境に展開する臨床LSMの厳密かつ最新の評価が可能になることが示唆された。
関連論文リスト
- EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs [51.129595320595094]
臨床意思決定 (CDM) は、臨床医が診断を推測し、治療を選択し、不完全な証拠の下で将来の健康結果を予測する、現実的な臨床の中心である。
LLMモデルは、強力な言語能力、幅広い生物医学的知識、効率性のために、これらの決定をサポートするためにますます使われています。
LLMの実際の臨床決定タスクに対する信頼性は、まだ十分に理解されていない。
論文 参考訳(メタデータ) (2026-05-28T22:38:26Z) - DISCO-TAB: A Hierarchical Reinforcement Learning Framework for Privacy-Preserving Synthesis of Complex Clinical Data [2.3915781021862332]
DISCO-TABは、Reinforcement Learningによって最適化された多目的識別器システムを用いて、微調整LDMをオーケストレーションする新しいフレームワークである。
私たちは、高次元の小さな医療データセットを含むさまざまなベンチマークで、私たちのフレームワークを厳格に検証しています。
以上の結果から, 階層的フィードバックは最先端の成果をもたらすことが示され, 下流の臨床的有用性は最大38.2%向上した。
論文 参考訳(メタデータ) (2026-04-01T23:37:58Z) - QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models [8.050059911826338]
LLM(Large Language Models)は、標準化された医療試験に優れるが、高いスコアは、現実世界の医療クエリに対する高品質な応答に変換できないことが多い。
実世界の医療LCM評価に適した生態学的に有効なベンチマークであるQuarkMedBenchを紹介する。
論文 参考訳(メタデータ) (2026-03-14T01:51:43Z) - EHRNavigator: A Multi-Agent System for Patient-Level Clinical Question Answering over Heterogeneous Electronic Health Records [31.559633376006442]
EHRNavigatorは、AIエージェントを活用するマルチエージェントフレームワークで、異種およびマルチモーダルのEHRデータにまたがる患者レベルの質問応答を実行する。
実際の症例では86%の精度を達成し, 臨床的に許容できる応答時間を維持した。
論文 参考訳(メタデータ) (2026-01-15T03:02:15Z) - Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models [46.81512544528928]
MedCheckは、医療ベンチマーク用に設計された最初のライフサイクル指向アセスメントフレームワークである。
我々のフレームワークは、設計からガバナンスまで、ベンチマークの開発を5つの連続的な段階に分解し、46の医学的基準の包括的なチェックリストを提供する。
本分析では,臨床実践からの深い切り離し,無害な汚染リスクによるデータの整合性の危機,モデルロバスト性や不確実性認識といった安全クリティカルな評価の側面を体系的に無視することなど,全身的な問題を明らかにする。
論文 参考訳(メタデータ) (2025-08-06T11:11:40Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z) - LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation [58.25892575437433]
医学における大規模言語モデル (LLMs) の評価は, 医療応用には精度が高く, 誤差の少ないため重要である。
LLMEval-Medは、5つの中核医療領域をカバーする新しいベンチマークであり、現実の電子健康記録から得られた2,996の質問と専門家が設計した臨床シナリオを含む。
論文 参考訳(メタデータ) (2025-06-04T15:43:14Z) - Quantifying the Reasoning Abilities of LLMs on Real-world Clinical Cases [48.87360916431396]
MedR-Benchは1,453例の構造化患者のベンチマークデータセットで、推論基準を付した注釈付きである。
本稿では,3つの批判的診察勧告,診断決定,治療計画を含む枠組みを提案し,患者のケアジャーニー全体をシミュレートする。
このベンチマークを用いて、DeepSeek-R1、OpenAI-o3-mini、Gemini-2.0-Flash Thinkingなど、最先端の5つのLCMを評価した。
論文 参考訳(メタデータ) (2025-03-06T18:35:39Z) - Comprehensive and Practical Evaluation of Retrieval-Augmented Generation Systems for Medical Question Answering [70.44269982045415]
Retrieval-augmented Generation (RAG) は,大規模言語モデル (LLM) の性能向上のための有望なアプローチとして登場した。
医療用QAデータセットに様々な補助的要素を提供するMedRGB(MedRGB)を導入する。
実験結果から,検索した文書のノイズや誤情報の処理能力に限界があることが判明した。
論文 参考訳(メタデータ) (2024-11-14T06:19:18Z) - ACR: A Benchmark for Automatic Cohort Retrieval [1.3547712404175771]
現在のコホート検索手法は、手作業によるキュレーションと組み合わせた構造化データの自動クエリに依存している。
大規模言語モデル(LLM)と情報検索(IR)の最近の進歩は、これらのシステムに革命をもたらす有望な道を提供する。
本稿では,新しいタスクであるAutomatic Cohort Retrieval (ACR)を導入し,LLMと商用のドメイン固有のニューロシンボリックアプローチの性能を評価する。
論文 参考訳(メタデータ) (2024-06-20T23:04:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。