論文の概要: LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making
- arxiv url: http://arxiv.org/abs/2607.09322v1
- Date: Fri, 10 Jul 2026 12:04:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.83557
- Title: LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making
- Title(参考訳): LongMedBench: 長期臨床意思決定のための医療エージェントのベンチマーク
- Authors: Yanzhen Chen, Zihan Xu, Xiaocheng Zhang, Zhiting Fan, Weiqi Zhai, Hongxia Xu, Zuozhu Liu,
- Abstract要約: LongMedBench(ロングメドベンチ)は、長期的な臨床意思決定のための現実のEHRベースのベンチマークである。
患者は335人、患者1人当たり19.72人、医療イベントは44.91人である。
実験の結果,近年のLCMは明示的なタイムスタンプをうまく活用できるが,暗黙の時間推論では課題があることがわかった。
- 参考スコア(独自算出の注目度): 24.67108801971425
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: In this work, we introduce LongMedBench, a real-world EHR-based benchmark for long-horizon clinical decision-making. Prior evaluations of LLM-based medical agents have largely emphasized short-context knowledge QA and tool use. However, real-world medical care is inherently longitudinal, and clinicians must aggregate evidence across repeated visits, tests, and evolving treatments. Therefore, long-horizon interaction is essential for realistic assessment. LongMedBench is constructed via a reproducible pipeline that integrates MIMIC-IV admission records and clinical notes into time-series event streams and long-context memory datasets, enabling long-horizon, multi-session interactions between agents and a clinical environment. It comprises 335 patients, with 19.72 inpatient visits per patient on average and 44.91 medical events per visit. Guided by the long-horizon decision process, we propose an evaluation taxonomy with three suites: fact-based QA, temporal reasoning, and long-horizon decision-making. This taxonomy measures how agents understand and leverage historical patient information over extended horizons. Our experiments show that while recent LLMs can make good use of explicit timestamps, they have challenges in implicit time inference; The RAG and agent memory system can improve the performance of information retrieval tasks, but the performance of decision-making tasks is highly dependent on the model's immediate context.
- Abstract(参考訳): 本研究では,長期臨床意思決定のための実世界のEHRベースのベンチマークであるLongMedBenchを紹介する。
LLMをベースとした医療エージェントの以前の評価では、短文知識QAとツールの使用が重視されていた。
しかし、現実の医療は本質的には縦断的であり、臨床医は何度も訪れ、検査し、治療を進化させなければならない。
したがって、ロングホライズン相互作用は現実的な評価に不可欠である。
LongMedBenchは、MIMIC-IVの入院記録と臨床ノートを時系列イベントストリームと長期コンテキストメモリデータセットに統合した再現可能なパイプラインを通じて構築され、エージェントと臨床環境間の長時間のマルチセッションインタラクションを可能にする。
患者は335人、患者1人当たり19.72人、医療イベントは44.91人である。
長期的意思決定プロセスによって導かれ, 事実に基づくQA, 時間的推論, 長期的意思決定という3つのスイートによる評価分類法を提案する。
この分類法は、エージェントが患者の歴史的情報を理解し、どのように活用するかを測定する。
実験の結果、近年のLCMは明示的なタイムスタンプをうまく活用できるが、暗黙の時間推論では課題があり、RAGとエージェントメモリシステムは情報検索タスクの性能を向上させることができるが、意思決定タスクの性能はモデルの初期状況に大きく依存していることがわかった。
関連論文リスト
- MedGym:A Unified Continuous-Time Benchmark for Dynamic Medical Treatment Reinforcement Learning [16.00709468365385]
動的治療推奨のためのベンチマーク環境であるMedGymを紹介する。
MedGymは、持続時間フレームワークにおける経時的患者の進化をモデル化する。
物理インフォームドニューラルネットワークを用いて臨床データから医学RLベンチマークを構築する。
論文 参考訳(メタデータ) (2026-05-31T05:36:03Z) - EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs [51.129595320595094]
臨床意思決定 (CDM) は、臨床医が診断を推測し、治療を選択し、不完全な証拠の下で将来の健康結果を予測する、現実的な臨床の中心である。
LLMモデルは、強力な言語能力、幅広い生物医学的知識、効率性のために、これらの決定をサポートするためにますます使われています。
LLMの実際の臨床決定タスクに対する信頼性は、まだ十分に理解されていない。
論文 参考訳(メタデータ) (2026-05-28T22:38:26Z) - Synthesis and Evaluation of Long-term History-aware Medical Dialogue [6.317682711402412]
高品質な長期医療対話をLLMと合成するための枠組みを提案する。
我々は,医療エージェントの記憶能力を評価するために,対話内推論,対話間推論,合成推論の3つのベンチマークタスクを構築した。
ベンチマーク実験によると、最先端のLLMでさえMediLongChatと競合している。
論文 参考訳(メタデータ) (2026-05-19T12:38:41Z) - MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences [50.71326426975699]
MedArenaは医療用大規模言語モデル(LLM)のためのインタラクティブな評価プラットフォームである。
MedArenaは、2つのランダムに選択されたモデルからの応答を表示し、ユーザが好みのレスポンスを選択するように要求する。
2025年11月1日までに12台のLLMで収集された1571の選好のうち、ジェミニ2.0フラッシュシンキング、ジェミニ2.5プロ、GPT-4oがブラッドリー・テリーのレーティングで上位3モデルとなった。
論文 参考訳(メタデータ) (2026-03-13T22:30:26Z) - ER-REASON: A Benchmark Dataset for LLM-Based Clinical Reasoning in the Emergency Room [6.910389029249664]
大規模言語モデル (LLMs) は, ライセンス試験に基づく質問応答タスクにおいて, 広範囲に評価されている。
ER-Reason(ER-Reason)は、救急室におけるLSMに基づく臨床推論と意思決定を評価するために設計されたベンチマークである。
論文 参考訳(メタデータ) (2025-05-28T22:43:44Z) - AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator [69.51568871044454]
我々は,emphDoctorをプレイヤとして,NPC間の動的医療相互作用をシミュレーションするフレームワークであるtextbfAI Hospitalを紹介した。
この設定は臨床シナリオにおけるLCMの現実的な評価を可能にする。
高品質な中国の医療記録とNPCを利用したマルチビュー医療評価ベンチマークを開発した。
論文 参考訳(メタデータ) (2024-02-15T06:46:48Z) - Clairvoyance: A Pipeline Toolkit for Medical Time Series [95.22483029602921]
時系列学習は、データ駆動の*クリニカルな意思決定支援のパンとバターである*
Clairvoyanceは、ソフトウェアツールキットとして機能する、統合されたエンドツーエンドのオートMLフレンドリなパイプラインを提案する。
Clairvoyanceは、臨床時系列MLのための包括的で自動化可能なパイプラインの生存可能性を示す最初のものである。
論文 参考訳(メタデータ) (2023-10-28T12:08:03Z) - BiteNet: Bidirectional Temporal Encoder Network to Predict Medical
Outcomes [53.163089893876645]
本稿では,患者の医療旅行におけるコンテキスト依存と時間的関係を捉える,新たな自己注意機構を提案する。
エンド・ツー・エンドの双方向時間エンコーダネットワーク(BiteNet)が患者の旅路の表現を学習する。
実世界のEHRデータセットを用いた2つの教師付き予測と2つの教師なしクラスタリングタスクにおける手法の有効性を評価した。
論文 参考訳(メタデータ) (2020-09-24T00:42:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。