論文の概要: CLIR-Bench: Benchmarking Multimodal Question Answering over Irregular Clinical Time Series
- arxiv url: http://arxiv.org/abs/2607.09880v1
- Date: Fri, 10 Jul 2026 18:13:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.23454
- Title: CLIR-Bench: Benchmarking Multimodal Question Answering over Irregular Clinical Time Series
- Title(参考訳): CLIR-Bench:不規則な臨床経過に対するマルチモーダル質問回答のベンチマーク
- Abstract要約: 臨床時系列はしばしばスパースで、不規則にサンプリングされ、非同期である。
既存のベンチマークは主に、静的データよりも定期的にサンプリングされた時系列QAまたは医療QAに焦点を当てている。
未同定ICU記録から構築した不規則な臨床時系列QAのベンチマークであるCLIR-Benchを紹介する。
- 参考スコア(独自算出の注目度): 10.182437392577633
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Clinical time series are central to patient monitoring, risk assessment, and clinical decision support. However, they are often sparse, irregularly sampled, and asynchronous, making it difficult for models to identify the temporal evidence required for clinical Question Answering (QA). Existing benchmarks primarily focus on regularly sampled time-series QA or medical QA over static data, and therefore rarely assess whether models can faithfully ground their answers in irregular temporal observations. To fill this gap, we introduce CLIR-Bench, a benchmark for irregular clinical time series QA constructed from de-identified ICU records through a principled four-stage pipeline. CLIR-Bench contains 6,600 QA instances spanning 11 clinical variables, organized into four capability dimensions and 11 tasks. Each question is linked to explicit temporal evidence and task-specific answer derivation rules, enabling evaluation of both answer accuracy and evidence use. Experiments show that existing generalist models struggle to retrieve and reason over sparse clinical evidence, highlighting the need for stronger irregular time-series reasoning methods. Our code and data are available at https://huggingface.co/datasets/winall/CLIR-Bench.
- Abstract(参考訳): 臨床時系列は、患者のモニタリング、リスクアセスメント、臨床決定支援の中心である。
しかし、しばしばスパースで不規則にサンプリングされ、非同期であるため、モデルが臨床質問応答(QA)に必要な時間的証拠を特定することは困難である。
既存のベンチマークは、主に静的データよりも定期的にサンプリングされた時系列QAまたは医学的なQAに焦点を当てているため、不規則な時間的観察において、モデルが彼らの回答を忠実に根拠付けることができるかどうかを評価することは滅多にない。
このギャップを埋めるために、原則化された4段階のパイプラインを通して、未同定ICUレコードから構築された不規則な臨床時系列QAのベンチマークであるCLIR-Benchを紹介する。
CLIR-Benchには、11の臨床的変数にまたがる6,600のQAインスタンスが含まれており、4つの機能ディメンションと11のタスクで構成されている。
各質問は、明確な時間的証拠とタスク固有の回答導出規則に関連付けられ、回答の正確さと証拠の使用の両方を評価することができる。
実験により、既存のジェネラリストモデルは、厳密な臨床証拠の回収と推論に苦慮し、より厳格な不規則な時系列推論方法の必要性を強調している。
私たちのコードとデータはhttps://huggingface.co/datasets/winall/CLIR-Bench.orgで公開されています。
関連論文リスト
- A Cost-Effective Multimodal LLM Reasoning Framework for Question Answering over Irregular Clinical Time Series [10.789471760777564]
不規則な臨床時系列(ICTS)に対する質問応答は、幅広い医療応用において重要な役割を担っている。
近年のマルチモーダル時系列大言語モデル (LLM) は, 汎用時系列QAにおいて有望であることを示す。
我々は,ICTSデータに対する質問応答のための費用対効果の高いマルチモーダルLCM推論フレームワークであるClinPRISMを提案する。
論文 参考訳(メタデータ) (2026-07-28T16:33:41Z) - EHRNote-ChatQA: A Benchmark for Evidence-Grounded Multi-Turn Clinical Question Answering over Longitudinal Discharge Summaries [13.472329890204831]
EHRNote-ChatQAは,患者の複数の退院サマリーに答えるエビデンスグラウンドド・マルチターン臨床質問に対する最初のベンチマークである。
EHRNote-ChatQAは、特定されていないMIMIC-IV放電サマリーから作られ、患者レベル967個のマルチターンサンプルを1から5つのノートと16,072個の医療専門家が検証したQAペアを含む。
論文 参考訳(メタデータ) (2026-06-14T10:35:19Z) - MI-CXR: A Benchmark for Longitudinal Reasoning over Multi-Interval Chest X-rays [5.631048557031927]
マルチビジットCXRシークエンスにおける長手推論の標準化評価のためのベンチマークであるMI-CXRを紹介する。
MI-CXRは5ビジットの患者タイムラインに5方向の多重選択質問を含む。
14の最先端のビジョン言語モデルを評価すると、全体的な性能は低く、平均精度は29.3%、ランダムな推測よりもわずかに高い。
論文 参考訳(メタデータ) (2026-05-15T03:34:03Z) - ReTAMamba: Reliability-Aware Temporal Aggregation with Mamba for Irregular Clinical Time Series Prediction [3.5795275871379704]
臨床時系列データは、不規則なサンプリング、頻繁な欠落値、不均一な観察パターンを示すため、モデル化が困難である。
既存のアプローチでは、観測マスクとタイムギャップ情報を用いることが多いが、過去の観測の信頼性の低下を継続的に捉えているわけではない。
我々は,臨床時系列を時間可変トークンシーケンスとして再構成したMambaを用いた信頼性を考慮したテンポラルアグリゲーションを提案する。
論文 参考訳(メタデータ) (2026-05-11T02:39:33Z) - CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation [51.11942945171396]
従来の評価指標は、語彙重なり合いやエンティティマッチングの粗い尺度のみを提供する。
我々はCT-RATEとMerlinのベンチマークであるCT-FineBenchを提案し、CTレポートの微細な事実整合性を評価する。
我々のベンチマークは、綿密な質問回答(QA)ベースのプロセスによって構築されます。
論文 参考訳(メタデータ) (2026-04-27T03:32:46Z) - Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models [51.91760712805404]
大規模言語モデル(LLM)におけるシーケンシャルな臨床推論を評価するためのベンチマークであるVivaBenchを紹介する。
本データセットは,医療訓練における(口頭)検査をシミュレートする対話的シナリオとして構成された1762名の医師による臨床ヴィグネットから構成される。
本分析では,臨床における認知的誤りを反映するいくつかの障害モードを同定した。
論文 参考訳(メタデータ) (2025-10-11T16:24:35Z) - Mind the Gap: Benchmarking LLM Uncertainty, Discrimination, and Calibration in Specialty-Aware Clinical QA [4.501692468580528]
臨床質問応答(QA)に焦点を当てた不確実性評価手法の評価を行った。
本稿では,推論指向モデルに基づく行動特徴に基づく,新しい軽量な手法を提案する。
以上の結果から,不確実性はモノリシックな性質ではなく,臨床専門性や質問タイプに依存していることが明らかとなった。
論文 参考訳(メタデータ) (2025-06-12T14:48:25Z) - CTPD: Cross-Modal Temporal Pattern Discovery for Enhanced Multimodal Electronic Health Records Analysis [50.56875995511431]
マルチモーダルEHRデータから有意な時間的パターンを効率的に抽出するために,CTPD(Cross-Modal Temporal Pattern Discovery)フレームワークを導入する。
提案手法では,時間的セマンティックな埋め込みを生成するためにスロットアテンションを用いて改良された時間的パターン表現を提案する。
論文 参考訳(メタデータ) (2024-11-01T15:54:07Z) - Continuous-Time Modeling of Counterfactual Outcomes Using Neural
Controlled Differential Equations [84.42837346400151]
反現実的な結果を予測することは、パーソナライズされたヘルスケアをアンロックする可能性がある。
既存の因果推論アプローチでは、観察と治療決定の間の通常の離散時間間隔が考慮されている。
そこで本研究では,腫瘍増殖モデルに基づく制御可能なシミュレーション環境を提案する。
論文 参考訳(メタデータ) (2022-06-16T17:15:15Z) - A New Score for Adaptive Tests in Bayesian and Credal Networks [64.80185026979883]
テストは、そのシークエンスと質問数とが、テイカーの推定スキルに基づいて動的に調整されるときに適応する。
後部確率のモードに基づいて、別のスコアの族を提示するので、説明し易い。
論文 参考訳(メタデータ) (2021-05-25T20:35:42Z) - Clinical Temporal Relation Extraction with Probabilistic Soft Logic
Regularization and Global Inference [50.029659413650194]
既存のメソッドは、高価な機能エンジニアリングを必要とするか、イベント間のグローバルな依存関係をモデル化できない。
本稿では,確率論的ソフト論理規則化とグローバル推論を用いた新しい臨床時間緩和法を提案する。
論文 参考訳(メタデータ) (2020-12-16T08:23:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。