論文の概要: RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care
- arxiv url: http://arxiv.org/abs/2608.04514v1
- Date: Wed, 05 Aug 2026 06:49:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.763937
- Title: RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care
- Title(参考訳): RESPClinBench : 呼吸器専門医療におけるマルチモーダル・クリニカル・メイキングと縦断病管理のベンチマーク
- Authors: Mouxiao Bian, Zhi Chen, Ruiyao Chen, Lu Lu, Hengrui Liang, Chaoyi Huang, Yiluo Lin, Jingru Ding, Yun Zhong, Yuming Su, Jie Xu,
- Abstract要約: RESPClinBenchは、呼吸性臨床的意思決定のための現実のシナリオベースのベンチマークである。
7つのモデルが温度0の標準API推論と最大出力長8192トークンで4,361応答を生成した。
- 参考スコア(独自算出の注目度): 8.38759176329075
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Background: Respiratory specialty care requires multimodal interpretation, longitudinal risk assessment, guideline-concordant intervention, and whole-course management, which are poorly represented by examination-oriented medical benchmarks. Objective: To develop RESPClinBench, a real-world scenario-based benchmark for respiratory clinical decision-making, and evaluate seven contemporary large language models across AECOPD-PIM and PNBIM. Methods: RESPClinBench cases were adapted from de-identified respiratory clinical data. Three attending-level respiratory physicians revised cases, reference answers, and atomic clinical-action points, while one senior respiratory specialist performed cross-review and final adjudication. AECOPD-PIM comprised 427 open-ended COPD cases, and PNBIM comprised 196 multimodal pulmonary nodule cases combining chest CT with structured clinical information. Seven models generated 4,361 responses through standardized API inference with temperature 0 and a maximum output length of 8192 tokens. An automated framework calculated the final score as the arithmetic mean of atomic-action recall and rubric-based LLM-as-a-Judge assessment. Results: Across 623 cases, the mean final score was 68.58. Qwen3.6-27B ranked first overall at 71.22, Qwen3.5-397B-A17B led PNBIM at 72.48, and Qwen3.6-27B led AECOPD-PIM at 71.11. Imaging hallucination and serious medical risk occurred in 31.85% and 8.16% of PNBIM responses; medication-safety risk and serious medical risk occurred in 26.93% and 1.44% of AECOPD-PIM responses. Conclusions: RESPClinBench identifies task-specific limitations in multimodal pulmonary nodule assessment and longitudinal COPD management. Combining explicit clinical-action coverage, holistic evaluation, and independent safety flags provides a clinically grounded basis for model selection and prospective validation.
- Abstract(参考訳): 背景: 呼吸器専門医療には多段階的解釈, 縦断的リスク評価, ガイドライン・コンコーダント介入, コース全体管理が必要である。
目的:AECOPD-PIMとPNBIMの7つの現代大言語モデルを評価する。
方法: RESPClinBench 症例は, 未同定の呼吸臨床データから適応した。
3名の主観的呼吸器科医が症例,基準回答,アトミックな臨床反応点を改訂し,1名のシニア呼吸器科医がクロスレビューと最終適応を行った。
AECOPD-PIMは427例, PNBIMは196例であった。
7つのモデルが温度0の標準API推論と最大出力長8192トークンで4,361応答を生成した。
自動フレームワークは、最終スコアを原子アクションリコールとルーリックベースのLCM-as-a-Judgeアセスメントの算術平均として計算した。
結果: 623例中, 最終スコアは68.58。
Qwen3.6-27Bは71.22、Qwen3.5-397B-A17Bは72.48、Qwen3.6-27Bは71.11であった。
幻覚と重篤な医療リスクは31.85%と8.16%のPNBIM反応で発生し、薬剤安全リスクと重篤な医療リスクは26.93%と1.44%のAECOPD-PIM反応で発生した。
結語:RESPClinBenchは肺結節多型の評価および経時的PDD管理におけるタスク特異的な制限を同定する。
明確な臨床行動カバレッジ、全体的評価、および独立した安全フラグを組み合わせることで、モデル選択と予測検証のための臨床基礎を提供する。
関連論文リスト
- MamaBench: Benchmarking LLM Robustness in Maternal and Child Health Diagnosis through Counterfactual Clinical Perturbation [0.49454229616760287]
大規模言語モデルは医学ベンチマークで強いスコアを得るが、これらのベンチマークはそれぞれの質問を独立して評価する。
ママベンチ(MamaBench)は、母体と小児のAIに対する最初のカウンターファクトのベンチマークである。
Evidence-Anchored RAGは,アグリゲート類似性をエビデンスカバレッジの目的に置き換える3段階検索手法である。
論文 参考訳(メタデータ) (2026-07-15T21:56:19Z) - Cross-Attention Multimodal Learning for Predicting Response to Neoadjuvant Imatinib in Gastrointestinal Stromal Tumors: A Multicenter Retrospective Study [0.17595857197891288]
消化管間質腫瘍(GISTs)におけるネオアジュバント・イマチニブに対する反応は,高度に変動しており,確実な予測はできない。
本研究はCT(Computerd tomography)画像と臨床変数を統合したマルチモーダル学習フレームワークを開発し,評価した。
論文 参考訳(メタデータ) (2026-06-24T08:53:18Z) - Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases [71.12461204050985]
MedSP1000 (MedSP1000) は、SP由来の臨床エージェント評価のための対話型ベンチマークである。
ピアレビューされたSPの授業ケースを、定義されたSPケーススクリプト、臨床環境コンテキスト、人為的な構造化ルーブリックで実行可能なシナリオに変換する。
MedSP1000を多種多様な汎用および医療用LLMに適用すると、静的ベンチマークの性能がそのような教育シナリオに確実に変換されないことが分かる。
論文 参考訳(メタデータ) (2026-06-03T17:17:16Z) - Privacy-Preserving Local Language Models for Longitudinal Data Retrieval in Chronic Dermatologic Disease: Implementation in Pemphigus Patients [0.28909295536379814]
ペムフィガスのような慢性皮膚疾患は長期の経過観察を必要とする。
プライバシ保存型小言語モデル(SLM)は、構造化された臨床特徴を検索し、長手要約を生成する。
論文 参考訳(メタデータ) (2026-05-24T12:00:13Z) - Structured Visual Evidence Decomposition for Evidence-Grounded Multimodal Screening of Obstructive Sleep Apnea-Hypopnea Syndrome [12.95586927836034]
EviOSAHSはエビデンスベースのマルチモーダル推論フレームワークである。
画像のみの解剖学的証拠の取得と最終臨床判断を分離する。
88.47%の精度、94.86%の感度、93.74%のF1スコア、5.14%の偽陰性率を記録した。
論文 参考訳(メタデータ) (2026-05-23T06:09:31Z) - Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture [71.46525715889656]
汎用エージェントメモリシステムは、ユーザの最新のステートメントで古い事実を上書きすることでコヒーレンスを最適化する。
本稿では,患者の物語を構造化された臨床記録から厳密に分離するDual-Stream Memory Architectureを提案する。
675日間のウェルネスコーチングセッションにおいて,26名の患者を対象にこのアーキテクチャを評価した。
論文 参考訳(メタデータ) (2026-04-29T17:59:28Z) - A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations [60.2076951536797]
大規模言語モデル(LLM)は、医療シナリオにますます多くデプロイされている。
LLMが会話中に臨床ガイドラインを特定・遵守できるのかは不明確である。
CPGBenchは、LSMの臨床ガイドラインの検出と付着能力をベンチマークする自動フレームワークである。
論文 参考訳(メタデータ) (2026-03-26T09:00:55Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Joint nnU-Net and Radiomics Approaches for Segmentation and Prognosis of
Head and Neck Cancers with PET/CT images [6.361835964390572]
3D nnU-Netアーキテクチャは原発性腫瘍とリンパ節の自動分節に同期的に採用された。
従来の放射能の特徴のみを含む3つの予後モデルが構築された。
セグメンテーションと予後タスクの評価指標としてDice scoreとC-indexが用いられた。
論文 参考訳(メタデータ) (2022-11-18T10:31:26Z) - Exploiting segmentation labels and representation learning to forecast
therapy response of PDAC patients [60.78505216352878]
化学療法に対する腫瘍反応を予測するためのハイブリッドディープニューラルネットワークパイプラインを提案する。
セグメンテーションから分類への表現伝達の組み合わせと、ローカライゼーションと表現学習を利用する。
提案手法は, 合計477個のデータセットを用いて, ROC-AUC 63.7% の処理応答を予測できる, 極めて効率的な手法である。
論文 参考訳(メタデータ) (2022-11-08T11:50:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。