論文の概要: MS-Exam-Gen: Source-Grounded Benchmark Construction for Evaluating LLMs on Textual Multiple Sclerosis MRI Knowledge
- arxiv url: http://arxiv.org/abs/2610.06170v1
- Date: Mon, 05 Oct 2026 11:41:57 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:35:45.975205
- Title: MS-Exam-Gen: Source-Grounded Benchmark Construction for Evaluating LLMs on Textual Multiple Sclerosis MRI Knowledge
- Title(参考訳): MS-Exam-Gen:テキスト型多発性硬化症MRI知識に基づくLLMの評価のためのベンチマーク構築
- Abstract要約: 我々は,MS-MRI知識のためのテキストベース多重選択質問(MCQ)ベンチマークの構築と監査を行うフレームワークであるMS-Exam-Genを提案する。
MS-Exam-Genは、ソースグラウンドの基準、プロトコル、レポート、ディファレンシャル診断をターゲットにしている。
- 参考スコア(独自算出の注目度): 5.161202800604429
- License:
- Abstract: Biomedical large language model (LLM) evaluation requires auditable assessment of narrow, evolving, source-grounded subspecialty knowledge. Multiple sclerosis MRI (MS-MRI) provides a high-stakes textual-knowledge test case because correct reasoning requires current diagnostic criteria, standardized acquisition and reporting knowledge, longitudinal monitoring concepts, lesion morphology, and recognition of difficult mimics. We present MS-Exam-Gen, a reproducible framework for constructing and auditing a text-based multiple-choice question (MCQ) benchmark for MS-MRI knowledge; it does not evaluate direct MRI image interpretation. MS-Exam-Gen targets source-grounded criteria, protocols, reporting, and differential diagnosis. The framework combines expert-source indexing, exam-oriented topic induction, evidence-grounded MCQ generation, automated quality audits, a same-family consistency screen, and empirical calibration. From a 66-source corpus indexed into 4,289 retrieval chunks, the pipeline produced a locked 3,058-item candidate benchmark spanning 16 topics and 53 subtopics. Evaluation across 12 primary LLM endpoints yielded 36,696 item-level predictions and separated performance over a 42.8-percentage-point accuracy range (89.7% to 46.9%). Across these endpoints, 25.5% of items were missed by at least four. Post-generation audits showed that refreshed construction reduced measurable answer cues, while option-order testing showed that absolute MCQ scores remain position-sensitive. Generated construction labels remain metadata rather than validated psychometric categories. Because expert adjudication and full option-order counterbalancing remain future work, MS-Exam-Gen is not a clinically certified examination. It should be interpreted as an automatically filtered, source-grounded candidate benchmark and reproducible audit workflow for item-level and topic-specific LLM evaluation.
- Abstract(参考訳): 生物医学的大規模言語モデル (LLM) の評価には、狭く進化し、根源的なサブ特質知識の監査可能な評価が必要である。
正しい推論には、現在の診断基準、標準化された取得と報告の知識、縦断的な監視概念、病変形態、難しい模倣の認識が必要である。
提案するMS-Exam-Genは,MS-MRI知識に対するテキストベース多重選択質問(MCQ)ベンチマークの構築と監査のための再現可能なフレームワークであり,MRI画像の直接解釈を評価できない。
MS-Exam-Genは、ソースグラウンドの基準、プロトコル、レポート、ディファレンシャル診断をターゲットにしている。
このフレームワークは、専門家によるインデクシング、試験指向のトピックインジェクション、エビデンスに基づくMCQ生成、自動品質監査、同系統の整合性画面、経験的校正を組み合わせたものだ。
66ソースのコーパスから4,289個の検索チャンクにインデックスされたパイプラインは、16のトピックと53のサブトピックにまたがる3,058の候補ベンチマークを生成した。
12のLLMエンドポイントに対する評価では、36,696項目レベルの予測と42.8ポイントの精度範囲(89.7%から46.9%)での分離性能が得られた。
これらのエンドポイント全体では、25.5%のアイテムが少なくとも4つは欠落している。
ポストジェネレーション監査では、リフレッシュされた構成により、測定可能な回答キューが減少し、オプションオーダーテストでは、絶対MCQスコアが位置感受性のままであることが示された。
生成された構成ラベルは、検証された心理指標カテゴリよりもメタデータのままである。
MS-Exam-Genは、専門家の判断と完全なオプションオーダーのカウンターバランスが今後も継続されるため、臨床検査として認定されていない。
項目レベルおよびトピック固有のLLM評価のための、自動フィルタリング、ソースグラウンドの候補ベンチマークおよび再現可能な監査ワークフローとして解釈されるべきである。
関連論文リスト
- QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models [8.050059911826338]
LLM(Large Language Models)は、標準化された医療試験に優れるが、高いスコアは、現実世界の医療クエリに対する高品質な応答に変換できないことが多い。
実世界の医療LCM評価に適した生態学的に有効なベンチマークであるQuarkMedBenchを紹介する。
論文 参考訳(メタデータ) (2026-03-14T01:51:43Z) - LiveMedBench: A Contamination-Free Medical Benchmark for LLMs with Automated Rubric Evaluation [22.211535340726073]
LiveMedBenchは、オンライン医療コミュニティからリアルな臨床ケースを抽出する、継続的に更新されたベンチマークである。
LiveMedBenchは、38の専門医と複数の言語にまたがる2,756の現実世界のケースで構成され、16,702のユニークな評価基準と組み合わせている。
大規模な評価では、最高のパフォーマンスモデルでさえ39.2%しか達成せず、84%のモデルがカット後のケースで性能劣化を示す。
論文 参考訳(メタデータ) (2026-02-10T23:38:25Z) - Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning [37.6854362777847]
Med-CMR(Med-CMR)について述べる。
Med-CMRは既存のものと3つのコア機能で区別する。
我々は,Med-CMRを用いた18種類の最先端MLLMを評価し,GPT-5を最高性能の商用モデルとして明らかにした。
論文 参考訳(メタデータ) (2025-11-30T09:56:50Z) - From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations [45.414878840652115]
大規模言語モデル(LLM)は医療ベンチマークで有望な性能を示した。
しかし、医学的な計算を行う能力は未熟であり、評価も不十分である。
本研究は,臨床信頼性を重視した医療計算評価を再考する。
論文 参考訳(メタデータ) (2025-09-20T09:10:26Z) - BEnchmarking LLMs for Ophthalmology (BELO) for Ophthalmological Knowledge and Reasoning [4.765373980518581]
BELOは、眼科関連の臨床的精度と推論品質の評価ベンチマークである。
5つのソースから集計された900の高品質で専門家レビューされた質問で構成されている。
透明な評価と報告を促進するために、公共のリーダーボードが設けられている。
論文 参考訳(メタデータ) (2025-07-21T15:27:32Z) - Comprehensive and Practical Evaluation of Retrieval-Augmented Generation Systems for Medical Question Answering [70.44269982045415]
Retrieval-augmented Generation (RAG) は,大規模言語モデル (LLM) の性能向上のための有望なアプローチとして登場した。
医療用QAデータセットに様々な補助的要素を提供するMedRGB(MedRGB)を導入する。
実験結果から,検索した文書のノイズや誤情報の処理能力に限界があることが判明した。
論文 参考訳(メタデータ) (2024-11-14T06:19:18Z) - GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI [67.09501109871351]
LVLM(Large Vision-Language Model)は、画像、テキスト、生理学的信号などの多様なデータタイプを扱うことができる。
GMAI-MMBenchは、よく分類されたデータ構造と、これまででもっとも包括的な一般医療用AIベンチマークである。
38の医療画像モダリティ、18の臨床関連タスク、18の部門、視覚質問回答(VQA)フォーマットの4つの知覚的粒度からなる284のデータセットで構成されている。
論文 参考訳(メタデータ) (2024-08-06T17:59:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。