論文の概要: MRI-Eval: A Tiered Benchmark for Evaluating LLM Performance on MRI Physics and GE Scanner Operations Knowledge
- arxiv url: http://arxiv.org/abs/2605.05175v1
- Date: Wed, 06 May 2026 17:42:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.971048
- Title: MRI-Eval: A Tiered Benchmark for Evaluating LLM Performance on MRI Physics and GE Scanner Operations Knowledge
- Title(参考訳): MRI-Eval:MRI物理とGEスキャナ操作知識を用いたLLM性能評価ベンチマーク
- Abstract要約: MRI-Evalは、MRI物理とGEスキャナ操作知識の相対モデル比較のためのタイレッドベンチマークである。
教科書、GEスキャナマニュアル、プログラミングコースの教材、エキスパートが作成した質問など、9つのカテゴリの1365の項目と3つの難易度が含まれている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Background: Existing MRI LLM benchmarks rely mainly on review-book multiple-choice questions, where top proprietary models already score highly, limiting discrimination. No systematic benchmark has evaluated vendor-specific scanner operational knowledge central to research MRI practice. Purpose: We developed MRI-Eval, a tiered benchmark for relative model comparison on MRI physics and GE scanner operations knowledge using primary multiple-choice questions (MCQ), with stem-only and primed diagnostic conditions as complementary analyses. Methods: MRI-Eval includes 1365 scored items across nine categories and three difficulty tiers from textbooks, GE scanner manuals, programming course materials, and expert-generated questions. Five model families were evaluated (GPT-5.4, Claude Opus 4.6, Claude Sonnet 4.6, Gemini 2.5 Pro, Llama 3.3 70B). MCQ was primary; stem-only removed options and used an independent LLM judge; primed stem-only tested responses to incorrect user claims. Results: Overall MCQ accuracy was 93.2% to 97.1%. GE scanner operations was the lowest category for every model (88.2% to 94.6%). In stem-only, frontier-model accuracy fell to 58.4% to 61.1%, and Llama 3.3 70B fell to 37.1%; GE scanner operations stem-only accuracy was 13.8% to 29.8%. Conclusion: High MCQ performance can mask weak free-text recall, especially for vendor-specific operational knowledge. MRI-Eval is most informative as a relative comparison benchmark rather than an absolute competency measure and supports caution in using raw LLM outputs for GE-specific protocol guidance.
- Abstract(参考訳): 背景: 既存のMRI LLMベンチマークは、主にレビューブックの多重選択問題に依存しており、トッププロプライエタリなモデルはすでに高いスコアを獲得し、差別を制限する。
組織的なベンチマークでは、MRIの実践研究の中心となるベンダー固有のスキャナの運用知識は評価されていない。
目的:MRI物理とGEスキャナ操作知識の相関モデル比較のためのベンチマークであるMRI-Evalを開発した。
方法: MRI-Evalには、9つのカテゴリにわたる1365項目と、教科書、GEスキャナマニュアル、プログラミングコース教材、専門家による質問からの難易度レベル3が含まれている。
5つのモデルファミリー(GPT-5.4、Claude Opus 4.6、Claude Sonnet 4.6、Gemini 2.5 Pro、Llama 3.3 70B)が評価された。
MCQはプライマリであり、ステムのみのオプションを削除し、独立したLCM判事を使用した。
結果:総合MCQの精度は93.2%から97.1%であった。
GEスキャナーの操作は全てのモデルで最も低いカテゴリー(88.2%から94.6%)であった。
ステムのみの場合、フロンティアモデルの精度は58.4%から61.1%に低下し、ラマ3.370Bは37.1%に低下し、GEスキャナーの操作精度は13.8%から29.8%に低下した。
結論: 高MCQパフォーマンスは、特にベンダ固有の運用知識において、弱いフリーテキストリコールを隠蔽する可能性がある。
MRI-Evalは、絶対能率ではなく、相対比較ベンチマークとして最も有益であり、GE固有のプロトコルガイダンスに生のLLM出力を使用することに注意を払っている。
関連論文リスト
- SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models [39.65665515356622]
今回,SurgiQについて紹介する。SurgiQは6つの外科領域にまたがる,13,055の4つの選択肢の多重選択質問に対する,テキストのみのソースグラウンドベンチマークである。
汎用モデル、特にQwen2.5は、ほとんどのバイオメディカルモデルより優れている。
論文 参考訳(メタデータ) (2026-06-06T09:45:45Z) - TumorXAI: Self-Supervised Deep Learning Framework for Explainable Brain MRI Tumor Classification [0.9967735666813463]
われわれは,マルチクラス脳腫瘍分類研究に自己教師あり学習(SSL)を用いる。
我々は,SimCLR,BYOL,DINO,Moco v3の4つのSSLフレームワークを,17種類の異なる4,448個のMRIで評価した。
その結果、ラベルが限定されている場合、SSLに制限されたモデルは、F1スコア、リコール、精度、精度の点で教師付きベースラインを上回っていることがわかった。
論文 参考訳(メタデータ) (2026-05-03T18:02:36Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models [57.73472878679636]
Med-RewardBenchは、医療報酬モデルと審査員を評価するために特別に設計された最初のベンチマークである。
Med-RewardBenchは、13の臓器系と8の臨床部門にまたがるマルチモーダルデータセットを特徴としている。
厳格な3段階のプロセスは、6つの臨床的に重要な次元にわたる高品質な評価データを保証する。
論文 参考訳(メタデータ) (2025-08-29T08:58:39Z) - Comparative analysis of privacy-preserving open-source LLMs regarding extraction of diagnostic information from clinical CMR imaging reports [0.49998148477760973]
9つのオープンソースのLarge Language Models (LLMs) について, 患者を診断し, 様々な診断カテゴリーに分類する能力について検討した。
GoogleのGemma2モデルは平均F1スコアが0.98で、Qwen2.5:32BとDeepseekR1-32Bはそれぞれ0.96と0.95だった。
論文 参考訳(メタデータ) (2025-05-29T11:25:10Z) - MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks [47.486705282473984]
大規模言語モデル(LLM)は、医学試験においてほぼ完璧なスコアを得る。
これらの評価は、実際の臨床実践の複雑さと多様性を不十分に反映している。
MedHELMは,医療業務におけるLCMの性能を評価するための評価フレームワークである。
論文 参考訳(メタデータ) (2025-05-26T22:55:49Z) - ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification [57.22053411719822]
ChestX-Reasoner(チェストX-Reasoner)は、臨床報告から直接採掘されるプロセスの監督を活用するために設計された放射線診断MLLMである。
我々の2段階のトレーニングフレームワークは、モデル推論と臨床標準との整合性を高めるために、プロセス報酬によって指導された教師付き微調整と強化学習を組み合わせる。
論文 参考訳(メタデータ) (2025-04-29T16:48:23Z) - It is Too Many Options: Pitfalls of Multiple-Choice Questions in Generative AI and Medical Education [0.7771252627207672]
MCQ(Multiple-choice question)ベンチマークにおけるLLM(Large Language Models)の性能は、その医療能力の証明としてしばしば引用される。
我々は、ペアMCQ(FreeMedQA)を用いた自由応答型質問の新しいベンチマークを作成しました。
このベンチマークを用いて,3つの最先端LCM (GPT-4o, GPT-3.5, LLama-3-70B-instruct) を評価し,自由応答問題において平均39.43%の性能低下が認められた。
論文 参考訳(メタデータ) (2025-03-13T19:42:04Z) - Brain Tumor Classification on MRI in Light of Molecular Markers [56.99710477905796]
1p/19q遺伝子の同時欠失は、低グレードグリオーマの臨床成績と関連している。
本研究の目的は,MRIを用いた畳み込みニューラルネットワークを脳がん検出に活用することである。
論文 参考訳(メタデータ) (2024-09-29T07:04:26Z) - Automated classification of multi-parametric body MRI series [7.039977392090069]
我々は,mpMRI研究において,8種類の異なるシリーズのタイプを分類する自動フレームワークを提案する。
我々は3つのシーメンススキャナーによって取得された1,363個の研究を用いて、5倍のクロスバリデーションを持つDenseNet-121モデルを訓練した。
平均精度は96.6%,感度は96.6%,特異性は99.6%,F1スコアは96.6%であった。
論文 参考訳(メタデータ) (2024-05-14T00:39:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。