論文の概要: Jev in Medicine: A Benchmark Evaluation
- arxiv url: http://arxiv.org/abs/2609.34024v3
- Date: Sun, 04 Oct 2026 19:31:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.401391
- Title: Jev in Medicine: A Benchmark Evaluation
- Title(参考訳): Jev in Medicine: ベンチマーク評価
- Abstract要約: Jevは、事前定義された回答オプションに確率を割り当て、外部では答えられない、非生成的な"System One"モデルである。
MetaMedQA, PubMedQA, diagnosisArena-MCQ, NEJM Case Challengesの4つのベンチマークでJev 1.13を評価した。
- 参考スコア(独自算出の注目度): 0.42970700836450487
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Jev is a non-generative "System One" model that assigns probabilities to predefined answer options and cannot answer outside them. Its accuracy and calibration on medical question-answering and case-based diagnostic-reasoning tasks are unknown. We evaluated Jev 1.13 on four medical benchmarks: MetaMedQA, PubMedQA, DiagnosisArena-MCQ and the NEJM Case Challenges. GPT-6 Sol, with (medium) and without reasoning, was the reference. The primary outcome was top-1 accuracy; key secondary outcomes were calibration, selective prediction and recognition of unanswerable questions. All 8,469 requests returned a valid answer. Jev's accuracy was similar to that of GPT-6 Sol with medium reasoning on PubMedQA (78.4% vs 78.2%;), lower on MetaMedQA (74.8% vs 82.7%) and much lower on DiagnosisArena-MCQ (59.8% vs 82.4%;) and the NEJM cases (61.8% vs 82.4%). On MetaMedQA, Jev's probabilities were the best calibrated (expected calibration error 0.063 vs 0.146), and its answers with a probability of at least 0.9 (52.9% of questions) were 93.4% accurate, but GPT-6 Sol was as accurate when it accepted a similar proportion of questions. On DiagnosisArena-MCQ, Jev's probabilities discriminated poorly (AUROC 0.645 vs 0.768). Of the 162 questions whose correct answer was "I don't know or cannot answer", Jev chose that option for 10.5% (GPT-6 Sol, 8.6%). Median latency was 0.27-0.31 s; all 2,823 items cost USD 0.08. Jev was fast and inexpensive, and its accuracy was similar to that of a frontier LLM on research abstracts but lower on examination questions and much lower on complex diagnostic cases. Task-specific validation is required before clinical use.
- Abstract(参考訳): Jevは、事前定義された回答オプションに確率を割り当て、外部では答えられない、非生成的な"System One"モデルである。
医学的質問応答とケースベース診断推論の精度とキャリブレーションは、不明である。
MetaMedQA, PubMedQA, diagnosisArena-MCQ, NEJM Case Challengesの4つのベンチマークでJev 1.13を評価した。
GPT-6 Sol, with (medium) and without reasoning, was the reference。
主な結果はトップ1の精度であり、主要な二次結果はキャリブレーション、選択的予測、未解決質問の認識であった。
8,469件の全てのリクエストが有効な回答を返した。
Jevの精度は、PubMedQA(78.4% vs 78.2%)、MetaMedQA(74.8% vs 82.7%)、診断Arena-MCQ(59.8% vs 82.4%)、NEJM(61.8% vs 82.4%)を中和したGPT-6 Solと類似していた。
MetaMedQAでは、Jevの確率は最高のキャリブレーション(推定キャリブレーション誤差0.063 vs 0.146)であり、少なくとも0.9(52.9%の質問)の確率は93.4%の精度であったが、GPT-6 Solは同様の割合の質問を受け入れた時点でも正確であった。
診断Arena-MCQでは、Jevの確率は低い(AUROC 0.645 vs 0.768)。
正しい答えが「私は知らないか答えられない」という162の質問のうち、Jevは10.5%(GPT-6 Sol, 8.6%)で選択した。
メディアのレイテンシは0.27-0.31秒であり、全2,823項目は0.08米ドルであった。
Jevは高速かつ安価で、その精度は研究要約におけるフロンティアLSMと似ているが、検査問題では低く、複雑な診断でははるかに低かった。
臨床使用の前には、タスク固有の検証が必要である。
関連論文リスト
- Unknown is not normal: separating language-model extraction from rule-based decision logic for clinical risk scores [0.0]
大規模言語モデル(LLM)は、フリーテキストノートから臨床リスクスコアを計算するために、ますます使われてきている。
決定論理から三状態抽出を分離することで、システムは決定を変えることができる質問のみを問うことができるかどうかを検証する。
論文 参考訳(メタデータ) (2026-09-28T01:48:17Z) - DementiaCare-Bench: A Modality-Validated Video Benchmark [83.92703885588868]
認知症は世界中で推定5700万人に影響を与える。
ほとんどの家族にとって、ケアの最も難しい部分は記憶喪失ではなく、認知症の行動や心理的症状である。
DementiaCare-Bench: 9つのBPSDカテゴリの94クリップに区切られた、プロのケア用トレーニングビデオ56本を提示する。
論文 参考訳(メタデータ) (2026-09-11T14:52:49Z) - One Score, Two Decisions: Selective Prediction on the Rare-Disease Tail [14.101636730819175]
患者の臨床所見から、診断システムは疾患をランク付けし、最初の予測をいつ修正するか、またはレビューのために延期するかを判断しなければならない。
この決定は通常、トップスコアをしきい値にすることで下される。
患者数は2000人を超え、8つの小さなオープンウェイトLSMは、超希少疾患に対して少なくとも4.6%のリコール@1を達成している。
損なわれないスコアだけで、マージンへの切り替えが役立つかどうかを判断できないことを証明します。
論文 参考訳(メタデータ) (2026-08-05T03:20:07Z) - When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models [2.064612766965483]
MedMCQA(4,183質問)とPubMedQA(1,000質問)でMedGemma(4Bおよび27Bパラメータ)を評価する。
実験の結果,いくつかの知見が得られた。
論文 参考訳(メタデータ) (2026-03-26T23:04:20Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Mechanistically Guided LoRA Improves Paraphrase Consistency in Medical Vision-Language Models [2.064612766965483]
医療ビジョンランゲージモデルでは、同じ臨床的疑問の言い換えに対して、異なるイエスまたはノーの回答を与えることができる。
PSF-Med Sadanandan と Behzadan (2025) を用いて MedGemma-4B でこれを研究した。
パラフレーズ整合性と解答精度のバランスをとるために,ローランド適応 (LoRA) アダプタを併用して微調整する。
論文 参考訳(メタデータ) (2026-02-24T23:30:50Z) - Explainable Admission-Level Predictive Modeling for Prolonged Hospital Stay in Elderly Populations: Challenges in Low- and Middle-Income Countries [65.4286079244589]
長期滞在期間 (pLoS) は, 院内感染のリスクに関連する重要な要因である。
入院レベルの患者と病院の診療データを用いて, pLosの予測モデルを開発し, 解説する。
論文 参考訳(メタデータ) (2026-01-07T23:35:24Z) - Hallucination Filtering in Radiology Vision-Language Models Using Discrete Semantic Entropy [2.2820819635675478]
個別意味エントロピー(DSE)を用いて幻覚を発生させる可能性のある質問を拒絶することで、X線画像に基づく視覚質問応答(VQA)におけるブラックボックス視覚言語モデル(VLM)の精度を向上させることができる。
この振り返り調査は、2つの公開されていないデータセットを使用してDSEを評価した。
論文 参考訳(メタデータ) (2025-10-10T10:53:33Z) - Medical Hallucinations in Foundation Models and Their Impact on Healthcare [71.15392179084428]
基礎モデルの幻覚は自己回帰訓練の目的から生じる。
トップパフォーマンスモデルは、チェーン・オブ・シークレット・プロンプトで強化された場合、97%の精度を達成した。
論文 参考訳(メタデータ) (2025-02-26T02:30:44Z) - Automated SSIM Regression for Detection and Quantification of Motion
Artefacts in Brain MR Images [54.739076152240024]
磁気共鳴脳画像における運動アーチファクトは重要な問題である。
MR画像の画質評価は,臨床診断に先立って基本的である。
構造類似度指数(SSIM)回帰に基づく自動画像品質評価法が提案されている。
論文 参考訳(メタデータ) (2022-06-14T10:16:54Z) - Reliable Visual Question Answering: Abstain Rather Than Answer
Incorrectly [100.60560477391732]
我々は、信頼性のある視覚的質問応答(VQA)のための問題定式化を促進する。
私たちは、彼らのカバレッジ、回答された質問の一部、そしてその部分のエラーの両方を分析します。
最高のパフォーマンスモデルは、VQA v2データセットで71%以上の精度を達成するが、そのオプションを導入することで、低いエラー(1%)のリスクを達成するために、8%未満の質問に答えることが制限されることがわかった。
これにより、マルチモーダル選択関数を用いて、予測された回答の正しさを直接推定し、例えば5.0%から16.7%のカバレッジを3倍にすることができることを示す。
論文 参考訳(メタデータ) (2022-04-28T16:51:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。