論文の概要: Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions
- arxiv url: http://arxiv.org/abs/2608.07550v1
- Date: Sat, 01 Aug 2026 16:18:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.429842
- Title: Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions
- Title(参考訳): 胸部X線写真における医用ビジョン・ランゲージモデルの検討 : 施設間の基準合意の推定
- Abstract要約: 視覚言語モデルでは、信頼スコアを示さないインターフェースを通して、構造化胸部画像像を返却する。
胸部X線写真コーパスを用いた3つの生成視覚言語モデルについて検討した。
- 参考スコア(独自算出の注目度): 6.575315179481716
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models return structured chest-radiograph findings through interfaces exposing no confidence score, so a receiving institution cannot read off how far to trust an individual judgment. Whether agreement with an institution's reference standard transfers across sites, findings, prediction directions and question formats is largely unmeasured. We evaluated three generative vision-language models on three institutional chest-radiograph corpora and six findings under two elicitation protocols, comprising more than 345,000 finding-level predictions, and estimated finding-by-direction reference agreement at a receiving institution from a small budget of local labels. Estimation strategies were then stress-tested under repeated strict institution-held-out evaluation. Under evaluation excluding the receiving institution from development entirely, adaptive selection among the seven estimators that design admits did not improve on simple fixed alternatives: it achieved a mean Brier score of 0.1083, against 0.0853 for always using a Beta-Binomial empirical-Bayes estimator and 0.0855 for a target-only logistic model. Those two differ by 0.0003, less than this family's own sensitivity to a change of solver version, and each leads in about half the settings, so no default can be recommended. Their advantage over estimators pooling across institutions was concentrated at one site and not confirmatory once clustered by institution, and a plug-in empirical-Bayes posterior-predictive count interval at a nominal 95% level covered 87.0%, less at the hardest institution. Reference agreement therefore has to be re-evaluated per site and per interface; these results concern agreement with institutional labels, not clinical correctness.
- Abstract(参考訳): 視覚言語モデルでは、信頼スコアを提示しないインターフェースを通じて、構造化胸部画像所見を返却するので、受信機関は個々の判断をどの程度信頼するかを読めない。
施設の基準基準との合意が、現場、発見、予測方向、質問形式にまたがって伝達されるか否かは、ほとんど未定である。
我々は,3施設の胸部X線撮影コーパスの3つの生成視覚言語モデルと,345,000件以上の発見レベルの予測と,少量の地方レーベルの予算から受信機関の指示基準合意を推定する2つの説明プロトコルによる6つの知見を評価した。
その後、厳格な制度維持評価を繰り返して、評価戦略をストレステストした。
受信機関を開発から完全に除外した評価では、設計が許容する7つの推定器の適応的選択は、単純な固定的な代替品では改善しなかった。
これらの2つは0.0003と異なり、このファミリーのソルババージョンの変更に対する感受性よりも低く、それぞれが約半分の設定で導かれるため、デフォルトは推奨できない。
施設をまたいでプールする推定器に対する彼らの優位性は、ある場所で集中し、一度組織によってクラスタ化されていなければ確認されず、95%という名目上の実証的な後数間隔は87.0%であり、最も厳しい施設ではより少なかった。
したがって、基準合意は、サイトごと、インターフェースごとの再評価が必要であり、これらの結果は、臨床的正確性ではなく、制度上のラベルとの合意に関係している。
関連論文リスト
- The Model Proposes, the Code Disposes: A Pre-Registered Ablation of a Verifier-and-Acceptance Stage in an LLM-Orchestrated Offensive-Security Agent [0.0]
決定的コードによって検証が強制されるモデル検証装置である検証受理段階が、LCMが主導する攻撃セキュリティエージェントが報告するものを変更するかどうかを評価する。
本報告では,15回の探索パイロット,20回の予備登録検定アブレーション,および2回の故意に脆弱な検査対象を40回実施した2×2因子分析を行った。
検証者はシステムが提供するものを変更し、決定論的コードは強制と監査性を提供します。
論文 参考訳(メタデータ) (2026-09-14T17:13:05Z) - Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay [0.6768558752130311]
単一エージェント環境において,実行されたリプレイからポリシー条件の真偽を検査する。
段階的な信用シグナルは、限界整合シャッフル制御以上の信頼度の高いインクリメンタル忠実度を示すものではない。
信頼のみのルータは、チャンスレベルにおいて重要なステップを回復するが、1ターンあたりの審査コストを13.1%削減する。
論文 参考訳(メタデータ) (2026-08-20T08:04:00Z) - Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation [6.047519836191728]
有限行動ポリシークラス上でプロトコルレベルの識別可能性監査を形式化する。
監査はモデルコールをゼロにし、診断ケースを解決します。
このケースは、モデル推論の前に、どのように評価設計の妥当性を構造的に確認できるかを示す。
論文 参考訳(メタデータ) (2026-08-13T14:49:47Z) - Beyond Aggregate Calibration: Decomposing Income-Conditional Recall Disparities in Automated Credit Default Prediction [0.0]
高所得既定者は低所得既定者に対してラベルノイズとして不均等に分類される。
16.86パーセントのポイントギャップは、最終的にデフォルトとなった高所得者と低所得者の間で真の正のレート(リコール)である。
論文 参考訳(メタデータ) (2026-08-08T15:57:15Z) - Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking [27.829988205900055]
MedQADEは、ドイツにおける最初の標準的オープンレスポンス臨床ベンチマークである。
最高のパフォーマンス評価モデルであるGemini 3 Flashは、医師の天井と一致している。
この統計的アライメントにもかかわらず、自動評価装置は臨床メタ認知に近づいた。
論文 参考訳(メタデータ) (2026-07-01T15:55:31Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Clinical Uncertainty Impacts Machine Learning Evaluations [40.773483049446426]
機械学習評価は, 直接分布に作用する確率的指標を用いて, アノテーションの不確かさを明示的に考慮すべきである,と論じる。
我々は、データセットの生アノテーションをコミュニティに公開し、パフォーマンス推定が臨床データをよりよく反映できるように、不確実性を考慮した評価を採用するよう促す。
論文 参考訳(メタデータ) (2025-09-26T11:56:58Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Agent-Based Uncertainty Awareness Improves Automated Radiology Report Labeling with an Open-Source Large Language Model [1.7064514726335305]
クローン病患者のヘブライ語9,683例について検討した。
我々は不確実性を認識したプロンプトアンサンブルとエージェントに基づく決定モデルを導入した。
論文 参考訳(メタデータ) (2025-02-02T16:57:03Z) - Revisiting Confidence Estimation: Towards Reliable Failure Prediction [53.79160907725975]
多くの信頼度推定法は誤分類誤りを検出するのに有害である。
本稿では, 最先端の故障予測性能を示す平坦な最小値を求めることにより, 信頼性ギャップを拡大することを提案する。
論文 参考訳(メタデータ) (2024-03-05T11:44:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。