論文の概要: Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations
- arxiv url: http://arxiv.org/abs/2608.04885v1
- Date: Wed, 05 Aug 2026 14:09:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.957077
- Title: Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations
- Title(参考訳): 視覚的・テキスト的摂動下における視覚言語モデルの診断的ロバスト性の評価
- Authors: Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili,
- Abstract要約: 証拠保存摂動下での4つのVLMファミリーの診断的ロバスト性について検討した。
以上の結果から,48.9%のケースで予測反転を示すモデルを用いて,プレゼンテーション順序安定性の重大な脆弱性を明らかにした。
- 参考スコア(独自算出の注目度): 3.765860543344957
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Standard accuracy metrics for VLMs often mask significant reliability failures in sensitive domains. In this work, we utilize a histopathology-validated brain MRI dataset to systematically assess the diagnostic robustness of four VLM families under evidence-preserving perturbations. By reordering anatomical slices and swapping target label positions, we evaluate whether models maintain consistent predictions when clinical evidence remains invariant. Our results reveal significant vulnerabilities in presentation-order stability, with models exhibiting prediction flips in up to 48.9% of cases under simple sequence reversals. We further identify a textual selection bias, where label reordering triggers inconsistent diagnoses in up to 67.8% of cases despite identical visual inputs. Negative-control tests further reveal diagnostic overcommitment: models generate categorical diagnoses in up to 76.1% of cases after expert-annotated lesion slices are removed. These results demonstrate that high accuracy can overestimate clinical reliability, masking sensitivity to sequential presentation and textual framing that is not captured by aggregate accuracy. Our findings highlight the necessity of stability-based metrics for the deployment of VLMs in safety-critical clinical applications. Our evaluation data and code will be made public upon acceptance.
- Abstract(参考訳): VLMの標準精度測定基準は、しばしば機密ドメインの重大な信頼性障害を隠蔽する。
本研究では、病理組織学的に検証された脳MRIデータセットを用いて、証拠保存摂動下での4つのVLMファミリーの診断的堅牢性を体系的に評価する。
解剖学的スライスをリオーダーし,ターゲットのラベル位置をスワップすることで,臨床証拠が不変である場合,モデルが一貫した予測を維持しているかどうかを評価する。
以上の結果から, 提示順序安定性の重大な脆弱性が明らかとなり, 予測フリップが48.9%のケースで逆転するモデルが得られた。
さらに、同一の視覚入力にもかかわらず67.8%の症例において、ラベルの並べ替えが矛盾する診断を誘導するテキスト選択バイアスを同定する。
モデルでは、専門家に注釈された病変のスライスを除去した後、76.1%の症例でカテゴリー診断を発生させる。
これらの結果から, 臨床信頼性の過大評価, シーケンシャルな提示に対するマスキング感度, 集合的精度で捉えないテキストフレーミングが得られた。
本研究は,VLMsの安全性と臨床応用における安定性に基づく指標の必要性を浮き彫りにした。
評価データとコードは受理後に公開します。
関連論文リスト
- Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction [72.89352076103889]
大規模言語モデル (LLM) は, 臨床情報がすべて一ターンで提供される場合に, 高い精度で診断を行う。
1,035例からなる高忠実多ターン診断ベンチマークであるMINTを導入する。
診断決定に大きな影響を及ぼす3つの永続的な行動パターンを明らかにする。
論文 参考訳(メタデータ) (2026-04-06T00:23:10Z) - Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning? [31.103598483020857]
大規模視覚言語モデル(LVLM)は皮膚学において強い性能を示す。
稀な疾患に対する診断的推論は ほとんど未発見のままです
このデータセットには26,030のマルチモーダル画像テキストペアと6,354の臨床的に困難な症例が含まれている。
LVLMをリードするベンチマーク22は、診断精度、鑑別診断、臨床推論に重大な欠陥を呈する。
論文 参考訳(メタデータ) (2026-03-19T02:25:36Z) - Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification [60.18369393468405]
既存の検証器は通常、ドメイン知識の欠如と限られた校正のために性能が劣る。
GLEANは専門家によって計算されたプロトコルをトラジェクトリインフォームされ、よく校正された正当性信号にコンパイルする。
我々は,MIMIC-IVデータセットから得られた3つの疾患の薬物的臨床診断でGLEANを実証的に検証した。
論文 参考訳(メタデータ) (2026-03-03T09:36:43Z) - Toward Guarantees for Clinical Reasoning in Vision Language Models via Formal Verification [12.60121003165514]
ヴィジュアル言語モデル(VLM)は放射線学レポートの起草において有望であるが、しばしば論理的矛盾に悩まされる。
標準的な語彙測度は、臨床パラフレージングを強く罰し、これらの誘因的障害を捉えるのに失敗する。
本稿では,VLMレポートの内部一貫性を決定的に監査するニューロシンボリック検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-27T15:49:59Z) - Diagnostics for Individual-Level Prediction Instability in Machine Learning for Healthcare [0.0]
2つの相補的診断法を用いて個人レベルの予測不安定性を定量化する評価フレームワークを提案する。
これらの診断をシミュレーションデータとGUSTO-I臨床データセットに適用する。
論文 参考訳(メタデータ) (2026-02-27T03:42:28Z) - EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models [82.43729208063468]
医療用LVLM(Large Vision-Language Models)の最近のベンチマークでは、信頼性と安全性を見越して、リーダボードの精度を強調している。
ユーザが提供した情報を非批判的に反響させる傾向のモデルについて検討する。
医療用LVLMの梅毒を系統的に評価するベンチマークであるEchoBenchを紹介する。
論文 参考訳(メタデータ) (2025-09-24T14:09:55Z) - Embeddings to Diagnosis: Latent Fragility under Agentic Perturbations in Clinical LLMs [0.0]
本稿では, 臨床用LDMの潜在ロバスト性について, 構造的対向編集による検討を行うLAPD (Latent Agentic Perturbation Diagnostics) を提案する。
本フレームワークでは,PCA-Reduced Latent Spaceにクロス決定境界を埋め込む際に,表現不安定性を捉えるモデルに依存しない診断信号であるLatent Diagnosis Flip Rate (LDFR)を導入する。
その結果, 表面の堅牢性とセマンティック安定性の間には, 安全クリティカルな臨床AIにおける幾何学的監査の重要性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-07-27T16:48:53Z) - PersonalizedUS: Interpretable Breast Cancer Risk Assessment with Local Coverage Uncertainty Quantification [2.6911061523689415]
現在の「ゴールドスタンダード」は、臨床医による手動のBI-RADSスコアに依存しており、しばしば不必要な生検や、患者とその家族に対する精神的な負担を伴っている。
我々は、直列予測の最近の進歩を活用して、正確でパーソナライズされたリスク推定を提供する、パーソナライズされた機械学習システムであるPersonalizedUSを紹介する。
具体的な臨床効果としては、BI-RADS 4aと4bの病変のうち、要求された生検を最大で65%減らし、がんの再発は最小限である。
論文 参考訳(メタデータ) (2024-08-28T00:47:55Z) - Towards Reliable Medical Image Segmentation by Modeling Evidential Calibrated Uncertainty [57.023423137202485]
医用画像のセグメンテーションの信頼性に関する懸念が臨床医の間で続いている。
本稿では,医療画像セグメンテーションネットワークにシームレスに統合可能な,実装が容易な基礎モデルであるDEviSを紹介する。
主観的論理理論を活用することで、医用画像分割の確率と不確実性を明示的にモデル化する。
論文 参考訳(メタデータ) (2023-01-01T05:02:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。