論文の概要: Wasserstein-Aligned Localisation for VLM-Based Distributional OOD Detection in Medical Imaging
- arxiv url: http://arxiv.org/abs/2605.05161v1
- Date: Wed, 06 May 2026 17:32:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.962631
- Title: Wasserstein-Aligned Localisation for VLM-Based Distributional OOD Detection in Medical Imaging
- Title(参考訳): 医用画像におけるVLMを用いたOOD検出のためのWasserstein-Aligned Localization
- Authors: Bernhard Kainz, Johanna P Mueller, Matthew Baugh, Cosmin Bercea,
- Abstract要約: 比較推論が可能な最適輸送理論に基づく学習自由フレームワークであるWALDOを紹介する。
Qwen2.5-VL-72B の WALDO は 43.5_pm1.6%$ mAP@30 (95% CI: [40.4, 46.7]) を達成し、ゼロショットベースラインよりも 19% の相対的な改善を示した。
- 参考スコア(独自算出の注目度): 8.915586506306875
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Zero-shot anomaly localisation via vision-language models (VLMs) offers a compelling approach for rare pathology detection, yet its performance is fundamentally limited by the absence of healthy anatomical context. We reformulate zero-shot localisation as a comparative inference problem in which anomalies are identified through structured comparison against reference distributions of normal anatomy. We introduce WALDO, a training-free framework grounded in optimal transport theory that enables comparative reasoning through: (i) entropy-weighted Sliced Wasserstein distances for anatomically-aware reference selection from DINOv2 patch distributions, (ii) Goldilocks zone sampling exploiting the non-monotonic relationship between reference similarity and localisation accuracy, and (iii) self-consistency aggregation via weighted non-maximum suppression. We theoretically analyse the Goldilocks effect through distributional divergence, and show that references with moderate similarity minimize a bias-variance trade-off in comparative visual reasoning. On the NOVA brain MRI benchmark, WALDO with Qwen2.5-VL-72B achieves $43.5_{\pm1.6}\%$ mAP@30 (95\% CI: [40.4, 46.7]), representing a 19\% relative improvement over zero-shot baselines. Cross-model evaluation shows consistent gains: GPT-4o achieves $32.0_{\pm6.5}\%$ and Qwen3-VL-32B achieves $32.0_{\pm6.6}\%$ mAP@30. Paired McNemar tests confirm statistical significance ($p<0.01$). Source code is available at https://github.com/bkainz/WALDO_MICCAI26_demo .
- Abstract(参考訳): 視覚言語モデル(VLM)によるゼロショット異常局所化は、稀な病理診断に魅力的なアプローチを提供するが、その性能は健康な解剖学的文脈が欠如していることによって根本的に制限される。
我々は、通常の解剖学の基準分布との比較により、異常を同定する比較推論問題としてゼロショットローカライゼーションを再構成する。
WALDOは、最適輸送理論に基づくトレーニング不要のフレームワークで、比較推論を可能にする。
i) DINOv2パッチ分布からの解剖学的基準選択のためのエントロピー重み付きスライスワッサースタイン距離
二 基準類似性と局所化精度の非単調性を利用したゴールディロックゾーンサンプリング
三 重み付き非最大抑制による自己整合性凝集
我々は,Goldilocks効果を分布のばらつきを通じて理論的に解析し,比較視覚推論におけるバイアス分散トレードオフを最小限に抑えることを示す。
NOVAの脳MRIベンチマークでは、Qwen2.5-VL-72B を用いた WALDO は 43.5_{\pm1.6}\%$ mAP@30 (95\% CI: [40.4, 46.7]) を達成し、ゼロショットベースラインよりも19 % 改善された。
GPT-4oは$32.0_{\pm6.5}\%、Qwen3-VL-32Bは$32.0_{\pm6.6}\%$mAP@30である。
Paired McNemar test confirmed statistics importance (p<0.01$)。
ソースコードはhttps://github.com/bkainz/WALDO_MICCAI26_demoで公開されている。
関連論文リスト
- An Integrated Framework for Explainable, Fair, and Observable Hospital Readmission Prediction: Development and Validation on MIMIC-IV [0.0]
MIMIC-IVデータベースから成人415231名を対象にコホートを構築した。
このフレームワークは、競争力のあるパフォーマンス、臨床的に実行可能な説明、強力な人口シェアを提供する。
論文 参考訳(メタデータ) (2026-04-24T13:21:44Z) - SA-CycleGAN-2.5D: Self-Attention CycleGAN with Tri-Planar Context for Multi-Site MRI Harmonization [3.5109108807229403]
本稿では,Ben-David らによる$HH$-divergence 境界によるドメイン適応フレームワーク SA-CycleGAN-2.5D を提案する。
2D効率と3D一貫性をブリッジすることで,腫瘍の病態を保ったボクセルレベルの高調波画像が得られる。
論文 参考訳(メタデータ) (2026-03-17T23:49:46Z) - A Unified Framework for Joint Detection of Lacunes and Enlarged Perivascular Spaces [3.9313804276175506]
脳小血管疾患(CSVD)マーカー,特にEPVSとlacunaeは,医用画像解析においてユニークな課題である。
本稿では,Zero-Gated CrossTask Attention が高密度EPVSコンテキストを利用してスパースラグーン検出を誘導する形態分離フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-04T16:30:46Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations [19.488236277427358]
視覚言語モデル(VLM)は、しばしばチェーン・オブ・シント(CoT)の説明を生み出す。
胸部X線視覚質問応答(VQA)の臨床的基盤として,制御されたテキストと画像修正を用いてCoT忠実度を探索するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-13T09:28:22Z) - Theory on Score-Mismatched Diffusion Models and Zero-Shot Conditional Samplers [49.97755400231656]
一般のスコアミスマッチ拡散サンプリング器に対する明示的な次元依存性を持つ最初の性能保証を示す。
その結果, スコアミスマッチは, 目標分布とサンプリング分布の分布バイアスとなり, 目標分布とトレーニング分布の累積ミスマッチに比例することがわかった。
この結果は、測定ノイズに関係なく、任意の条件モデルに対するゼロショット条件付きサンプリングに直接適用することができる。
論文 参考訳(メタデータ) (2024-10-17T16:42:12Z) - Flexible Amortized Variational Inference in qBOLD MRI [56.4324135502282]
データから酸素抽出率(OEF)と脱酸素血液量(DBV)をより明瞭に決定する。
既存の推論手法では、DBVを過大評価しながら非常にノイズの多い、過小評価されたEFマップが得られる傾向にある。
本研究は, OEFとDBVの可算分布を推定できる確率論的機械学習手法について述べる。
論文 参考訳(メタデータ) (2022-03-11T10:47:16Z) - PaDiM: a Patch Distribution Modeling Framework for Anomaly Detection and
Localization [64.39761523935613]
本稿では,画像中の異常を同時検出・ローカライズするPatch Distribution Modeling, PaDiMを提案する。
PaDiMは、パッチの埋め込みに事前訓練された畳み込みニューラルネットワーク(CNN)を使用している。
また、CNNの異なるセマンティックレベル間の相関を利用して、異常のローカライズも改善している。
論文 参考訳(メタデータ) (2020-11-17T17:29:18Z) - Generalized Focal Loss: Learning Qualified and Distributed Bounding
Boxes for Dense Object Detection [85.53263670166304]
一段検出器は基本的に、物体検出を密度の高い分類と位置化として定式化する。
1段検出器の最近の傾向は、局所化の質を推定するために個別の予測分岐を導入することである。
本稿では, 上記の3つの基本要素, 品質推定, 分類, ローカライゼーションについて述べる。
論文 参考訳(メタデータ) (2020-06-08T07:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。