論文の概要: PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image
- arxiv url: http://arxiv.org/abs/2607.19261v2
- Date: Thu, 30 Jul 2026 09:25:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.240073
- Title: PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image
- Title(参考訳): PathAgentBench: 完全スライディング画像におけるビデンス探索型視覚言語モデルのベンチマーク
- Authors: Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin,
- Abstract要約: 全スライディング画像(WSI)の診断には、診断に関係のある領域を特定し、倍率で調べ、マルチスケールのエビデンスを統合する必要がある。
既存のほとんどの病理ベンチマークは、プリクロップされたパッチや抽出済みのスライド機能に関するモデルを評価し、ギガピクセルのWSIから直接証拠を取得する能力は、ほとんどテストされていない。
PathAgentBenchは,視覚言語モデル(VLM)を4つの補完機能で評価するためのベンチマークである。
- 参考スコア(独自算出の注目度): 16.376573433449458
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Whole-slide image (WSI) diagnosis requires identifying diagnostically relevant regions, examining them across magnifications, and integrating multi-scale evidence. However, most existing pathology benchmarks evaluate models on pre-cropped patches or pre-extracted slide features, leaving their ability to acquire evidence directly from gigapixel WSIs largely untested. We introduce PathAgentBench, a benchmark for evaluating evidence-seeking vision-language models (VLMs) across four complementary capabilities: image-to-text matching for evidence interpretation, text-to-image retrieval for evidence verification, diagnostic-region localization for evidence acquisition, and multi-scale reasoning for evidence integration. The benchmark is organized as a diagnostic tree that links nested regions across magnifications with scale-specific findings and path-level diagnoses. It contains 1,822 TCGA WSIs and 17,135 diagnostic paths annotated by ten board-certified pathologists. An additional private cohort of 190 breast cancer WSIs with detailed annotations is used to evaluate autonomous whole-slide exploration. We evaluate 20 general-purpose, medical, and pathology-specialized models. Leading open-weight models achieve over 93% accuracy in multi-scale reasoning and over 50% accuracy in both cross-modal matching tasks. In contrast, diagnostic-region localization remains challenging: the best text-guided mean intersection-over-union is below 0.09, underperforming a simple center-based heuristic. During autonomous exploration, the unconditional hit rate decreases from 0.522 at low magnification to 0.185 at intermediate magnification and 0.020 at high magnification. These results reveal a pronounced gap between reasoning over curated evidence and acquiring that evidence directly from WSIs. PathAgentBench provides a unified framework for measuring and improving evidence-seeking pathology models.
- Abstract(参考訳): 全スライディング画像(WSI)の診断には、診断に関係のある領域を特定し、倍率で調べ、マルチスケールのエビデンスを統合する必要がある。
しかし、既存のほとんどの病理ベンチマークでは、プリクロップされたパッチや抽出済みのスライド機能に関するモデルを評価しており、ギガピクセルのWSIから直接証拠を取得する能力はほとんどテストされていない。
PathAgentBenchは、エビデンス解釈のための画像とテキストのマッチング、エビデンス検証のためのテキストと画像の検索、エビデンス取得のための診断領域のローカライゼーション、エビデンス統合のためのマルチスケール推論の4つの相補的な機能でエビデンス検索視覚言語モデル(VLM)を評価するためのベンチマークである。
このベンチマークは、拡大した領域にスケール特異的な発見とパスレベルの診断をリンクする診断ツリーとして構成されている。
TCGA WSIは1,822人、診断パスは17,135人、診断パスは10名である。
詳細な注釈を付した190個の乳がんWSIの追加のプライベートコホートは、自律的な全すべり探査を評価するために使用される。
20種類の汎用, 医療, 病理特化モデルについて検討した。
先行するオープンウェイトモデルは、マルチスケール推論において93%以上の精度を達成し、両方のクロスモーダルマッチングタスクにおいて50%以上の精度を達成する。
これとは対照的に、診断領域のローカライゼーションは依然として困難であり、テキスト誘導の平均交叉数は0.09以下であり、単純な中心に基づくヒューリスティックを下回っている。
自律探査では、低倍率で0.522から中間倍率で0.185、高倍率で0.020に低下する。
これらの結果は、キュレートされた証拠に関する推論と、その証拠を直接WSIから取得するの間に明らかなギャップがあることを明らかにします。
PathAgentBenchはエビデンス検索の病理モデルの測定と改善のための統合されたフレームワークを提供する。
関連論文リスト
- Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data [9.98520042320808]
脳MRI診断に明示的な領域マーキングを導入したBrReMarkを提案する。
モデルはまず、潜在的な異常についての仮説を生成し、明示的な境界ボックスマーキングを通じてそれらをグラウンド化する。
我々は,ドメインランダム化に基づく病理合成の強化戦略を統合し,OEDデータに対するモデルの一般化性を向上させる。
論文 参考訳(メタデータ) (2026-06-24T14:41:27Z) - BenchX: Benchmarking AI Models for Cancer Detection and Localization with Demographic and Protocol Biases [59.19934491064188]
人工知能(AI)は医療画像において顕著な成功を収めた。
これらのモデルは、実世界の臨床環境において矛盾なく機能することが多い。
我々は,12種類の腫瘍検出AIモデルを体系的に評価する85,355個のCTスキャンのベンチマークを開発した。
論文 参考訳(メタデータ) (2026-06-23T17:58:59Z) - Anatomy-Aware Unsupervised Detection and Localization of Retinal Abnormalities in Optical Coherence Tomography [4.828654519487229]
教師なしの異常検出フレームワークは、病変のアノテーションなしで正常な網膜解剖の規範的な分布を学習する。
網膜層を意識した3重項学習と構造的三重項学習を併用し,病的表現と健康的表現を分離する。
Kermany データセット (AUROC: 0.799) では,VAE, VQVAE, VQGAN, f-AnoGAN ベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-04-24T01:09:05Z) - Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs [63.535652574541764]
MLLM(Multimodal Large Language Models)は医用画像解析において顕著な可能性を示した。
消化器内視鏡におけるそれらの応用は、現在、2つの重要な限界によって妨げられている。
本稿では,これらの課題に対処する新しい臨床認知アライメント(CogAlign)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-21T07:47:37Z) - Beyond CLIP: Knowledge-Enhanced Multimodal Transformers for Cross-Modal Alignment in Diabetic Retinopathy Diagnosis [7.945705180020063]
本稿では,網膜基底像,臨床テキスト,構造化された患者データを統合する知識強化型関節埋め込みフレームワークを提案する。
このフレームワークはRecall@1の99.94%でほぼ完璧なテキスト・ツー・イメージ検索性能を実現している。
論文 参考訳(メタデータ) (2025-12-22T18:41:45Z) - DeepGI: Explainable Deep Learning for Gastrointestinal Image Classification [0.0]
この研究は、可変照明、ゆらぎのあるカメラアングル、頻繁な画像アーティファクトなど、一般的な内視鏡的課題に直面している。
最高性能のVGG16とMobileNetV2はそれぞれ96.5%の精度を達成した。
このアプローチには、Grad-CAM視覚化による説明可能なAIが含まれており、モデル予測に最も影響を及ぼす画像領域の識別を可能にする。
論文 参考訳(メタデータ) (2025-11-26T22:35:57Z) - An Explainable Hybrid AI Framework for Enhanced Tuberculosis and Symptom Detection [55.35661671061754]
結核は、特に資源に制限された遠隔地において、重要な世界的な健康問題である。
本稿では, 胸部X線による疾患および症状の検出を, 2つの頭部と自己監督頭部を統合することで促進する枠組みを提案する。
本モデルでは, 新型コロナウイルス, 結核, 正常症例の鑑別で98.85%の精度が得られ, マルチラベル症状検出では90.09%のマクロF1スコアが得られた。
論文 参考訳(メタデータ) (2025-10-21T17:18:55Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - RadFabric: Agentic AI System with Reasoning Capability for Radiology [61.25593938175618]
RadFabricは、総合的なCXR解釈のための視覚的およびテキスト分析を統合するマルチエージェント、マルチモーダル推論フレームワークである。
システムは、病理診断に特殊なCXRエージェント、正確な解剖学的構造に視覚所見をマッピングする解剖学的解釈エージェント、および視覚的、解剖学的、臨床データを透明かつ証拠に基づく診断に合成する大規模なマルチモーダル推論モデルを利用した推論エージェントを使用する。
論文 参考訳(メタデータ) (2025-06-17T03:10:33Z) - CPathAgent: An Agent-based Foundation Model for Interpretable High-Resolution Pathology Image Analysis Mimicking Pathologists' Diagnostic Logic [23.488576700623966]
我々は、病理医の診断ワークフローを模倣する革新的なエージェントベースのアプローチであるCPathAgentを紹介する。
我々は、パッチレベル、リージョンレベル、WSIレベルの機能を単一のモデルに統合するマルチステージトレーニング戦略を開発します。
PathMMU-HR2は、大規模領域分析のための最初のエキスパート検証ベンチマークである。
論文 参考訳(メタデータ) (2025-05-26T20:22:19Z) - Towards a Benchmark for Colorectal Cancer Segmentation in Endorectal Ultrasound Videos: Dataset and Model Development [59.74920439478643]
本稿では,多様なERUSシナリオをカバーする最初のベンチマークデータセットを収集し,注釈付けする。
ERUS-10Kデータセットは77の動画と10,000の高解像度アノテートフレームで構成されています。
本稿では,ASTR (Adaptive Sparse-context TRansformer) という大腸癌セグメンテーションのベンチマークモデルを提案する。
論文 参考訳(メタデータ) (2024-08-19T15:04:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。