論文の概要: PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?
- arxiv url: http://arxiv.org/abs/2607.28318v1
- Date: Thu, 30 Jul 2026 14:53:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.614231
- Title: PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?
- Title(参考訳): PathView-Bench: マルチモーダルな大規模言語モデルは、病理像の微細なマルチスケール理解を実現することができるか?
- Abstract要約: PathVUは、コンピュータ病理学における細粒度およびマルチスケールの視覚的理解のための、視覚適応型ベンチマークである。
PathVUはMLLMの理解を,高分解能な局所領域の領域FOVとマクロな全体スライダービューのSlide FOVの2つの視点で評価する。
ベンチマークには14のVQAスタイルのタスク、61,673のイメージ、28の臓器にわたる308,070のサンプル、7,253,526のアノテーションが含まれている。
- 参考スコア(独自算出の注目度): 21.473702959414737
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multimodal large language models (MLLMs) are increasingly used to analyze pathology images. However, dominant multimodal benchmarks in pathology mainly score final diagnostic answers, captions, or reports. These evaluations provide limited insight into whether a model understands the multiscale visual content needed for pathology reasoning and decision-making. We introduce PathVU, a vision-anchored benchmark for fine-grained and multiscale visual understanding in computational pathology. Built from 23 public pathology imaging datasets with human-supervised labels and spatial annotations, PathVU evaluates MLLM understanding in two fields of view: Region FOV for high-resolution local regions and Slide FOV for macro whole-slide views. By converting raw annotations into deterministic task targets, PathVU enables programmatic scoring of region localization, visual recognition, quantity estimation, spatial reasoning, and insufficient-context judgment. The benchmark contains 14 VQA-style tasks, 61,673 images, and 308,070 samples across 28 organs and 7,253,526 annotations. Evaluating 18 representative general-purpose, medical-domain, and pathology-oriented MLLMs, we observe substantial limitations even in advanced models on fine-grained visual tasks across multiscale pathology images. PathVU provides a reproducible basis for developing and evaluating pathology MLLMs with explicit multiscale visual understanding.
- Abstract(参考訳): MLLM(Multimodal large language model)は、病理画像の解析に使用されることが多い。
しかし、病理学における支配的なマルチモーダルベンチマークは主に最終診断結果、キャプション、レポートをスコアする。
これらの評価は、モデルが病理的推論や意思決定に必要なマルチスケールの視覚的内容を理解するかどうかについての限られた洞察を与える。
PathVUは、コンピュータ病理学における微細でマルチスケールな視覚的理解のための、視覚支援型ベンチマークである。
PathVUは23のパブリックな病理画像データセットと人間の監督されたラベルと空間的アノテーションから構築され、MLLMの理解を2つの観点から評価している。
生のアノテーションを決定論的タスクターゲットに変換することで、PathVUは、領域のローカライゼーション、視覚認識、量推定、空間的推論、および不十分なコンテキスト判断のプログラム的スコアリングを可能にする。
ベンチマークには14のVQAスタイルのタスク、61,673のイメージ、28の臓器にわたる308,070のサンプル、7,253,526のアノテーションが含まれている。
18の汎用、医療ドメイン、病理指向MLLMを評価し、マルチスケールの病理画像にまたがる細粒度視覚タスクの高度なモデルにおいても、かなりの限界を観測する。
PathVUは、多スケールの視覚的理解を明示した病理MLLMの開発と評価のための再現可能な基盤を提供する。
関連論文リスト
- Can Multimodal Large Language Models Understand OCT? [3.932595394031011]
マルチモーダル大言語モデル (MLLM) は, 医用画像解析において有意な可能性を証明している。
OCT-Benchは、7つの公開データセットにわたる4,137のOCT画像から構築された10,076の高品質な多重選択質問からなる。
我々は,プロプライエタリモデル,オープンソース汎用モデル,医療ドメインモデルを含む20の代表的なMLLMを体系的に評価する。
論文 参考訳(メタデータ) (2026-07-18T03:08:31Z) - Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis [63.49939245944781]
我々は1100万の質問と0.28万の画像を含む総合的なきめ細かい評価ベンチマークであるFG-BMKを紹介する。
現在のLVLMは、視覚的表現、セマンティックグラウンドディング、モダリティアライメント、カテゴリーレベルの知識において、相互に絡み合ったボトルネックから生じる障害を伴って、微粒化認識器が不十分なままである。
論文 参考訳(メタデータ) (2026-06-17T13:23:26Z) - MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models [83.50100003741628]
ビジョンと言語モデル(VLM)は、バイオメディカルイメージングを変革する大きな可能性を秘めている。
本稿では,MMBU(Massive Multimodal Biomedical Understanding)ベンチマークを紹介する。
今までで最大のビジョンと言語ベンチマークで、35のサブモダリティと豊富な構造化メタデータをカバーしている。
論文 参考訳(メタデータ) (2026-06-04T20:24:47Z) - OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models [29.07161421917658]
$textbfOphIn-Engine$は眼科固有の命令データキュレーションパイプラインである。
オープンアクセス眼科ウェブスケールビデオから高品質な指導データを構築する。
$textbfOphIn-VL$は、高度な視覚的理解と会話能力を備えた眼科固有のMLLMである。
論文 参考訳(メタデータ) (2026-05-27T03:43:23Z) - PathMR: Multimodal Visual Reasoning for Interpretable Pathology Diagnosis [9.728322291979564]
病理画像解析のための細胞レベルでのマルチモーダルビジュアル推論フレームワークであるPathMRを提案する。
PathMRは、テキスト生成品質、セグメンテーション精度、モーダルアライメントにおいて、最先端の視覚的推論手法よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2025-08-28T14:46:24Z) - Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation [56.52520416420957]
医用画像セグメンテーションにおける領域一般化に取り組むために, MCDRL(Multimodal Causal-Driven Representation Learning)を提案する。
MCDRLは競合する手法より一貫して優れ、セグメンテーション精度が優れ、堅牢な一般化性を示す。
論文 参考訳(メタデータ) (2025-08-07T03:41:41Z) - Evidence-based diagnostic reasoning with multi-agent copilot for human pathology [7.976907866539546]
現在の計算病理学におけるMLLM(Multimodal Large Language Model)は限界に直面している。
そこで我々は,ヒトの病理に特化して設計された新しいMLLMであるPathChat+を紹介した。
また、PathChat+を利用した推論可能なマルチエージェントAIシステムであるSlideSeekを紹介し、ギガピクセル全体の画像を自律的に評価する。
論文 参考訳(メタデータ) (2025-06-26T03:02:16Z) - A Survey of Medical Vision-and-Language Applications and Their Techniques [48.268198631277315]
医療ビジョン・アンド・ランゲージモデル(MVLM)は、複雑な医療データを解釈するための自然言語インタフェースを提供する能力から、大きな関心を集めている。
本稿では,MVLMの概要と適用した各種医療課題について概観する。
また、これらのタスクに使用するデータセットについても検討し、標準化された評価指標に基づいて異なるモデルの性能を比較した。
論文 参考訳(メタデータ) (2024-11-19T03:27:05Z) - LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models [38.78576472811659]
大規模視覚言語モデル(LVLM)は、解剖情報を理解し、眼疾患を診断し、解釈と追跡計画の作成を支援する可能性がある。
我々は、クローズドソース、オープンソース、医療ドメインの13の最先端のLVLM代表をベンチマークした。
その結果,眼科領域では他の領域と比較してLVLMが有意に低下した。
論文 参考訳(メタデータ) (2024-10-02T14:57:58Z) - ViKL: A Mammography Interpretation Framework via Multimodal Aggregation of Visual-knowledge-linguistic Features [54.37042005469384]
MVKLは,マルチビュー画像,詳細な表示,報告を含む最初のマルチモーダルマンモグラフィーデータセットである。
このデータセットに基づいて、教師なし事前学習のチャラリングタスクに焦点を当てる。
視覚,知識,言語機能を相乗化するフレームワークであるViKLを提案する。
論文 参考訳(メタデータ) (2024-09-24T05:01:23Z) - Hierarchical Text-to-Vision Self Supervised Alignment for Improved Histopathology Representation Learning [64.1316997189396]
病理組織像のための新しい言語型自己教師学習フレームワーク,階層型言語型自己監督(HLSS)を提案する。
その結果,OpenSRH と TCGA の2つの医用画像ベンチマークにおいて,最先端の性能が得られた。
論文 参考訳(メタデータ) (2024-03-21T17:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。