論文の概要: PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation
- arxiv url: http://arxiv.org/abs/2604.17570v1
- Date: Sun, 19 Apr 2026 18:24:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.588892
- Title: PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation
- Title(参考訳): PBSBench:多層視覚言語フレームワークと血液病理画像解析のためのベンチマーク
- Authors: Yuanlong Wang, Weichi Chen, Adrian Rajab, Wenfang Liu, Yulan Jin, Andrew Srisuwananukorn, Ping Zhang,
- Abstract要約: 末梢血マニア(PBS)は、血液病理学において、全スライディング画像(WSI)を呈する重要な顕微鏡検査である
PBSの解釈は、組織構造よりも個々の細胞形態に焦点を当てており、視覚的特徴と診断的推論の両方において区別される。
PBS 解釈のための最初の視覚言語データセット PBSInstr を構築し,353 PBS WSIs に顕微鏡的印象節と29k の細胞レベルの画像作物をアノテートし,形態的記述を行った。
我々は、細胞とスライドの両方で多レベルPBS解釈のための、血液病理調整型視覚言語モデルPBS-VLを開発した。
- 参考スコア(独自算出の注目度): 4.554013906734423
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Peripheral Blood Smear (PBS) is a critical microscopic examination in hematopathology that yields whole-slide imaging (WSI). Unlike solid tissue pathology, PBS interpretation focuses on individual cell morphologies rather than tissue architecture, making it distinct in both visual characteristics and diagnostic reasoning. However, current multimodal large language models (MLLMs) for pathology are primarily developed on solid-tissue WSIs and struggle to generalize to PBS. To bridge this gap, we construct PBSInstr, the first vision-language dataset for PBS interpretation, comprising 353 PBS WSIs paired with microscopic impression paragraphs and 29k cell-level image crops annotated with cell type labels and morphological descriptions. To facilitate instruction tuning, PBSInstr further includes 27k question-answer (QA) pairs for cell crops and 1,286 QA pairs for PBS slides. Building upon PBSInstr, we develop PBS-VL, a hematopathology-tailored vision-language model for multi-level PBS interpretation at both cell and slide levels. To comprehensively evaluate PBS understanding, we construct PBSBench, a visual question answering (VQA) benchmark featuring four question categories and six PBS interpretation tasks. Experiments show that PBS-VL outperforms existing general-purpose and pathology MLLMs, underscoring the value of PBS-specific data. We release our code, datasets, and model weights to facilitate future research. Our proposed framework lays the foundation for developing practical AI assistants supporting decision-making in hematopathology.
- Abstract(参考訳): 末梢血腫(英: peripheral blood Smear, PBS)は、血液病理学における重要な顕微鏡検査である。
固形組織病理とは異なり、PBSの解釈は組織構造よりも個々の細胞形態に焦点を当てており、視覚的特徴と診断的推論の両方が異なる。
しかし、現在の病理学用マルチモーダル大言語モデル(MLLM)は、主に固形版 WSI で開発され、PBS への一般化に苦慮している。
このギャップを埋めるために、PBS解釈のための最初の視覚言語データセットPBSInstrを構築し、353個のPBS WSIと、細胞型ラベルと形態的記述を付加した29kの細胞レベルの画像作物を組み合わせた。
命令チューニングを容易にするため、PBSInstrはさらに、細胞作物のための27kのQAペアとPBSスライドのための1,286のQAペアを含む。
PBSInstrをベースとしたPBS-VLは,細胞レベルとスライドレベルの両方で多レベルPBSを解釈するための血液学的適応型視覚言語モデルである。
PBS理解を包括的に評価するために,4つの質問カテゴリと6つのPBS解釈タスクを備えた視覚的質問応答(VQA)ベンチマークPBSBenchを構築した。
実験の結果、PBS-VLは既存の汎用および病理学MLLMよりも優れており、PBS固有のデータの価値が強調されている。
将来の研究を促進するために、コード、データセット、モデルウェイトをリリースします。
提案する枠組みは,血液病理学における意思決定を支援する実践的AIアシスタントの開発の基礎となる。
関連論文リスト
- MPath: Multimodal Pathology Report Generation from Whole Slide Images [0.0]
本稿では,WSI 由来の視覚的埋め込みにおいて,事前訓練された生体医療言語モデル (BioBART) を規定する軽量フレームワーク MPath を紹介する。
MPathはRED 2025グランドチャレンジのデータセットで開発、評価され、応募機会が限られているにもかかわらずテストフェーズ2で4位にランクインした。
その結果,病的報告生成のためのスケーラブルかつ解釈可能な戦略として,プロンプトベースのマルチモーダルコンディショニングの可能性を強調した。
論文 参考訳(メタデータ) (2025-12-10T17:54:38Z) - PLUTO: Pathology-Universal Transformer [4.920983796208486]
そこで我々はPathoLogy Universal TransfOrmer (PLUTO)を提案する。
我々はPLUTOの出力埋め込みを利用したタスク固有の適応ヘッドを,病的規模にまたがるタスクに設計する。
PLUTOは既存のタスク固有のベースラインや病理学固有の基盤モデルに適合するか、性能を向上する。
論文 参考訳(メタデータ) (2024-05-13T16:40:17Z) - Knowledge-enhanced Visual-Language Pretraining for Computational Pathology [68.6831438330526]
本稿では,公共資源から収集した大規模画像テキストペアを利用した視覚的表現学習の課題について考察する。
ヒト32組織から病理診断を必要とする4,718の疾患に対して50,470個の情報属性からなる病理知識ツリーをキュレートする。
論文 参考訳(メタデータ) (2024-04-15T17:11:25Z) - Decomposing Disease Descriptions for Enhanced Pathology Detection: A Multi-Aspect Vision-Language Pre-training Framework [43.453943987647015]
医学的な視覚言語事前訓練は研究の最前線として現れ、ゼロショットの病理診断を可能にしている。
バイオメディカルテキストの複雑なセマンティクスのため、現在の方法では、医学的画像と、非構造化レポートの重要な病理学的所見の整合に苦慮している。
これは、大きな言語モデルと医療専門家に相談することで達成される。
我々の研究は、近年の手法の精度を最大8.56%まで改善し、17.26%を目に見えるカテゴリーで改善した。
論文 参考訳(メタデータ) (2024-03-12T13:18:22Z) - A self-supervised framework for learning whole slide representations [52.774822784847565]
我々は、全スライド画像のギガピクセルスケールの自己スーパービジョンのためのSlide Pre-trained Transformer (SPT)を提案する。
バイオメディカル・マイクロスコープ・データセットを用いて,5つの診断課題におけるSPT視覚表現のベンチマークを行った。
論文 参考訳(メタデータ) (2024-02-09T05:05:28Z) - WBCAtt: A White Blood Cell Dataset Annotated with Detailed Morphological
Attributes [22.423647778787334]
本稿では,WBC(White Blood Cells)画像に対する包括的なアノテーションを提案する。
細胞とその成分に関連する11の形態学的特性を同定した。
我々はこれらの属性を画像から予測する実験を行い、基本的なWBC分類を超えた洞察を提供する。
論文 参考訳(メタデータ) (2023-06-23T14:52:37Z) - Pixel-Level Explanation of Multiple Instance Learning Models in
Biomedical Single Cell Images [52.527733226555206]
複数のインスタンス学習モデルを説明するための4つの属性法について検討する。
急性骨髄性白血病の2つのデータセットと100万以上の単細胞画像について検討した。
我々は、属性マップと医療専門家の注釈を比較し、モデルの意思決定が人間の基準とどのように異なるかを確認する。
論文 参考訳(メタデータ) (2023-03-15T14:00:11Z) - Statistical Dependency Guided Contrastive Learning for Multiple Labeling
in Prenatal Ultrasound [56.631021151764955]
標準平面認識は出生前超音波(US)スクリーニングにおいて重要な役割を担っている。
我々は,複数の標準平面と対応する解剖学的構造を同時に識別する,新しいマルチラベル学習手法を構築した。
論文 参考訳(メタデータ) (2021-08-11T06:39:26Z) - PS-DeVCEM: Pathology-sensitive deep learning model for video capsule
endoscopy based on weakly labeled data [0.0]
本稿では, ビデオカプセル内視鏡(VCE)データを用いて, フレームレベルの異常検出と大腸疾患の多ラベル分類を行うための, 病因性深層学習モデル(PS-DeVCEM)を提案する。
我々のモデルは注目に基づく深層マルチインスタンス学習によって駆動され、弱いラベル付きデータでエンドツーエンドに訓練されている。
トレーニング中にフレームアノテーション情報を使わずに、時間的にフレームを病状でローカライズする能力を示す。
論文 参考訳(メタデータ) (2020-11-22T15:33:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。