論文の概要: From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology
- arxiv url: http://arxiv.org/abs/2608.03508v2
- Date: Thu, 13 Aug 2026 06:18:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 16:15:26.685234
- Title: From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology
- Title(参考訳): マルチリゾリューションセルからギガピクセル全スライド画像モデルへ : 計算病理学のための基礎モデル
- Abstract要約: MRPT(Multi-Resolution Pyramid Transformer)
624Mパッチ、2.4Mリージョン、36K全スライド画像(WSIs)を用いたマルチレゾリューションによる事前学習
- 参考スコア(独自算出の注目度): 40.79247708160045
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision Transformers (ViTs) and their hierarchical variants have achieved strong performance in Computational Pathology (CPath). However, most are pre-trained on single-resolution Whole Slide Images (WSIs), limiting their generalization across arbitrary resolutions. Gigapixel WSIs inherently contain diagnostic patterns at multiple scales, including cellular morphologies, tissue architectures, and global context, mirroring how expert pathologists examine WSIs. We introduce Multi-Resolution Pyramid Transformer (MRPT), a model that hierarchically aggregates multi-resolution information from cellular to tissue and WSI levels. MRPT employs a biologically meaningful Consecutive Cross-Resolution Attention (CCRA) mechanism to capture scale-independent interactions and enforces multi-resolution semantic consistency by aligning embeddings across resolutions, yielding robust and generalizable WSI representations. Pre-trained in a multi-resolution self-supervised manner on 624M patches, 2.4M regions, and 36K WSIs, MRPT learns rich coarse-to-fine histopathology features. Extensive experiments on 34 diverse datasets show that MRPT surpasses recent foundation models and Multimodal Large Language Models (MLLMs) in cancer subtype classification, tissue phenotyping, and Visual Question Answering (VQA) for WSI understanding.
- Abstract(参考訳): 視覚変換器(ViT)とその階層的変異体は計算病理学(CPath)において高い性能を達成している。
しかし、そのほとんどは単一解像度のWSI(Whole Slide Images)で事前訓練されており、任意の解像度で一般化を制限している。
Gigapixel WSIには、細胞形態、組織構造、グローバルコンテキストなど、複数のスケールで診断パターンが本質的に含まれており、専門家の病理学者がWSIを調査する方法を反映している。
我々は,細胞から組織,WSIレベルに至るまでの多分解能情報を階層的に集約するモデルであるMRPT(Multi-Resolution Pyramid Transformer)を導入する。
MRPTは、生物学的に意味のある連続的相互解決注意(CCRA)機構を用いて、スケール非依存の相互作用を捕捉し、解像度をまたいだ埋め込みを整合させ、堅牢で一般化可能なWSI表現をもたらすことで、多面的なセマンティック一貫性を強制する。
MRPTは624Mのパッチ、2.4Mの領域、36KのWSIに対して、マルチレゾリューションな自己教師方式で事前訓練され、粗大な病理組織学的特徴を学習する。
34種類の多様なデータセットに対する大規模な実験により、MRPTは、WSI理解のための癌サブタイプ分類、組織表現、視覚質問応答(VQA)において、最近の基礎モデルとMLLM(Multimodal Large Language Models)を超越していることが示された。
関連論文リスト
- MuViT: Multi-Resolution Vision Transformers for Learning Across Scales in Microscopy [1.9116784879310027]
我々は、同じ基盤画像から真のマルチ解像度観測を融合するために構築されたトランスフォーマーアーキテクチャであるMuViTを紹介する。
合成ベンチマーク、腎臓病理、高分解能マウス脳顕微鏡などを通じて、MuViTは強力なViTおよびCNNベースラインよりも一貫した改善を行っている。
論文 参考訳(メタデータ) (2026-02-27T17:48:54Z) - Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation [56.52520416420957]
医用画像セグメンテーションにおける領域一般化に取り組むために, MCDRL(Multimodal Causal-Driven Representation Learning)を提案する。
MCDRLは競合する手法より一貫して優れ、セグメンテーション精度が優れ、堅牢な一般化性を示す。
論文 参考訳(メタデータ) (2025-08-07T03:41:41Z) - WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image [39.06747701238473]
ギガピクセルのWSI理解のためのフレームワークであるWSI-LLaVAを3段階のトレーニングアプローチで紹介する。
実験の結果、WSI-LLaVAはすべての能力範囲で既存のモデルより優れています。
論文 参考訳(メタデータ) (2024-12-03T03:57:24Z) - A Unified Model for Compressed Sensing MRI Across Undersampling Patterns [69.19631302047569]
様々な計測アンサンプパターンと画像解像度に頑健な統合MRI再構成モデルを提案する。
我々のモデルは、拡散法よりも600$times$高速な推論で、最先端CNN(End-to-End VarNet)の4dBでSSIMを11%改善し、PSNRを4dB改善する。
論文 参考訳(メタデータ) (2024-10-05T20:03:57Z) - URCDM: Ultra-Resolution Image Synthesis in Histopathology [4.393805955844748]
Ultra-Resolution Cascaded Diffusion Models (URCDMs) は、すべての病理像を高分解能で合成することができる。
本手法は脳,乳腺,腎臓の組織からなる3つの異なるデータセットを用いて評価した。
URCDMは、訓練された評価器が実際の画像と区別できない様々な解像度の出力を一貫して生成する。
論文 参考訳(メタデータ) (2024-07-18T08:31:55Z) - PLUTO: Pathology-Universal Transformer [4.920983796208486]
そこで我々はPathoLogy Universal TransfOrmer (PLUTO)を提案する。
我々はPLUTOの出力埋め込みを利用したタスク固有の適応ヘッドを,病的規模にまたがるタスクに設計する。
PLUTOは既存のタスク固有のベースラインや病理学固有の基盤モデルに適合するか、性能を向上する。
論文 参考訳(メタデータ) (2024-05-13T16:40:17Z) - A self-supervised framework for learning whole slide representations [52.774822784847565]
我々は、全スライド画像のギガピクセルスケールの自己スーパービジョンのためのSlide Pre-trained Transformer (SPT)を提案する。
バイオメディカル・マイクロスコープ・データセットを用いて,5つの診断課題におけるSPT視覚表現のベンチマークを行った。
論文 参考訳(メタデータ) (2024-02-09T05:05:28Z) - AMIGO: Sparse Multi-Modal Graph Transformer with Shared-Context
Processing for Representation Learning of Giga-pixel Images [53.29794593104923]
本稿では,スライド病理像全体に対する共有コンテキスト処理の新たな概念を提案する。
AMIGOは、組織内のセルラーグラフを使用して、患者に単一の表現を提供する。
我々のモデルは、データの20%以下で同じ性能を達成できる程度に、欠落した情報に対して強い堅牢性を示す。
論文 参考訳(メタデータ) (2023-03-01T23:37:45Z) - Diagnose Like a Pathologist: Transformer-Enabled Hierarchical
Attention-Guided Multiple Instance Learning for Whole Slide Image
Classification [39.41442041007595]
複数のインスタンス学習とトランスフォーマーは、病理組織学的にWSI(Whole Slide Image)分類でますます人気がある。
本稿では,WSI を完全に活用するための階層型注意誘導型多重インスタンス学習フレームワークを提案する。
このフレームワーク内では、インテグレート・アテンション・トランスが提案され、トランスの性能をさらに向上する。
論文 参考訳(メタデータ) (2023-01-19T15:38:43Z) - Hierarchical Transformer for Survival Prediction Using Multimodality
Whole Slide Images and Genomics [63.76637479503006]
下流タスクのためのギガピクセルレベルのスライド病理画像(WSI)の良質な表現を学習することが重要である。
本稿では,病理画像と対応する遺伝子間の階層的マッピングを学習する階層型マルチモーダルトランスフォーマーフレームワークを提案する。
より優れたWSI表現能力を維持しながら、ベンチマーク手法と比較してGPUリソースが少ないアーキテクチャです。
論文 参考訳(メタデータ) (2022-11-29T23:47:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。