論文の概要: Pathologist Attention-Aligned Report Generation for Prostate Histopathology
- arxiv url: http://arxiv.org/abs/2607.19624v1
- Date: Tue, 21 Jul 2026 23:08:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.942146
- Title: Pathologist Attention-Aligned Report Generation for Prostate Histopathology
- Title(参考訳): 前立腺病理の病理組織学的検討
- Abstract要約: 我々は、病理学者レポート生成モデルのトレーニングに人間の注意を導入する。
実験の結果、NLPベースの指標では平均10.9%、臨床的に関係のある5つのレポートコンポーネントでは19.3%の精度が得られた。
- 参考スコア(独自算出の注目度): 28.438575541774487
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The allocation of visual attention by pathologists during cancer diagnosis is a highly selective process that critically shapes the information extracted from whole-slide images (WSIs). Human attention helps medical imaging tasks such as classification and segmentation, and becomes a strong semantic cue for identifying diagnostically informative regions for report generation. In this paper, we introduce human attention into the training of pathologist report generation models. To this end, we collected a multimodal human-attention dataset of 121 prostate WSIs annotated with pathologists' multi-scale viewport trajectories synchronized with the pathologists' verbal descriptions and cursor movements for five clinically relevant components (e.g., Gleason patterns). Using this dataset, we finetune two report generation models with an attention-alignment loss that regularizes the model attention over image patches to match the distribution of pathologist attention. We evaluate our approach on prostate cancer report generation and visual question answering using two models with different internal attention mechanisms (i.e., how image tokens are integrated into the language decoder). Experiments show average gains of 10.9% on NLP-based metrics and 19.3% in accuracy across five clinically relevant report components. Further, model attention maps extracted at inference time, with minimal computational overhead, align more closely with pathologist attention, providing stronger visual support for the generated reports by highlighting the regions that most influence the output.
- Abstract(参考訳): がん診断における病理医による視覚的注意の配分は、全スライディング画像(WSI)から抽出した情報を批判的に形作る、高度に選択的なプロセスである。
人間の注意は、分類やセグメンテーションなどの医療画像のタスクを支援し、レポート生成のための診断情報のある領域を特定するための強力なセマンティックキューとなる。
本稿では,病理学報告生成モデルのトレーニングにおける人間の注意を紹介する。
この目的のために,病理学者の言語記述とカーソル運動と同期した多段階ビューポートトラジェクトリを付加した121個の前立腺WSIのマルチモーダル・ヒューマンアテンションデータセット(例:Gleasonパターン)を収集した。
このデータセットを用いて2つのレポート生成モデルにアテンションアライメント損失を付与し、画像パッチ上でモデルのアテンションを調整し、病理学者のアテンションの分布に一致させる。
我々は,前立腺癌レポート生成と視覚的質問応答に対するアプローチを,内的注意機構の異なる2つのモデル(すなわち,画像トークンが言語デコーダにどのように統合されるか)を用いて評価した。
実験の結果、NLPベースの指標では平均10.9%、臨床的に関係のある5つのレポートコンポーネントでは19.3%の精度が得られた。
さらに、推定時に抽出したモデル注意マップは、最小の計算オーバーヘッドで、病理学者の注意とより密接に一致し、出力に最も影響を及ぼす領域を強調することで、生成されたレポートに対するより強力な視覚的支援を提供する。
関連論文リスト
- Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration [21.260659596426184]
画像と報告の両方から病理観察の一貫性を最大化するために,新しい病理レベルの相互アライメント(PCMA)手法を提案する。
PCMAモジュールは外部の疾患アノテーションとは独立して動作し,本手法の汎用性と堅牢性を高める。
実験により,提案するフレームワークは,複数の下流タスクにおいて,新しい最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2025-06-12T11:01:57Z) - Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models [9.76070837929117]
既存のアライメント手法は、微粒な病理属性の分離よりも病気のクラス間の分離を優先する。
本稿では,マルチモーダル三重項学習による画像テキストアライメントを向上させる新しい手法であるMedTrimを提案する。
我々の実証では,MedTrimは,最先端のアライメント手法と比較して,下流検索および分類タスクの性能を向上させることが示されている。
論文 参考訳(メタデータ) (2025-04-22T14:17:51Z) - Causal Disentanglement for Robust Long-tail Medical Image Generation [80.15257897500578]
そこで本研究では,病的特徴と構造的特徴を独立に生成する新しい医用画像生成フレームワークを提案する。
本稿では,病理所見から導かれる拡散モデルを用いて病理像をモデル化し,種々の対物画像の生成を可能にする。
論文 参考訳(メタデータ) (2025-04-20T01:54:18Z) - Visual Prompt Engineering for Vision Language Models in Radiology [0.17183214167143138]
Contrastive Language-Image Pretraining (CLIP)は,マルチモーダルな大規模事前訓練によるゼロショット分類を可能にすることで,有望なソリューションを提供する。
CLIPは、グローバルな画像コンテンツを効果的にキャプチャするが、ラジオロジーは、解釈可能性と診断精度の両方を高めるために、特定の病理領域により局所的な焦点をあてる必要がある。
視覚的手がかりをゼロショット分類に組み込む可能性を探り、矢印、バウンディングボックス、円などの視覚的マーカーを直接放射線画像に埋め込んでモデル注意を誘導する。
論文 参考訳(メタデータ) (2024-08-28T13:53:27Z) - Radiology Report Generation Using Transformers Conditioned with
Non-imaging Data [55.17268696112258]
本稿では,胸部X線画像と関連する患者の人口統計情報を統合したマルチモーダルトランスフォーマーネットワークを提案する。
提案ネットワークは、畳み込みニューラルネットワークを用いて、CXRから視覚的特徴を抽出し、その視覚的特徴と患者の人口統計情報のセマンティックテキスト埋め込みを組み合わせたトランスフォーマーベースのエンコーダデコーダネットワークである。
論文 参考訳(メタデータ) (2023-11-18T14:52:26Z) - Beyond Images: An Integrative Multi-modal Approach to Chest X-Ray Report
Generation [47.250147322130545]
画像からテキストまでの放射線学レポート生成は,医療画像の発見を記述した放射線学レポートを自動生成することを目的としている。
既存の方法の多くは画像データのみに焦点をあてており、他の患者情報は放射線科医に公開されていない。
胸部X線レポートを生成するための多モードディープニューラルネットワークフレームワークを,非構造的臨床ノートとともにバイタルサインや症状などの構造化された患者データを統合することで提案する。
論文 参考訳(メタデータ) (2023-11-18T14:37:53Z) - Visual attention analysis of pathologists examining whole slide images
of Prostate cancer [29.609319636136426]
前立腺癌組織の全スライディング画像(WSI)をデジタル顕微鏡で観察し,病理医の注意を喚起した。
13名の病理医(生殖器専門医5名,一般病理医8名)からスライドナビゲーションデータを収集し,視線熱マップとスキャンパスを作成した。
WSIにおける病理医の注意とがんの証拠との関係を定量化するために, 生殖器専門医から腫瘍のアノテーションを入手した。
論文 参考訳(メタデータ) (2022-02-17T04:01:43Z) - Auxiliary Signal-Guided Knowledge Encoder-Decoder for Medical Report
Generation [107.3538598876467]
放射線技師の動作パターンを模倣する補助信号誘導知識デコーダ(ASGK)を提案する。
ASGKは、内的特徴融合と外部医療言語情報を統合して、医療知識の伝達と学習をガイドする。
論文 参考訳(メタデータ) (2020-06-06T01:00:15Z) - Weakly supervised multiple instance learning histopathological tumor
segmentation [51.085268272912415]
スライド画像全体のセグメント化のための弱教師付きフレームワークを提案する。
トレーニングモデルに複数のインスタンス学習スキームを利用する。
提案するフレームワークは,The Cancer Genome AtlasとPatchCamelyonデータセットのマルチロケーションとマルチ中心公開データに基づいて評価されている。
論文 参考訳(メタデータ) (2020-04-10T13:12:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。