論文の概要: Agentic Visual Reasoning in Whole-Slide Pathology Images via Active Perception
- arxiv url: http://arxiv.org/abs/2608.08648v1
- Date: Sun, 09 Aug 2026 11:45:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.907538
- Title: Agentic Visual Reasoning in Whole-Slide Pathology Images via Active Perception
- Title(参考訳): アクティブ・パーセプションによる全スライディング画像のエージェント・ビジュアル・ライソン
- Abstract要約: 全スライディングの視覚的推論は、ギガピクセルスライドでスパース診断の証拠を特定する必要がある。
本稿では、WSIの証拠取得をシーケンシャルな意思決定として定式化するアクティブパーセプションフレームワークであるAdaptivePathを紹介する。
- 参考スコア(独自算出の注目度): 30.71594045045451
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Whole-slide visual reasoning requires identifying sparse diagnostic evidence in gigapixel pathology slides and integrating observations across spatial scales. Existing WSI methods either compress densely sampled patches into global representations or use pretrained vision-language models with heuristic region selection, weakening links between predictions and morphology or lacking pathology-trained observation policies. We present AdaptivePath, an active-perception framework that formulates WSI evidence acquisition as sequential decision making. The Navigator learns question-agnostic abnormality-driven navigation from pathologist-reviewed labels to select observation locations and spatial extents, avoiding costly question-specific trajectory annotations. We train this policy through alternating representation learning and proximal policy optimization, followed by fine-tuning with geometric and appearance consistency objectives to stabilize focus trajectories. During inference, the Navigator hierarchically acquires sparse observations from low to high magnification under a limited ROI budget. A Morphology Interpreter converts observations into question-conditioned evidence, while the Deliberator evaluates evidence and revises intermediate answers across magnifications. The Arbiter integrates deliberation history to produce final answers. AdaptivePath achieves state-of-the-art zero-shot performance on WSI and region pathology VQA benchmarks and reaches 80.14% accuracy for cancer subtype classification across six TCGA cohorts. In a blinded diagnostic-utility study, pathologists using AdaptivePath-selected observation sequences achieve 82.9% accuracy. These results demonstrate that learned active perception enables effective and traceable visual reasoning over gigapixel pathology slides.
- Abstract(参考訳): 全スライディングの視覚的推論は、ギガピクセルの病理スライドにおけるスパース診断の証拠を特定し、空間的スケールで観察を統合する必要がある。
既存のWSI法は、密集したパッチを大域的な表現に圧縮するか、ヒューリスティック領域選択による事前訓練された視覚言語モデルを使用するか、予測と形態の間のリンクを弱めるか、または病理訓練された観察ポリシーを欠くかのいずれかである。
本稿では、WSIの証拠取得をシーケンシャルな意思決定として定式化するアクティブパーセプションフレームワークであるAdaptivePathを紹介する。
ナビゲータは、病理学者がレビューしたラベルから疑問に依存しない異常駆動ナビゲーションを学習し、高価な疑問特異的な軌跡アノテーションを回避し、観察場所と空間的範囲を選択する。
我々は、表現学習と近似ポリシー最適化の交互化を通じてこのポリシーを訓練し、次いで、焦点軌跡を安定させるために幾何学的および外観整合性の目的を微調整する。
推論中、ナビゲーターは、限られたROI予算の下で、低から高倍率のスパース観測を階層的に取得する。
モルフォロジー解釈器は、観察結果を疑問条件付き証拠に変換し、デリベレータは証拠を評価し、倍率で中間回答を修正する。
Arbiterは議論履歴を統合して最終回答を生成する。
AdaptivePathはWSIおよび地域病理VQAベンチマークで最先端のゼロショット性能を達成し、6つのTCGAコホートで癌サブタイプ分類の精度が80.14%に達する。
盲目の診断ユーティリティー研究において、AdaptivePath選択された観察シーケンスを用いた病理学者は82.9%の精度を達成している。
これらの結果から,学習した能動知覚は,ギガピクセルの病態スライド上での効果的かつ追跡可能な視覚的推論を可能にすることが示唆された。
関連論文リスト
- PathAgent: Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model-based Agentic Reasoning [17.067199015601954]
PathAgentはトレーニングフリーで大規模言語モデル(LLM)に基づくエージェントフレームワークで、人間の専門家の反射的、段階的分析的アプローチをエミュレートする。
観察と決定のシーケンス全体が明確な連鎖を形成し、完全に解釈可能な予測をもたらす。
論文 参考訳(メタデータ) (2025-11-21T08:50:14Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - PathMR: Multimodal Visual Reasoning for Interpretable Pathology Diagnosis [9.728322291979564]
病理画像解析のための細胞レベルでのマルチモーダルビジュアル推論フレームワークであるPathMRを提案する。
PathMRは、テキスト生成品質、セグメンテーション精度、モーダルアライメントにおいて、最先端の視覚的推論手法よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2025-08-28T14:46:24Z) - Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration [21.260659596426184]
画像と報告の両方から病理観察の一貫性を最大化するために,新しい病理レベルの相互アライメント(PCMA)手法を提案する。
PCMAモジュールは外部の疾患アノテーションとは独立して動作し,本手法の汎用性と堅牢性を高める。
実験により,提案するフレームワークは,複数の下流タスクにおいて,新しい最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2025-06-12T11:01:57Z) - CPathAgent: An Agent-based Foundation Model for Interpretable High-Resolution Pathology Image Analysis Mimicking Pathologists' Diagnostic Logic [23.488576700623966]
我々は、病理医の診断ワークフローを模倣する革新的なエージェントベースのアプローチであるCPathAgentを紹介する。
我々は、パッチレベル、リージョンレベル、WSIレベルの機能を単一のモデルに統合するマルチステージトレーニング戦略を開発します。
PathMMU-HR2は、大規模領域分析のための最初のエキスパート検証ベンチマークである。
論文 参考訳(メタデータ) (2025-05-26T20:22:19Z) - PathoSCOPE: Few-Shot Pathology Detection via Self-Supervised Contrastive Learning and Pathology-Informed Synthetic Embeddings [42.42150241818321]
教師なしの病理検出では、非病理データに基づいて、偏差を病理としてモデル化する。
そこで我々は,少数の非病理サンプルのみを必要とする,数発の非教師付き病理診断フレームワークPathoSCOPEを提案する。
PathoSCOPEは計算効率(2.48 GFLOP, 166 FPS)を維持しながら教師なし手法の最先端性能を実現する
論文 参考訳(メタデータ) (2025-05-23T08:21:58Z) - A Graph-Based Framework for Interpretable Whole Slide Image Analysis [86.37618055724441]
我々は,全スライディング画像を生物学的にインフォームドされたグラフ表現に変換するフレームワークを開発した。
我々のアプローチは、任意の格子ではなく、自然構造を尊重する組織領域からグラフノードを構築する。
がんのステージングと生存予測の課題に強いパフォーマンスを示す。
論文 参考訳(メタデータ) (2025-03-14T20:15:04Z) - Leveraging Vision-Language Embeddings for Zero-Shot Learning in Histopathology Images [7.048241543461529]
ゼロショット組織像分類におけるこれらの課題に対処するため, MR-PHE(Multi-Resolution Prompt-Guided Hybrid Embedding)と呼ばれる新しいフレームワークを提案する。
我々は,グローバルな画像埋め込みと重み付けされたパッチ埋め込みを統合したハイブリッドな埋め込み戦略を導入する。
類似性に基づくパッチ重み付け機構は、クラス埋め込みとの関連性に基づいて、アテンションのような重み付けをパッチに割り当てる。
論文 参考訳(メタデータ) (2025-03-13T12:18:37Z) - PathVG: A New Benchmark and Dataset for Pathology Visual Grounding [45.21597220882424]
そこで我々はPathVG(Pathology Visual Grounding)と呼ばれる新しいベンチマークを提案する。
実験の結果,病理表現の根底にある暗黙的な情報に最大の課題があることが判明した。
提案手法は,PathVGベンチマーク上での最先端性能を実現する。
論文 参考訳(メタデータ) (2025-02-28T09:13:01Z) - Active Learning Enhances Classification of Histopathology Whole Slide
Images with Attention-based Multiple Instance Learning [48.02011627390706]
我々は、注意に基づくMILをトレーニングし、データセット内の各画像に対する信頼度を算出し、専門家のアノテーションに対して最も不確実なWSIを選択する。
新たな注意誘導損失により、各クラスにアノテートされた領域がほとんどない、トレーニングされたモデルの精度が向上する。
将来的には、病理組織学における癌分類の臨床的に関連する文脈において、MILモデルのトレーニングに重要な貢献をする可能性がある。
論文 参考訳(メタデータ) (2023-03-02T15:18:58Z) - Trustworthy Visual Analytics in Clinical Gait Analysis: A Case Study for
Patients with Cerebral Palsy [43.55994393060723]
gaitXplorerは、CP関連歩行パターンの分類のための視覚分析手法である。
Grad-CAMは、機械学習の分類の説明のために、よく確立された説明可能な人工知能アルゴリズムである。
論文 参考訳(メタデータ) (2022-08-10T09:21:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。