論文の概要: PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis
- arxiv url: http://arxiv.org/abs/2607.23794v1
- Date: Sun, 26 Jul 2026 18:36:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.228437
- Title: PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis
- Title(参考訳): PathScale-R1: 画像解析のためのクロススケール推論
- Authors: Chi Phan, Tianyi Zhang, Yufeng Wu, Qiaochu Xue, Jiajie Zhang, Linghan Cai, Zeyu Liu, Sudong Wang, Yueming Jin, Dan Hu,
- Abstract要約: PathScale-VQA(パススケール-VQA)は、複数の倍率レベルにわたる1,368の診断パスにある10,373の多重選択質問を備えた、高品質なクロススケールな病理VQAベンチマークである。
セマンティック推論セットに基づいて、PathScale-R1はDifficulty駆動のReasoning Diastillationによる微調整によって最適化される。
- 参考スコア(独自算出の注目度): 22.108085023153482
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pathological diagnosis is inherently multi-scale, requiring the integration of global tissue architecture at low magnification with cellular morphology at higher magnification. However, existing pathology benchmarks and vision-language models (VLMs) are still largely developed under single-scale settings, limiting their ability to learn clinically meaningful multi-magnification reasoning. Moreover, naively constructed visual question answering (VQA) tasks may be susceptible to text-only or superficial visual shortcuts, leading to unreliable assessments of visual understanding. To address these limitations, we introduce a benchmark and training framework for shortcut-resistant cross-scale pathology reasoning. We design an Adversarial Text-only Screening strategy for semantic reasoning questions and a Structure-controlled Distractor Sampling strategy for visual grounding questions, encouraging models to rely on cross-scale visual evidence. Based on this pipeline, we construct PathScale-VQA, a high-quality cross-scale pathology VQA benchmark with 10,373 multiple-choice questions grounded in 1,368 diagnostic paths across multiple magnification levels. Building on the semantic reasoning set, PathScale-R1 is optimized through Difficulty-driven Reasoning Distillation supervised fine-tuning followed by reinforcement learning with a Scale-aware Reasoning Structure reward, which encourages the use of evidence across magnifications. Extensive experiments demonstrate state-of-the-art performance of PathScale-R1 on cross-scale reasoning tasks and effective transfer to conventional single-scale pathology VQA. Our code is available at https://github.com/iMVR-PL/PathScale-R1.
- Abstract(参考訳): 病理診断は本質的にマルチスケールであり,低倍率でグローバル組織構造と高倍率で細胞形態を統合する必要がある。
しかしながら、既存の病理モデルと視覚言語モデル(VLM)は、現在でも主に単一スケールで開発されており、臨床的に有意義な多画像化推論を学習する能力に制限がある。
さらに、視覚的質問応答(VQA)タスクは、テキストのみまたは表面的な視覚的ショートカットの影響を受けやすいため、視覚的理解の信頼性が低い。
これらの制約に対処するために、ショートカット耐性のクロススケール病因推論のためのベンチマークおよびトレーニングフレームワークを導入する。
本研究では,意味的推論問題に対するAdversarial Text-only Screening Strategyを設計し,ビジュアルグラウンド問題に対するStructure-control Distractor Smpling Strategyを設計し,モデルに大規模視覚的エビデンスへの依存を促す。
このパイプラインをベースとしたPathScale-VQAは,複数の倍率レベルにわたる1,368の診断パスに10,373の多重選択質問を根拠とした,高品質なクロススケール病理VQAベンチマークである。
意味論的推論セットに基づいて、PathScale-R1は、ディフルティ駆動のリソン蒸留(Reasoning Distillation)によって最適化され、その後、スケール対応リソン構造報酬(Scale-aware Reasoning Structure reward)による強化学習により、倍率にまたがるエビデンスの使用が促進される。
クロススケール推論タスクにおけるPathScale-R1の最先端性能と,従来のシングルスケール病理VQAへの効果的な移行を実証した。
私たちのコードはhttps://github.com/iMVR-PL/PathScale-R1.comで利用可能です。
関連論文リスト
- Enhancing Pathological VLMs with Cross-scale Reasoning [16.185615513686532]
病理画像は本質的にマルチスケールであり、病理学者は、低倍率で地球規模の組織構造から高倍率で細胞形態まで、正確な診断のために証拠を統合する必要がある。
本稿では,病理学の解釈を多変量化推論として定式化する,最初のクロススケールトレーニングと評価パラダイムを紹介する。
本稿では、強化学習を用いて訓練されたモデルであるScaleReasoner-R1を紹介し、大規模VQAタスクのパフォーマンスを最適化する。
論文 参考訳(メタデータ) (2026-06-16T01:49:10Z) - Thinking in Scales: Accelerating Gigapixel Pathology Image Analysis via Adaptive Continuous Reasoning [52.41928980786654]
スライド画像全体に対してトークン効率のよいスケール空間連続推論を可能にするPathCTMを提案する。
PathCTMは診断推論を動的逐次情報追跡として定式化する。
必要な画像パッチの数を95.95%削減し、推論時間を約95.62%短縮し、AUCを劣化せずに維持する。
論文 参考訳(メタデータ) (2026-05-19T07:46:44Z) - PathReasoner-R1: Instilling Structured Reasoning into Pathology Vision-Language Model via Knowledge-Guided Policy Optimization [6.821738567680833]
PathReasonerは,WSI推論の最初の大規模データセットである。
PathReasoner-R1は、教師付き微調整と推論指向の強化学習を相乗し、構造化されたチェーン・オブ・シント機能を注入する。
実験により、PathReasoner-R1はPathReasonerと公開ベンチマークの両方で、様々な画像スケールで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-01-29T12:21:16Z) - Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation [52.7583577508452]
MLLM(Multimodal Large Language Models)は自然画像推論において顕著な進歩を遂げている。
医用画像におけるその潜在性は、特に臨床解剖学的外科画像では未発見のままである。
これらの課題は、従来のSupervised Fine-Tuning戦略の有効性を制限する。
論文 参考訳(メタデータ) (2025-12-22T16:06:36Z) - A Semantically Enhanced Generative Foundation Model Improves Pathological Image Synthesis [82.01597026329158]
本稿では,組織合成のための相関調整フレームワーク(CRAFTS)について紹介する。
CRAFTSは、生物学的精度を確保するためにセマンティックドリフトを抑制する新しいアライメント機構を組み込んでいる。
本モデルは,30種類の癌にまたがる多彩な病理像を生成する。
論文 参考訳(メタデータ) (2025-12-15T10:22:43Z) - SVQA-R1: Reinforcing Spatial Reasoning in MLLMs via View-Consistent Reward Optimization [57.484274282231226]
本稿では,R1スタイルのトレーニングを空間VQAに拡張する最初のフレームワークであるSVQA-R1を提案する。
特に,オブジェクト間の空間的関係を摂動させることで,視点に一貫性のある報酬を構成する新しいグループワイドRL戦略であるSpatial-GRPOを紹介する。
我々のモデルSVQA-R1は空間的VQAベンチマークの精度を劇的に向上させるだけでなく、教師付き微調整データを使用しなくても解釈可能な推論経路を示す。
論文 参考訳(メタデータ) (2025-06-02T06:58:43Z) - PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks [15.497221591506625]
病理画像に特化して設計された視覚言語モデルPathVLM-R1を提案する。
我々は,Qwen2.5-VL-7B-インストラクタをベースとして,厳密に設計したポストトレーニング戦略により,病理的タスクのパフォーマンスを向上させた。
論文 参考訳(メタデータ) (2025-04-12T15:32:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。