論文の概要: Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
- arxiv url: http://arxiv.org/abs/2605.30716v1
- Date: Fri, 29 May 2026 01:15:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.322631
- Title: Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
- Title(参考訳): 簡易利得高能率ビジョンランゲージモデルによる症例レベルシンプティクスレポート生成
- Abstract要約: ケースレベルの合成レポート生成のための単純なトークン効率の視覚言語モデルを提案する。
私たちのアーキテクチャは、凍結した病理パッチ、軽量な2層視覚言語調整器、および大規模言語モデルデコーダという、最小限の3成分設計に従っています。
提案手法は,メモリと実行時の効率を著しく向上しつつ,高いROUGE-L/METEOR/BLEU-4スコアを実現する。
- 参考スコア(独自算出の注目度): 9.268049949671958
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Generating clinically useful pathology reports for pathology cases from whole-slide images (WSIs) is challenging due to gigapixel resolution, long visual-token sequences, and the complexity of case-level reasoning, where a single case may contain multiple WSIs with heterogeneous tissues and ambiguous findings. We present a simple token-efficient vision--language model for case-level synoptic report generation that remains practical under constrained GPU memory. Our architecture follows a minimal three-component design: a frozen pathology patch encoder, a lightweight two-layer MLP vision-language aligner, and a large language model decoder, with an explicit WSI marker token to separate slides within a case. Training proceeds in two supervised stages: (1) aligner-only WSI captioning using heterogeneous WSI-text pairs, and (2) case-level supervised fine-tuning on case-report pairs for structured report generation. To reduce sequence length, we represent each slide using $512 \times 512$ patches at $5\times$ magnification, which reduces the average sequence length by up to $64\times$ times compared to the commonly used $20\times$ patches. Combined with efficient training techniques, we enable practical training with only half a NVIDIA H100 GPU. Across both training stages, our approach achieves high ROUGE-L/METEOR/BLEU-4 scores while being substantially more efficient in memory and runtime. In AI-based evaluations, our model is consistently preferred over strong baselines. Extensive ablations characterize performance-efficiency trade-offs and identify simple choices that improve robustness in multi-WSI settings. Overall, this work provides a strong, reproducible baseline for efficient pathology report generation, lowering the barrier to multi-WSI VLM research under limited compute.
- Abstract(参考訳): 臨床的に有用である病態報告を全スライディング画像(WSIs)から作成することは、ギガピクセル分解能、長い視覚的トーケン配列、およびケースレベルの推論の複雑さにより困難であり、一例は異種組織を含む複数のWSIとあいまいな所見を含む可能性がある。
本稿では,制約付きGPUメモリ下でも実用的でありながら,単純なトークン効率の視覚言語モデルを提案する。
我々のアーキテクチャは、凍結した病理パッチエンコーダ、軽量な2層MLP視覚言語コーディネータ、およびケース内のスライドを分離するための明示的なWSIマーカートークンを備えた大規模言語モデルデコーダである。
不均一なWSIテキストペアを用いたコーディネータのみのWSIキャプションと、構造化レポート生成のためのケースレポートペアのケースレベルの微調整である。
シーケンス長を削減するために、512 \times 512$ パッチを5\times$ 倍率で表現し、一般的に使用される 20\times$ パッチと比較して、平均シーケンス長を最大6,4\times$ の倍率で表現する。
効率的なトレーニング技術と組み合わせることで、NVIDIA H100 GPUを半分だけ使用して実践的なトレーニングを可能にします。
いずれの訓練段階においても,本手法は高いROUGE-L/METEOR/BLEU-4スコアを達成できると同時に,メモリや実行時の効率も著しく向上する。
AIに基づく評価では、強いベースラインよりも、私たちのモデルは一貫して好まれます。
大規模な改善は、パフォーマンス効率のトレードオフを特徴付け、マルチWSI設定の堅牢性を改善するための単純な選択を識別する。
全体として、この研究は、効率的な病理報告生成のための強力な再現可能なベースラインを提供し、限られた計算下でのマルチWSI VLM研究への障壁を低くする。
関連論文リスト
- Unified Spatio-Temporal Token Scoring for Efficient Video VLMs [61.08183446817756]
トケンプルーニングは視覚言語モデルの計算効率を高めるために不可欠である。
本稿では,視覚トークンを ViT と LLM の両方にわたってプルークする,シンプルで軽量なモジュールである Spatio-Temporal Token Scoring (STTS) を紹介する。
STTSはアーキテクチャ全体の視覚トークンの50%を突破し、トレーニングと推論の両方で効率が62%向上した。
論文 参考訳(メタデータ) (2026-03-18T17:59:56Z) - LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models [19.89635786218384]
ワイルスライド画像(WSI)の理解は、そのギガピクセルスケールと診断関連領域の極端に親和性があるため、基本的に困難である。
既存のスライドレベルの多モード大言語モデル(MLLM)は、重いスライドレベルのエンコーダに依存している。
コストのかかるスライドレベルのエンコーダを冗長性低減モジュールに置き換える,効率的なMLLMフレームワークであるLoC-Pathを導入する。
論文 参考訳(メタデータ) (2025-12-05T03:16:46Z) - Learning Hyperspectral Images with Curated Text Prompts for Efficient Multimodal Alignment [1.7188280334580195]
我々は、CLIPスタイルのコントラストトレーニングフレームワークを利用して、超スペクトルシーン理解のための視覚言語モデル(VLM)の最適化を試みる。
我々のフレームワークは、視覚バックボーンから凍結した大きな埋め込みモデルの潜在空間へのボクセルレベルの埋め込みをマッピングする。
提案手法は全パラメータの0.07パーセントしか更新していないが、最先端の性能が得られる。
論文 参考訳(メタデータ) (2025-09-20T23:23:04Z) - AHDMIL: Asymmetric Hierarchical Distillation Multi-Instance Learning for Fast and Accurate Whole-Slide Image Classification [51.525891360380285]
AHDMILは非対称な階層的蒸留マルチインスタンス学習フレームワークである。
2段階のトレーニングプロセスを通じて、無関係なパッチを排除します。
分類性能と推論速度の両方において、従来の最先端手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-08-07T07:47:16Z) - HiLa: Hierarchical Vision-Language Collaboration for Cancer Survival Prediction [55.00788339683146]
生存予測を改善するための新しい階層型視覚・言語協調フレームワークを提案する。
具体的には、HiLaは事前訓練された特徴抽出器を使用して、パッチレベルとリージョンレベルの両方でWSIから階層的な視覚的特徴を生成する。
このap-proachは、プロンプトから異なる生存関連属性に対応する識別的視覚特徴の包括的学習を可能にする。
論文 参考訳(メタデータ) (2025-07-07T02:06:25Z) - Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction [62.8375542401319]
MLLM(Multimodal Large Language Models)は、入力イメージを視覚トークンとしてエンコードし、それらを言語バックボーンに入力する。
画像解像度が大きくなるにつれて、視覚トークンの数は2次的に増加し、膨大な計算コストがかかる。
本稿では,各層を浅層から深層まで保持する最小限の視覚トークンを求めるために,欲求探索アルゴリズム(G-Search)を提案する。
論文 参考訳(メタデータ) (2024-11-30T18:54:32Z) - A self-supervised framework for learning whole slide representations [52.774822784847565]
我々は、全スライド画像のギガピクセルスケールの自己スーパービジョンのためのSlide Pre-trained Transformer (SPT)を提案する。
バイオメディカル・マイクロスコープ・データセットを用いて,5つの診断課題におけるSPT視覚表現のベンチマークを行った。
論文 参考訳(メタデータ) (2024-02-09T05:05:28Z) - Hierarchical Transformer for Survival Prediction Using Multimodality
Whole Slide Images and Genomics [63.76637479503006]
下流タスクのためのギガピクセルレベルのスライド病理画像(WSI)の良質な表現を学習することが重要である。
本稿では,病理画像と対応する遺伝子間の階層的マッピングを学習する階層型マルチモーダルトランスフォーマーフレームワークを提案する。
より優れたWSI表現能力を維持しながら、ベンチマーク手法と比較してGPUリソースが少ないアーキテクチャです。
論文 参考訳(メタデータ) (2022-11-29T23:47:56Z) - An Efficient Cervical Whole Slide Image Analysis Framework Based on
Multi-scale Semantic and Spatial Features using Deep Learning [2.7218168309244652]
本研究では,YOLCO(You Only Look Cytopathology Once)という名前の軽量モデルを構築するために,マルチスケール接続を充実させることにより,新しいインライン接続ネットワーク(InCNet)を設計する。
提案したモデルでは、入力サイズをメガピクセルに拡大し、平均リピートで重なり合うことなくWSIを縫合することができる。
統合マルチスケールマルチタスクの特徴を分類するためのTransformerに基づいて、実験結果は、WSI分類における従来の方法よりも0.872$ AUCスコアが良く、2.51times$速く見える。
論文 参考訳(メタデータ) (2021-06-29T06:24:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。