論文の概要: An Automated Multimodal Glaucoma Detection Framework Using ViT and a Stacking-Based Ensemble
- arxiv url: http://arxiv.org/abs/2607.02692v1
- Date: Thu, 02 Jul 2026 18:33:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.394027
- Title: An Automated Multimodal Glaucoma Detection Framework Using ViT and a Stacking-Based Ensemble
- Title(参考訳): ViTとスタック型アンサンブルを用いたマルチモーダル緑内障自動検出フレームワーク
- Abstract要約: 緑内障は進行性眼疾患であり、早期に検出されない場合、不可逆的な視力喪失を引き起こす可能性がある。
本研究は, 緑内障検診において, 試料検診と患者検診の2つの評価条件について検討した。
基礎画像と臨床データを統合する自動マルチモーダルフレームワークを提案する。
- 参考スコア(独自算出の注目度): 2.5937996810126407
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Glaucoma is a progressive eye disease that can lead to irreversible vision loss if not detected at an early stage. Conventional diagnostic procedures are often time-consuming and rely heavily on expert interpretation, limiting their scalability for large-scale screening. In this study, glaucoma detection is investigated under two evaluation settings: sample-wise, where individual samples are analyzed independently, and patient-wise, where data from each patient are aggregated for final prediction. An automated multimodal framework is proposed that integrates fundus images with clinical data. Under the sample-wise setting, detection is performed using fundus images and clinical features individually, as well as through their multimodal combination. Under the patient-wise setting, predictions are obtained by aggregating multiple fundus image representations with corresponding clinical information for each patient. Deep visual features are extracted using a Vision Transformer (ViT) architecture and classified using classical machine-learning models, with a stacking-based ensemble of the three best-performing classifiers employed to optimize performance. Experiments conducted on the publicly available PAPILA dataset demonstrate strong diagnostic performance, achieving 97.47% accuracy and a 97.50% F1-score for sample-wise multimodal classification, and 98.97% accuracy and F1-score for subject-wise detection. The proposed framework is further deployed as an end-to-end web-based platform to support automated glaucoma screening and clinical decision support.
- Abstract(参考訳): 緑内障は進行性眼疾患であり、早期に検出されない場合、不可逆的な視力喪失を引き起こす可能性がある。
従来の診断手順は時間を要することが多く、専門家の解釈に大きく依存しているため、大規模スクリーニングのスケーラビリティが制限される。
本研究は, 緑内障検出を, 個別のサンプルを個別に分析するサンプル・ワイドと, 患者ごとのデータを最終予測のために集約する患者・ワイドの2つの評価条件下で検討した。
基礎画像と臨床データを統合する自動マルチモーダルフレームワークを提案する。
本発明のサンプルワイド設定では, 眼底画像と臨床像を個別に検出し, マルチモーダル組み合わせにより検出する。
患者側設定では、患者毎に複数の眼底画像表現と対応する臨床情報とを集約して予測する。
視覚的特徴は視覚変換器(ViT)アーキテクチャを用いて抽出され、古典的な機械学習モデルを用いて分類される。
一般公開されたPAPILAデータセットでの実験では、97.47%の精度と97.50%のF1スコア、98.97%の精度とF1スコアの主観的検出が達成された。
提案フレームワークは、自動緑内障スクリーニングと臨床診断支援をサポートするエンド・ツー・エンドのWebベースプラットフォームとして、さらに展開されている。
関連論文リスト
- Retrieving Patient-Specific Radiomic Feature Sets for Transparent Knee MRI Assessment [42.97456036889799]
古典的な放射能の特徴は、画像の外観と強度パターンを定量化するように設計されている。
近年の適応放射能の研究では、DLを用いて放射能プール上の特徴量を予測する。
本稿では,患者ごとにひとつのコンパクトな特徴セットを予測できる,患者固有の特徴セット選択フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-02T20:12:41Z) - Digital FAST: An AI-Driven Multimodal Framework for Rapid and Early Stroke Screening [0.7136933021609076]
本研究では,F.A.S.T.アセスメントで収集したデータをもとに,高速かつ非侵襲的な2次脳卒中自動スクリーニングのための多モード深層学習フレームワークを提案する。
提案手法は, 表情, 音声信号, 上体動作からの相補的な情報を統合し, 診断の堅牢性を高める。
論文 参考訳(メタデータ) (2026-01-17T03:35:39Z) - Timely Clinical Diagnosis through Active Test Selection [49.091903570068155]
本稿では,現実の診断推論をよりうまくエミュレートするためのACTMED (Adaptive Clinical Test selection via Model-based Experimental Design)を提案する。
LLMは柔軟なシミュレータとして機能し、構造化されたタスク固有のトレーニングデータを必要とせずに、患者状態のもっともらしい分布を生成し、信念の更新をサポートする。
我々は、実世界のデータセット上でACTMEDを評価し、診断精度、解釈可能性、リソース使用量を改善するためにテスト選択を最適化できることを示す。
論文 参考訳(メタデータ) (2025-10-21T18:10:45Z) - Intelligent Healthcare Imaging Platform: A VLM-Based Framework for Automated Medical Image Analysis and Clinical Report Generation [0.0]
本稿では,視覚言語モデル(VLM)を活用した医用画像解析のためのインテリジェントマルチモーダルフレームワークを提案する。
このフレームワークはGoogle Gemini 2.5 Flashを統合し、腫瘍を自動的に検出し、CT、MRI、X線、超音波などの複数の画像モダリティで臨床報告を生成する。
論文 参考訳(メタデータ) (2025-09-16T23:15:44Z) - PRETI: Patient-Aware Retinal Foundation Model via Metadata-Guided Representation Learning [3.771396977579353]
PreTIは、メタデータ認識学習と堅牢な自己教師付き表現学習を統合した網膜基盤モデルである。
患者レベルのデータペアを構築し、同一人物の画像を関連付けることにより、非臨床的変動に対する堅牢性を向上させる。
実験では、PreTIは様々な疾患やバイオマーカー予測にまたがって最先端の結果を達成することを示した。
論文 参考訳(メタデータ) (2025-05-18T04:59:03Z) - MIL vs. Aggregation: Evaluating Patient-Level Survival Prediction Strategies Using Graph-Based Learning [52.231128973251124]
我々は,WSIおよび患者レベルでの生存を予測するための様々な戦略を比較した。
前者はそれぞれのWSIを独立したサンプルとして扱い、他の作業で採用された戦略を模倣します。
後者は、複数のWSIの予測を集約するか、最も関連性の高いスライドを自動的に識別するメソッドを含む。
論文 参考訳(メタデータ) (2025-03-29T11:14:02Z) - A Transformer-based representation-learning model with unified
processing of multimodal input for clinical diagnostics [63.106382317917344]
本稿では,マルチモーダル入力を統一的に処理する臨床診断支援として,トランスフォーマーを用いた表現学習モデルについて報告する。
統一モデルは, 肺疾患の同定において, 画像のみのモデル, 非統一型マルチモーダル診断モデルより優れていた。
論文 参考訳(メタデータ) (2023-06-01T16:23:47Z) - Multi-Label Retinal Disease Classification using Transformers [0.0]
新たな多ラベル網膜疾患データセットである MuReD が構築され、眼底疾患分類のために公開されているデータセットが多数使用されている。
広範な実験によって最適化されたトランスフォーマーベースのモデルは、画像解析と意思決定に使用される。
この手法は, 疾患検出と疾患分類のためのAUCスコアの7.9%と8.1%の精度で, 同じ課題における最先端の作業よりも優れていた。
論文 参考訳(メタデータ) (2022-07-05T22:06:52Z) - Convolutional-LSTM for Multi-Image to Single Output Medical Prediction [55.41644538483948]
発展途上国の一般的なシナリオは、複数の理由からボリュームメタデータが失われることである。
ヒトの診断過程を模倣したマルチイメージから単一診断モデルを得ることが可能である。
論文 参考訳(メタデータ) (2020-10-20T04:30:09Z) - Self-Training with Improved Regularization for Sample-Efficient Chest
X-Ray Classification [80.00316465793702]
挑戦的なシナリオで堅牢なモデリングを可能にするディープラーニングフレームワークを提案する。
その結果,85%のラベル付きデータを用いて,大規模データ設定で学習した分類器の性能に適合する予測モデルを構築することができた。
論文 参考訳(メタデータ) (2020-05-03T02:36:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。