論文の概要: Performance of large language models in the optical diagnosis of colorectal polyps
- arxiv url: http://arxiv.org/abs/2608.07543v1
- Date: Fri, 31 Jul 2026 02:34:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.560524
- Title: Performance of large language models in the optical diagnosis of colorectal polyps
- Title(参考訳): 大腸ポリープの光学診断における大規模言語モデルの性能
- Abstract要約: 大腸ポリープの正確な光診断は切除戦略と監視を導く。
画像に基づく診断の可能性を示す多モード大言語モデル(MLLM)。
クロードオプス4, Google Gemini 2.5 Pro, GPT-o3, GPT-4o, GPT-5について検討した。
- 参考スコア(独自算出の注目度): 26.586274034380523
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Background and Study Aims: Accurate optical diagnosis of colorectal polyps guides resection strategy and surveillance, with multimodal large language models (MLLMs) showing potential for image-based diagnosis. We aimed to evaluate the diagnostic accuracy of MLLMs in classifying colorectal polyps and predicting histology. Methods: We conducted a retrospective diagnostic performance study using the PRIME dataset, a curated set of white light and narrow-band imaging (NBI) images. We evaluated Claude Opus 4, Google Gemini 2.5 Pro, GPT-o3, GPT-4o, and GPT-5. For Paris, Narrow-band Imaging Colorectal Endoscopic (NICE), and predicted histology, we calculated F1 scores, percent correct scores, and accuracy of each MLLM compared to expert responses for 132 cases. Cochran's Q and McNemar's Test were used to determine differences between predicted values of each MLLM. Results: The F1 scores among MLLMs were >0.9 for all models for neoplastic vs. non-neoplastic polyps. Gemini 2.5 Pro demonstrated the highest F1 scores for invasive vs. non-invasive polyps and low- vs. high-grade adenoma, at 0.560 and 0.492 respectively. Claude Opus 4 and GPT-5 had statistically significantly higher percent correct scores than other MLLMs at 41.7%, using Paris classification. Conclusions: Claude Opus 4 and Gemini 2.5 Pro showed the highest accuracy in differentiating polyp subtypes, performing closest to expert consensus. Sensitivity and specificity, however, did not meet ESGE standards, highlighting the need for prospective multicenter trials and the design of human-in-the-loop workflows before clinical deployment.
- Abstract(参考訳): 背景と研究目標:大腸ポリープの正確な光学的診断は切除戦略と監視をガイドし,マルチモーダル大言語モデル(MLLM)は画像に基づく診断の可能性を示している。
大腸ポリープの分類と組織像の予測において,MLLMの診断精度を評価することを目的とした。
方法: PRIMEデータセットを用いて, 白光画像と狭帯域画像(NBI)画像の補正を行った。
クロードオプス4, Google Gemini 2.5 Pro, GPT-o3, GPT-4o, GPT-5について検討した。
パリではNarrow-band Imaging Colorectal Endoscopic (NICE) を用い, 病理組織学的にF1スコア, 正解率, 各MLLMの精度を132例と比較した。
コクランのQとマクネマールのテストは、それぞれのMLLMの予測値の違いを決定するために用いられた。
結果: MLLMのF1スコアは, 腫瘍性ポリープと非腫瘍性ポリープの全モデルで0.9。
Gemini 2.5 Proは, 浸潤性ポリープと非浸潤性ポリープのF1スコアが0.560, 0.492であった。
クロード・オプス4とGPT-5はパリの分類を用いて他のMLLMの41.7%よりも統計的に有意に高い正解率を示した。
結論: Claude Opus 4 と Gemini 2.5 Pro はポリプサブタイプを識別する際の高い精度を示し、専門家のコンセンサスに最も近い性能を示した。
しかし、感度と特異性はESGEの基準を満たしておらず、将来的な多施設試験の必要性と臨床展開前の人道内ワークフローの設計を強調した。
関連論文リスト
- Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary [36.736436091313585]
この注釈書は、GPT-5ファミリー(GPT-5, GPT-5 Mini, GPT-5 Nano)の最初の制御された横断的な評価である。
GPT-5は、MedXpertQAの25ポイントを超える絶対的な改善により、専門家レベルのテキスト推論において著しく向上した。
マルチモーダル合成を課題とする場合、GPT-5はこの強化された推論能力を有効活用し、具体的な画像証拠に不確実な臨床物語を根拠とした。
論文 参考訳(メタデータ) (2026-03-05T03:24:48Z) - GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards [17.453089229230663]
我々は,パノラマ性消化管内視鏡のワークフローにおけるMLLM(Multimodal Large Language Models)の評価を行った。
細粒度病変を20種類含むGI-Benchを作成した。
モデルでは、人間に比べて言語的可読性に優れたレポートを生成する。
論文 参考訳(メタデータ) (2026-01-13T03:23:11Z) - SkinGenBench: Generative Model and Preprocessing Effects for Synthetic Dermoscopic Augmentation in Melanoma Diagnosis [0.0]
生成的アーキテクチャの選択は、前処理の複雑さよりも画像の忠実さと診断ユーティリティの両方に強い影響を与える。
メラノーマF1スコアは8~15%増加し, メラノーマ検出は有意に改善した。
論文 参考訳(メタデータ) (2025-12-19T13:52:11Z) - MeCaMIL: Causality-Aware Multiple Instance Learning for Fair and Interpretable Whole Slide Image Diagnosis [40.3028468133626]
MIL(Multiple Case Learning)は、コンピュータ病理学における全スライド画像(WSI)解析の主流パラダイムとして登場した。
因果関係を意識したMILフレームワークである textbfMeCaMIL は、構造化因果グラフを通じて、階層的共同創設者を明示的にモデル化する。
MeCaMILは優れた公正性を達成する -- 人口格差の分散は、属性全体の平均で65%以上減少する。
論文 参考訳(メタデータ) (2025-11-14T06:47:21Z) - LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology [43.092364533480456]
視力低下の眼疾患は、労働力不足によるタイムリーな診断と専門医療へのアクセス制限により、世界的な健康上の重荷となる。
本報告では,12の眼球運動条件に共通する多粒性アノテーションと5つの画像モダリティを併用した32,633例の大規模マルチモーダル眼科ベンチマークを報告する。
このデータセットは、画像、解剖学的構造、人口統計、自由テキストアノテーションを統合し、解剖学的構造認識、疾患スクリーニング、疾患ステージング、およびバイアス評価のための人口統計予測をサポートする。
論文 参考訳(メタデータ) (2025-09-30T00:29:18Z) - EyePCR: A Comprehensive Benchmark for Fine-Grained Perception, Knowledge Comprehension and Clinical Reasoning in Ophthalmic Surgery [42.23133882924834]
我々は,眼科手術解析のための大規模ベンチマークであるtextbfEyePCR を開発した。
EyePCRは210k以上のVQAを持つリッチな注釈付きコーパスを提供する。
リッチアノテーションは深い認知分析を促進し、外科医が視覚的手がかりをどう知覚するかをシミュレートし、それらをドメイン知識と組み合わせて意思決定する。
論文 参考訳(メタデータ) (2025-09-19T04:55:56Z) - Diagnostic Accuracy of Open-Source Vision-Language Models on Diverse Medical Imaging Tasks [1.6567957832859204]
このデータセットは, 胸部X線撮影, 大腸病理検査, 内視鏡検査, 新生児黄体診, 網膜内視鏡検査を含む7,461例の22,349枚の画像を含む。
Qwen2.5 は胸部X線写真 (90.4%) と内視鏡画像 (84.2%) で最高精度を達成し、他のモデル (p.001) よりも大幅に優れていた。
Qwen2.5とGemma3は18.6%(比較可能、p=.99)で、他の試験されたモデル(p.001)よりもはるかに優れている。
論文 参考訳(メタデータ) (2025-08-01T18:28:37Z) - Evaluating Large Language Models for Multimodal Simulated Ophthalmic Decision-Making in Diabetic Retinopathy and Glaucoma Screening [37.69303106863453]
大規模言語モデル(LLM)は、自然言語のプロンプトに基づいて臨床推論をシミュレートすることができるが、眼科におけるそれらの有用性はほとんど解明されていない。
本研究は,GPT-4による網膜底写真の構造的記述の解釈能力について検討した。
300点の注釈付き眼底画像を用いた振り返り診断検査を行った。
論文 参考訳(メタデータ) (2025-07-02T01:35:59Z) - Vision Language Models versus Machine Learning Models Performance on Polyp Detection and Classification in Colonoscopy Images [0.06782770175649853]
本研究は、確立された畳み込みニューラルネットワーク(CNN)に対する視覚言語モデル(VLM)の総合的な性能評価を提供する。
428例の大腸内視鏡像2,258例について検討した。
論文 参考訳(メタデータ) (2025-03-27T09:41:35Z) - Pre-examinations Improve Automated Metastases Detection on Cranial MRI [36.39673740985943]
コントラスト強調T1強調画像における高感度MMの自動検出
診断成績は造影T1強調画像と術前MRIで得られた。
論文 参考訳(メタデータ) (2024-03-13T06:18:08Z) - Domain Transfer Through Image-to-Image Translation for Uncertainty-Aware Prostate Cancer Classification [42.75911994044675]
前立腺MRIの非対位画像翻訳のための新しいアプローチと臨床的に重要なPCaを分類するための不確実性認識トレーニングアプローチを提案する。
提案手法では,無ペアの3.0T多パラメータ前立腺MRIを1.5Tに翻訳し,利用可能なトレーニングデータを増強する。
実験の結果,提案手法は,従来の研究に比べてAUC(Area Under ROC Curve)を20%以上改善することがわかった。
論文 参考訳(メタデータ) (2023-07-02T05:26:54Z) - Significantly improving zero-shot X-ray pathology classification via fine-tuning pre-trained image-text encoders [50.689585476660554]
本稿では,正対損失緩和とランダムな文サンプリングを含む新たな微調整手法を提案する。
提案手法は,胸部X線データセットと3つの事前訓練モデル間のゼロショット病理分類を一貫して改善する。
論文 参考訳(メタデータ) (2022-12-14T06:04:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。