論文の概要: A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports
- arxiv url: http://arxiv.org/abs/2607.28466v1
- Date: Thu, 30 Jul 2026 16:24:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.659936
- Title: A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports
- Title(参考訳): 280万回定期報告からの大腸内視鏡検査のための画像言語基礎モデル
- Abstract要約: EndoCLIPは125,756の病変レベルの画像テキストペアに基づいて訓練された視覚言語基盤モデルである。
これは、ゼロショットとリニアプローブの両方の設定において、汎用およびバイオメディカルな視覚言語エンコーダよりも優れている。
- 参考スコア(独自算出の注目度): 58.14965296904734
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Vision-language models remain underused in colonoscopy despite the rich expert descriptions recorded in routine reports. These reports document lesion appearance, size and location but summarise entire procedures rather than caption individual frames, leaving clinical findings only weakly linked to the corresponding images. Here we develop EndoCLIP, a colonoscopy vision-language foundation model trained on 125,756 lesion-level image-text pairs progressively recovered from 280,476 routine colonoscopy records. Across lesion-level image-text retrieval, structured report generation and six multi-centre clinical classification tasks, EndoCLIP outperforms general-purpose and biomedical vision-language encoders in both zero-shot and linear-probe settings. On benign-versus-malignant classification, its linear probe approaches the performance of expert readers in a blinded study involving 12 endoscopists. These results suggest that recovering finding-to-frame correspondence can transform routine documentation into scalable supervision, enabling clinical targets to be specified in language rather than separately annotated for each task.
- Abstract(参考訳): 視覚言語モデルは、定期的な報告に記録されている豊富な専門家の記述にもかかわらず、大腸内視鏡では未熟なままである。
本報告では, 病変の出現, サイズ, 位置を文書化するが, 個々のフレームを挿入するのではなく, 全処置を要約し, 臨床所見は対応する画像と弱い関係しか残っていない。
今回我々は,280,476例の大腸内視鏡検査記録から,125,756例の病変レベルの画像テキストペアを段階的に回収した内視鏡的基盤モデルであるEndoCLIPを開発した。
病変レベルの画像テキスト検索、構造化されたレポート生成、および6つの多段階臨床分類タスクにおいて、EndoCLIPは、ゼロショットとリニアプローブの両方の設定において、汎用およびバイオメディカル視覚言語エンコーダより優れている。
良性交叉悪性度分類では、12人の内科医を含む盲目研究において、その線形プローブが専門家読者のパフォーマンスに近づいた。
これらの結果から,各タスクに別々にアノテートするのではなく,臨床対象を言語で特定することが可能になる。
関連論文リスト
- An end-to-end-trained vision-language model for native-language prostate pathology report generation [0.09772267314090433]
前立腺癌は世界で最も頻繁に診断された悪性腫瘍の一つである。
既存のツールによって分類され、病理学者はコヒーレントな報告を組み立てることになる。
本稿では, 言語に依存しない前立腺生検レポートを生成するスライドレベルフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-24T11:49:23Z) - Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence [51.57735743553791]
今回我々はFundusGroundを紹介した。これは臨床的に解釈可能な眼科用VQAの空間的根拠を用いた新しいベンチマークである。
この構造された病変の証拠に基づいて、72,706の質問が4つのフォーマットにまたがって生成される。
実験により、病変レベルの視覚的エビデンスを組み込むことで、モデルの性能と透明性が一貫して向上することが示された。
論文 参考訳(メタデータ) (2026-05-21T12:37:03Z) - CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis [0.4551615447454768]
ワイヤレスカプセル内視鏡(WCE)は小腸の非侵襲的視覚的評価を可能にする。
WCEの既存の学習ベースのアプローチは主に視覚のみであり、しばしば狭い病理セットに限られる。
本稿では,WCEのためのドメイン固有視覚言語表現学習フレームワークであるCapCLIPを紹介する。
論文 参考訳(メタデータ) (2026-05-08T21:14:56Z) - MetaDent: Labeling Clinical Images for Vision-Language Models in Dentistry [32.93319761809706]
VLM(Vision-Language Models)は、医用画像解析において重要な可能性を示している。
口内撮影におけるそれらの応用は、細粒度で注釈付きデータセットと包括的なベンチマークが欠如していることから、いまだほとんど探索されていない。
本稿では, 臨床, 公衆およびWebソースから収集した, 新規で大規模な歯科画像データセットを含む包括的リソースであるMetaDentについて紹介する。
論文 参考訳(メタデータ) (2026-04-16T10:56:54Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - Self-supervised vision-langage alignment of deep learning representations for bone X-rays analysis [53.809054774037214]
本稿では, 骨X線とフレンチレポートを組み合わせることで, 視覚言語による事前訓練を活用することを提案する。
骨X線表現にまつわる埋め込み空間を形成するために、フランスの報告を統合する最初の研究である。
論文 参考訳(メタデータ) (2024-05-14T19:53:20Z) - IMITATE: Clinical Prior Guided Hierarchical Vision-Language Pre-training [15.04212780946932]
階層的視覚言語アライメントを用いた医療報告から構造情報を学習するための新しいフレームワークImitateを提案する。
このフレームワークは胸部X線(CXR)画像から多段階の視覚特徴を導出し、これらの特徴を階層的な医療報告に符号化された記述的および決定的テキストと別々に整列する。
論文 参考訳(メタデータ) (2023-10-11T10:12:43Z) - Vision-Language Modelling For Radiological Imaging and Reports In The
Low Data Regime [70.04389979779195]
本稿では,視覚および言語入力を共通空間に埋め込んだ医用視覚言語モデル(VLM)について検討する。
本稿では,新しい画像領域やテキスト領域への汎用事前学習モデルの適用など,低データ性能向上のためのいくつかの候補手法について検討する。
テキスト・ツー・イメージ検索をベンチマークとして,2つの胸部X線および放射線学的報告を用いた可変サイズのトレーニングデータセットを用いて,これらの手法の性能評価を行った。
論文 参考訳(メタデータ) (2023-03-30T18:20:00Z) - Self-supervised Answer Retrieval on Clinical Notes [68.87777592015402]
本稿では,ドメイン固有パスマッチングのためのトランスフォーマー言語モデルをトレーニングするためのルールベースのセルフスーパービジョンであるCAPRを紹介する。
目的をトランスフォーマーベースの4つのアーキテクチャ、コンテキスト文書ベクトル、ビ-、ポリエンコーダ、クロスエンコーダに適用する。
本稿では,ドメイン固有パスの検索において,CAPRが強いベースラインを上回り,ルールベースおよび人間ラベル付きパスを効果的に一般化することを示す。
論文 参考訳(メタデータ) (2021-08-02T10:42:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。