論文の概要: Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration
- arxiv url: http://arxiv.org/abs/2608.30352v1
- Date: Mon, 31 Aug 2026 07:09:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.276057
- Title: Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration
- Title(参考訳): 若年性黄斑変性症における視覚・文書指導のための専門家用ViTとVLM
- Authors: Ziheng "Leo" Li, Benjamin Freeman, Akshay Raman, Kavin Aravindhan Rajkumar, Xinxin Fang, Rishabh Srivastava, Steven Feiner, Kaveri A. Thakoor,
- Abstract要約: 本稿では、専門家の視線と判断を2つのガイダンスに抽出するCo-Annotatorについて述べる。
注目領域(AOIs)とオントロジー有界視覚言語モデル(VLM)は、編集可能なバイオマーカーの要約をプリフィルする。
- 参考スコア(独自算出の注目度): 2.520997642237269
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Clinical AI often optimizes predictive performance without engaging how clinicians decide where to look and what to write. We present Co-Annotator, which distills expert gaze and dictation into two guidance components: a gaze-aligned Vision Transformer producing fixation-aligned areas of interest (AOIs), and an ontology-bounded vision-language model (VLM) that pre-fills editable biomarker summaries for retinal optical coherence tomography (OCT). We first collect expert gaze and dictations (US1) to train the models, significantly improving diagnostic accuracy and biomarker generation. We then deploy the system with ophthalmology residents: a controlled resident study (US2) confirmed each modality is safe and independently beneficial, with AOI guidance producing lasting perceptual efficiency gains through post-guidance carryover and VLM guidance more than doubling biomarker documentation breadth. In a combined deployment across two academic institutions (US3), providing both modalities simultaneously produced efficiency gains that substantially exceeded either modality alone: correct diagnoses per minute increased by 40% and comment editing time fell by 67%, without compromising diagnostic accuracy. Notably, neither modality improved efficiency during guidance in US2, which makes the in-guidance efficiency gain under combined guidance in US3 the more striking result. Expert-distilled multimodal guidance can remove two distinct clinical workflow bottlenecks at once (visual search overhead and documentation burden) without compromising the diagnostic accuracy clinicians already achieve.
- Abstract(参考訳): 臨床AIは、臨床医がどのように見て何を書けばよいかを決めることなく、予測パフォーマンスを最適化することが多い。
我々は、専門家の視線と予測を2つのガイダンス成分に抽出するCo-Annotatorと、網膜光コヒーレンストモグラフィー(OCT)のための編集可能なバイオマーカー要約をプリフィルするオントロジーバウンド視覚言語モデル(VLM)を提案する。
まず、専門家の視線とディクテーション(US1)を収集し、モデルのトレーニングを行い、診断精度とバイオマーカー生成を大幅に改善する。
AOI指導は,バイオマーカーの文書の広大化よりも,誘導後搬送とVLM指導による知覚効率の持続的向上を図り,各モダリティが安全かつ独立に有用であることを確認した。
2つの学術機関(US3)への共同展開において、両方のモダリティを提供することで、いずれかのモダリティを実質的に上回る効率向上を実現した: 毎分毎の正しい診断は40%増加し、コメント編集時間は67%減少し、診断精度は向上しなかった。
特に、US2の誘導において、どちらのモダリティも効率を向上せず、US3の誘導と組み合わせた誘導による誘導効率の向上は、より顕著な結果となる。
専門家によるマルチモーダルガイダンスは、すでに達成されている診断精度を損なうことなく、一度に2つの異なるワークフローボトルネック(視覚的検索オーバーヘッドとドキュメントの負担)を取り除くことができる。
関連論文リスト
- ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding [67.57715989349471]
MLLM(Multimodal large language model)は、臨床実践に革命をもたらす大きな可能性を秘めている。
我々は、総合的な医学的理解のために設計された視覚中心のMLLMであるClinFusionを紹介する。
ClinFusionは、総合的な2Dおよび3Dマルチモーダル・メディカル・ベンチマーク・スイートにまたがって、最先端の新たな状態を設定する。
論文 参考訳(メタデータ) (2026-07-27T17:59:49Z) - Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs [53.697403481143404]
LVLM(Large Vision-Language Models)は、医用画像処理タスクにおいて強力なパフォーマンスを実現している。
しかし、実際の不整合、視力の低下、臨床的に有意義なフィードバックによる不一致が続く傾向にある。
論文 参考訳(メタデータ) (2026-06-10T18:35:36Z) - ODySSeI: An Open-Source End-to-End Framework for Automated Detection, Segmentation, and Severity Estimation of Lesions in Invasive Coronary Angiography Images [23.05175906366438]
Invasive Coronary Angiography (ICA) は冠動脈疾患の診断における臨床標準である。
本研究では,ICA画像の自動検出,病変,重症度推定のためのオープンソースフレームワークODySSeIを紹介する。
ODySSeIは、新しいピラミッド拡張スキーム(PAS)を用いて訓練された深層学習に基づく病変検出と病変分割モデルを統合する
我々のLSE技術は,MLDの予測値が,対応する基底真理からpm$2-3ピクセルしか差がないため,精度が高い。
論文 参考訳(メタデータ) (2026-03-20T15:07:15Z) - Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge [66.67024684187915]
LVLM(Large Vision Language Models)は、眼科における自動診断の可能性を秘めている。
彼らの臨床展開は、ドメイン固有の知識の欠如によって著しく妨げられている。
EyExInは、Deep Expert Injectionメカニズムを通じて専門知識で網膜VLMを固定するように設計されたフレームワークである。
論文 参考訳(メタデータ) (2026-03-07T09:43:49Z) - A Graph-Augmented knowledge Distillation based Dual-Stream Vision Transformer with Region-Aware Attention for Gastrointestinal Disease Classification with Explainable AI [0.06372261626436675]
本研究は,教師-学生の知識蒸留に基づくハイブリッド二流深層学習フレームワークを提案する。
教師のセマンティックな知識と形態的知識を継承するコンパクトなTiny-ViT構造として学生ネットワークが実装された。
主要なGI疾患クラスを含む2つの注意深くキュレートされたWireless Capsule Endoscopyデータセットを使用して、バランスの取れた表現を保証した。
論文 参考訳(メタデータ) (2025-12-24T07:51:54Z) - VLCD: Vision-Language Contrastive Distillation for Accurate and Efficient Automatic Placenta Analysis [1.366127486479084]
胎盤の病理検査は、出産に伴う健康リスクの検出および緩和に有効な方法である。
近年のAIの進歩により、胎盤の写真と、出産関連病理の徴候の検出と分類のための病理報告が利用できるようになった。
本稿では,その精度と効率を高めるために,視覚言語によるコントラスト学習フレームワークの2つの改良を提案する。
論文 参考訳(メタデータ) (2025-06-02T20:12:27Z) - EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy [26.132684811981143]
VLA(Vision-Language-Action)モデルは、視覚知覚、言語接地、モーションプランニングをエンドツーエンドのフレームワークに統合する。
EndoVLAは,(1)ポリープ追跡,(2)異常粘膜領域の脱線・追尾,(3)周囲切削時の円形マーカーへの付着の3つのコアタスクを実行する。
論文 参考訳(メタデータ) (2025-05-21T07:35:00Z) - A Cascaded Dilated Convolution Approach for Mpox Lesion Classification [0.0]
Mpoxウイルスは、他の皮膚疾患と視覚的に類似しているため、重要な診断上の課題を呈する。
深層学習に基づく皮膚病変分類のアプローチは、有望な代替手段を提供する。
本稿では,これらの課題に対処するためのCascaded Atrous Group Attentionフレームワークを紹介する。
論文 参考訳(メタデータ) (2024-12-13T12:47:30Z) - Cross-modal Clinical Graph Transformer for Ophthalmic Report Generation [116.87918100031153]
眼科報告生成(ORG)のためのクロスモーダルな臨床グラフ変換器(CGT)を提案する。
CGTは、デコード手順を駆動する事前知識として、臨床関係を視覚特徴に注入する。
大規模FFA-IRベンチマークの実験は、提案したCGTが従来のベンチマーク手法より優れていることを示した。
論文 参考訳(メタデータ) (2022-06-04T13:16:30Z) - Robust and Efficient Medical Imaging with Self-Supervision [80.62711706785834]
医用画像AIの堅牢性とデータ効率を向上させるための統一表現学習戦略であるREMEDISを提案する。
様々な医療画像タスクを研究し, 振り返りデータを用いて3つの現実的な応用シナリオをシミュレートする。
論文 参考訳(メタデータ) (2022-05-19T17:34:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。