論文の概要: IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation
- arxiv url: http://arxiv.org/abs/2607.04344v1
- Date: Sun, 05 Jul 2026 14:59:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.905264
- Title: IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation
- Title(参考訳): IRIS: トピックツリーとシーン駆動型VQA生成による眼表面病のインテリジェントビジョンランゲージシステム
- Abstract要約: IRIS (Intelligent Recognition and Interaction System) は、眼表面の微細な疾患(OSD)を外眼写真で理解するための知能認識・インタラクションシステムである。
従来の画像キャプションペアのセマンティックな浅さを克服するために,臨床上の先行点を明示的に注入するための相乗的データ生成パラダイムを提案する。
我々の発見は、構造化された知識注入が、リソース効率の高い専門家レベルのAIデプロイメントの可能性を解き放ち、厳密なパラメータスケーリングよりも大きく優位であることを示している。
- 参考スコア(独自算出の注目度): 2.9438135444211526
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Large Vision-Language Models (VLMs) demonstrate remarkable generic capabilities, their clinical reasoning in specialized domains like ocular surface diseases (OSDs) is severely hindered by a paucity of high-fidelity, multimodal instruction-tuning data. To dismantle this data bottleneck, we introduce IRIS, an Intelligent Recognition and Interaction System tailored for fine-grained OSD understanding via external eye photography. First, we curate IRIS-120K, the largest and most comprehensive OSD visual question-answering (VQA) dataset to date. Crucially, to overcome the semantic shallowness of conventional image-caption pairs, we propose a synergistic data generation paradigm to explicitly inject clinical priors. Our data engine operates via a dual-branch framework: 1) a Topic Finding Tree (TFT) that hierarchically anchors visual features to precise anatomical and pathological concepts, enforcing rigorous medical deduction logic; and 2) a Scene-driven strategy that synthesizes role-adaptive clinical dialogues to ensure pragmatic generalization. By explicitly aligning a compact 4B-parameter VLM on this structurally enriched corpus, IRIS achieves state-of-the-art performance, comprehensively outperforming both generalist and specialized medical VLMs with up to 34B parameters. Our findings underscore that structured knowledge injection profoundly prevails over sheer parameter scaling, unlocking the potential for resource-efficient, expert-level AI deployment on mobile edge devices for scalable OSD screening. Code, datasets, and model weights will be publicly released by this repo.
- Abstract(参考訳): 眼表面疾患(OSD)のような専門領域における臨床推論は、高忠実でマルチモーダルなインストラクションチューニングデータによって著しく妨げられている。
このデータボトルネックを解消するために、外部の眼写真を通してのOSDの微細な理解に適した知能認識・インタラクションシステムであるIRISを導入する。
まず、これまでで最大かつ最も包括的なOSD視覚質問応答(VQA)データセットであるIRIS-120Kをキュレートする。
重要なことは、従来の画像キャプチャーペアのセマンティックな浅さを克服するために、臨床上の先行点を明示的に注入するための相乗的データ生成パラダイムを提案する。
データエンジンはデュアルブランチフレームワークを介して動作します。
1)厳格な医学的推論論理を強制して、解剖学的・病理学的概念に階層的に視覚的特徴を固定するトピックファインディングツリー(TFT)
2) 現実的な一般化を保証するために, 役割適応型臨床対話を合成するシーン駆動型戦略。
この構造に富んだコーパスにコンパクトな4BパラメータVLMを明示的にアライメントすることにより、IRISは最先端のパフォーマンスを達成し、ジェネラリストと専門の医用VLMの両方を最大34Bパラメータで総合的に上回る。
我々の研究は、構造化された知識注入がパラメータのスケーリングよりも大きく普及し、スケーラブルなOSDスクリーニングのために、モバイルエッジデバイスにリソース効率の高い専門家レベルのAIを配置する可能性の解放を図っている。
コード、データセット、モデルの重み付けは、このリポジトリから公開される予定である。
関連論文リスト
- Unlocking Biological Workflows for Robust Protein-Text Question Answering: A Dual-Dimensional RAG Framework [60.82334952881798]
タンパク-テキスト質問回答(QA)は、自然言語による生物学的配列の解釈に不可欠である。
2D-ProteinRAGは,大規模言語モデル(LLM)を金本位生物研究ワークフロー内で動作させる新しいフレームワークである。
本研究では,2D-Proteinが常に最先端の性能を達成し,微調整ベースラインや他のRAG法よりも優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2026-05-17T05:03:24Z) - Graph-Augmented Topological Internalization with Dual-Stream Classifiers for Medical Report Generation [3.3887144970801555]
トポロジカル内部化を用いたグラフ拡張型デュアルストリーム医療レポート生成法(GDMRG)を提案する。
本フレームワークでは,グローバルな疾患の共起を前提としたパラメータ化重み行列を生成するトポロジカル・ナレッジ・インサイナライゼーション・モジュールであるTKIを導入する。
MIMIC-CXRデータセットの実験は、GDMRGが自然言語の流速を維持しながら競争力のある臨床効果CEを達成することを示した。
論文 参考訳(メタデータ) (2026-05-04T09:17:27Z) - Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge [66.67024684187915]
LVLM(Large Vision Language Models)は、眼科における自動診断の可能性を秘めている。
彼らの臨床展開は、ドメイン固有の知識の欠如によって著しく妨げられている。
EyExInは、Deep Expert Injectionメカニズムを通じて専門知識で網膜VLMを固定するように設計されたフレームワークである。
論文 参考訳(メタデータ) (2026-03-07T09:43:49Z) - Context-Aware Asymmetric Ensembling for Interpretable Retinopathy of Prematurity Screening via Active Query and Vascular Attention [1.8420107091891775]
未熟児網膜症(ROP:Retinopathy of Prematurity)は、小児期盲症の主要な原因の一つである。
現在のディープラーニングモデルは、大きなプライベートデータセットとパッシブマルチモーダル融合に大きく依存している。
本研究では,2つの専門ストリームによる臨床推論をシミュレートする文脈認識非対称アンサンブルモデル(CAAアンサンブル)を提案する。
論文 参考訳(メタデータ) (2026-02-05T02:06:26Z) - A Semantically Enhanced Generative Foundation Model Improves Pathological Image Synthesis [82.01597026329158]
本稿では,組織合成のための相関調整フレームワーク(CRAFTS)について紹介する。
CRAFTSは、生物学的精度を確保するためにセマンティックドリフトを抑制する新しいアライメント機構を組み込んでいる。
本モデルは,30種類の癌にまたがる多彩な病理像を生成する。
論文 参考訳(メタデータ) (2025-12-15T10:22:43Z) - DuPLUS: Dual-Prompt Vision-Language Framework for Universal Medical Image Segmentation and Prognosis [5.494301428436596]
効率的なマルチモーダル医療画像解析のためのディープラーニングフレームワークであるDuPLUSを紹介する。
DuPLUSは、階層的セマンティックプロンプトを利用して分析タスクのきめ細かい制御を行う新しい視覚言語フレームワークを導入した。
セグメンテーションのために、DuPLUSは、30以上の臓器と腫瘍タイプを含む10の異なる医療データセットである3つの画像モダリティを一般化することができる。
論文 参考訳(メタデータ) (2025-10-03T20:01:00Z) - AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models [78.08374249341514]
AI生成コンテンツ(AIGC)の急速な発展は、誤情報を拡散するAIGIの誤用につながった。
大規模で包括的なデータセットであるHolmes-Setを導入し、画像がAI生成されているかどうかを解説したインストラクションチューニングデータセットを含む。
本研究は,MLLMの構造化説明と品質管理によるデータ生成を効率化する,Multi-Expert Juryと呼ばれる効率的なデータアノテーション手法を提案する。
さらに,視覚専門家による事前学習,教師付き微調整,直接選好最適化を含む3段階学習フレームワークであるHolmes Pipelineを提案する。
論文 参考訳(メタデータ) (2025-07-03T14:26:31Z) - Decentralized LoRA Augmented Transformer with Context-aware Multi-scale Feature Learning for Secured Eye Diagnosis [2.1358421658740214]
本稿では、コンテキスト認識型マルチスケールパッチ埋め込み、ローランド適応(LoRA)、知識蒸留、フェデレーション学習を統合し、これらの課題に統一的に対処する新しいデータ効率画像変換器(DeiT)ベースのフレームワークを提案する。
提案モデルでは,マルチスケールパッチ表現と局所的および大域的注意機構を活用することで,局所的および大域的網膜特徴を効果的に捉えている。
論文 参考訳(メタデータ) (2025-05-11T13:51:56Z) - EyecareGPT: Boosting Comprehensive Ophthalmology Understanding with Tailored Dataset, Benchmark and Model [51.66031028717933]
Med-LVLM(Med-LVLM)は、医療において重要な可能性を示す。
現在、知的眼科診断は、(i)データ、(ii)ベンチマーク、(iii)モデルという3つの大きな課題に直面している。
我々は、前述の3つの課題に対処するEyecare Kitを提案する。
論文 参考訳(メタデータ) (2025-04-18T12:09:15Z) - Cross-modal Clinical Graph Transformer for Ophthalmic Report Generation [116.87918100031153]
眼科報告生成(ORG)のためのクロスモーダルな臨床グラフ変換器(CGT)を提案する。
CGTは、デコード手順を駆動する事前知識として、臨床関係を視覚特徴に注入する。
大規模FFA-IRベンチマークの実験は、提案したCGTが従来のベンチマーク手法より優れていることを示した。
論文 参考訳(メタデータ) (2022-06-04T13:16:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。