論文の概要: Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation
- arxiv url: http://arxiv.org/abs/2607.08397v1
- Date: Thu, 09 Jul 2026 12:21:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.52349
- Title: Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation
- Title(参考訳): Open-Vocabularyendoscopic compositional Referring Segmentation の属性検索
- Authors: Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann,
- Abstract要約: Referring Image (RIS)は、自然言語で指定された画像領域をセグメント化することを目的としており、きめ細かい視覚的理解を可能にする。
RISを内視鏡画像に拡張することは、高品質なアノテーションの不足や、複雑なドメイン固有の画像-テキスト関係など、ユニークな課題を示す。
本稿では、内視鏡領域におけるRISの大規模ベンチマークであるReferEndoscopyを紹介する。
本稿では,Attribute Retrievalをベースとしたオープンボキャブラリ型内視鏡合成参照セグメンテーションのための内視鏡-RISフレームワークを提案する。
- 参考スコア(独自算出の注目度): 16.583090298184537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Referring Image Segmentation (RIS) aims to segment image regions specified by natural language, enabling fine-grained and controllable visual understanding. Extending RIS to endoscopic imagery, however, presents unique challenges, including scarce high-quality annotations and complex, domain-specific image-text relationships. Although recent vision-language models demonstrate strong cross-domain alignment, they often fail to capture fine-grained textual cues in endoscopic settings, resulting in suboptimal performance and limited generalization. To address these challenges, we introduce ReferEndoscopy, a large-scale benchmark for RIS in the endoscopy field. Building on this dataset, we propose the Attribute Retrieval-based Endoscopic-RIS (AR-ERIS) framework for open-vocabulary endoscopic compositional referring segmentation. AR-ERIS leverages attribute retrieval for open-vocabulary endoscopic compositional referring segmentation and is pretrained on the curated ReferEndoscopy dataset, achieving state-of-the-art performance with strong generalization across both simulated and real-world endoscopic data. The dataset and code will be publicly released upon completion of the review process.
- Abstract(参考訳): Referring Image Segmentation (RIS)は、自然言語で指定された画像領域をセグメント化することを目的としており、きめ細かい視覚的理解を可能にする。
しかし、RISを内視鏡画像に拡張することは、高品質なアノテーションの不足や、複雑なドメイン固有の画像とテキストの関係など、ユニークな課題をもたらす。
最近の視覚言語モデルは、強いドメイン間のアライメントを示すが、しばしば内視鏡的設定において微細なテキストの手がかりを捉えることができず、その結果、準最適性能と限定的な一般化をもたらす。
これらの課題に対処するために、内視鏡領域におけるRISの大規模ベンチマークであるReferEndoscopyを紹介する。
本稿では,Attribute Retrieval-based Endoscopic-RIS (AR-ERIS) framework for open-vocabulary endoscopic compositional segmentationを提案する。
AR-ERISは、オープンボキャブラリ構成参照セグメンテーションの属性検索を活用し、キュレートされたReferEndoscopyデータセットで事前訓練され、シミュレーションおよび実世界の内視鏡データの両方にわたって強力な一般化を伴う最先端のパフォーマンスを達成する。
データセットとコードは、レビュープロセスが完了すると公開されます。
関連論文リスト
- CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis [0.4551615447454768]
ワイヤレスカプセル内視鏡(WCE)は小腸の非侵襲的視覚的評価を可能にする。
WCEの既存の学習ベースのアプローチは主に視覚のみであり、しばしば狭い病理セットに限られる。
本稿では,WCEのためのドメイン固有視覚言語表現学習フレームワークであるCapCLIPを紹介する。
論文 参考訳(メタデータ) (2026-05-08T21:14:56Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - ACM Multimedia Grand Challenge on ENT Endoscopy Analysis [9.343316855950263]
本稿では,細粒度の解剖学的分類と画像間画像検索,およびバイリンガル監視下でのテキスト間画像検索を統合したENTRepを紹介する。
このデータセットは、解剖学的領域と正常または異常な状態にラベル付けされた専門家注釈付き画像と、二重言語記述を伴う。
論文 参考訳(メタデータ) (2025-08-06T18:22:23Z) - Open Set Recognition for Endoscopic Image Classification: A Deep Learning Approach on the Kvasir Dataset [5.762226441746656]
ResNet-50、Swin Transformer、ハイブリッドResNet-Transformerモデルなど、いくつかの代表的なディープラーニングアーキテクチャのOSR機能をクローズドセットおよびオープンセット条件下で評価・比較する。
この研究は、Kvasirデータセットにオープンセット認識を適用するための最初の取り組みの1つであり、医療画像解析においてOSRのパフォーマンスを評価するためのベンチマークを提供する。
論文 参考訳(メタデータ) (2025-06-23T04:39:07Z) - Referring Expression Instance Retrieval and A Strong End-to-End Baseline [37.47466772169063]
テキスト画像検索は、画像レベルの記述に基づいてギャラリーからターゲット画像を取得する。
Referring Expressionは、インスタンスレベルの記述を使用して、所定のイメージ内でターゲットオブジェクトをローカライズする。
我々は、インスタンスレベルの検索とローカライゼーションの両方をサポートする textbfReferring Expression Instance Retrieval (REIR) という新しいタスクを導入する。
論文 参考訳(メタデータ) (2025-06-23T02:28:44Z) - MRGen: Segmentation Data Engine for Underrepresented MRI Modalities [59.61465292965639]
稀ながら臨床的に重要な画像モダリティのための医用画像分割モデルの訓練は、注釈付きデータの不足により困難である。
本稿では,データ合成における生成モデルの利用について検討する。
本稿では,テキストプロンプトとセグメンテーションマスクを条件とした医用画像合成のためのデータエンジンMRGenを提案する。
論文 参考訳(メタデータ) (2024-12-04T16:34:22Z) - Eye-gaze Guided Multi-modal Alignment for Medical Representation Learning [65.54680361074882]
アイゲイズガイドマルチモーダルアライメント(EGMA)フレームワークは、アイゲイズデータを利用して、医用視覚的特徴とテキスト的特徴のアライメントを改善する。
我々は4つの医療データセット上で画像分類と画像テキスト検索の下流タスクを行う。
論文 参考訳(メタデータ) (2024-03-19T03:59:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。