Fugu-MT 論文翻訳(概要): Kvasir-VQA: A Text-Image Pair GI Tract Dataset

論文の概要: Kvasir-VQA: A Text-Image Pair GI Tract Dataset

arxiv url: http://arxiv.org/abs/2409.01437v1
Date: Mon, 2 Sep 2024 19:41:59 GMT
ステータス: 翻訳完了
システム内更新日: 2024-09-06 04:02:22.051976
Title: Kvasir-VQA: A Text-Image Pair GI Tract Dataset
Title（参考訳）: Kvasir-VQA: テキストイメージのペアGIトラクトデータセット
Authors: Sushant Gautam, Andrea Storås, Cise Midoglu, Steven A. Hicks, Vajira Thambawita, Pål Halvorsen, Michael A. Riegler,
Abstract要約: このデータセットは、様々なGI路条件と手術器具にまたがる6,500の注釈付き画像からなる。データセットは、画像キャプション、視覚質問回答(VQA)、テキストベースの合成医療画像の生成、オブジェクト検出、分類などのアプリケーションを対象としている。
参考スコア（独自算出の注目度）: 4.250633109741797
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: We introduce Kvasir-VQA, an extended dataset derived from the HyperKvasir and Kvasir-Instrument datasets, augmented with question-and-answer annotations to facilitate advanced machine learning tasks in Gastrointestinal (GI) diagnostics. This dataset comprises 6,500 annotated images spanning various GI tract conditions and surgical instruments, and it supports multiple question types including yes/no, choice, location, and numerical count. The dataset is intended for applications such as image captioning, Visual Question Answering (VQA), text-based generation of synthetic medical images, object detection, and classification. Our experiments demonstrate the dataset's effectiveness in training models for three selected tasks, showcasing significant applications in medical image analysis and diagnostics. We also present evaluation metrics for each task, highlighting the usability and versatility of our dataset. The dataset and supporting artifacts are available at https://datasets.simula.no/kvasir-vqa.
Abstract（参考訳）: 我々は,HyperKvasirとKvasir-Instrumentのデータセットから派生した拡張データセットであるKvasir-VQAを紹介した。各種GI路条件および手術器具にまたがる6,500個の注釈付き画像からなるデータセットで、イエス/ノー、選択、位置、数値を含む複数の質問タイプをサポートする。データセットは、画像キャプション、視覚質問回答(VQA)、テキストベースの合成医療画像の生成、オブジェクト検出、分類などのアプリケーションを対象としている。本実験は, 3つのタスクのトレーニングモデルにおけるデータセットの有効性を実証し, 医用画像解析および診断における重要な応用を示すものである。また、各タスクの評価指標を示し、データセットのユーザビリティと汎用性を強調します。データセットとサポートアーティファクトはhttps://datasets.simula.no/kvasir-vqaで公開されている。

関連論文リスト

Rotterdam artery-vein segmentation (RAV) dataset [0.8004597666699035]
このデータセットには、1024x1024ピクセルのPNGイメージが3つのモードで含まれており、オリジナルのRGBファウンダスイメージ、コントラスト強化バージョン、RGBエンコードされたA/Vマスクである。眼科における血管分析のための機械学習アルゴリズムの開発を支援する。
論文参考訳（メタデータ） (2025-12-19T08:09:02Z)
AlphaDent: A dataset for automated tooth pathology detection [98.1937495272719]
このデータセットは、295人の患者の歯のDSLRカメラ写真に基づいており、1200枚以上の画像を含んでいる。この記事では、データセットとラベリングフォーマットの詳細な説明を提供する。その結果,高い予測精度が得られた。
論文参考訳（メタデータ） (2025-07-30T09:34:43Z)
Kvasir-VQA-x1: A Multimodal Dataset for Medical Reasoning and Robust MedVQA in Gastrointestinal Endoscopy [3.3091869879941687]
Kvasir-VQA-x1は消化管内視鏡(GI)の新しい大規模データセットである。我々は159,549組の新しい質問応答ペアを組み込むことで,元のKvasir-VQAを大幅に拡張した。 Kvasir-VQA-x1は、より困難で臨床的に関係のあるベンチマークを提供することで、より信頼性が高く効果的なマルチモーダルAIシステムの開発を加速することを目指している。
論文参考訳（メタデータ） (2025-06-11T17:31:38Z)
MRGen: Segmentation Data Engine for Underrepresented MRI Modalities [59.61465292965639]
稀ながら臨床的に重要な画像モダリティのための医用画像分割モデルの訓練は、注釈付きデータの不足により困難である。本稿では,データ合成における生成モデルの利用について検討する。本稿では,テキストプロンプトとセグメンテーションマスクを条件とした医用画像合成のためのデータエンジンMRGenを提案する。
論文参考訳（メタデータ） (2024-12-04T16:34:22Z)
Eye-gaze Guided Multi-modal Alignment for Medical Representation Learning [65.54680361074882]
アイゲイズガイドマルチモーダルアライメント(EGMA)フレームワークは、アイゲイズデータを利用して、医用視覚的特徴とテキスト的特徴のアライメントを改善する。我々は4つの医療データセット上で画像分類と画像テキスト検索の下流タスクを行う。
論文参考訳（メタデータ） (2024-03-19T03:59:14Z)
BESTMVQA: A Benchmark Evaluation System for Medical Visual Question Answering [8.547600133510551]
本稿では,BESTMVQAで表される医用視覚質問応答のベンチマーク評価SysTemを開発する。本システムは,Med-VQAデータセットを自動構築する上で有用なツールを提供する。簡単な構成で、ベンチマークデータセット上で選択したモデルを自動でトレーニングし、評価する。
論文参考訳（メタデータ） (2023-12-13T03:08:48Z)
UNK-VQA: A Dataset and a Probe into the Abstention Ability of Multi-modal Large Models [55.22048505787125]
本稿ではUNK-VQAと呼ばれる包括的データセットを提案する。まず、画像または疑問について意図的に摂動することで、既存のデータを拡大する。そこで我々は,新たなマルチモーダル大規模モデルのゼロショット性能と少数ショット性能を広範囲に評価した。
論文参考訳（メタデータ） (2023-10-17T02:38:09Z)
Vision-Language Modelling For Radiological Imaging and Reports In The Low Data Regime [70.04389979779195]
本稿では,視覚および言語入力を共通空間に埋め込んだ医用視覚言語モデル(VLM)について検討する。本稿では,新しい画像領域やテキスト領域への汎用事前学習モデルの適用など,低データ性能向上のためのいくつかの候補手法について検討する。テキスト・ツー・イメージ検索をベンチマークとして,2つの胸部X線および放射線学的報告を用いた可変サイズのトレーニングデータセットを用いて,これらの手法の性能評価を行った。
論文参考訳（メタデータ） (2023-03-30T18:20:00Z)
RAMM: Retrieval-augmented Biomedical Visual Question Answering with Multi-modal Pre-training [45.38823400370285]
ヴィジュアル・アンド・ランゲージ・マルチモーダル事前学習と微調整は視覚的質問応答(VQA)において大きな成功を収めた。本稿では, バイオメディカルVQAのためのRAMMという, 事前学習とファイントゥン検索のパラダイムを提案する。
論文参考訳（メタデータ） (2023-03-01T14:21:19Z)
Medical visual question answering using joint self-supervised learning [8.817054025763325]
エンコーダは、自己アテンション機構で画像-テキスト二重モードに埋め込まれる。デコーダはエンコーダの上部に接続され、小型の医療用VQAデータセットを使用して微調整される。
論文参考訳（メタデータ） (2023-02-25T12:12:22Z)
Data-Efficient Vision Transformers for Multi-Label Disease Classification on Chest Radiographs [55.78588835407174]
視覚変換器(ViT)は一般的な画像の分類性能が高いにもかかわらず、このタスクには適用されていない。 ViTは、畳み込みではなくパッチベースの自己アテンションに依存しており、CNNとは対照的に、ローカル接続に関する事前の知識は存在しない。以上の結果から,ViTとCNNのパフォーマンスはViTの利点に匹敵するものの,DeiTsはトレーニング用に適度に大規模なデータセットが利用可能であれば,前者よりも優れることがわかった。
論文参考訳（メタデータ） (2022-08-17T09:07:45Z)
SimVQA: Exploring Simulated Environments for Visual Question Answering [15.030013924109118]
視覚空間と言語空間を完全に制御するために,合成コンピュータ生成データを用いて検討する。我々は、実世界のVQAベンチマークにおける合成データの効果を定量化し、実際のデータに一般化する結果を生成する。 VQAモデルをよりドメイン不変にするために、トレーニング中にオブジェクトレベルの機能をランダムに切り替える機能スワッピング(F-SWAP)を提案する。
論文参考訳（メタデータ） (2022-03-31T17:44:27Z)
Application of DatasetGAN in medical imaging: preliminary studies [10.260087683496431]
ジェネレーティブ・ディベサール・ネットワーク(GAN)は医用画像の多くの可能性について広く研究されている。 datasetGANは、高品質なセグメンテーションイメージを合成できるモダンなGANをベースにした、最近提案されたフレームワークである。医療画像への応用に焦点を当てた研究は発表されていない。
論文参考訳（メタデータ） (2022-02-27T22:03:20Z)
A Survey on RGB-D Datasets [69.73803123972297]
本稿では,深度情報を含む画像データセットをレビューし,分類した。アクセス可能なデータを含む203のデータセットを収集し、それらをシーン/オブジェクト、ボディ、医療の3つのカテゴリに分類しました。
論文参考訳（メタデータ） (2022-01-15T05:35:19Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。