論文の概要: UltraG-Bench: A Multi-task Benchmark for assessing Large Vision-Language Models on Pixel-level Evidence Grounding in Ultrasound
- arxiv url: http://arxiv.org/abs/2609.30928v1
- Date: Fri, 25 Sep 2026 07:43:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.279269
- Title: UltraG-Bench: A Multi-task Benchmark for assessing Large Vision-Language Models on Pixel-level Evidence Grounding in Ultrasound
- Title(参考訳): UltraG-Bench: 超音波の画素レベルのエビデンスグラウンドにおける大規模視線モデル評価のためのマルチタスクベンチマーク
- Abstract要約: 超音波における画素レベルの証拠を評価するための大規模ベンチマークであるUltraG-Benchを紹介する。
また,VLMのセグメンテーション能力とUltraSAM3の超音波特異的セグメンテーション能力を組み合わせたUltraG-Agentを提案する。
- 参考スコア(独自算出の注目度): 26.34739112327755
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ultrasound is one of the most widely used medical imaging modalities, and recent large vision-language models(VLMs) have shown increasing capabilities in ultrasound image understanding. However, these models fail to provide pixel-level visual evidence aligned with their semantic predictions, and their fine-grained grounding capability in ultrasound remains largely unclear. We introduce UltraG-Bench, a large-scale multi-task benchmark for evaluating pixel-level evidence grounding in ultrasound. UltraG-Bench is built by annotating 40 public ultrasound segmentation datasets spanning 13 anatomical categories, and comprises three progressive tasks: instruction-guided segmentation, evidence-grounded VQA, and evidence-grounded report generation, with 331125, 666779, and 138832 annotations, respectively. Comprehensive evaluation of 14 state-of-the-art models reveals a substantial gap between semantic understanding and fine-grained pixel-level localization. We further propose UltraG-Agent, which combines the semantic reasoning capabilities of a VLM with the ultrasound-specific segmentation capability of UltraSAM3. Experiments show that UltraG-Agent substantially improves both semantic prediction and pixel-level visual grounding. Our dataset and code are available at https://github.com/zhuqh19/UltraG-Bench.
- Abstract(参考訳): 超音波は最も広く用いられている医用画像モダリティの1つであり、近年の大規模視覚言語モデル(VLM)は超音波画像理解の能力の増大を示している。
しかし、これらのモデルでは、それらの意味的予測と一致したピクセルレベルの視覚的証拠が得られず、超音波の微細な接地能力はほとんど不明である。
超音波における画素レベルの証拠を評価するための大規模マルチタスクベンチマークであるUltraG-Benchを紹介する。
UltraG-Benchは、13の解剖学的カテゴリにまたがる40の公開超音波セグメンテーションデータセットをアノテートすることで構築され、それぞれ331125、666779、138832アノテーションを備えた命令誘導セグメンテーション、エビデンスグラウンドVQA、エビデンスグラウンドレポート生成の3つのプログレッシブタスクで構成されている。
14の最先端モデルの包括的評価は、セマンティック理解と細粒度画素レベルの局所化の間に大きなギャップがあることを明らかにする。
さらに,VLMのセマンティック推論能力とUltraSAM3の超音波特異セグメンテーション機能を組み合わせたUltraG-Agentを提案する。
実験により,UltraG-Agentは意味的予測と画素レベルの視覚的接地の両方を大幅に改善することが示された。
データセットとコードはhttps://github.com/zhuqh19/UltraG-Bench.comから入手可能です。
関連論文リスト
- FUSEP: A Multi-Center Benchmark for Diverse Tasks in Early Pregnancy Fetal Ultrasound Screening [50.7313801030297]
胎児の早期妊娠における超音波データセットの欠如は、自動診断の開発を遅らせている。
妊娠初期における胎児超音波スクリーニングのためのFUSEPというベンチマークデータセットを提案する。
本データセットは,4,017個の超音波画像と45,820個のボックスレベルの専門家レベルのアノテーションを用いた2つの超音波画像からなる。
論文 参考訳(メタデータ) (2026-08-05T12:33:07Z) - UltraSAM3: A Concept-Driven Foundation Model for Universal Ultrasound Image Segmentation [22.394292096035603]
UltraSAM3は、ユニバーサル超音波画像分割のための概念駆動基盤モデルである。
37の公開データセットと13の解剖学的カテゴリをカバーする大規模な超音波セグメンテーションコーパスで訓練されている。
実験により、UltraSAM3は、典型的な概念とテキスト駆動のバイオメディカルセグメンテーションモデルより一貫して優れていることが示された。
論文 参考訳(メタデータ) (2026-07-31T09:19:49Z) - SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis [51.81845420301345]
SonoCLIPは胎児超音波解析のための視覚言語基盤モデルである。
セグメンテーションマスクを視覚エンコーダ内にマスクチャネル視覚プロンプトとして組み込む。
グローバルおよびマスク誘導推論の両方において、ゼロショット転送性能に優れる。
論文 参考訳(メタデータ) (2026-06-28T20:04:49Z) - EchoVLM: Dynamic Mixture-of-Experts Vision-Language Model for Universal Ultrasound Intelligence [9.731550105507457]
本稿では,超音波医療画像に特化して設計された視覚言語モデルであるEchoVLMを提案する。
このモデルは、7つの解剖学的領域にまたがるデータに基づいてトレーニングされたMixture of Experts (MoE)アーキテクチャを採用している。
EchoVLMは、それぞれBLEU-1スコアとROUGE-1スコアで10.15点と4.77点を大きく改善した。
論文 参考訳(メタデータ) (2025-09-18T14:07:53Z) - A Fully Open and Generalizable Foundation Model for Ultrasound Clinical Applications [77.3888788549565]
一般臨床用超音波基礎モデルであるEchoCareについて紹介する。
我々は、キュレートされた、一般公開された大規模なデータセットであるEchoCareData上で、自己教師付き学習を通じてEchoCareを開発した。
最小限のトレーニングで、EchoCareは10の代表的なベンチマークで最先端の比較モデルを上回っている。
論文 参考訳(メタデータ) (2025-09-15T10:05:31Z) - Grounding DINO-US-SAM: Text-Prompted Multi-Organ Segmentation in Ultrasound with LoRA-Tuned Vision-Language Models [4.981692533734272]
本研究では,複数の超音波臓器にまたがる物体セグメンテーションを実現するために,Grounding DINOとSAM2を統合したプロンプト駆動視覚言語モデル(VLM)を提案する。
胸, 甲状腺, 肝臓, 前立腺, 腎臓, 脊髄筋を含む18種類の超音波データセットが得られた。
提案手法は,UniverSeg,MedSAM,MedCLIP-SAM,BiomedParse,SAMUSなどの最先端セグメンテーション手法より優れている。
論文 参考訳(メタデータ) (2025-06-30T14:33:44Z) - Deep Spectral Methods for Unsupervised Ultrasound Image Interpretation [53.37499744840018]
本稿では, 超音波を応用した非教師型深層学習手法を提案する。
我々は、スペクトルグラフ理論と深層学習法を組み合わせた教師なしディープスペクトル法から重要な概念を統合する。
スペクトルクラスタリングの自己教師型トランスフォーマー機能を利用して、超音波特有のメトリクスと形状と位置の先行値に基づいて意味のあるセグメントを生成し、データセット間のセマンティック一貫性を確保する。
論文 参考訳(メタデータ) (2024-08-04T14:30:14Z) - Voice-assisted Image Labelling for Endoscopic Ultrasound Classification
using Neural Networks [48.732863591145964]
本稿では,臨床医が提示した生音声からのEUS画像にラベルを付けるマルチモーダル畳み込みニューラルネットワークアーキテクチャを提案する。
その結果,5つのラベルを持つデータセットにおいて,画像レベルでの予測精度は76%であった。
論文 参考訳(メタデータ) (2021-10-12T21:22:24Z) - Deep Learning for Ultrasound Beamforming [120.12255978513912]
受信した超音波エコーを空間画像領域にマッピングするビームフォーミングは、超音波画像形成チェーンの心臓に位置する。
現代の超音波イメージングは、強力なデジタル受信チャネル処理の革新に大きく依存している。
ディープラーニング手法は、デジタルビームフォーミングパイプラインにおいて魅力的な役割を果たす。
論文 参考訳(メタデータ) (2021-09-23T15:15:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。