論文の概要: Scaling 3D Visual Grounding in Abdominal CT
- arxiv url: http://arxiv.org/abs/2610.04095v1
- Date: Fri, 02 Oct 2026 22:03:36 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:43:55.118727
- Title: Scaling 3D Visual Grounding in Abdominal CT
- Title(参考訳): 腹部CTにおける3次元視覚グラウンドのスケーリング
- Abstract要約: 画像領域にレポート結果をリンクすることで、画像グラウンドモデルにより放射線学が向上する。
3Dグラウンドリングモデルのトレーニングには、ペア化されたフレーズとリージョンの大規模なセットが必要で、そのようなデータセットの構築にはコストがかかる。
本稿では,定期的な臨床アノテーションを大規模フレーズ領域管理に変換する自動パイプラインを提案する。
- 参考スコア(独自算出の注目度): 4.014618722322392
- License:
- Abstract: Visual grounding models can enhance radiology workflows by linking report findings to image regions. This is particularly valuable for 3D CT, where findings often occupy a tiny fraction of the volume. Training 3D grounding models requires large sets of paired phrases and regions, and building such datasets is expensive, requiring radiologists to annotate images by hand. We posit that this supervision is already created implicitly during routine reporting, as radiologists frequently place 2D annotations (e.g., distance measurement, arrows) on key images to make measurements and to support report interpretation. We introduce an automated pipeline that converts these routine clinical annotations into large-scale phrase-region supervision for 3D visual grounding. The pipeline links each annotation to the corresponding finding in the report through metadata matching, then uses a promptable 3D segmentation model to convert the 2D annotation into a volumetric mask. This produces phrase-mask-volume datasets without requiring additional radiologist annotation. Applied to a single institution's clinical picture archiving and communication system (PACS), our approach generated 105K phrase-mask-volume triplets from 59K abdominal CT exams. We also introduce two abdominal CT grounding benchmarks, LocusBench-Onc and LocusBench-ED, which comprise 240 oncology and 260 emergency-department radiologist-reviewed phrase-mask-volume triplets, respectively, with the latter spanning 13 distinct categories such as appendicitis, hematoma, and hernia. We further introduce LocusCT, a 3D visual grounding model trained on this dataset, which achieves hit rates of 0.725 on LocusBench-Onc and 0.773 on LocusBench-ED, substantially outperforming comparator models. These results show that routine PACS annotations are a scalable, previously unused source of supervision for 3D visual grounding.
- Abstract(参考訳): ビジュアルグラウンドモデルは、レポート結果を画像領域にリンクすることで、放射線学のワークフローを強化することができる。
これは3次元CTでは特に有用であり、しばしば体積のごく一部を占める。
3Dグラウンドリングモデルのトレーニングには、ペア化されたフレーズとリージョンの大規模なセットが必要であり、そのようなデータセットの構築にはコストがかかるため、放射線学者は手動で画像に注釈を付ける必要がある。
2Dアノテーション(例えば距離計測、矢印)をキー画像に配置し、計測を行い、レポートの解釈を支援するため、この監視はすでに日常的な報告中に暗黙的に作成されていると仮定する。
本稿では,これらの定期的な臨床アノテーションを3次元視覚的接地のための大規模フレーズ領域監視に変換する自動パイプラインを提案する。
パイプラインはメタデータマッチングを通じて、レポート内の対応する発見とそれぞれのアノテーションをリンクし、2Dアノテーションをボリュームマスクに変換するために、プロンプト可能な3Dセグメンテーションモデルを使用する。
これは、追加のラジオロジストアノテーションを必要とせずに、フレーズマスクボリュームデータセットを生成する。
腹腔鏡下CT検査にて,1施設の臨床画像アーカイブ・コミュニケーションシステム(PACS)に適用し,105Kのフレーズマスクボリュームトリプレットを作成した。
また,2つの腹部CTグラウンドニングベンチマーク, LocusBench-Onc と LocusBench-ED も導入した。
さらに、このデータセットでトレーニングされた3DビジュアルグラウンドモデルであるLocusCTを導入し、LocusBench-Oncで0.725、LocusBench-EDで0.773のヒット率を達成した。
これらの結果から,PACSアノテーションは拡張性があり,以前は使われていなかった3次元視覚的グラウンドの監督源であることがわかった。
関連論文リスト
- Anatomy-Grounded Synthetic Coronary Angiography for Geometry-Informed Multi-View Matching [6.620961894485603]
本稿では3D冠動脈CT血管造影(CCTA)ボリュームから高忠実度デジタル再構成ラジオグラフィ(DRR)を合成する物理地上データ生成フレームワークを提案する。
我々のフレームワークは,患者解剖学における現実的なC-アームの獲得形状を人的コストゼロでシミュレートすることにより,高密度で高精度な3D-to-2Dプロジェクションラベルを生成する。
評価が主観的人間のアノテーションに依存する実際の血管造影とは違って、我々のデータセットは2D対応ラベルとペア画像を提供し、人間の自由な評価を可能にしている。
論文 参考訳(メタデータ) (2026-06-26T14:58:23Z) - 3DLAND: 3D Lesion Abdominal Anomaly Localization Dataset [8.974431489804337]
3DLANDは,肝,膵,腎臓,脾臓,胃,胆嚢の7臓器に関連し,6,000以上の造影CT量と20,000以上の高忠実度3D病変アノテーションを併用した大規模ベンチマークデータセットである。
このパイプラインは, 自動空間推論, プロンプト最適化2次元セグメンテーション, メモリ誘導3次元伝搬を統合し, サーフェススコア0.75を超える専門的放射線学者による検証を行った。
我々のデータセットは、臓器を意識した3Dセグメンテーションモデルを評価するための新しいベンチマークを確立し、医療指向AIの進歩の道を開く。
論文 参考訳(メタデータ) (2026-02-13T11:08:15Z) - Opportunistic Promptable Segmentation: Leveraging Routine Radiological Annotations to Guide 3D CT Lesion Segmentation [4.014618722322392]
臨床画像アーカイブ・通信システム(PACS)では大量のCT画像と報告が容易に利用可能である
クリティカルな発見の3Dセグメンテーションは、一般的には放射線技師による広範囲な手作業による注釈を必要とする。
スパースアノテーションをCTボリュームの3次元セグメンテーションに変換するために設計された,最初のプロンプト可能なセグメンテーションモデルを提案する。
論文 参考訳(メタデータ) (2026-01-30T20:59:53Z) - ReXGroundingCT: A 3D Chest CT Dataset for Segmentation of Findings from Free-Text Reports [23.716614736159034]
ReXGroundingCTは,胸部CTスキャンにおいて,自由テキスト所見とピクセルレベルの3Dセグメンテーションをリンクする最初の公開データセットである。
データセットには、CT-RATEの標準化された放射線学レポートと組み合わせた3,142個の非コントラスト胸部CTスキャンが含まれている。
約79%が焦点異常、21%が非焦点性である。
論文 参考訳(メタデータ) (2025-07-29T17:27:15Z) - RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis [56.57177181778517]
RadGenome-Chest CTはCT-RATEに基づく大規模3次元胸部CT解釈データセットである。
私たちは、最新の強力なユニバーサルセグメンテーションと大きな言語モデルを活用して、元のデータセットを拡張します。
論文 参考訳(メタデータ) (2024-04-25T17:11:37Z) - Multi-dimension unified Swin Transformer for 3D Lesion Segmentation in
Multiple Anatomical Locations [1.7413461132662074]
3次元病変分割のためのMDU-ST(multi-dimension unified Swin transformer)と呼ばれる新しいモデルを提案する。
ネットワークの性能はDice similarity coefficient(DSC)とHausdorff distance(HD)で内部の3D病変データセットを用いて評価される。
提案手法は, 放射線学および腫瘍成長モデル研究を支援するために, 自動3次元病変セグメンテーションを行うために用いられる。
論文 参考訳(メタデータ) (2023-09-04T21:24:00Z) - On the Localization of Ultrasound Image Slices within Point Distribution
Models [84.27083443424408]
甲状腺疾患は高分解能超音波(US)で診断されることが多い
縦断追跡は病理甲状腺形態の変化をモニタリングするための重要な診断プロトコルである。
3次元形状表現におけるUS画像の自動スライスローカライズのためのフレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-01T10:10:46Z) - Geometry-Aware Attenuation Learning for Sparse-View CBCT Reconstruction [53.93674177236367]
Cone Beam Computed Tomography (CBCT) は臨床画像撮影において重要な役割を担っている。
従来の方法では、高品質な3D CBCT画像の再構成には数百の2次元X線投影が必要である。
これにより、放射線線量を減らすため、スパースビューCBCT再構成への関心が高まっている。
本稿では,この問題を解決するために,新しい幾何対応エンコーダデコーダフレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-26T14:38:42Z) - A unified 3D framework for Organs at Risk Localization and Segmentation
for Radiation Therapy Planning [56.52933974838905]
現在の医療ワークフローは、OAR(Organs-at-risk)のマニュアル記述を必要とする
本研究は,OARローカライゼーション・セグメンテーションのための統合された3Dパイプラインの導入を目的とする。
提案手法は医用画像に固有の3Dコンテキスト情報の活用を可能にする。
論文 参考訳(メタデータ) (2022-03-01T17:08:41Z) - Cylindrical and Asymmetrical 3D Convolution Networks for LiDAR-based
Perception [122.53774221136193]
運転時のLiDARに基づく認識のための最先端の手法は、しばしば点雲を2D空間に投影し、2D畳み込みによって処理する。
自然な対策として、3Dボクセル化と3D畳み込みネットワークを利用する方法がある。
本研究では,3次元幾何学的パターンを探索するために,円筒状分割と非対称な3次元畳み込みネットワークを設計する,屋外LiDARセグメンテーションのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2021-09-12T06:25:11Z) - Revisiting 3D Context Modeling with Supervised Pre-training for
Universal Lesion Detection in CT Slices [48.85784310158493]
CTスライスにおける普遍的病変検出のための3Dコンテキスト強化2D特徴を効率的に抽出するための修飾擬似3次元特徴ピラミッドネットワーク(MP3D FPN)を提案する。
新たな事前学習手法により,提案したMP3D FPNは,DeepLesionデータセット上での最先端検出性能を実現する。
提案された3Dプリトレーニングウェイトは、他の3D医療画像分析タスクのパフォーマンスを高めるために使用できる。
論文 参考訳(メタデータ) (2020-12-16T07:11:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。