論文の概要: Decouple and Reason: Anatomically Guided Two-Stage Voxel-Level Grounding of Free-Text Findings in 3D Chest CT
- arxiv url: http://arxiv.org/abs/2607.12602v1
- Date: Tue, 14 Jul 2026 10:26:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.117498
- Title: Decouple and Reason: Anatomically Guided Two-Stage Voxel-Level Grounding of Free-Text Findings in 3D Chest CT
- Title(参考訳): 解剖学的にガイドされた2段階Voxel-Level Groundingによる3次元胸部CT所見の検討
- Abstract要約: 3次元胸部CT(CT)における自由テキスト所見の接地は臨床的解釈に重要である。
そこで本研究では,この問題を,クラス非依存的病変セグメント化とテキストボリューム推論という,2つの特殊な段階に分離する,新たな分離フレームワークを提案する。
本手法は, 公式のリーダーボード上での総合的な基礎品質において, 最先端の性能を実現する。
- 参考スコア(独自算出の注目度): 4.758987047240808
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic voxel-level grounding of free-text findings in 3D chest Computed Tomography (CT) is critical for clinical interpretability. However, this task remains highly challenging due to the intricate spatial complexity of large 3D volumes and the heterogeneity of free-text findings. Existing end-to-end approaches often struggle to simultaneously learn the localized feature representations required for accurate 3D segmentation and the complex semantic understanding needed for text alignment, leading to suboptimal grounding performance. To overcome this fundamental limitation, we propose a novel decoupled framework that disentangles the problem into two specialized stages: (1) class-agnostic lesion segmentation and (2) text-volume reasoning. This structural separation allows the model to first extract candidate sub-volumes by localizing potential abnormalities. Subsequently, intensive cross-modal reasoning is performed to align these localized sub-volumes with free-text medical findings. To resolve the spatial ambiguities inherent in local regions, the reasoning module is augmented with explicit anatomical guidance, utilizing relative spatial coordinates and lung lobe priors. Evaluated on the ReXGroundingCT benchmark, our method achieves state-of-the-art performance in overall grounding quality on the official leaderboard. These results demonstrate that decoupling detection from reasoning is a highly effective paradigm for handling the complexity of 3D medical visual grounding. Our code is publicly available at https://github.com/khuhm/DAGG.
- Abstract(参考訳): 3D chest Computed Tomography (CT) におけるvoxel-level grounding は臨床的解釈に重要である。
しかし, この課題は, 大規模3次元ボリュームの複雑な空間的複雑さと自由テキストの異質性のため, 依然として困難な課題である。
既存のエンドツーエンドアプローチでは、正確な3Dセグメンテーションに必要な局所的な特徴表現と、テキストアライメントに必要な複雑な意味理解を同時に学習するのに苦労することが多い。
この基本的な限界を克服するために,(1)分類に依存しない病変のセグメンテーションと(2)テキストボリューム推論という2つの特殊な段階に分解する新しい分離フレームワークを提案する。
この構造的分離により、モデルはポテンシャル異常を局在させることで、まず候補サブボリュームを抽出することができる。
その後、これらの局所化サブボリュームをフリーテキストの医療所見と整合させるため、集中的なクロスモーダル推論を行う。
局所領域に固有の空間的曖昧性を解決するために、相対的な空間座標と肺葉前駆体を利用して、明確な解剖学的ガイダンスで推論モジュールを拡張する。
ReXGroundingCTベンチマークで評価したところ,本手法は,公式のリーダボード上での全体的なグラウンドニング品質において,最先端のパフォーマンスを実現している。
これらの結果から,3次元医用視覚グラウンドの複雑化に対処するためには,推論からの分離検出が極めて有効なパラダイムであることが示唆された。
私たちのコードはhttps://github.com/khuhm/DAGG.comで公開されています。
関連論文リスト
- AnaDiffusion: Anatomically CompositionalLatent Diffusion for Controllable 3D Brain MRI Generation [58.56402940400457]
3次元脳MRIは、医用画像、シミュレーション、および制御可能な解剖学的解析において大きな進歩を遂げた。
本稿では,AnaDiffusionを紹介した。AnaDiffusionは解剖学的に有意な領域に生成過程を分解する,解剖学的に構成された潜在拡散フレームワークである。
AnaDiffusionは明示的な部分資産とグローバルなコヒーレントボリュームの両方を生成し、制御可能な部分編集を可能にする。
論文 参考訳(メタデータ) (2026-08-24T09:16:42Z) - Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography [10.665332135327205]
ボリュームCT表現を学習する共同埋め込み予測フレームワークであるRad-JEPA 3Dを紹介する。
中間表現の質を向上させるために,隠れ状態直交正規化(HSOR)を提案する。
HSORは、生徒と教師の隠れ状態を調整し、エンコーダ全体の特徴冗長性を減少させる。
論文 参考訳(メタデータ) (2026-07-28T19:00:17Z) - Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models [8.949206640442354]
本稿では,新しいスライスワイズデータ合成パラダイムを用いて構築した大規模構造化推論データセットを提案する。
放射線技師の真の診断ワークフローに触発されたこのパラダイムは、複雑な3D読み取りプロセスを分解して視覚認知をモデル化する。
この戦略は、計算に高価な3D特化事前学習を必要とせずに、深いボリューム理解と高度に解釈可能な臨床論理を解き放つ。
論文 参考訳(メタデータ) (2026-07-15T14:05:58Z) - Topology-Driven Transferability Estimation for 3D Medical Vision Foundation Models [24.834339924064505]
3次元医用画像における高密度予測タスクのためのボクセル・ワイド・フレームワークを提案する。
本フレームワークは,高密度特徴のスパース1-スケルトン幾何グラフと意味ラベルとのアライメントから,転送可能性を直接推定する。
本フレームワークは,平均重み付きケンドール(0.36)を56倍の速度で評価しながら,最先端の転写性評価を実現する。
論文 参考訳(メタデータ) (2026-07-05T09:45:18Z) - FDR-Occ: Factorized Dense Routing for Full-Spectrum 3D Occupancy Prediction [63.738631229597274]
視覚に基づく3次元占有予測は、基本的に2次元から3次元のビュー変換に依存している。
現在のパラダイムは、厳密でスパースなカメラ線にルーティング行列を人工的に制限する明示的な物理射影を主に利用している。
本稿では,このボトルネックを解消するためにFDR(Facterized Dense Routing)を提案する。
本フレームワークは,Occ3D-nuScenesおよびOcc3D-Waymoベンチマークの最先端性能を実現する。
論文 参考訳(メタデータ) (2026-07-04T11:12:42Z) - GLeVE: Graph-Guided Lesion Grounding with Proposal Verification in 3D CT [16.979389238358937]
臨床診断には3次元CTボリュームへの地中X線検査報告の記載が不可欠である。
既存のレポート支援および視覚言語基底法は、フレーズレベルのアライメントや高密度画素監督に依存している。
解剖学的事前検証とオクツリーによる自己回帰的改善を併用したグラフ誘導型病変基盤フレームワークであるGLeVEを提案する。
論文 参考訳(メタデータ) (2026-05-21T15:30:41Z) - AGA3DNet: Anatomy-Guided Gaussian Priors with Multi-view xLSTM for 3D Brain MRI Subtype Classification [6.425977576228159]
AGA3DNetは,放射線学報告から抽出した短い解剖学的フレーズを軟解剖学的先行チャネルとして組み込んだ報告基盤フレームワークである。
AGA3DNetは、パフォーマンス指標間の全体的なバランスを改善し、前回のチャネルを通じて臨床解釈可能なローカライゼーションをサポートする。
論文 参考訳(メタデータ) (2026-05-08T02:21:26Z) - Align then Refine: Text-Guided 3D Prostate Lesion Segmentation [5.284052813431228]
体積法は、解剖学的整合性を確保しながら複数のモードを組み合わせる必要がある。
現在のモデルは、クロスモーダル情報を確実に統合するのに苦労している。
3つの重要なイノベーションを取り入れた新しいマルチエンコーダU-Netアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-04-20T18:13:52Z) - Preoperative-to-intraoperative Liver Registration for Laparoscopic Surgery via Latent-Grounded Correspondence Constraints [51.7011449975586]
Land-Regは変形可能な登録フレームワークで、潜伏した2D-3Dのランドマーク対応を学習する。
厳格な登録のために、Land-Regはクロスモーダルラテントアライメントモジュールを採用している。
類似性マッチングを持つ不確実なオーバーラップランドマーク検出器を提案し, 明確な2D-3Dランドマーク対応を強く推定する。
論文 参考訳(メタデータ) (2026-03-02T10:44:03Z) - MOSAIC: A Multi-View 2.5D Organ Slice Selector with Cross-Attentional Reasoning for Anatomically-Aware CT Localization in Medical Organ Segmentation [0.8747606955991707]
既存の3Dセグメンテーションアプローチは計算的かつメモリ集約的であり、多くの場合、多くの解剖学的に無関係なスライスを含む全ボリュームを処理する。
セグメント化に先立って入力量を削減できる新しい解剖学的スライスセレクタパイプラインを提案する。
提案モデルでは, 構造的関連性の高いスライスを選択的に保持する多視点表現を前提として, 解剖学的局所化の「専門家」として機能する。
論文 参考訳(メタデータ) (2025-05-15T19:32:28Z) - GOI: Find 3D Gaussians of Interest with an Optimizable Open-vocabulary Semantic-space Hyperplane [53.388937705785025]
3Dオープンボキャブラリのシーン理解は、拡張現実とロボット応用の推進に不可欠である。
GOIは2次元視覚言語基礎モデルから3次元ガウススプラッティング(3DGS)に意味的特徴を統合するフレームワークである。
提案手法では,特徴空間内の超平面分割として特徴選択処理を扱い,クエリに関連性の高い特徴のみを保持する。
論文 参考訳(メタデータ) (2024-05-27T18:57:18Z) - Pairwise-Constrained Implicit Functions for 3D Human Heart Modelling [60.56741715207466]
我々は、心を相互依存型SDFの集合としてモデル化するペアワイズ拘束型SDFアプローチを導入する。
本手法は, 単SDF, UDF, ボクセルベース, セグメンテーションベースを用いて, 内部構造精度を大幅に向上させる。
論文 参考訳(メタデータ) (2023-07-16T10:07:15Z) - KTN: Knowledge Transfer Network for Learning Multi-person 2D-3D
Correspondences [77.56222946832237]
画像中の複数の人物の密着度を検出するための新しい枠組みを提案する。
提案手法は知識伝達ネットワーク(KTN)の2つの問題に対処する。
特徴解像度を同時に維持し、背景画素を抑圧し、この戦略は精度を大幅に向上させる。
論文 参考訳(メタデータ) (2022-06-21T03:11:37Z) - Delving into Localization Errors for Monocular 3D Object Detection [85.77319416168362]
単眼画像から3Dバウンディングボックスを推定することは、自動運転に不可欠な要素です。
本研究では, 各サブタスクがもたらす影響を定量化し, 局所化誤差を求めることが, モノクロ3次元検出の抑制に欠かせない要因である。
論文 参考訳(メタデータ) (2021-03-30T10:38:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。