論文の概要: A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans
- arxiv url: http://arxiv.org/abs/2608.21140v1
- Date: Fri, 21 Aug 2026 14:16:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.579503
- Title: A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans
- Title(参考訳): CTスキャンにおける信頼性・聴覚的空間関係検証のためのモジュールエージェント
- Abstract要約: 現代の視覚言語モデル(VLM)は、多くの医療画像タスクにおいて有望な性能を示す。
軸方向CTスライスにおける2値空間関係検証のためのモジュラー医用イメージングエージェントを提案する。
最高の性能のハイブリッド構成は94.1%の精度と94.2%のF1に達し、直接Qwen2-VLよりも42.5ポイント高い精度である。
- 参考スコア(独自算出の注目度): 7.8047270656196766
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable spatial understanding is an important prerequisite for future medical vision-language systems that aim to support radiological report generation and structured image understanding. While modern vision-language models (VLMs) show promising performance on many medical imaging tasks, recent evidence suggests they remain weak in controlled spatial reasoning and often fail to reliably ground spatial relations in image evidence. Given that radiological reasoning hinges on understanding the relative positions of anatomical structures and findings, this spatial weakness poses risks to diagnostic accuracy. We present a modular medical imaging agent for binary spatial relation verification in axial CT slices. Instead of directly predicting spatial answers end-to-end, the system decomposes the task into explicit stages: language parsing, anatomical localization, and deterministic geometric verification. Natural-language queries are converted into structured relation tuples, queried organs are localized with a YOLO-based detector, and the final spatial decision is computed from object centers using deterministic geometric rules. We evaluate the approach on the held-out MIRP spatial QA benchmark and compare it against representative end-to-end VLM baselines. The best-performing hybrid configuration reaches 94.1% accuracy and 94.2% F1, outperforming direct Qwen2-VL prompting by 42.5 percentage points in accuracy, while preserving interpretable intermediate representations and auditable reasoning stages. The results suggest that explicit modular spatial verification can serve as a promising building block for future report-oriented medical imaging agents.
- Abstract(参考訳): 信頼性の高い空間理解は、放射線学的レポート生成と構造化画像理解を支援する将来の医療ビジョン言語システムにとって重要な前提条件である。
現代の視覚言語モデル(VLM)は、多くの医療画像タスクにおいて有望な性能を示すが、最近の証拠は、制御された空間的推論において弱いままであり、しばしば画像証拠において空間的関係を確実に基礎づけることができないことを示唆している。
放射線学的推論が解剖学的構造と所見の相対的な位置の理解に結びついていることを考えると、この空間的弱点は診断精度にリスクをもたらす。
軸方向CTスライスにおける2値空間関係検証のためのモジュラー医用イメージングエージェントを提案する。
言語解析、解剖学的局所化、決定論的幾何学的検証など、空間的回答を終末まで直接予測する代わりに、システムはタスクを明示的な段階に分解する。
自然言語クエリは構造化された関係タプルに変換され、クエリされた臓器はYOLOベースの検出器で局所化され、最終的な空間決定は決定論的幾何規則を用いてオブジェクト中心から計算される。
提案手法をMIRP空間QAベンチマークで評価し,これを代表的エンドツーエンドのVLMベースラインと比較した。
最高の性能のハイブリッド構成は94.1%の精度と94.2%のF1に達し、直接Qwen2-VLよりも42.5ポイント高い精度で、解釈可能な中間表現と監査可能な推論段階を保っている。
以上の結果から,将来の報告指向医用イメージングエージェントのビルディングブロックとして,モジュールの空間的検証が期待できる可能性が示唆された。
関連論文リスト
- Concept-Grounded Reasoning with Prompt-Driven Localization for Interpretable Structured Report Generation [66.62662330558906]
CORALは、空間的接地と概念レベルの監督を統一的な推論プロセスに統合するマルチモーダルフレームワークである。
コーラルは、疾患の局所化とコンセプション・ボトルネックモジュールによる多クラス臨床属性の予測のために、プロンプト駆動型医療セグメンテーションモデルを採用している。
BUS-CoTとIU X線データセットの実験では、診断精度、概念整合性、報告品質が強力な汎用および医療MLLMよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - Bridging Vision Foundation Model Priors with CLIP for Spatial-aware Few-shot Anomaly Detection in Medical Images [48.646448077284276]
本研究では,数発の医用異常検出を効果的に行うためのフレームワークであるSpatial-FADを提案する。
VFM空間先行とCLIPセマンティクスを組み合わせることで病変の局在を改善する。
本手法は,Diceスコアが11.4%,AUCが1.8%以上の平均改善を実現している。
論文 参考訳(メタデータ) (2026-09-11T05:21:01Z) - CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement [3.586844533420584]
本稿では,胸部X線ビジョンランゲージモデル(VLM)であるCARE-Xを紹介する。
CARE-Xは、言語モデリングの目的と協調して訓練された、焦点空間の分類と複合空間の接地ヘッドにより、その生成バックボーンを増強する。
その結果は、4つのレポートジェネレーションベンチマークの大多数における最先端のパフォーマンス、ReXVQAにおける94.0%のVQA精度、および専用の検出ヘッドとほぼ同値な生成空間デコーディングが得られた。
論文 参考訳(メタデータ) (2026-08-04T16:23:39Z) - Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models [3.6659638651482536]
近年の3次元医用視覚言語モデルの進歩により、ボリューム画像やテキストに対する共同推論が可能になった。
これらのモデルが3次元ボリュームから空間的基底解剖学を学習したのか、あるいは主に学習前と言語相関に頼っているのかは、まだ不明である。
我々は3次元CTデータにおける意味空間的推論を評価するためのベンチマークであるCT-SpatialVQAを紹介する。
論文 参考訳(メタデータ) (2026-05-09T08:16:00Z) - MedScribe: Clinically Grounded CT Reporting through Agentic Workflows [13.40306812882295]
視覚言語モデル(VLM)は、自動放射線診断レポート生成の可能性を示している。
我々は,仮説駆動型フレームワークであるMedScribeを紹介し,レポート生成を反復的証拠取得プロセスとして再構築する。
論文 参考訳(メタデータ) (2026-05-03T08:32:40Z) - Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models [62.932580559941414]
VLM(Vision-Language Models)は、しばしば「ハロシン化(hallucinate)」する。
本稿では,静的な出力誤差からモデル計算認知の動的病理へ再キャストし,幻覚を診断するための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2026-03-16T17:20:38Z) - Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers [57.54843029965778]
制御可能な病理画像合成には、空間配置、組織形態、意味的詳細の信頼できる規制が必要である。
In-Context Diffusion Transformer (IC-DiT) は,空間レイアウト,テキスト記述,視覚的埋め込みを統合拡散変換器に組み込んだレイアウト認識生成モデルである。
IC-DiTは既存の方法よりも忠実度が高く、空間制御性が強く、診断の整合性が良くなる。
論文 参考訳(メタデータ) (2026-03-11T06:14:11Z) - S-Chain: Structured Visual Chain-of-Thought For Medicine [81.97605645734741]
S-Chainは,有界ボックスと構造化ビジュアルCoT(SV-CoT)を備えた,12,000のエキスパートアノテートされた医用画像の最初の大規模データセットである。
データセットはさらに16言語をサポートし、幅広い多言語適用性のための合計700万VQAペアをサポートする。
S-Chainは、根拠のある医療推論のための新しいベンチマークを確立し、より信頼性が高く説明可能な医療ビジョン言語モデルへの道を開く。
論文 参考訳(メタデータ) (2025-10-26T15:57:14Z) - RAU: Reference-based Anatomical Understanding with Vision Language Models [26.06602931463068]
視覚言語モデル(VLM)を用いた参照型解剖学的理解のためのフレームワークであるRAUを紹介する。
まず,VLMが参照画像と対象画像の相対的空間的推論により解剖学的領域の同定を学習することを示す。
次に, VLM由来の空間的手がかりをSAM2の細粒度セグメンテーション能力とシームレスに統合できることを実証した。
論文 参考訳(メタデータ) (2025-09-26T14:32:03Z) - PRS-Med: Position Reasoning Segmentation with Vision-Language Model in Medical Imaging [6.411386758550256]
PRS-Medは、視覚言語モデルとセグメンテーション機能を統合し、正確なセグメンテーションマスクとそれに対応する空間推論出力の両方を生成するフレームワークである。
MMRSデータセットは、医療画像における位置推論データの欠如に対処するために、多様な空間的な質問応答ペアを提供する。
論文 参考訳(メタデータ) (2025-05-17T06:42:28Z) - Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding [72.18719355481052]
MRG(Messical Report Grounding)と呼ばれる新しい課題について紹介する。
MRGは医療報告から診断フレーズとその対応する接地箱を直接エンドツーエンドで識別することを目的としている。
マルチモーダルな大規模言語モデルを用いて診断フレーズを予測する,堅牢で信頼性の高いフレームワークである uMedGround を提案する。
論文 参考訳(メタデータ) (2024-04-10T07:41:35Z) - Cross-Modal Causal Intervention for Medical Report Generation [107.76649943399168]
放射線医学報告生成(RRG)は, コンピュータ支援診断と薬剤指導に不可欠である。
視覚言語的バイアスによる急激な相関により、正確な病変記述の生成は依然として困難である。
我々はCrossModal Causal Representation Learning (CMCRL)という2段階のフレームワークを提案する。
IU-XrayとMIMIC-CXRの実験により、我々のCMCRLパイプラインは最先端の手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2023-03-16T07:23:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。