論文の概要: Do Medical Vision Models Reason About Anatomy? Probing the Spatial Inductive Biases of Learned Visual Representations
- arxiv url: http://arxiv.org/abs/2608.28092v1
- Date: Fri, 28 Aug 2026 08:59:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.259923
- Title: Do Medical Vision Models Reason About Anatomy? Probing the Spatial Inductive Biases of Learned Visual Representations
- Title(参考訳): 医用視覚モデルでは解剖が問題となるか? : 学習された視覚表現の空間誘導的ビアース
- Authors: Naren Akash, Neeraja Ramanan,
- Abstract要約: 腹腔鏡下腹腔鏡下SPAR-Bench (SPAR-Bench) を作製した。
5つのアーキテクチャ構成と3つの医療基盤モデルに適用し、凍結して微調整します。
これらのエンコーダは、臓器が通常どこにあるかの地図を持ち、特定の患者の構造を比較するための機械をほとんど持っていないことを示唆している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Interpreting a CT scan means comparing structures on either side, judging how far apart organs sit, and knowing where each one belongs. Medical vision encoders are evaluated on diagnostic accuracy, or through assembled multimodal systems where a failure is hard to attribute, so it remains unclear whether their representations support any of this. We construct SPAR-Bench, eight probes over multi-organ abdominal CT that separate coordinate localization, relational reasoning, and spatial queries, and apply them to five architectural configurations and three medical foundation models, frozen and finetuned. Probes that ask for a comparison within the slice stay at chance, and neither pretraining scale, finetuning, nor architecture closes the gap. Probes that appear solved in domain fall to chance under zero-shot transfer, indicating that their accuracy reflects recall of canonical anatomy rather than computation over the image. Reading the same frozen features with a pooled head rather than the full set of tokens moves relational recovery from 0.7% to 67.8%, so pooled probing understates what a representation holds. Questions the encoders answer well are answered at chance by four open-weight MLLMs. Our results suggest these encoders carry a map of where organs usually lie, and little of the machinery for comparing structures within a particular patient. Code and data will be available at https://spar-bench.github.io.
- Abstract(参考訳): CTスキャンを解釈することは、両側の構造を比較し、臓器がどれくらい離れているかを判断し、それぞれがどこにいるかを知ることを意味する。
医用視覚エンコーダは、診断精度や、故障が原因とならない組立マルチモーダルシステムを通じて評価されるため、これらの表現がこれをサポートするかどうかは不明である。
SPAR-Benchは,多臓器腹部CT上の8つのプローブで,座標定位,関係推論,空間的クエリを分離し,それらを5つのアーキテクチャ構成と3つの医療基盤モデルに適用し,凍結・微調整する。
スライス内の比較を求めるプローブは偶然に留まり、事前訓練されたスケールや微調整、アーキテクチャがギャップを埋めることはない。
領域内で解かれたプローブはゼロショット転送で偶然に落下し、その精度が画像上の計算よりも正準解剖学のリコールを反映していることを示す。
トークンの完全なセットではなく、プールされた頭で同じ凍結した特徴を読み取ると、リレーショナルリカバリは0.7%から67.8%に移動する。
エンコーダがうまく答える質問は、4つのオープンウェイトMLLMによって答えられる。
これらのエンコーダは、臓器が通常どこにあるかの地図を持ち、特定の患者の構造を比較するための機械をほとんど持っていないことを示唆している。
コードとデータはhttps://spar-bench.github.io.comで入手できる。
関連論文リスト
- Frozen Brain-MRI Foundation Models Are Site Fingerprints [0.0]
凍結ファンデーションモデル埋め込みは、オフザシェルフ脳MRI表現としてますます使われている。
私たちは、彼らが実際にエンコードしたものを監査し、そのサイトが表現の大きな、本質的なコンポーネントであることに気付きます。
我々は,凍結脳MRI FM の使用とオープン監査ツールキットの公開を推奨する。
論文 参考訳(メタデータ) (2026-08-10T23:03:21Z) - Self-supervision drives representational convergence in medical foundation models more than clinical supervision [2.8356496885865017]
画像18枚とテキストエンコーダ7枚を対象とし,7Mから27Bのパラメータと5つの画像モダリティにまたがる全オープンウェイトでローカルに実行した。
我々は、固定データ、アーキテクチャ、スケールの目的のみが異なるエンコーダを訓練し、その効果を合成モデルで再現する。
収束性は軽度だが、ランダムな床の上にあり、自己監督目的によって駆動され、臨床監督ではない。
論文 参考訳(メタデータ) (2026-07-22T15:25:05Z) - A Vision-language Framework for Comparative Reasoning in Radiology [68.52471827773482]
我々は,放射線学的比較を実体認識のクロスイメージ推論問題として定式化する。
我々は,日常的な画像とレポートのペアから得られた大規模比較画像資源を構築した。
臨床類似症例の検索を制御可能なエンティティ対応ビジュアルエンコーダであるMedReCoを開発した。
論文 参考訳(メタデータ) (2026-06-04T17:12:47Z) - SAMe: A Semantic Anatomy Mapping Engine for Robotic Ultrasound [60.64817443833982]
本稿では,ロボット超音波に解剖学的先行層を明示する意味解剖マッピングエンジンSAMeを提案する。
SAMeはスキャン開始をターゲット・トゥ・アノプティ・トゥ・アクションのプロセスとして扱う。
単一の外部画像から、接地対象に対する患者固有の解剖学的表現をインスタンス化する。
論文 参考訳(メタデータ) (2026-04-28T13:44:09Z) - Med-Query: Steerable Parsing of 9-DoF Medical Anatomies with Query Embedding [14.901279446640393]
我々は,CTスキャンにおける解剖の検出,識別,セグメント化のための,安定かつ堅牢で効率的な計算フレームワークを提案する。
解剖学の複雑な形状、大きさ、配向を考えると、完全な3次元空間における9自由度(9-DoF)のポーズ推定解が提示される。
胸骨,脊椎,腹部臓器の3つの画像解析作業について,本法の有効性を検証した。
論文 参考訳(メタデータ) (2022-12-05T04:04:21Z) - Attentive Symmetric Autoencoder for Brain MRI Segmentation [56.02577247523737]
視覚変換器(ViT)をベースとした3次元脳MRIセグメンテーションタスクのための新しいアテンテーティブシンメトリオートエンコーダを提案する。
事前学習の段階では、提案するオートエンコーダがより注意を払って、勾配測定値に従って情報パッチを再構築する。
実験の結果,提案手法は最先端の自己教師付き学習法や医用画像分割モデルよりも優れていた。
論文 参考訳(メタデータ) (2022-09-19T09:43:19Z) - Weakly-supervised Biomechanically-constrained CT/MRI Registration of the
Spine [72.85011943179894]
本稿では,各脊椎の剛性と容積を保存し,登録精度を最大化しながら,弱教師付き深層学習フレームワークを提案する。
また,CTにおける椎体自動分節化はMRIと対比してより正確な結果をもたらすため,CTラベルマップのみに依存するよう,これらの損失を特に設計する。
以上の結果から, 解剖学的認識による損失の増大は, 精度を維持しつつも, 推測変換の妥当性を高めることが示唆された。
論文 参考訳(メタデータ) (2022-05-16T10:59:55Z) - Chest x-ray automated triage: a semiologic approach designed for
clinical implementation, exploiting different types of labels through a
combination of four Deep Learning architectures [83.48996461770017]
本研究では,異なる畳み込みアーキテクチャの後期融合に基づく深層学習手法を提案する。
公開胸部x線画像と機関アーカイブを組み合わせたトレーニングデータセットを4つ構築した。
4つの異なるディープラーニングアーキテクチャをトレーニングし、それらのアウトプットとレイトフュージョン戦略を組み合わせることで、統一されたツールを得ました。
論文 参考訳(メタデータ) (2020-12-23T14:38:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。