論文の概要: Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models
- arxiv url: http://arxiv.org/abs/2608.05960v1
- Date: Thu, 06 Aug 2026 12:34:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.902066
- Title: Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models
- Title(参考訳): ビッグ、ライト、インヴィジブル:3DCT基礎モデルの凍結機能ベンチマーク
- Authors: Maulik Chevli, Johannes Brandt, Rickmer Braren, Daniel Rueckert, Philip Müller,
- Abstract要約: 3次元CT基礎モデルは、解剖学と病理学の一般化可能な表現を提供することで、日常的な解釈を支援することができる。
胸部CTスキャンの3コホートに10個の凍結CTエンコーダをベンチマークした。
評価状況によってランクが著しく変動するので、普遍的な最先端技術は見つからない。
- 参考スコア(独自算出の注目度): 30.102620002840904
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Routine CT interpretation is inherently comprehensive, capturing incidental findings across the entire scan volume. 3D CT foundation models could assist this process by providing generalizable representations of anatomy and pathology. To evaluate their diagnostic breadth, we benchmark ten frozen CT encoders across three cohorts of thoracic CT scans, including an unseen internal clinical dataset, using $k$-nearest neighbors, zero-shot prompting, and linear probing. We find no universal state-of-the-art, with rankings fluctuating significantly depending on the evaluation context. While models combining fine-grained image tokenization with vision-language alignment generally perform best, a lightweight supervised encoder remains highly competitive, demonstrating that explicit labels can effectively substitute for scale. Crucially, rather than model architecture, we observe that the primary determinant of performance is a physical bottleneck: a finding's detectability scales with its contrast against surrounding tissue and its spatial extent. Through controlled within-organ comparisons, we empirically demonstrate that widespread or high-contrast abnormalities, such as devices and effusions, are reliably recovered. Conversely, small, low-contrast focal lesions remain a persistent challenge across all evaluated encoders. We attribute this to the inherent limitations of globally pooled embeddings, suggesting that accurately representing small, low-contrast structures will require region- or lesion-level pretraining.
- Abstract(参考訳): ルーチンCTの解釈は本質的に包括的であり、スキャンボリューム全体にわたって偶発的な結果を捉えている。
3次元CT基盤モデルは、解剖学と病理学の一般的な表現を提供することで、このプロセスを支援することができる。
診断範囲を評価するため, 胸部CTスキャンの3つのコホートに10個の凍結CTエンコーダをベンチマークし, 内科的データセットをk$-nearest neighbors, zero-shot prompting, linear probingを用いて検討した。
評価状況によってランクが著しく変動するので、普遍的な最先端技術は見つからない。
微粒な画像トークン化と視覚言語アライメントを組み合わせるモデルは一般的には最適であるが、軽量な教師付きエンコーダは競争力が高く、明示的なラベルが効果的にスケールに取って代わることができることを示した。
重要なことに、我々はモデルアーキテクチャではなく、パフォーマンスの主要な決定要因が物理的ボトルネックであると考えている。
組織内比較の制御を通じて,装置や溶出などの広範囲あるいは高コントラスト異常が確実に回復できることを実証的に実証した。
逆に、小さくて低コントラストの焦点障害は、すべての評価エンコーダにおいて永続的な課題である。
我々はこれを,世界規模でプールされた埋め込みの固有の制限によるものとみなし,小さな低コントラスト構造を正確に表現するには,領域レベルの事前トレーニングが必要であることを示唆している。
関連論文リスト
- Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography [10.665332135327205]
ボリュームCT表現を学習する共同埋め込み予測フレームワークであるRad-JEPA 3Dを紹介する。
中間表現の質を向上させるために,隠れ状態直交正規化(HSOR)を提案する。
HSORは、生徒と教師の隠れ状態を調整し、エンコーダ全体の特徴冗長性を減少させる。
論文 参考訳(メタデータ) (2026-07-28T19:00:17Z) - 3D Ultrasound-Derived Pseudo-CT Synthesis Using a Transformer-Augmented Residual Network for Real-Time Operator Guidance [0.0]
超音波(US)は非イオン化であり、広くアクセス可能であるが、操作性が高く、定量的な組織特性が欠如している。
本研究は,USから推定されるCTのような解剖学的基準量を生成する3D超音波による擬似CTフレームワークを提案する。
提案手法は, 構造的忠実度と知覚的画像品質において, 確立されたベースラインより優れる。
論文 参考訳(メタデータ) (2026-05-06T12:52:59Z) - EXACT: an explainable anomaly-aware vision foundation model for analysis of 3D chest CT [29.0378459959757]
EXACTは3次元胸部CTの異常認識基盤モデルである。
2つの臨床スキャンと放射線学レポートから空間的に解決された表現を学習する。
EXACTは臨床的に関係のあるCTタスクに対して一貫した改善を示す。
論文 参考訳(メタデータ) (2026-04-27T07:57:47Z) - PHASOR: Anatomy- and Phase-Consistent Volumetric Diffusion for CT Virtual Contrast Enhancement [60.81732730684265]
本稿では,高忠実度仮想コントラスト拡張(VCE)のための体積拡散フレームワークPHASORを紹介する。
我々は、CTボリュームをコヒーレントシーケンスとして扱うことにより、ビデオ拡散モデルを利用して、構造的コヒーレンスとボリューム精度を向上させる。
まず, 解剖学的意味論に固有の拡張パターンを固定し, 臓器特異的なメモリを付加して, より詳細な情報を収集する。
第二に、インテンシティ・フェイズ・アウェアメント・アライメント・アライメント(IP-REPA)は、不完全な空間アライメントの影響を緩和しつつ、複雑なコントラスト信号を強調する。
論文 参考訳(メタデータ) (2026-04-01T15:57:18Z) - Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers [57.54843029965778]
制御可能な病理画像合成には、空間配置、組織形態、意味的詳細の信頼できる規制が必要である。
In-Context Diffusion Transformer (IC-DiT) は,空間レイアウト,テキスト記述,視覚的埋め込みを統合拡散変換器に組み込んだレイアウト認識生成モデルである。
IC-DiTは既存の方法よりも忠実度が高く、空間制御性が強く、診断の整合性が良くなる。
論文 参考訳(メタデータ) (2026-03-11T06:14:11Z) - Organ-Aware Attention Improves CT Triage and Classification [0.7901846308308808]
市販のビジョン言語モデルは、3D解剖、プロトコルシフト、ノイズの多いレポート管理に苦しむ。
本研究は,CT-RATEとRADCHEST-CTの2つの胸部CTデータセットを用いた。
本稿では,Organ-Masked AttentionとOrgan-Scalar Fusionを組み合わせたエンコーダに依存しない臓器認識ヘッドORACLE-CTを提案する。
論文 参考訳(メタデータ) (2026-01-19T20:37:45Z) - Unified Supervision For Vision-Language Modeling in 3D Computed Tomography [1.4193731654133002]
汎用視覚言語モデル(VLM)は放射線学において有望なツールとして登場し、ゼロショット機能を提供している。
診断放射線学のような高度な領域では、これらのモデルは信頼できる臨床使用に必要な識別精度を欠いていることが多い。
分類ラベルやセグメンテーションマスクにエンコードされた多種多様な監視信号を統合するボリュームVLMであるUniferumを,単一のトレーニングフレームワークに導入する。
論文 参考訳(メタデータ) (2025-09-01T15:30:17Z) - Rethinking Whole-Body CT Image Interpretation: An Abnormality-Centric Approach [57.86418347491272]
全身に404例の異常所見を呈する包括的階層分類システムを提案する。
複数平面および全人体領域からの14.5K以上のCT画像を含むデータセットを寄贈し,19K以上の異常に対する接地アノテーションを念頭に提供した。
OminiAbnorm-CTは,テキストクエリに基づいて,多面的および全身的なCT画像に異常な所見を自動的に検出し,記述することができる。
論文 参考訳(メタデータ) (2025-06-03T17:57:34Z) - Reliable Joint Segmentation of Retinal Edema Lesions in OCT Images [55.83984261827332]
本稿では,信頼性の高いマルチスケールウェーブレットエンハンストランスネットワークを提案する。
本研究では,ウェーブレット型特徴抽出器ネットワークとマルチスケール変圧器モジュールを統合したセグメンテーションバックボーンを開発した。
提案手法は,他の最先端セグメンテーション手法と比較して信頼性の高いセグメンテーション精度を実現する。
論文 参考訳(メタデータ) (2022-12-01T07:32:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。