論文の概要: Sparse Concept Channels in Frozen 3D CT Vision Encoders
- arxiv url: http://arxiv.org/abs/2607.20993v1
- Date: Thu, 23 Jul 2026 07:17:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.30856
- Title: Sparse Concept Channels in Frozen 3D CT Vision Encoders
- Title(参考訳): 凍結3次元CTビジョンエンコーダにおけるスパースコンセプトチャネル
- Abstract要約: 大規模な視覚言語モデルは、3D画像の解釈においてますます支配的になりつつある。
まず,3次元胸部視覚言語モデル(Pillar-0)を用いて,凍結した視覚埋め込みを探索した。
i) それぞれの放射線学的発見は, フル機能の分類性能に適合する10個の視覚エンコーダチャネルのスパース/i>セットで符号化されている。
- 参考スコア(独自算出の注目度): 3.9173955300197973
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large vision-language models are becoming increasingly dominant in 3D medical image interpretation, but we rarely know <i>which</i> internal units encode clinical findings or <i>where</i> that information lives in the representation. We first study this on a 3D chest vision-language model (Pillar-0) by probing its frozen vision embeddings. We show that (i) each radiological finding is encoded by a <i>sparse</i> set of ~10 vision-encoder channels that match full-feature classification performance and far exceed a zero-shot text prompting; (ii) turning off the channels tied to one finding, that finding's score collapses while unrelated labels stay stable; and (iii) the same sparse probe <i>replicates</i> on an architecturally unrelated 3D abdominal VLM (Merlin) suggesting a general property of frozen medical encoders. Our training-free concept channel probe (CCP) method, paired with a corpus-derived report template, outperforms published CT-CHAT on clinical efficacy and NLG metrics (F1 0.549 vs. 0.184; BLEU 0.483 vs. 0.373) at 22x lower latency. Our results provide a clear, reproducible characterization of how frozen medical encoders represent findings, demonstrating direct applicability across models.
- Abstract(参考訳): 医用画像の解釈において,大規模視覚言語モデルはますます支配的になりつつあるが,臨床所見を符号化する<i>thei</i>内部単位や,情報表現における<i>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei</i>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei>thei</i>thei>thei</i>the
まず,3次元胸部視覚言語モデル(Pillar-0)を用いて,凍結した視覚埋め込みを探索した。
私たちはそれを示します
i) それぞれの放射線学的発見は, フル機能の分類性能に適合し, ゼロショットテキストのプロンプトをはるかに超える, 〜10個の視覚エンコーダチャネルのスパースセットによって符号化される。
二 発見者の得点が崩壊し、無関係なラベルが安定しているチャンネルを消し去ること。
3) 3次元腹部VLM (Merlin) 上の同じスパースプローブ<i>Replicates</i>を用いて, 凍結医療エンコーダの汎用性を示唆した。
臨床効果のCT-CHATとNLG測定値(F1 0.549 vs. 0.184; BLEU 0.483 vs. 0.373)を22倍低レイテンシで比較した。
以上の結果から,凍結した医療エンコーダが所見を表現し,モデル間で直接適用可能であることを示す。
関連論文リスト
- Frozen Brain-MRI Foundation Models Are Site Fingerprints [0.0]
凍結ファンデーションモデル埋め込みは、オフザシェルフ脳MRI表現としてますます使われている。
私たちは、彼らが実際にエンコードしたものを監査し、そのサイトが表現の大きな、本質的なコンポーネントであることに気付きます。
我々は,凍結脳MRI FM の使用とオープン監査ツールキットの公開を推奨する。
論文 参考訳(メタデータ) (2026-08-10T23:03:21Z) - Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models [30.102620002840904]
3次元CT基礎モデルは、解剖学と病理学の一般化可能な表現を提供することで、日常的な解釈を支援することができる。
胸部CTスキャンの3コホートに10個の凍結CTエンコーダをベンチマークした。
評価状況によってランクが著しく変動するので、普遍的な最先端技術は見つからない。
論文 参考訳(メタデータ) (2026-08-06T12:34:17Z) - Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography [75.7789001619107]
ビジョン言語による事前トレーニングは、汎用医療AIにとって大きな可能性を秘めている。
3つの主要なコンポーネントを特徴とするフレームワークを提案する。
診断対応プロンプト戦略では、トレーニング前の推論ギャップを埋めるために、実際の臨床用語と集約された疾患プロトタイプを用いている。
論文 参考訳(メタデータ) (2026-06-24T08:24:45Z) - DINO-MVR: Multi-View Readout of Frozen DINOv3 for Annotation-Efficient Medical Segmentation [10.929173865297933]
凍結したDINOv3の特徴は,すでに医用セグメンテーションに有用な構造的および境界的手がかりを含んでいる。
アノテーション効率のよい医療セグメンテーションのための多視点読み出しフレームワークであるDINO-MVRを提案する。
論文 参考訳(メタデータ) (2026-05-08T04:13:01Z) - U-VLM: Hierarchical Vision Language Modeling for Report Generation [20.09433657986766]
トレーニングとアーキテクチャの両方において階層型視覚言語モデリングを可能にするU-VLMを提案する。
U-VLMはCT-RATEとAbdomenAtlas 3.0で、スクラッチからトレーニングされた0.1Bデコーダのみを使用して、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-02-28T05:43:11Z) - An Explainable Non-local Network for COVID-19 Diagnosis [37.378584156643825]
新型3次元非局所ネットワーク(NL-RAN)を用いて,COVID-19,コモン肺炎,正常などのCT画像の分類を行った。
ネットワークにはグローバル情報をキャプチャするための非ローカルモジュールが埋め込まれており、3Dアテンションモジュールは病変の詳細に集中するために埋め込まれている。
実験結果から,提案手法は既存手法よりも優れた性能を示した。
論文 参考訳(メタデータ) (2024-08-08T08:35:21Z) - Lung-CADex: Fully automatic Zero-Shot Detection and Classification of Lung Nodules in Thoracic CT Images [45.29301790646322]
コンピュータ支援診断は早期の肺結節の検出に役立ち、その後の結節の特徴づけを促進する。
MedSAMと呼ばれるSegment Anything Modelの変種を用いて肺結節をゼロショットでセグメント化するためのCADeを提案する。
また、放射能特徴のギャラリーを作成し、コントラスト学習を通じて画像と画像のペアを整列させることにより、良性/良性としての結節的特徴付けを行うCADxを提案する。
論文 参考訳(メタデータ) (2024-07-02T19:30:25Z) - CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios [53.94122089629544]
我々は,CT-GLIP(Grounded Language- Image Pretraining with CT scans)を導入する。
本手法は,104臓器にわたる17,702症例を対象に,44,011例の臓器レベルの視覚テキストペアからなるマルチモーダルCTデータセットを用いて訓練し,自然言語を用いて臓器と異常をゼロショットで識別できることを実証した。
論文 参考訳(メタデータ) (2024-04-23T17:59:01Z) - WATUNet: A Deep Neural Network for Segmentation of Volumetric Sweep
Imaging Ultrasound [1.2903292694072621]
ボリューム・スイープ・イメージング(VSI)は、訓練を受けていないオペレーターが高品質な超音波画像をキャプチャできる革新的な手法である。
本稿ではWavelet_Attention_UNet(WATUNet)と呼ばれる新しいセグメンテーションモデルを提案する。
このモデルでは、簡単な接続ではなく、ウェーブレットゲート(WG)とアテンションゲート(AG)をエンコーダとデコーダの間に組み込んで、上記の制限を克服する。
論文 参考訳(メタデータ) (2023-11-17T20:32:37Z) - On the Localization of Ultrasound Image Slices within Point Distribution
Models [84.27083443424408]
甲状腺疾患は高分解能超音波(US)で診断されることが多い
縦断追跡は病理甲状腺形態の変化をモニタリングするための重要な診断プロトコルである。
3次元形状表現におけるUS画像の自動スライスローカライズのためのフレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-01T10:10:46Z) - COVID-19 identification from volumetric chest CT scans using a
progressively resized 3D-CNN incorporating segmentation, augmentation, and
class-rebalancing [4.446085353384894]
新型コロナウイルスは世界的なパンデミックの流行だ。
高い感度のコンピュータ支援スクリーニングツールは、疾患の診断と予後に不可欠である。
本稿では,3次元畳み込みニューラルネットワーク(CNN)に基づく分類手法を提案する。
論文 参考訳(メタデータ) (2021-02-11T18:16:18Z) - Automated Model Design and Benchmarking of 3D Deep Learning Models for
COVID-19 Detection with Chest CT Scans [72.04652116817238]
3D胸部CTスキャン分類のための3D DLモデルを自動的に検索するための差別化可能なニューラルネットワーク探索(DNAS)フレームワークを提案する。
また,我々のモデルのクラスアクティベーションマッピング(cam)技術を利用して,結果の解釈可能性を提供する。
論文 参考訳(メタデータ) (2021-01-14T03:45:01Z) - Learning Hybrid Representations for Automatic 3D Vessel Centerline
Extraction [57.74609918453932]
3次元医用画像からの血管の自動抽出は血管疾患の診断に不可欠である。
既存の方法では、3次元画像からそのような細い管状構造を分割する際に、抽出された容器の不連続に悩まされることがある。
抽出された船舶の連続性を維持するためには、地球的幾何学を考慮に入れる必要があると論じる。
この課題を解決するためのハイブリッド表現学習手法を提案します。
論文 参考訳(メタデータ) (2020-12-14T05:22:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。