論文の概要: Semantically Calibrated Evidence Composition for CT Vision-Language Learning
- arxiv url: http://arxiv.org/abs/2608.00239v1
- Date: Fri, 31 Jul 2026 19:34:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.554576
- Title: Semantically Calibrated Evidence Composition for CT Vision-Language Learning
- Title(参考訳): CTビジョンランゲージ学習のための意味的校正エビデンス構成
- Abstract要約: CT-Reportペアからの学習表現には、全巻のコンテキストと解剖学的特異な証拠を組み合わせる必要がある。
我々は,CT視覚言語学習における意味的校正されたエビデンス構成のためのフレームワークであるSCOPE(Semantic Evidence of comPosed)を提案する。
- 参考スコア(独自算出の注目度): 4.757530530297623
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning transferable representations from CT-report pairs requires combining whole-volume context with anatomy-specific evidence. Existing methods typically emphasize either global CT-report alignment or fine-grained anatomy-level correspondence. Global alignment preserves broad study context but leaves the contribution of localized evidence implicit, whereas anatomy-level alignment explicitly grounds local findings but does not specify how independently represented evidence should interact, acquire study-level meaning, and contribute to a global CT representation. To address this gap, we propose SCOPE (Semantic Calibration Of comPosed Evidence), a framework for semantically calibrated evidence composition in CT vision-language learning. Under organ-specific report supervision, mask-guided queries with fixed anatomical identities extract context-aware organ evidence from shared, uncropped volumetric features, while an unrestricted global query retains access to whole-volume context. The global query then drives Local-Global Coupling to compose the organ evidence into a unified evidence representation. The composed evidence is subsequently calibrated using the diagnostic summary, providing study-level semantic supervision beyond local organ descriptions, and is finally integrated as a controlled residual into a context-preserving whole-volume representation aligned with the complete report. This progressive pathway connects localized evidence with study-level semantics without reducing the CT representation to a predefined set of organs. On CT-RATE and RadChestCT, SCOPE achieves macro AUCs of 85.0 and 72.2, respectively, outperforming the previous SOTA by 7.2 and 4.2, while also yielding substantial gains in linear probing and cross-modal retrieval. These results demonstrate the effectiveness of semantically calibrated evidence composition.
- Abstract(参考訳): CT-Reportペアから転送可能な表現を学習するには、全巻のコンテキストと解剖学的特異な証拠を組み合わせる必要がある。
既存の方法では、大域的なCTレポートアライメントや微粒な解剖学的レベルの対応が強調される。
グローバルアライメントは広い研究の文脈を保っているが、局所的な証拠の寄与を暗黙に残しているが、解剖学的レベルのアライメントは、局所的な発見を明確に根拠としているが、独立に表現された証拠がどのように相互作用すべきかを規定し、研究レベルの意味を取得し、グローバルなCT表現に寄与する。
このギャップに対処するために,CT視覚言語学習において意味的校正されたエビデンスを構成するフレームワークであるSCOPE(Semantic Calibration of composed Evidence)を提案する。
臓器特異的な報告監督の下では、固定された解剖学的同一性を持つマスク誘導クエリは、共有された、クローンされていないボリュームの特徴からコンテキスト認識の臓器証拠を抽出する一方、制限のないグローバルクエリは、全ボリュームコンテキストへのアクセスを保持する。
グローバルクエリはLocal-Global Couplingを駆動し、臓器のエビデンスを統一されたエビデンス表現に構成する。
構成されたエビデンスを診断概要を用いて校正し、局所的な臓器記述を超越した研究レベルのセマンティック・インスペクティブを提供し、最終的に、完全なレポートと整合した文脈保存された全量表現に制御された残留物として統合する。
このプログレッシブパスは、CT表現を事前に定義された臓器の集合に還元することなく、局所的な証拠と研究レベルの意味論を結びつける。
CT-RATE と RadChestCT では、SCOPE は 85.0 と 72.2 のマクロ AUC をそれぞれ達成し、以前の SOTA を 7.2 と 4.2 で上回った。
これらの結果は,意味的校正されたエビデンス構成の有効性を示す。
関連論文リスト
- AnaDiffusion: Anatomically CompositionalLatent Diffusion for Controllable 3D Brain MRI Generation [58.56402940400457]
3次元脳MRIは、医用画像、シミュレーション、および制御可能な解剖学的解析において大きな進歩を遂げた。
本稿では,AnaDiffusionを紹介した。AnaDiffusionは解剖学的に有意な領域に生成過程を分解する,解剖学的に構成された潜在拡散フレームワークである。
AnaDiffusionは明示的な部分資産とグローバルなコヒーレントボリュームの両方を生成し、制御可能な部分編集を可能にする。
論文 参考訳(メタデータ) (2026-08-24T09:16:42Z) - LoRCA: LoRA Cycle Adaptation for Histology to HiP-CT Translation with DINOv3 [3.882636699866806]
本稿では,共有冷凍DINOv3上にモダリティ固有のLoRAアダプタを組み込んだ周期整合型翻訳フレームワークを提案する。
本研究では,Fréchet Inception Distance (FID) と構造的忠実度を用いて相互情報を用いた翻訳品質を評価する。
下流登録ユーティリティの予備的な指標として,手動で調整したHiP-CTと組織学テストペア上でのMatchAnythingの下で,スタイル変換画像が特徴対応性を高めることを発見した。
論文 参考訳(メタデータ) (2026-08-07T15:43:55Z) - Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge [7.277508278429653]
我々は,臓器階層的知識付加型CTレポートフレームワークであるoka-CTを提案する。
OK-CTは,まず,ラジオロジーレポート解析を用いて,自由テキストレポートを臓器条件の知識に変換する。
ステージ1は、微細な臓器条件の監督を通じて、解剖学的根拠をCTの視覚表現に注入する。
Stage2は、組織特異的なレポートエビデンスを使用して、構造化レポート-CTコントラスト学習をガイドする。
論文 参考訳(メタデータ) (2026-07-12T23:09:23Z) - ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training [26.518178155362634]
本稿では,医用ボリューム表現学習のための視覚言語事前学習フレームワークを提案する。
解剖学的知識注入モジュールは,(1)臓器レベルでの構造的前提を組み込んだもの,(2)文レベルの発見と局所的な領域を関連付ける意味的適応的選択的アライメント機構,(3)解剖学的に認知された視覚的特徴と接地されたテキストの手がかりとを効果的に相互作用するための意味的適応的融合モジュールである。
論文 参考訳(メタデータ) (2026-05-30T07:59:21Z) - EXACT: an explainable anomaly-aware vision foundation model for analysis of 3D chest CT [29.0378459959757]
EXACTは3次元胸部CTの異常認識基盤モデルである。
2つの臨床スキャンと放射線学レポートから空間的に解決された表現を学習する。
EXACTは臨床的に関係のあるCTタスクに対して一貫した改善を示す。
論文 参考訳(メタデータ) (2026-04-27T07:57:47Z) - Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts [52.256130375429414]
医用ビジュアルグラウンドリング(MVG)は、フリーテキストラジオグラフィーレポートから関連するフレーズを識別し、医療画像中の対応する領域をローカライズすることを目的としている。
我々は,フレーズ関連医療知識をコンパクトな埋め込みにエンコードする知識強化促進戦略であるKnowMVGを提案する。
この設計は、余分なテキスト推論オーバーヘッドを導入することなく、高レベルな意味理解ときめ細かい視覚知覚を橋渡しする。
論文 参考訳(メタデータ) (2026-04-02T11:31:30Z) - Retrieval-Augmented Anatomical Guidance for Text-to-CT Generation [1.5532758127091075]
本研究では,現実的な推論環境下で意味情報と解剖情報を統合したテキスト・ツー・CT生成のための検索拡張手法を提案する。
CT-RATEデータセットを用いた実験により,検索拡張生成は,テキストのみのベースラインに比べて画像の忠実度と臨床整合性を向上することが示された。
本研究は,容積医用画像合成における意味的条件付けと解剖学的妥当性を橋渡しする,原則的かつスケーラブルな機構を導入する。
論文 参考訳(メタデータ) (2026-03-09T12:27:17Z) - OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis [53.01523944168442]
臨床解釈はスライス駆動の局所特徴と体積駆動の空間表現の両方に依存している。
既存のLVLM(Large Vision-Language Models)は、CTスライスとボリューム理解で断片化されている。
我々は,CTシナリオのための強力な統合スライスボリュームLVLMであるOmniCTを提案する。
論文 参考訳(メタデータ) (2026-02-18T00:42:41Z) - Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images [96.43608872116347]
AnomReasonは4倍のtextbfAnomAgentのような構造化アノテーションを備えた大規模ベンチマーク
AnomReasonとAnomAgentは、AI生成画像の意味的妥当性の測定と改善の基盤となっている。
論文 参考訳(メタデータ) (2025-10-11T14:09:24Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - Cross-Modal Causal Intervention for Medical Report Generation [107.76649943399168]
放射線医学報告生成(RRG)は, コンピュータ支援診断と薬剤指導に不可欠である。
視覚言語的バイアスによる急激な相関により、正確な病変記述の生成は依然として困難である。
我々はCrossModal Causal Representation Learning (CMCRL)という2段階のフレームワークを提案する。
IU-XrayとMIMIC-CXRの実験により、我々のCMCRLパイプラインは最先端の手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2023-03-16T07:23:55Z) - Learning Inductive Attention Guidance for Partially Supervised
Pancreatic Ductal Adenocarcinoma Prediction [73.96902906734522]
膵管腺癌(PDAC)は、アメリカ合衆国で3番目に多いがん死の原因である。
本稿では,全てのトレーニングデータに対して安価な画像レベルのアノテーションが提供され,それらのサブセットに対してのみ,コストのかかるvoxelアノテーションが利用可能となる,部分教師付き設定について考察する。
Inductive Attention Guidance Network (IAG-Net) を提案し、通常の/PDAC分類のためのグローバル画像レベルの分類器と半教師付きPDAC分類のためのローカルボクセルレベルの分類器を共同で学習する。
論文 参考訳(メタデータ) (2021-05-31T08:16:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。