論文の概要: SentZero: An Enhanced Sentence-Centric Vision-Language Pretraining for Multi-Task Zero-Shot Chest X-Ray Analysis
- arxiv url: http://arxiv.org/abs/2609.34479v1
- Date: Mon, 28 Sep 2026 07:33:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 13:13:41.366581
- Title: SentZero: An Enhanced Sentence-Centric Vision-Language Pretraining for Multi-Task Zero-Shot Chest X-Ray Analysis
- Title(参考訳): SentZero:マルチタスクゼロショット胸部X線解析のための拡張センス中心視線前処理
- Abstract要約: 胸部X線(CXR)画像とX線画像を用いたVL事前訓練は,医用画像理解に有意な可能性を示唆している。
既存の方法は、ラジオロジー報告が長く、臨床的に密度が高く、単純なゼロショットプロンプトと整合が難しいため、タスク固有の微調整に依存していることが多い。
最近の文レベルアプローチは、大言語モデル(LLM)から抽出された臨床用語を用いて、この制限に部分的に対処している。
ゼロショット・マルチタスクCXR解析のための拡張文中心のVL事前学習フレームワークであるSentZeroを提案する。
- 参考スコア(独自算出の注目度): 48.03854427778655
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language (VL) pretraining using paired chest X-ray (CXR) images and radiology reports has shown strong potential for medical image understanding. However, existing methods often remain dependent on task-specific finetuning because radiology reports are lengthy, clinically dense, and difficult to align with simple zero-shot prompts. Recent sentence-level approaches partially address this limitation using clinical phrases extracted by large language models (LLMs), but they largely overlook the intrinsic characteristics of radiology discourse. In particular, limited positive-pair diversity constrains further gains, while clinically equivalent sentences frequently recur across patients, creating false negatives in contrastive learning. To address these issues, we propose SentZero, an enhanced sentence-centric VL pretraining framework for zero-shot, multi-task CXR analysis. SentZero introduces LLM-based abstract-level sentence structuring and mapping to expand positive-pair diversity, together with an additional loss term to mitigate false negatives. We further introduce sentence-conditioned residual modulation of visual embeddings, enabling visual features to adapt to the semantic characteristics of each input sentence. Across diverse downstream tasks and datasets, SentZero improves zero-shot generalization and outperforms prior multi-task zero-shot methods.
- Abstract(参考訳): 胸部X線(CXR)画像とX線画像を用いたVL事前訓練は,医用画像理解に有意な可能性を示唆している。
しかし、ラジオグラフィー報告は長く、臨床的に密度が高く、単純なゼロショットプロンプトと整合が難しいため、既存の手法はタスク固有の微調整に依存していることが多い。
近年の文レベルのアプローチは,大言語モデル(LLM)から抽出した臨床用語を用いて,この制限に部分的に対処するが,その内在的特徴を概ね見落としている。
特に、ポジティブ・ペアの多様性の制限はさらに増加し、臨床的に等価な文は患者間で頻繁に再帰し、対照的な学習において偽陰性を生み出す。
これらの問題に対処するために、ゼロショットマルチタスクCXR解析のための拡張文中心のVL事前学習フレームワークであるSentZeroを提案する。
SentZeroは、LLMに基づく抽象レベルの文構造とマッピングを導入し、ポジティブペアの多様性を拡大し、偽陰性を緩和するための損失項を追加した。
さらに,視覚的特徴が各入力文の意味的特徴に適応できるように,文条件による視覚的埋め込みの残差変調を導入する。
さまざまなダウンストリームタスクやデータセットにわたって、SentZeroはゼロショットの一般化を改善し、以前のマルチタスクゼロショットメソッドより優れている。
関連論文リスト
- Concept-Guided Noisy Negative Suppression for Zero-Shot Classification and Grounding of Chest X-Ray Findings [24.28276094444468]
胸部X線と放射線学報告を用いた視覚言語アライメントは、ゼロショット分類とグラウンド化の高度なパラダイムとして登場した。
標準的なコントラスト学習は、通常、異なる患者からのX線写真とレポートを単に負のペアとして扱う。
我々は,概念誘導雑音抑圧フレームワークであるCNNSを提案する。
論文 参考訳(メタデータ) (2026-05-19T05:19:45Z) - KEPIL: Knowledge-Enhanced Prompt-Image Learning for Prompt-Robust Disease Detection [6.447908430647854]
放射線学的所見は、実際には長い尾を持つが、いくつかの条件は表現されておらず、ゼロショット推論が不可欠である。
我々は、ゼロショットの一般化を安定させるために、キュレートされた医療知識を統合するプロンプトロバストフレームワークであるtextitKEPILを提案する。
論文 参考訳(メタデータ) (2026-05-09T19:29:01Z) - Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease [72.0406069194794]
音声表現は、しばしば言語に依存した構造を符号化する。
本稿では,ソース言語による自己教師型音声表現とターゲット言語分布とを一致させる表現レベル言語シフトを提案する。
チェコ語,ドイツ語,スペイン語におけるパーキンソン病音声データセットの経口DDK記録に対するアプローチについて検討した。
論文 参考訳(メタデータ) (2026-03-23T17:23:39Z) - RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability [0.5833117322405447]
RadZeroは、ゼロショットマルチタスク機能を備えた胸部X線における視覚言語(VL)アライメントのための新しいフレームワークである。
テキスト埋め込みとローカルな画像特徴を一致させて、解釈可能できめ細かいVL推論を行う。
トレーニング済みのビジョンエンコーダとトレーニング可能なトランスフォーマー層を使用し、効率的な高解像度画像処理を可能にする。
論文 参考訳(メタデータ) (2025-04-10T03:14:17Z) - AutoRad-Lung: A Radiomic-Guided Prompting Autoregressive Vision-Language Model for Lung Nodule Malignancy Prediction [5.736781475109306]
肺がんは、世界中でがん関連死亡の原因の1つとなっている。
臨床実践では、放射線技師はCT画像から抽出した定量的で手作りの放射線学的特徴に頼っている。
本稿では,手作りラジオミクスから発生するプロンプトと,自己回帰的に事前訓練されたVLMを結合したAutoRad-Lungを紹介する。
論文 参考訳(メタデータ) (2025-03-26T15:56:48Z) - SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models [74.40683913645731]
Zero-shot Multi-label Recognition (MLR) with Vision-Language Models (VLMs) は、トレーニングデータ、モデルチューニング、アーキテクチャの変更なしに重要な課題に直面している。
我々の研究は、VLMをブラックボックスとして扱い、トレーニングデータや地上の真実を使わずにスコアを活用する新しいソリューションを提案する。
これらのプロンプトスコアの分析により、VLMバイアスとAND'/OR信号の曖昧さが明らかになり、特に、最高スコアは2番目に高いスコアに比べて驚くほど低い。
論文 参考訳(メタデータ) (2025-02-24T07:15:05Z) - Vision-Language Modelling For Radiological Imaging and Reports In The
Low Data Regime [70.04389979779195]
本稿では,視覚および言語入力を共通空間に埋め込んだ医用視覚言語モデル(VLM)について検討する。
本稿では,新しい画像領域やテキスト領域への汎用事前学習モデルの適用など,低データ性能向上のためのいくつかの候補手法について検討する。
テキスト・ツー・イメージ検索をベンチマークとして,2つの胸部X線および放射線学的報告を用いた可変サイズのトレーニングデータセットを用いて,これらの手法の性能評価を行った。
論文 参考訳(メタデータ) (2023-03-30T18:20:00Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。