論文の概要: Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation
- arxiv url: http://arxiv.org/abs/2607.09481v1
- Date: Fri, 10 Jul 2026 14:57:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.876004
- Title: Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation
- Title(参考訳): テキストガイド・メディカルセグメンテーションのためのバックボーンからの言語誘導
- Abstract要約: 本稿では,テキスト誘導医療画像セグメンテーションのためのバックボーン変換可能な階層型アダプターフレームワークBTHAを提案する。
BTHAは、マルチスケールの視覚的特徴とテキスト表現が与えられたときに、形状保存アダプタを通じて意味的なガイダンスを注入する、安定した機能レベルのインターフェースを中心に構築されている。
さらに,SAGSG (Scale-Adaptive Gated Semantic Guidance) アダプタを設計し,分解能特異的ゲートがテキスト注入とチャネル再校正を適応的に制御し,冗長なクロスモーダル応答を抑制する。
- 参考スコア(独自算出の注目度): 42.08068886844972
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-guided medical image segmentation leverages clinical semantics to improve lesion delineation, yet many existing models bind cross-modal fusion, supervision, and decoder design into a task-specific architecture. Such tight coupling makes it difficult to reuse language guidance modules across heterogeneous vision and text backbones, and often requires redesigning the network when the encoder pair changes. This paper presents BTHA, a backbone-transferable hierarchical adapter framework for text-guided medical image segmentation. BTHA is built around a stable feature-level interface: given multi-scale visual features and a text representation, it injects semantic guidance through shape-preserving adapters while maintaining the decoder-side tensor contract. To make this interface effective, we introduce a Hierarchical Coarse-to-Fine Supervision Strategy that decomposes learning into global image-text alignment, multi-scale auxiliary localization, and boundary-aware final mask refinement. We further design a Scale-Adaptive Gated Semantic Guidance (SAGSG) adapter, where resolution-specific gates adaptively control textual injection and channel recalibration suppresses redundant cross-modal responses. Evaluations across diverse vision and text backbones show that the same adapter and supervision design remains effective across convolutional and transformer-based visual encoders as well as different language encoders. Experiments on four public datasets further demonstrate that BTHA improves strong text-guided baselines with modest computational overhead.
- Abstract(参考訳): テキスト誘導医療画像のセグメンテーションは、臨床的セマンティクスを活用して病変のデラインを改善するが、既存のモデルの多くは、クロスモーダル融合、監督、デコーダ設計をタスク固有のアーキテクチャに結合する。
このような密結合は、異種視覚とテキストバックボーンをまたいだ言語指導モジュールの再利用を困難にし、エンコーダペアが変更された場合、しばしばネットワークを再設計する必要がある。
本稿では,テキスト誘導医療画像セグメンテーションのためのバックボーン変換可能な階層型アダプタであるBTHAについて述べる。
BTHAは、マルチスケールの視覚的特徴とテキスト表現を与えられた場合、デコーダ側のテンソル契約を維持しながら、形状保存アダプタを通じて意味的なガイダンスを注入する。
このインターフェースを効果的にするために、学習をグローバルな画像テキストアライメント、マルチスケールの補助的ローカライゼーション、境界対応の最終的なマスク改善に分解する階層型粗大化スーパービジョン戦略を導入する。
さらに,SAGSG (Scale-Adaptive Gated Semantic Guidance) アダプタを設計し,分解能特異的ゲートがテキスト注入とチャネル再校正を適応的に制御し,冗長なクロスモーダル応答を抑制する。
多様な視覚とテキストのバックボーンによる評価は、異なる言語エンコーダだけでなく、畳み込みやトランスフォーマーベースのビジュアルエンコーダに対しても、同じアダプタと監督設計が有効であることを示している。
4つの公開データセットの実験により、BTHAは計算オーバーヘッドを緩やかにすることで、強いテキスト誘導ベースラインを改善していることが示された。
関連論文リスト
- Text-guided Feature Disentanglement for Cross-modal Gait Recognition [5.766298616867406]
歩行認識は、歩行パターンに基づいて個人を識別する生体計測技術であり、長距離で非侵襲的なシナリオにおいて利点を提供する。
現実のシナリオでは、LiDARやRGBカメラのようなモダリティを感知することが多く、LiDAR-Cross-Modal Gait認識は重要で困難なタスクである。
この課題に対処するため,テキスト誘導型クロスモーダル特徴分散ネットワークTCFDNetを提案する。
SUSTech1KとFreeGaitデータセットの大規模な実験は、TCFDNetが新しい最先端の結果を達成し、提案したモジュールの有効性を検証することを実証している。
論文 参考訳(メタデータ) (2026-05-29T03:16:44Z) - TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation [56.09179939570486]
本稿では,パラメータ効率,タスク固有適応に着目したCLIPベースのフレームワークであるTGC-Netを提案する。
TGC-Netは、挑戦的なベンチマークで顕著なDiceゲインを含む、トレーニング可能なパラメータをかなり少なくして、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-24T12:06:26Z) - TCSA-UDA: Text-Driven Cross-Semantic Alignment for Unsupervised Domain Adaptation in Medical Image Segmentation [10.074858409073292]
視覚表現学習を支援するためのテキスト駆動型クロスセマンティックアライメントフレームワークを提案する。
我々のフレームワークはドメインシフトを大幅に減らし、最先端のUDAメソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2025-11-08T00:56:52Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - BiPVL-Seg: Bidirectional Progressive Vision-Language Fusion with Global-Local Alignment for Medical Image Segmentation [9.262045402495225]
BiPVL-Segは、視覚言語融合と埋め込みアライメントを統合するエンドツーエンドフレームワークである。
BiPVL-Segはアーキテクチャにプログレッシブ融合を導入し、視覚とテキストエンコーダの段階的な情報交換を容易にする。
これは、クラスレベルと概念レベルの両方でテキストと視覚の埋め込みをアライメントすることで、テキストエンコーダの理解を高める訓練目的である。
論文 参考訳(メタデータ) (2025-03-30T17:34:39Z) - BEFUnet: A Hybrid CNN-Transformer Architecture for Precise Medical Image
Segmentation [0.0]
本稿では,医療画像の正確な分割のために,身体情報とエッジ情報の融合を強化するBEFUnetという,革新的なU字型ネットワークを提案する。
BEFUnetは、新しいローカル・クロス・アテンション・フィーチャー(LCAF)融合モジュール、新しいダブル・レベル・フュージョン(DLF)モジュール、デュアルブランチ・エンコーダの3つの主要モジュールから構成されている。
LCAFモジュールは、2つのモダリティの間に空間的に近接する特徴に対して、局所的な相互注意を選択的に行うことにより、エッジとボディの特徴を効率よく融合させる。
論文 参考訳(メタデータ) (2024-02-13T21:03:36Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - LAVT: Language-Aware Vision Transformer for Referring Image Segmentation [80.54244087314025]
視覚トランスフォーマーエンコーダネットワークにおいて,言語的特徴と視覚的特徴を早期に融合することにより,より優れたモーダルアライメントを実現することができることを示す。
提案手法は,RefCOCO,RefCO+,G-Refの従来の最先端手法を大きなマージンで上回っている。
論文 参考訳(メタデータ) (2021-12-04T04:53:35Z) - Enhanced Modality Transition for Image Captioning [51.72997126838352]
MTM(Modality Transition Module)を構築し、言語モデルに転送する前に視覚的機能をセマンティック表現に転送します。
トレーニング段階では、モダリティ遷移ネットワークは提案されたモダリティ損失によって最適化される。
提案手法の有効性を示すMS-COCOデータセットを用いて実験を行った。
論文 参考訳(メタデータ) (2021-02-23T07:20:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。