論文の概要: CDGC-Net: 3D Medical Image Segmentation with Cooperative Dual-Scale Self-Attention and Grouped Channel Modeling
- arxiv url: http://arxiv.org/abs/2608.08575v1
- Date: Sun, 09 Aug 2026 08:29:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.874006
- Title: CDGC-Net: 3D Medical Image Segmentation with Cooperative Dual-Scale Self-Attention and Grouped Channel Modeling
- Title(参考訳): CDGC-Net:協調的2次元自己注意とグループチャネルモデリングによる3次元医用画像分割
- Authors: Zheyang Jing, Qin Lu, Jianwang Li, Yujie Yang, Chen Yi, Shaofeng Jiang,
- Abstract要約: CDGC-Netは、協調的な2次元空間的注意とグループ化された階層チャネルモデリングを組み合わせた3次元医用画像セグメンテーションネットワークである。
Synapse、ACDC、BraTS、LAのデータセットでは、CDGC-Netはそれぞれ86.96%、92.91%、82.56%、93.52%の平均値を達成した。
- 参考スコア(独自算出の注目度): 11.11888950065648
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accurate 3D medical image segmentation requires the integration of long-range anatomical context with fine boundary detail. Existing methods often model global and local features in separate modules or feature levels and perform channel recalibration independently. This may cause semantic mismatch between global context and local boundaries, insufficient channel relationship modeling, weak spatial-channel interaction, and redundant representations. We propose CDGC-Net, a 3D medical image segmentation network that combines cooperative dual-scale spatial attention with grouped hierarchical channel modeling. With-in each CDGC block, Cooperative Dual-Scale Self-Attention (CDSA) assigns attention heads to parallel local-window and global-sparse branches. The two branches capture fine spatial details and long-range anatomical context at the same feature level. Their outputs are concatenated into an $N\times C$ spatial representation and directly passed to Grouped Hierarchical Channel Attention (GHCA). GHCA organizes the channels into $r$ groups and models both within-group and cross-group dependencies. CDSA and GHCA reuse a shared key projection to maintain a consistent feature reference. Residual feature alignment subsequently integrates the refined features with the original representation. On the Synapse, ACDC, BraTS, and LA datasets, CDGC-Net achieved mean DSC values of 86.96\%, 92.91\%, 82.56\%, and 93.52\%, respectively, exceeding the next-highest reported values by 0.39, 0.47, 0.17, and 0.32 percentage points. CDGC-Net contains 25.83M parameters and 28.62G FLOPs for an input size of $64\times128\times128$, reducing these quantities by 39.87\% and 40.30\%, respectively, relative to UNETR++. These results indicate a favorable trade-off between segmentation accuracy and computational complexity.
- Abstract(参考訳): 正確な3次元医用画像分割は、長距離解剖学的コンテキストと細かな境界の詳細を統合する必要がある。
既存のメソッドは、しばしば異なるモジュールや機能レベルでグローバルとローカルの機能をモデル化し、チャンネルの再分類を独立して行う。
これは、グローバルコンテキストと局所境界のセマンティックミスマッチ、不十分なチャネル関係モデリング、弱い空間チャネル相互作用、冗長な表現を引き起こす可能性がある。
協調的な2次元空間的注意とグループ階層型チャネルモデリングを組み合わせた3次元医用画像分割ネットワークCDGC-Netを提案する。
各CDGCブロックを組み込んだCDSA(Cooperative Dual-Scale Self-Attention)は、並列なローカルウィンドウとグローバルスパースブランチに注意を向ける。
2つの枝は同じ特徴レベルで細かな空間的詳細と長距離解剖学的文脈をキャプチャする。
それらの出力は$N\times C$空間表現に連結され、グループ階層チャネル注意(GHCA)に直接渡される。
GHCAはチャネルを$r$グループに整理し、グループ内およびグループ間の依存関係の両方をモデルにする。
CDSAとGHCAは共有キープロジェクションを再利用し、一貫した特徴参照を維持する。
残像アライメントはその後、洗練された特徴と元の表現を統合する。
Synapse、ACDC、BraTS、LAのデータセットでは、CDGC-Netの平均DSC値は86.96\%、92.91\%、82.56\%、93.52\%で、それぞれ0.39、0.47、0.17、0.32の2番目に高い。
CDGC-Net は 25.83M パラメータと 28.62G FLOP を含み、入力サイズは 64\times128\times128$ であり、これらの量は UNETR++ と比較してそれぞれ 39.87\% と 40.30\% に削減されている。
これらの結果は、セグメンテーションの精度と計算複雑性のトレードオフが好ましいことを示している。
関連論文リスト
- VasGuideNet: Vascular Topology-Guided Couinaud Liver Segmentation with Structural Contrastive Loss [15.54612173358869]
本稿では,血管トポロジで明示的にガイドされた最初のCouinaudセグメンテーションフレームワークであるVasGuideNetを提案する。
VasGuideNetのDiceスコアは83.68%、RVDは76.65%、RVDは1.68と7.08である。
UNETR、Swin UNETR、G-UNETR++などの代表的ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-25T03:50:48Z) - GCA-ResUNet: Medical Image Segmentation Using Grouped Coordinate Attention [3.6679095759171645]
GCA-ResUNetは、軽量でプラグ&プレイのGrouped Coordinate Attention (GCA)モジュールを備えた効率的な医用画像セグメンテーションフレームワークである。
Synapse と ACDC の2つの広く使われているベンチマークによる大規模な実験では、それぞれ GCA-ResUNet が 86.11% と 92.64% のDice のスコアを達成している。
論文 参考訳(メタデータ) (2025-12-30T05:13:20Z) - GCA-ResUNet:Image segmentation in medical images using grouped coordinate attention [3.6679095759171645]
GCA-ResUNetは、Grouped Coordinate AttentionをResNet-50残留ブロックに統合する効率的なセグメンテーションネットワークである。
Synapseデータセットでは、GCA-ResUNetが86.11%のDiceスコアを獲得し、ACDCデータセットでは92.64%に達する。
論文 参考訳(メタデータ) (2025-11-18T03:13:34Z) - S3TU-Net: Structured Convolution and Superpixel Transformer for Lung Nodule Segmentation [5.2752693301728355]
マルチ次元空間コネクタとスーパーピクセルベースの視覚変換器を統合したセグメンテーションモデルS3TU-Netを提案する。
S3TU-NetはマルチビューCNN-Transformerハイブリッドアーキテクチャ上に構築されており、スーパーピクセルアルゴリズム、構造化重み付け、空間シフト技術が組み込まれている。
LIDC-IDRIデータセットの実験結果は、S3TU-Netがそれぞれ89.04%、90.73%、90.70%のDSC、精度、IoUを達成したことを示している。
論文 参考訳(メタデータ) (2024-11-19T15:00:18Z) - BRAU-Net++: U-Shaped Hybrid CNN-Transformer Network for Medical Image Segmentation [11.986549780782724]
医用画像の正確な分割作業のために,BRAU-Net++ というハイブリッドで効果的な CNN-Transformer ネットワークを提案する。
具体的には、BRAU-Net++は、U字型エンコーダデコーダ構造を設計するために、コアビルディングブロックとしてバイレベルルーティングアテンションを使用する。
提案手法は,そのベースラインであるBRAU-Netを含む,最先端の手法を超越した手法である。
論文 参考訳(メタデータ) (2024-01-01T10:49:09Z) - Dual-scale Enhanced and Cross-generative Consistency Learning for Semi-supervised Medical Image Segmentation [49.57907601086494]
医用画像のセグメンテーションはコンピュータ支援診断において重要な役割を担っている。
半教師型医用画像(DEC-Seg)のための新しいDual-scale Enhanced and Cross-generative consistency learning frameworkを提案する。
論文 参考訳(メタデータ) (2023-12-26T12:56:31Z) - BCS-Net: Boundary, Context and Semantic for Automatic COVID-19 Lung
Infection Segmentation from CT Images [83.82141604007899]
BCS-Netは、CT画像から自動的に新型コロナウイルスの肺感染症を分離するための新しいネットワークである。
BCS-Netはエンコーダ-デコーダアーキテクチャに従っており、多くの設計はデコーダのステージに焦点を当てている。
BCSRブロックでは、アテンション誘導グローバルコンテキスト(AGGC)モジュールがデコーダの最も価値のあるエンコーダ機能を学ぶように設計されている。
論文 参考訳(メタデータ) (2022-07-17T08:54:07Z) - Global-and-Local Collaborative Learning for Co-Salient Object Detection [162.62642867056385]
Co-Salient Object Detection (CoSOD)の目標は、2つ以上の関連する画像を含むクエリグループに一般的に現れる有能なオブジェクトを見つけることである。
本稿では,グローバル対応モデリング(GCM)とローカル対応モデリング(LCM)を含む,グローバル・ローカル協調学習アーキテクチャを提案する。
提案したGLNetは3つの一般的なCoSODベンチマークデータセットに基づいて評価され、我々のモデルが小さなデータセット(約3k画像)でトレーニングされた場合、一部の大規模データセット(約8k-200k画像)でトレーニングされた11の最先端の競合製品(約8k-200k画像)を上回っていることを示す。
論文 参考訳(メタデータ) (2022-04-19T14:32:41Z) - Two-Stream Graph Convolutional Network for Intra-oral Scanner Image
Segmentation [133.02190910009384]
本稿では,2ストリームグラフ畳み込みネットワーク(TSGCN)を提案する。
TSGCNは3次元歯(表面)セグメンテーションにおいて最先端の方法よりも優れています。
論文 参考訳(メタデータ) (2022-04-19T10:41:09Z) - Conformer: Local Features Coupling Global Representations for Visual
Recognition [72.9550481476101]
本稿では,畳み込み操作と自己アテンション機構を利用した表現学習のためのハイブリッドネットワーク構造,conformerを提案する。
実験では、コンフォーマーが同等のパラメータ複雑性の下で視覚変換器(DeiT-B)を2.3%上回ることが示されている。
論文 参考訳(メタデータ) (2021-05-09T10:00:03Z) - Adaptive feature recombination and recalibration for semantic
segmentation with Fully Convolutional Networks [57.64866581615309]
完全畳み込みネットワークを用いたセマンティックセグメンテーションに適応した特徴の組換えと空間適応型再分類ブロックを提案する。
その結果、再結合と再校正は競争ベースラインの結果を改善し、3つの異なる問題にまたがって一般化することを示した。
論文 参考訳(メタデータ) (2020-06-19T15:45:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。