論文の概要: OptiModNet: A UNet-Transformer Hybrid with Grouped-Query and Channel Attention for Optic Disc and Cup Segmentation
- arxiv url: http://arxiv.org/abs/2608.18516v1
- Date: Wed, 19 Aug 2026 04:10:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.275106
- Title: OptiModNet: A UNet-Transformer Hybrid with Grouped-Query and Channel Attention for Optic Disc and Cup Segmentation
- Title(参考訳): OptiModNet:光ディスクとカップセグメンテーションのためのグループクエリとチャネルアテンションを備えたUNetトランスフォーマーハイブリッド
- Authors: Soumili Ghosh, Debapriya Roy, Aryan Das, Bikash Santra,
- Abstract要約: 緑内障検出では, 迅速かつ大規模スクリーニングが可能であり, 資源限定の臨床環境への展開を容易にするために, 低計算法が重要である。
本研究では,光ディスクとカップセグメンテーションに適した軽量なハイブリッドアーキテクチャであるOptiModNetを提案する。
提案手法は,3.73 GFLOPと1.93Mパラメータのみで高効率を維持しつつ,既存手法を2.5%以上上回る最先端性能を実現する。
- 参考スコア(独自算出の注目度): 0.4491500338252194
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Precise segmentation of the optic disc and cup is critical for the early detection and diagnosis of glaucoma. However, achieving consistently high performance across datasets while maintaining low computational requirements remains a significant challenge. In glaucoma detection, low-computation methods are crucial for enabling rapid, large-scale screening and facilitating deployment in resource-limited clinical environments. While deep learning models such as UNets, Vision Transformers (ViTs), and Diffusion models have demonstrated strong segmentation performance but these methods often come with substantial computational overhead. UNets are efficient at capturing local features but are limited in modeling global contextual information. Conversely, ViTs excel at long-range dependency modeling but are computationally intensive. Hybrid architectures, such as UNetR, which combine transformer-based encoders with UNet-style decoders, have shown improved performance but while incurring additional complexity. Considering these, in this work, we propose OptiModNet, a light weight novel hybrid architecture tailored for optic disc and cup segmentation. The model integrates diverse attention mechanisms at multiple stages of the network to enhance both local and global feature representation. We include an Aggregated Pyramid Loss that supervises predictions at multiple decoder depths, to promote better gradient flow and structural consistency. We evaluate OptiModNet on the REFUGE2 dataset for both optic disc and cup segmentation tasks. Our method achieves state-of-the-art performance, exceeding existing approaches by over 2.5\%, while maintaining high efficiency with only 3.73 GFLOPs and 1.93M parameters. The code is available at https://github.com/SG1947/OptiModNet.
- Abstract(参考訳): 緑内障の早期発見と診断には,光学ディスクとカップの精密分画が重要である。
しかし、低い計算要求を維持しながらデータセット間で一貫して高いパフォーマンスを達成することは、大きな課題である。
緑内障検出では, 迅速かつ大規模スクリーニングが可能であり, 資源限定の臨床環境への展開を容易にするために, 低計算法が重要である。
UNets、Vision Transformer(ViT)、Diffusionモデルといったディープラーニングモデルではセグメンテーション性能が優れているが、これらの手法は計算オーバーヘッドがかなり大きいことが多い。
UNetsはローカルな特徴を捉えるのに効率的だが、グローバルなコンテキスト情報のモデリングには制限がある。
逆に、ViTは長距離依存モデリングでは優れているが、計算集約性が高い。
トランスフォーマーベースのエンコーダとUNetスタイルのデコーダを組み合わせたUNetRのようなハイブリッドアーキテクチャでは、パフォーマンスが向上しているが、さらなる複雑さが生じる。
本稿では,光ディスクとカップセグメンテーションに適した軽量なハイブリッドアーキテクチャであるOptiModNetを提案する。
このモデルは、ネットワークの複数段階における多様な注意機構を統合し、局所的特徴表現とグローバル的特徴表現の両方を強化する。
複数のデコーダ深度での予測を監督し、より優れた勾配流と構造的整合性を促進するアグリゲートピラミッドロスを含む。
光学ディスクとカップセグメンテーションタスクの両方を対象としたREFUGE2データセット上でOptiModNetを評価する。
提案手法は,3.73 GFLOPと1.93Mパラメータのみで高効率を維持しつつ,既存の手法を2.5 %以上上回る最先端性能を実現する。
コードはhttps://github.com/SG1947/OptiModNetで公開されている。
関連論文リスト
- LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks [27.57718303520023]
軽量適応Cue-Aware Vision Mambaネットワークを提案する。
マルチモーダルひび割れのシナリオ下で、異なるモーダルから形態的およびテクスチャ的手がかりを効率よく知覚し、統合する。
本手法はF1では0.8204、mIoUでは0.8465、パラメータは5.35Mである。
論文 参考訳(メタデータ) (2025-07-30T08:28:20Z) - Flexiffusion: Training-Free Segment-Wise Neural Architecture Search for Efficient Diffusion Models [50.260693393896716]
拡散モデル(DM)は高忠実度画像を生成できる強力な生成モデルであるが、高い計算コストで制約される。
我々は、事前訓練されたパラメータを変更することなく、生成スケジュールとモデルアーキテクチャを協調的に最適化する、トレーニング不要なNASフレームワークFlexiffusionを提案する。
我々の研究は、品質を犠牲にすることなく高速DMを検索するための資源効率の良いパラダイムを開拓した。
論文 参考訳(メタデータ) (2025-06-03T06:02:50Z) - ContextFormer: Redefining Efficiency in Semantic Segmentation [48.81126061219231]
畳み込み法は、局所的な依存関係をうまく捉えるが、長距離関係に苦慮する。
ビジョントランスフォーマー(ViT)は、グローバルなコンテキストキャプチャでは優れるが、高い計算要求によって妨げられる。
我々は,リアルタイムセマンティックセグメンテーションの効率,精度,堅牢性のバランスをとるために,CNN と ViT の強みを活用したハイブリッドフレームワーク ContextFormer を提案する。
論文 参考訳(メタデータ) (2025-01-31T16:11:04Z) - Low-Resolution Self-Attention for Semantic Segmentation [93.30597515880079]
我々は,グローバルコンテキストを計算コストの大幅な削減で捉えるために,低解像度自己認識(LRSA)機構を導入する。
我々のアプローチは、入力画像の解像度に関わらず、固定された低解像度空間における自己注意を計算することである。
本稿では,エンコーダ・デコーダ構造を持つビジョントランスであるLRFormerを構築することで,LRSA手法の有効性を示す。
論文 参考訳(メタデータ) (2023-10-08T06:10:09Z) - Complexity Matters: Rethinking the Latent Space for Generative Modeling [65.64763873078114]
生成的モデリングにおいて、多くの成功したアプローチは、例えば安定拡散のような低次元の潜在空間を利用する。
本研究では, モデル複雑性の観点から潜在空間を再考することにより, 未探索の話題に光を当てることを目的としている。
論文 参考訳(メタデータ) (2023-07-17T07:12:29Z) - UT-Net: Combining U-Net and Transformer for Joint Optic Disc and Cup
Segmentation and Glaucoma Detection [0.0]
緑内障は慢性の視覚疾患であり、永久的な不可逆性視覚障害を引き起こす可能性がある。
緑内障の早期発見には,カップ・ツー・ディスク比(CDR)の測定が重要な役割を担っている。
我々はUT-Netと呼ばれる新しいセグメンテーションパイプラインを提案し、U-Netとトランスフォーマーの双方の利点をエンコーディング層で利用し、次にアテンションゲートバイ線形融合方式を提案する。
論文 参考訳(メタデータ) (2023-03-08T23:21:19Z) - An Adaptive Device-Edge Co-Inference Framework Based on Soft
Actor-Critic [72.35307086274912]
高次元パラメータモデルと大規模数学的計算は、特にIoT(Internet of Things)デバイスにおける実行効率を制限する。
本稿では,ソフトポリシーの繰り返しによるエフェキシット点,エフェキシット点,エンフェキシット点を生成する離散的(SAC-d)のための新しい深層強化学習(DRL)-ソフトアクタ批判法を提案する。
レイテンシと精度を意識した報酬設計に基づいて、そのような計算は動的無線チャンネルや任意の処理のような複雑な環境によく適応でき、5G URLをサポートすることができる。
論文 参考訳(メタデータ) (2022-01-09T09:31:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。