論文の概要: Step-Attention Refinement of DINOv3 Features for Efficient Anterior Eye Segmentation
- arxiv url: http://arxiv.org/abs/2607.27087v2
- Date: Fri, 31 Jul 2026 03:15:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.307606
- Title: Step-Attention Refinement of DINOv3 Features for Efficient Anterior Eye Segmentation
- Title(参考訳): DINOv3のステップアテンションによる眼球分離能の増強
- Authors: Philippe Baumstimler, Jean-Mathieu Gagnon, Sébastien Gagné, Mathieu Duchesneau, Clément Playout, Lama Séoud,
- Abstract要約: 前眼節(AES)セグメンテーションは、眼生体計測と臨床画像解析の両分野において重要な要素である。
臨床環境でのAESセグメンテーションについて検討し, 蒸留したDINOv3 ViT-Smallバックボーン上に構築した軽量アーキテクチャを提案する。
提案手法は,8つの眼科的取得プロトコルにまたがる333個のAES画像から,7つの解剖学的クラスに注釈を付した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Anterior eye segment (AES) segmentation is a key component of both ocular biometrics and emerging clinical image analysis applications. However, heterogeneous acquisition conditions and limited annotations in medical settings hinder the robustness and generalization of existing methods. Foundation models (FMs) such as DINOv3 offer strong transfer capabilities, but efficiently adapting their representations to dense prediction tasks remains challenging. In this study, we investigate robust AES segmentation in clinical settings, and propose a lightweight architecture built upon a distilled DINOv3 ViT-Small backbone. We introduce a step-attention feature refinement module that progressively adapts multi-level transformer representations before convolutional decoding, enabling efficient exploitation of pretrained features with few parameters. We evaluate the proposed approach on a private dataset of 333 clinically acquired AES images spanning eight ophthalmic acquisition protocols and annotated for seven anatomical classes. Compared with convolutional and transformer-based baselines, including DINOv3-based methods, our approach achieves the best overall performance, reaching 85.55\% mIoU when fully fine-tuned. It also demonstrates the strongest robustness to domain shift across four unseen public AES segmentation datasets. These results establish a strong baseline for robust AES segmentation in clinical settings and highlight the importance of decoder design for effectively adapting FMs representations to medical segmentation tasks.
- Abstract(参考訳): 前眼節(AES)セグメンテーションは、眼生体計測と臨床画像解析の両分野において重要な要素である。
しかし、医学的条件における異種獲得条件や限定アノテーションは、既存の手法の堅牢性と一般化を妨げている。
DINOv3のような基礎モデル(FM)は、強い伝達能力を提供するが、その表現を密度の高い予測タスクに効率的に適応させることは依然として困難である。
本研究では,DINOv3 ViT-Smallを蒸留した背骨上に構築した軽量アーキテクチャを提案する。
本稿では,畳み込み復号化前のマルチレベルトランスフォーマー表現を段階的に適応させるステップアテンション機能改善モジュールを提案する。
提案手法は,8つの眼科的取得プロトコルにまたがる333個のAES画像から,7つの解剖学的クラスに注釈を付した。
DINOv3法を含む畳み込みおよび変圧器ベースラインと比較して,本手法は完全微調整で85.55\% mIoUに達した。
また、未確認のパブリックなAESセグメンテーションデータセット4つにまたがるドメインシフトに対する強い堅牢性を示している。
これらの結果は, 医用セグメンテーションタスクにFM表現を効果的に適応させるためのデコーダ設計の重要性を強調し, 臨床環境におけるAESセグメンテーションの強力なベースラインを確立した。
関連論文リスト
- Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation [11.100699187381961]
本稿では,高いセグメンテーション精度と極端なパラメータ効率を実現する新しいフレームワークであるDual-Adaptive SAM3(DA-SAM3)を提案する。
私たちの最初の適応はタスク認識であり、最も関係のある専門家をわずかに活性化する動的エキスパートルータ(DER)です。
第2の適応はパラメータ認識です。
専門家(DPE)は、各専門家を共有凍結ベースとして表現する。
論文 参考訳(メタデータ) (2026-06-30T08:14:18Z) - Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography [75.7789001619107]
ビジョン言語による事前トレーニングは、汎用医療AIにとって大きな可能性を秘めている。
3つの主要なコンポーネントを特徴とするフレームワークを提案する。
診断対応プロンプト戦略では、トレーニング前の推論ギャップを埋めるために、実際の臨床用語と集約された疾患プロトタイプを用いている。
論文 参考訳(メタデータ) (2026-06-24T08:24:45Z) - ESICA: A Scalable Framework for Text-Guided 3D Medical Image Segmentation [14.190653103688883]
テキストガイド3D画像分割は、クラスベースおよび空間的プロンプトベースモデルの柔軟な代替手段を提供する。
既存のテキストガイドフレームワークは、しばしば計算コストが高く、弱いテキストボリュームの特徴的アライメントを示し、微妙な解剖学的詳細を捉えることができない。
3つのイノベーションを通じてこれらの課題に対処する軽量でスケーラブルなフレームワークであるESICAを提案する。
論文 参考訳(メタデータ) (2026-04-27T18:03:15Z) - OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance [53.45125687428705]
Open-Vocabularyは、セマンティック記述を活用することで、定義済みのカテゴリセットを超えてイメージ領域を分割することを目的としている。
近年の取り組みは、これらの制限を軽減するために、DINOのようなVision Foundation Models (VFM) を取り入れている。
我々は,構造アライメントを通じてDINOの潜在エッジ感度を活性化する新しいフレームワークであるOVS-DINOを提案する。
論文 参考訳(メタデータ) (2026-04-09T16:57:11Z) - Adapting Foundation Models for Annotation-Efficient Adnexal Mass Segmentation in Cine Images [4.42778347374376]
超音波による近接性質量評価は、主観的解釈と重要なサーバ間変動によって妨げられることが多い、困難な臨床課題である。
本稿では,事前訓練されたDINOv3基盤視変換器バックボーンのロバストなセマンティクスを活かしたラベル効率のセグメンテーションフレームワークを提案する。
提案手法は,U-Net,U-Net++,DeepLabV3,MAnetなどの完全教師付きベースラインと比較して,最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-04-09T09:48:50Z) - Prior-AttUNet: Retinal OCT Fluid Segmentation Based on Normal Anatomical Priors and Attention Gating [6.013762133627291]
本研究は, 生成解剖学的先行を付加したセグメンテーションモデルである Pre-AttUNet を紹介する。
このフレームワークは、生成前の経路とセグメンテーションネットワークを統合するハイブリッドなデュアルパスアーキテクチャを採用している。
このモデルは計算コストが 0.37 TFLOPs で、セグメント精度と推論効率の効果的なバランスを保っている。
論文 参考訳(メタデータ) (2025-12-25T14:37:04Z) - VesSAM: Efficient Multi-Prompting for Segmenting Complex Vessel [68.24765319399286]
本稿では,2次元血管セグメンテーションに適した,強力で効率的なフレームワークであるVesSAMを提案する。
VesSAMは、(1)局所的なテクスチャ機能を強化する畳み込みアダプタ、(2)解剖学的プロンプトを融合するマルチプロンプトエンコーダ、(3)ジャグアーティファクトを減らす軽量マスクデコーダを統合する。
VesSAMは、最先端のPEFTベースのSAMを10%以上のDiceと13%のIoUで一貫して上回っている。
論文 参考訳(メタデータ) (2025-11-02T15:47:05Z) - SegStitch: Multidimensional Transformer for Robust and Efficient Medical Imaging Segmentation [15.811141677039224]
最先端の手法、特にトランスフォーマーを利用した手法は、3Dセマンティックセグメンテーションにおいて顕著に採用されている。
しかし、局所的な特徴や計算の複雑さが無視されているため、普通の視覚変換器は困難に直面する。
本稿では,SegStitchを提案する。SegStitchは変圧器とODEブロックを結合した革新的なアーキテクチャである。
論文 参考訳(メタデータ) (2024-08-01T12:05:02Z) - ASPS: Augmented Segment Anything Model for Polyp Segmentation [77.25557224490075]
SAM(Segment Anything Model)は、ポリープセグメンテーションに先例のないポテンシャルを導入している。
SAMのTransformerベースの構造は、グローバルおよび低周波情報を優先する。
CFAはトレーニング可能なCNNエンコーダブランチと凍結したViTエンコーダを統合し、ドメイン固有の知識の統合を可能にする。
論文 参考訳(メタデータ) (2024-06-30T14:55:32Z) - 3DSAM-adapter: Holistic adaptation of SAM from 2D to 3D for promptable tumor segmentation [52.699139151447945]
医用画像の領域分割を行うために, SAMを2次元から3次元に変換する新しい適応法を提案する。
本モデルでは, 腎腫瘍, 膵腫瘍, 大腸癌の3つのタスクのうち8.25%, 29.87%, 10.11%の3つのタスクにおいて, ドメイン・オブ・ザ・アーティヴ・メディカル・イメージ・セグメンテーション・モデルより優れ, 肝腫瘍セグメンテーションでも同様の性能が得られる。
論文 参考訳(メタデータ) (2023-06-23T12:09:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。