論文の概要: WSPolypNet: Weakly Supervised Polyp Localization in Colonoscopy Videos
- arxiv url: http://arxiv.org/abs/2609.08182v1
- Date: Tue, 08 Sep 2026 03:14:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.564285
- Title: WSPolypNet: Weakly Supervised Polyp Localization in Colonoscopy Videos
- Title(参考訳): WSPolypNet: 大腸内視鏡ビデオにおけるポリープの局在の弱さ
- Abstract要約: ビデオレベルラベルのみを用いたポリプローカライズのための弱教師付きフレームワークであるWSPolypNetを提案する。
WSPolypNetは、ビデオレベルの監視で訓練された3D畳み込みニューラルネットワークを使用して、クラスアクティベーションマップ(CAM)を生成する
これらの結果から,大腸内視鏡画像におけるポリープ局所化の空間的アノテーション要件を大幅に低減するために,時間的学習が弱くなる可能性が示唆された。
- 参考スコア(独自算出の注目度): 6.122917797749268
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Because dense frame-level annotation of colonoscopy videos is costly, we propose WSPolypNet, a weakly supervised framework for polyp localization using only video-level labels. WSPolypNet employs a 3D convolutional neural network trained with video-level supervision to generate class activation maps (CAMs), which identify candidate polyp regions without requiring frame-level spatial annotations. The CAM-derived localization cues are further enhanced using a multi-view strategy and provided to MedSAM2 as point prompts. MedSAM2 then propagates segmentation masks across the video, refining the coarse localization cues according to polyp boundaries. WSPolypNet achieved CorLoc scores of 47.80%, 43.68%, and 35.01% at IoU thresholds of 0.3, 0.5, and 0.7, respectively, compared with 36.87%, 33.72%, and 27.94% in the single-view setting. For small polyps, the multi-view strategy improved CorLoc@0.5 from 16.01% to 30.97%. The framework also achieved a recall of 94.51%. These results demonstrate the potential of weakly supervised spatiotemporal learning to substantially reduce spatial annotation requirements for polyp localization in colonoscopy videos.
- Abstract(参考訳): 大腸内視鏡画像のフレームレベルアノテーションは費用がかかるため,ビデオレベルラベルのみを用いたポリプローカライズのための弱教師付きフレームワークであるWSPolypNetを提案する。
WSPolypNetは、ビデオレベルの監視で訓練された3D畳み込みニューラルネットワークを使用して、フレームレベルの空間アノテーションを必要とせずに、候補のポリプ領域を識別するクラスアクティベーションマップ(CAM)を生成する。
CAM由来のローカライゼーションキューは、マルチビュー戦略によりさらに拡張され、ポイントプロンプトとしてMedSAM2に提供される。
その後、MedSAM2はビデオ全体でセグメンテーションマスクを伝播し、ポリプ境界に従って粗いローカライゼーションキューを精製する。
WSPolypNetのCorLocスコアは47.80%、43.68%、35.01%でそれぞれ0.3、0.5、0.7、36.87%、33.72%、27.94%だった。
小さなポリープでは、CorLoc@0.5を16.01%から30.97%に改善した。
フレームワークも94.51%のリコールを達成した。
これらの結果は, 大腸内視鏡画像におけるポリプ局在の空間的アノテーション要件を大幅に低減するために, 教師付き時空間学習の弱さを示すものである。
関連論文リスト
- DepthPolyp: Pseudo-Depth Guided Lightweight Segmentation for Real-Time Colonoscopy [6.950410307869166]
擬似深層誘導マルチタスク学習と効率的な特徴変調に基づく軽量で堅牢な多目的セグメンテーションフレームワークを提案する。
DepthPolypは、劣化したデータに基づいてトレーニングし、クリーンかつノイズの多いターゲットドメインの両方で評価すると、強力なクロスデータセットの一般化を実現する。
3.57Mパラメータと0.86 GMACしか持たず、提案手法は180FPS以上のモバイルデバイス上で動作し、リソース制約された臨床環境におけるリアルタイムなデプロイに適している。
論文 参考訳(メタデータ) (2026-05-15T18:14:32Z) - ASGNet: Adaptive Spectrum Guidance Network for Automatic Polyp Segmentation [31.86667278394464]
ポリープの早期同定と除去は、大腸癌の発症リスクを減少させる可能性がある。
ポリプの様々な形態、複雑な背景、しばしば隠された性質は大腸内視鏡像におけるポリープのセグメンテーションを極めて困難にしている。
本稿では,空間知覚の限界に対処する適応スペクトル誘導ネットワークASGNetを提案する。
論文 参考訳(メタデータ) (2026-04-16T08:10:20Z) - Learning with Geometric Priors in U-Net Variants for Polyp Segmentation [11.412362266277675]
本稿では,ポリプセグメンテーションのためのU-Netアーキテクチャに明示的な幾何学的先行を注入する新しい幾何学的事前誘導モジュール(GPM)を提案する。
具体的には、シミュレーションしたColonDepthデータセット上にVisual Geometry Grounded Transformer(VGGT)を微調整し、内視鏡領域に合わせたポリプ画像の深さマップを推定する。
GPMはプラグイン・アンド・プレイであり、様々なU-Netにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-01-24T06:27:25Z) - Progressive Evolution from Single-Point to Polygon for Scene Text [79.29097971932529]
単点をコンパクトな多角形に効率よく変換できるPoint2Polygonを導入する。
まず認識信頼度に基づいてアンカーポイントを作成し,ポリゴンを垂直に水平に精製する。
また,本手法により生成したポリゴンを用いた学習において,GTと比較して精度の86%を達成し,さらに,提案したPoint2Polygonをシームレスに統合することにより,単一点スポッターにポリゴンの生成を促進させることができた。
論文 参考訳(メタデータ) (2023-12-21T12:08:27Z) - M3FPolypSegNet: Segmentation Network with Multi-frequency Feature Fusion
for Polyp Localization in Colonoscopy Images [1.389360509566256]
M3FPolypSegNet (M3FPolypSegNet) は、入力画像を低周波数成分/高周波数成分に分解する。
我々は3つの独立したマルチ周波数エンコーダを用いて、複数の入力画像を高次元の特徴空間にマッピングした。
我々は,4つのデコーダブロックで3つのマルチタスク学習(領域,エッジ,距離)を設計し,その領域の構造的特徴を学習した。
論文 参考訳(メタデータ) (2023-10-09T09:01:53Z) - Accurate Real-time Polyp Detection in Videos from Concatenation of
Latent Features Extracted from Consecutive Frames [5.2009074009536524]
畳み込みニューラルネットワーク(CNN)は入力画像の小さな変化に対して脆弱である。
CNNベースのモデルは、連続したフレームに現れる同じポリプを見逃す可能性がある。
CNNを用いたエンコーダデコーダモデルの効率的な特徴結合法を提案する。
論文 参考訳(メタデータ) (2023-03-10T11:51:22Z) - Lesion-aware Dynamic Kernel for Polyp Segmentation [49.63274623103663]
ポリープセグメンテーションのための障害対応動的ネットワーク(LDNet)を提案する。
従来のU字型エンコーダ・デコーダ構造であり、動的カーネル生成と更新スキームが組み込まれている。
この単純だが効果的なスキームは、我々のモデルに強力なセグメンテーション性能と一般化能力を与える。
論文 参考訳(メタデータ) (2023-01-12T09:53:57Z) - Adaptive Context Selection for Polyp Segmentation [99.9959901908053]
本稿では,ローカルコンテキストアテンション(LCA)モジュール,グローバルコンテキストモジュール(GCM)モジュール,適応選択モジュール(ASM)モジュールで構成される適応コンテキスト選択に基づくエンコーダデコーダフレームワークを提案する。
LCAモジュールは、エンコーダ層からデコーダ層へローカルなコンテキスト機能を提供する。
GCMは、グローバルなコンテキストの特徴をさらに探求し、デコーダ層に送信することを目的としている。ASMは、チャンネルワイドアテンションを通じて、コンテキスト特徴の適応的選択と集約に使用される。
論文 参考訳(メタデータ) (2023-01-12T04:06:44Z) - Video Polyp Segmentation: A Deep Learning Perspective [97.70996418522748]
本稿では,第1回総合ビデオポリプセグメンテーション(VPS)研究について紹介する。
まず、有名なSUNデータセットから158,690フレームを含む、SUN-SEGという高品質なフレーム単位のVPSデータセットを紹介します。
また,グローバルエンコーダ,ローカルエンコーダ,正規化自己保持ブロックからなる,シンプルだが効率的なベースラインを設計する。
論文 参考訳(メタデータ) (2022-03-27T12:40:10Z) - Automatic Polyp Segmentation via Multi-scale Subtraction Network [100.94922587360871]
臨床的には、正確なポリープセグメンテーションは大腸癌の早期発見に重要な情報を提供する。
既存のほとんどの手法はU字型構造に基づいており、デコーダで段階的に異なるレベルの特徴を融合させるために要素ワイド付加または結合を用いる。
大腸内視鏡画像からポリプを抽出するマルチスケールサブトラクションネットワーク(MSNet)を提案する。
論文 参考訳(メタデータ) (2021-08-11T07:54:07Z) - Colonoscopy Polyp Detection: Domain Adaptation From Medical Report
Images to Real-time Videos [76.37907640271806]
大腸内視鏡画像と実時間映像の領域間ギャップに対処する画像-ビデオ結合型ポリープ検出ネットワーク(Ivy-Net)を提案する。
収集したデータセットの実験は、Ivy-Netが大腸内視鏡ビデオで最先端の結果を達成することを示した。
論文 参考訳(メタデータ) (2020-12-31T10:33:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。