論文の概要: Dense Structural Priors for Sparse Functional Landmark Localization in Surgical Videos
- arxiv url: http://arxiv.org/abs/2606.31007v1
- Date: Tue, 30 Jun 2026 00:50:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.03558
- Title: Dense Structural Priors for Sparse Functional Landmark Localization in Surgical Videos
- Title(参考訳): 手術映像におけるスパース関数型ランドマーク位置定位のための高密度構造優先
- Abstract要約: SAM 3のような視覚基盤モデルは、様々な手術ビデオ条件で伝達可能なオブジェクトレベル構造を提供することができる。
本稿では,SAM 3 を先行構造として用いる軽量化フレームワークを提案する。
粗いマルチフレームネットワークは、先端とアンカーのプロンプトを予測する。
- 参考スコア(独自算出の注目度): 6.6344199526412195
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision foundation models such as SAM 3 can provide transferable object-level structure across diverse surgical video conditions, but segmentation outputs do not explicitly encode the action-conditioned semantics that define functional surgical landmarks. Estimating instrument extent and geometry differs from localizing the tip or anchor relevant to clipping, grasping, or dissecting. We investigate vision foundation model-enabled sparse action-aware landmark localization, using zero-shot, point-prompted structural masks to provide dense instrument-level context without manual pixel-level mask annotations. We propose a lightweight refinement framework that uses SAM 3 as a structural prior. A coarse multi-frame network predicts tip and anchor prompts, generating non-oracle masks that are fused with visual and heatmap features to refine functional landmark predictions. We compare direct mask-augmented supervision, prediction-derived mask-prior refinement, and auxiliary mask supervision to examine how vision foundation model-derived structure should enter a precision-oriented localization system. Experiments on 7,867 clips from 60 surgical videos spanning YouTube, Cholec80, HeiChole, SurgVU, and CRCD evaluate the approach under heterogeneous conditions. Without manual pixel-level mask annotations for training, the proposed model achieves overall F1 scores of 72.4% for tip and 58.0% for anchor localization. Directly imposing masks on heatmap targets biases learning toward broad tool regions, whereas prediction-derived priors and auxiliary supervision provide effective intermediate structural guidance for action-dependent landmark prediction.
- Abstract(参考訳): SAM 3のような視覚基盤モデルは、様々な外科的ビデオ条件をまたいで伝達可能なオブジェクトレベル構造を提供することができるが、セグメンテーション出力は、機能的な外科的ランドマークを定義するアクション条件セマンティクスを明示的にエンコードしていない。
楽器の幅と形状の推定は、切り抜き、つかみ、切り離しに関連する先端やアンカーの局所化と異なる。
手動の画素レベルのマスクアノテーションを使わずに高密度の楽器レベルのコンテキストを提供するため、ゼロショット・ポイントプロンプト構造マスクを用いて、視覚基盤モデルで対応可能なスパースアクション対応ランドマークローカライズについて検討する。
本稿では,SAM 3 を先行構造として用いる軽量化フレームワークを提案する。
粗いマルチフレームネットワークは、チップとアンカーのプロンプトを予測し、視覚とヒートマップの機能を融合した非オークルマスクを生成し、機能的なランドマークの予測を洗練させる。
本研究は,視覚基盤モデルに基づく構造が精度指向のローカライゼーションシステムにどのように入り込むべきかを検討するために,直接マスク強化監視,予測由来マスクプリアリファインメント,補助マスク監視を比較した。
YouTube、Cholec80、HeiChole、SurgVU、CRCDにまたがる60の手術ビデオから、7,867本のビデオクリップで実験を行った。
トレーニング用の手動ピクセルレベルのマスクアノテーションがなければ、提案されたモデルは、チップの72.4%、アンカーのローカライゼーションの58.0%という総合的なF1スコアを達成できる。
ヒートマップにマスクを直接配置すると、幅広いツール領域に向けて学習するバイアスが生じるのに対し、予測に基づく事前と補助的な監視は、アクション依存のランドマーク予測に効果的な中間構造的ガイダンスを提供する。
関連論文リスト
- DenseTRF: Texture-Aware Unsupervised Representation Adaptation for Surgical Scene Dense Prediction [0.609006146869448]
テクスチャ中心の注意に基づく自己教師型表現適応フレームワークDenseTRFを提案する。
DenseTRFは、監視なしでターゲット分布に表現を適用することにより、ドメインシフトに対する堅牢性を大幅に改善する。
複数の外科手術における実験は、最先端のセグメンテーションモデルと比較して、クロスディストリビューションの一般化の改善を実証している。
論文 参考訳(メタデータ) (2026-05-11T21:43:40Z) - OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance [53.45125687428705]
Open-Vocabularyは、セマンティック記述を活用することで、定義済みのカテゴリセットを超えてイメージ領域を分割することを目的としている。
近年の取り組みは、これらの制限を軽減するために、DINOのようなVision Foundation Models (VFM) を取り入れている。
我々は,構造アライメントを通じてDINOの潜在エッジ感度を活性化する新しいフレームワークであるOVS-DINOを提案する。
論文 参考訳(メタデータ) (2026-04-09T16:57:11Z) - Focus-to-Perceive Representation Learning: A Cognition-Inspired Hierarchical Framework for Endoscopic Video Analysis [18.349979396713646]
臨床検査をエミュレートする認知に触発された階層的枠組みであるフォーカス・ツー・パーセプティブ・ラーニング(FPRL)を提案する。
FPRLは最初、静的セマンティクスを学ぶためにフレーム内病変中心の領域に焦点を当て、フレーム間の進化を知覚してコンテキストセマンティクスをモデル化する。
11の内視鏡的ビデオデータセットの実験により、FPRLは様々な下流タスクで優れたパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-03-26T14:06:48Z) - LapFM: A Laparoscopic Segmentation Foundation Model via Hierarchical Concept Evolving Pre-training [39.51756689308245]
ラプFM(LapFM)は、大規模な未ラベルの手術画像から、堅牢なセグメンテーション能力を進化させるために設計された基礎モデルである。
本稿では,階層的一貫性に基づいて疑似ラベルを反復的に生成・フィルタリングする信頼駆動進化ラベルを提案する。
このプロセスは114Kのイメージマスク対からなる大規模ベンチマークであるLapBench-114Kを生成する。
論文 参考訳(メタデータ) (2025-12-09T10:09:31Z) - Polyline Path Masked Attention for Vision Transformer [52.90241449955985]
ビジョントランスフォーマー (ViT) はコンピュータビジョンにおいて大きな成功を収めた。
Mamba2は自然言語処理タスクにおいて大きな可能性を実証している。
本稿では,VTの自己注意機構とMamba2の強化された構造化マスクを統合するポリリンパス仮面注意(PPMA)を提案する。
論文 参考訳(メタデータ) (2025-06-19T00:52:30Z) - Bridge the Points: Graph-based Few-shot Segment Anything Semantically [79.1519244940518]
プレトレーニング技術の最近の進歩により、視覚基礎モデルの能力が向上した。
最近の研究はSAMをFew-shot Semantic segmentation (FSS)に拡張している。
本稿では,グラフ解析に基づく簡易かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-10-09T15:02:28Z) - MaskInversion: Localized Embeddings via Optimization of Explainability Maps [49.50785637749757]
MaskInversionは、テスト時にマスクによって指定されたクエリ画像領域に対するコンテキスト認識の埋め込みを生成する。
オープン語彙のクラス検索、表現理解の参照、局所的なキャプションや画像生成など、幅広いタスクに使用することができる。
論文 参考訳(メタデータ) (2024-07-29T14:21:07Z) - PWISeg: Point-based Weakly-supervised Instance Segmentation for Surgical
Instruments [27.89003436883652]
我々はPWISeg (Point-based Weakly-supervised Instance) という,弱制御型手術器具セグメンテーション手法を提案する。
PWISegは、特徴点とバウンディングボックスの関係をモデル化するために、ポイント・ツー・ボックスとポイント・ツー・マスクのブランチを備えたFCNベースのアーキテクチャを採用している。
そこで本研究では,キー・ツー・マスク・ブランチを駆動し,より正確なセグメンテーション予測を生成するキー・ピクセル・アソシエーション・ロスとキー・ピクセル・アソシエーション・ロスを提案する。
論文 参考訳(メタデータ) (2023-11-16T11:48:29Z) - Background Activation Suppression for Weakly Supervised Object
Localization and Semantic Segmentation [84.62067728093358]
弱教師付きオブジェクトローカライゼーションとセマンティックセグメンテーションは、画像レベルのラベルのみを使用してオブジェクトをローカライズすることを目的としている。
画素レベルのローカライゼーションを実現するために,フォアグラウンド予測マップを生成することで,新たなパラダイムが誕生した。
本稿では,物体の局在化学習過程に関する2つの驚くべき実験結果を示す。
論文 参考訳(メタデータ) (2023-09-22T15:44:10Z) - Self-supervised Pre-training with Masked Shape Prediction for 3D Scene
Understanding [106.0876425365599]
Masked Shape Prediction (MSP)は、3Dシーンでマスクされた信号モデリングを行うための新しいフレームワークである。
MSPは3Dセマンティックキュー、すなわち幾何学的形状をマスクされた点の予測ターゲットとして使用する。
論文 参考訳(メタデータ) (2023-05-08T20:09:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。