論文の概要: ReGround-Surg: Reliability-Guided Anchor Grounding for Referring Surgical Video Segmentation
- arxiv url: http://arxiv.org/abs/2608.24671v1
- Date: Tue, 25 Aug 2026 15:08:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:35.057333
- Title: ReGround-Surg: Reliability-Guided Anchor Grounding for Referring Surgical Video Segmentation
- Title(参考訳): ReGround-Surg: Reliability-Guided Anchor Grounding for Referring Surgery Video Segmentation
- Authors: Jiaxin Wen, Ming Yin, Lu Liu, Zeyu Fu,
- Abstract要約: 外科的ビデオセグメンテーションの参照には、自然言語の表現に従って、ビデオフレームをまたいで対象の機器または組織領域をセグメンテーションする必要がある。
最近のSegment Anything Model 2 (SAM2) ベースの2段階法 (ReSurgSAM2) は、最初に参照されたターゲットを初期または選択されたフレームに接地し、次に選択されたマスクを追跡によって伝播する。
Re-Ground-Surgは,SAM2をベースとした手術用ビデオセグメンテーションを改善するための軽量な信頼性誘導アンカーグラウンドディングフレームワークである。
- 参考スコア(独自算出の注目度): 19.691062682670378
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Referring surgical video segmentation requires segmenting a target instrument or tissue region across video frames according to a natural language expression. Recent Segment Anything Model 2 (SAM2) based two-stage methods (e.g., ReSurgSAM2) first ground the referred target in an initial or selected frame, then propagate the selected mask via tracking. Although effective, their performance is highly sensitive to the quality of the initial grounded mask: once an incorrect anchor is selected, subsequent tracking tends to propagate the error. This issue is especially challenging in surgical videos due to visually similar instruments, occlusion, and complex tissue-tool interactions. To address this issue, we propose ReGround-Surg, a lightweight reliability-guided anchor grounding framework to improve SAM2-based referring surgical video segmentation. It first predicts a text-conditioned spatial reliability map from the referring expression and current-frame visual features. The map is then reused in two complementary branches: a Gated Side Adapter enhances expression-relevant visual regions before text-to-vision fusion, while a Reliability-Weighted Vision-to-Text Attention module suppresses off-target visual evidence during prompt-token aggregation. Experiments on Ref-EndoVis17 and Ref-EndoVis18 show consistent improvements over state-of-the-art methods across three evaluation splits with negligible speed reduction. Code is publicly available at https://github.com/JiaxinWen1/ReGround-Surg.
- Abstract(参考訳): 外科的ビデオセグメンテーションの参照には、自然言語の表現に従って、ビデオフレームをまたいで対象の機器または組織領域をセグメンテーションする必要がある。
最近のSegment Anything Model 2 (SAM2) ベースの2段階法 (例:ReSurgSAM2) は、最初に参照されたターゲットを初期または選択されたフレームに接地し、次に選択されたマスクを追跡によって伝播する。
有効ではあるが、それらの性能は初期接地マスクの品質に非常に敏感であり、不正なアンカーが選択されると、その後の追跡はエラーを伝播する傾向にある。
この問題は、視覚的に類似した機器、閉塞、複雑な組織とツールの相互作用のために、特に手術ビデオでは困難である。
そこで本研究では,SAM2をベースとした手術用ビデオセグメンテーションの改善を目的とした軽量な信頼性誘導アンカーグラウンドグラウンドフレームワークであるReGround-Surgを提案する。
まず、参照表現と現在フレームの視覚的特徴から、テキスト条件付き空間信頼性マップを予測する。
Gated Side Adapterはテキスト・ツー・ビジョン融合前の表現関連視覚領域を強化し、Reliability-Weighted Vision-to-Text Attentionモジュールは、プロンプト・ツー・ケンアグリゲーション中のターゲット外の視覚的エビデンスを抑制する。
Ref-EndoVis17とRef-EndoVis18の実験では、3つの評価分割における最先端手法に対する一貫した改善が認められた。
コードはhttps://github.com/JiaxinWen1/ReGround-Surg.comで公開されている。
関連論文リスト
- Prompting Diffusion Models for Zero-Shot Instance Segmentation [74.37083707535778]
本稿では拡散型セグメンテーションのための空間条件付きフレームワークPrompt2Segを提案する。
提案手法は2次元ガウスあるいは信頼マップとして表現された空間的プロンプトを明示的な入力信号として用い,ユーザ意図に直接応答するようにモデルを訓練する。
我々は,標準的なベンチマークから,絵画,エゴ中心ビュー,X線データなど,より困難な領域まで,7つのデータセットを評価した。
論文 参考訳(メタデータ) (2026-06-21T20:30:41Z) - GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation [81.0871900167463]
GeoSAM2は3次元部分分割のためのプロンプト制御可能なフレームワークである。
テクスチャのないオブジェクトが与えられた場合、事前に定義された視点から正規写像とポイントマップを描画する。
部品の選択をガイドするシンプルな2Dプロンプト(クリックやボックス)を受け入れます。
予測されたマスクはオブジェクトにバックプロジェクションされ、ビューに集約される。
論文 参考訳(メタデータ) (2025-08-19T17:58:51Z) - OFFSET: Segmentation-based Focus Shift Revision for Composed Image Retrieval [59.377821673653436]
Composed Image Retrieval (CIR)は、ユーザの複雑な検索要求を柔軟に表現することができる。
1) 視覚データにおける支配的部分とノイズ的部分の不均一性は無視され、クエリー特徴が劣化する。
本研究は、主部分分割と二重焦点写像という2つのモジュールからなる集中写像に基づく特徴抽出器を提案する。
論文 参考訳(メタデータ) (2025-07-08T03:27:46Z) - Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder [5.57393627015653]
Sa2VAで実証されたビデオセグメンタとグライダーアプローチは、セグメンテーションモデル内で機能を直接フューズする。
これはしばしば、動的視覚情報と静的意味論の好ましくない絡み合いが生じ、セグメント化の精度が低下する。
SAM-2に固有の情報処理制限に対処するため,テキスト事前学習と線形デカップリングモジュールを統合したデカップリング強化プロンプト方式であるDeSa2VAを提案する。
論文 参考訳(メタデータ) (2025-06-28T13:30:36Z) - ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations [33.74746234704817]
ビデオオブジェクトセグメンテーション(RVOS)は、テキスト記述に基づいて、ビデオ全体を通してターゲットオブジェクトをセグメンテーションすることを目的としている。
これは、深い視覚レベルの理解、ピクセルレベルの高密度な予測、時間的推論を含むため、難しい。
基礎的な視覚基盤モデルから領域レベルの視覚テキストアライメントを継承するbfReferDINO RVOSを提案する。
論文 参考訳(メタデータ) (2025-01-24T16:24:15Z) - VideoRepair: Improving Text-to-Video Generation via Misalignment Evaluation and Localized Refinement [63.4357918830628]
VideoRepairは、モデルに依存しない、トレーニングなしのビデオリファインメントフレームワークである。
微粒なテキストビデオの誤りを特定し、明示的な空間的およびテキスト的フィードバックを生成する。
VideoRepairは、テキストとビデオのアライメントの指標で、最近のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2024-11-22T18:31:47Z) - LACOSTE: Exploiting stereo and temporal contexts for surgical instrument segmentation [14.152207010509763]
ステレオ画像とテンポラル画像の位置情報を併用した新しいLACOSTEモデルを提案し,手術器具のセグメンテーションを改善した。
我々は3つの公開手術ビデオデータセットに対するアプローチを広範囲に検証した。
論文 参考訳(メタデータ) (2024-09-14T08:17:56Z) - MILES: Visual BERT Pre-training with Injected Language Semantics for
Video-text Retrieval [43.2299969152561]
ゼロショット・ファインチューン評価プロトコルを用いた4つのデータセットのテキスト・ビデオ検索手法
提案手法は,ゼロショットおよびファインチューン評価プロトコルを用いた4つのデータセット上でのテキスト・ビデオ検索における最先端手法よりも優れる。
論文 参考訳(メタデータ) (2022-04-26T16:06:31Z) - Rethinking Cross-modal Interaction from a Top-down Perspective for
Referring Video Object Segmentation [140.4291169276062]
ビデオオブジェクトセグメンテーション(RVOS)は、ビデオオブジェクトを自然言語参照のガイダンスでセグメント化することを目的としている。
以前の手法では、画像格子上の言語参照を直接グラウンド化することで、RVOSに対処するのが一般的であった。
そこで本研究では,複数のサンプルフレームから検出されたオブジェクトマスクをビデオ全体へ伝播させることにより,オブジェクトトラッカーの徹底的なセットを構築した。
次に,Transformerベースのトラックレット言語基底モジュールを提案し,インスタンスレベルの視覚的関係とモーダル間相互作用を同時に,効率的にモデル化する。
論文 参考訳(メタデータ) (2021-06-02T10:26:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。