論文の概要: TEDi: Temporal Memory-Enhanced and Denoising Transformer for Surgical Instrument Segmentation
- arxiv url: http://arxiv.org/abs/2609.16797v1
- Date: Tue, 15 Sep 2026 08:03:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.400143
- Title: TEDi: Temporal Memory-Enhanced and Denoising Transformer for Surgical Instrument Segmentation
- Title(参考訳): TEDi : 外科用機器分割用経時記憶・騒音変換器
- Abstract要約: 外科用機器セグメンテーションのための一時記憶強調復調変換器TEDiを提案する。
前者はクエリレベルのメモリバンクとメモリ検索拡張エンコーダを導入し、過去のフレームから識別表現を検索する。
後者は、時間的に不安定な予測を抑制するために、時間的に一貫した参照をクロスフレームセマンティックアンカーとして構成する。
- 参考スコア(独自算出の注目度): 9.547507272250378
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Query-based segmentation methods have shown promising potential for surgical instrument segmentation and recognition, which is essential for scene understanding and downstream tasks in computer assisted surgery. However, most existing approaches predominantly rely on per-frame predictions and overlook cross-frame temporal priors as well as temporal-consistency constraints. This limitation often leads to unstable query representations and suboptimal category recognition. In this paper, we propose TEDi, a Temporal memory-Enhanced and Denoising transformer for surgical instrument segmentation that addresses these is sues through Memory Search Enhancement and Temporal Consistency Denoising. The former introduces a query-level memory bank and a memory search enhancement encoder to retrieve discriminative representations from historical frames, enriching current-frame features. The latter constructs a temporally consistent reference as a cross-frame semantic anchor to suppress temporally unstable predictions and promote semantic coherence across frames. Extensive experiments on two benchmark datasets, EndoVis 2017 and EndoVis 2018, demonstrate that TEDi consistently outperforms state-of-the-art methods, highlighting its potential to further advance computer-assisted surgery. Our code is available at github.com/argon-xixi/TEDi.
- Abstract(参考訳): 問合せに基づくセグメンテーション手法は,手術機器のセグメンテーションと認識に有望な可能性を示唆している。
しかし、既存のアプローチのほとんどは、時間的一貫性の制約だけでなく、フレームごとの予測や、フレーム間の時間的優先順位の見落としに依存している。
この制限はしばしば不安定なクエリ表現とサブ最適カテゴリ認識につながる。
本稿では,手術機器のセグメント化のための一時記憶強調デノゲーショントランスフォーマであるTEDiを提案する。
前者はクエリレベルのメモリバンクとメモリ検索拡張エンコーダを導入し、過去のフレームから識別表現を検索し、現在のフレームの特徴を豊かにする。
後者は、時間的に一貫した参照をフレーム間のセマンティックアンカーとして構成し、時間的に不安定な予測を抑え、フレーム間のセマンティックコヒーレンスを促進する。
EndoVis 2017とEndoVis 2018の2つのベンチマークデータセットに関する大規模な実験は、TEDiが常に最先端の手法より優れており、コンピュータ支援手術をさらに進める可能性を示している。
私たちのコードはgithub.com/argon-xixi/TEDiで利用可能です。
関連論文リスト
- MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - Temporal Cluster Assignment for Efficient Real-Time Video Segmentation [9.248291541710781]
ビジョントランスフォーマーは、画像ドメインとビデオドメインの両方にわたるセグメンテーションモデルの性能を大幅に向上させた。
Swinのウィンドウベースのアテンションメカニズムは、ウィンドウ毎に一定数のトークンを必要とするため、従来のプルーニング技術の適用性が制限される。
時間的コヒーレンスを活用してトークンクラスタリングを強化する軽量かつ効果的で微調整のない戦略である時間的クラスタ割り当て(TCA)を導入する。
論文 参考訳(メタデータ) (2025-08-07T20:52:49Z) - Temporal Propagation of Asymmetric Feature Pyramid for Surgical Scene Segmentation [7.150163844454341]
手術シーンのセグメンテーションは,ロボットによる腹腔鏡下手術理解に不可欠である。
現在のアプローチでは、(i)静的な画像制限ときめ細かい構造的詳細という2つの課題に直面している。
クロスフレーム特徴伝搬を実現する双方向アテンションアーキテクチャである時間非対称特徴伝搬ネットワークを提案する。
本フレームワークは外科的シーン理解のための時間的指導と文脈的推論の両方を可能にする。
論文 参考訳(メタデータ) (2025-04-18T03:41:23Z) - MoSFormer: Augmenting Temporal Context with Memory of Surgery for Surgical Phase Recognition [6.913838841605972]
メモリ・オブ・サーチ (Memory of Surgery, MOS) は、意味論的解釈可能な長期手術の歴史と短期的印象の両方を取り入れることで、時間的モデリングを強化する枠組みである。
MoSFormerは、複数のベンチマークで最先端のパフォーマンスをデモする。
論文 参考訳(メタデータ) (2025-03-02T02:26:21Z) - Temporally Consistent Referring Video Object Segmentation with Hybrid Memory [98.80249255577304]
本稿では,参照セグメンテーションとともに時間的一貫性を明示的にモデル化する,エンドツーエンドなR-VOSパラダイムを提案する。
自動生成された高品質の参照マスクを有するフレームの特徴は、残りのフレームをセグメント化するために伝播される。
大規模な実験により,本手法は時間的整合性を著しく向上させることが示された。
論文 参考訳(メタデータ) (2024-03-28T13:32:49Z) - WeakSurg: Weakly supervised surgical instrument segmentation using temporal equivariance and semantic continuity [14.448593791011204]
本稿では,楽器の有無ラベルのみを付与した手術器具セグメンテーションを提案する。
手術ビデオの時間的特性を考慮し,2段階の弱教師付きセグメンテーションパラダイムを拡張した。
1つの胆嚢摘出手術ベンチマークと1つの実際のロボット左外側肝外科手術データセットを含む2つの手術ビデオデータセットで実験が検証されている。
論文 参考訳(メタデータ) (2024-03-14T16:39:11Z) - Action Quality Assessment with Temporal Parsing Transformer [84.1272079121699]
行動品質評価(AQA)は、作業の理解と解決に重要である。
本稿では,時間的部分表現に包括的特徴を分解する時間的パーシング変換器を提案する。
提案手法は,3つの公開AQAベンチマークにおける先行研究よりもかなりのマージンで優れていた。
論文 参考訳(メタデータ) (2022-07-19T13:29:05Z) - TraSeTR: Track-to-Segment Transformer with Contrastive Query for
Instance-level Instrument Segmentation in Robotic Surgery [60.439434751619736]
そこで我々は,TraSeTRを提案する。TraSeTR,TraSeTR,Trace-to-Segment Transformerは,手術器具のセグメンテーションを支援する。
TraSeTRは、機器の種類、位置、アイデンティティとインスタンスレベルの予測を共同で理由付けている。
提案手法の有効性を,3つの公開データセットに対して,最先端の計器型セグメンテーション結果を用いて実証した。
論文 参考訳(メタデータ) (2022-02-17T05:52:18Z) - Efficient Global-Local Memory for Real-time Instrument Segmentation of
Robotic Surgical Video [53.14186293442669]
手術器具の知覚における重要な手がかりとして,隣接するフレームからの局所的時間依存性と,長距離における大域的意味的相関があげられる。
本稿では,グローバルとローカルの両方の時間的知識を関連付ける新しいデュアルメモリネットワーク(DMNet)を提案する。
本手法は,実時間速度を維持しながらセグメント化精度を向上する手法である。
論文 参考訳(メタデータ) (2021-09-28T10:10:14Z) - Temporal Memory Relation Network for Workflow Recognition from Surgical
Video [53.20825496640025]
本研究では, 長期および多スケールの時間パターンを関連づける, エンドツーエンドの時間メモリ関係ネットワーク (TMNet) を提案する。
我々はこのアプローチを2つのベンチマーク手術ビデオデータセットで広範囲に検証した。
論文 参考訳(メタデータ) (2021-03-30T13:20:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。