論文の概要: SPIRIT: Spatio-temporal Pairwise Relational Modeling of Instrument-Tissue Interactions for Surgical Action Triplet Recognition
- arxiv url: http://arxiv.org/abs/2608.02188v1
- Date: Mon, 03 Aug 2026 13:12:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.573796
- Title: SPIRIT: Spatio-temporal Pairwise Relational Modeling of Instrument-Tissue Interactions for Surgical Action Triplet Recognition
- Title(参考訳): SPIRIT:手術行動トリプルト認識のための機器間相互作用の時空間関係モデリング
- Authors: Saurav Sharma, Lorenzo Arboit, Nabani Banik, Sarah Meuli, Julia Alekseenko, Jan Liechti, Franziska Heitzinger, Michela Orsi, Didier Mutter, Daniel Gero, Philipp C. Nett, Beat P. Muller, Joel L. Lavanchy, Nicolas Padoy,
- Abstract要約: textbfBypass-4C-T40はRux-en-Y胃バイパスにおける多中心性重度外科的作用三重項認識である。
textbfSPIRITは、センター間でより確実に転送されるインタラクション表現を学習するために設計された、外科的アクション三重項認識のための構造化フレームワークである。
- 参考スコア(独自算出の注目度): 5.183200834703575
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Fine-grained understanding of surgical activity is essential for context-aware assistance in the operating room, including safety monitoring, adverse event identification, and skill assessment. Surgical action triplets, defined as tuples of the form <instrument, verb, target>, provide a structured description of instrument-tissue interactions. A key open problem, however, is how to learn triplet representations that remain reliable across institutions, where surgical video varies in acquisition conditions, surgeon style, tool usage, and tissue handling, while existing triplet datasets do not support explicit evaluation of center-wise transfer. To address this problem, we propose \textbf{SPIRIT}, a structured framework for surgical action triplet recognition designed to learn interaction representations that transfer more reliably across centers. Instead of treating each triplet as a flat class label, SPIRIT first learns spatio-temporal representations for instruments, verbs, and targets, then models their pairwise relations, and finally composes them into coherent triplet predictions, with multi-head distillation used to stabilize learning. To evaluate this setting, we establish \textbf{MultiBypass-4C-T40}, a multi-centric dataset for dense surgical action triplet recognition in Roux-en-Y gastric bypass across four geographically distinct centers, with auxiliary phase and step annotations. Across multiple evaluation protocols, SPIRIT consistently outperforms strong recent baselines, highlighting the value of explicit relational reasoning for multi-centric triplet recognition. Code will be available at https://github.com/CAMMA-public/multibypass-4c-t40.
- Abstract(参考訳): 外科的活動のきめ細かい理解は、安全監視、有害事象の識別、スキルアセスメントなど、手術室におけるコンテキスト認識の支援に不可欠である。
Instrument, verb, target> という形式のタプルとして定義された外科的三重奏法は, 楽器と音節の相互作用を構造化した記述を提供する。
しかし、主要な課題は、外科的ビデオが取得条件、外科医のスタイル、道具の使用方法、組織処理などによって異なる施設間で信頼できる三重項表現を学習する方法であり、既存の三重項データセットはセンターワイド転送の明確な評価をサポートしない。
この問題を解決するために, センター間でより確実に伝達する相互作用表現の学習を目的とした, 手術行動三重項認識のための構造化フレームワークである textbf{SPIRIT} を提案する。
それぞれの三重項をフラットなクラスラベルとして扱う代わりに、SPIRITはまず、楽器、動詞、ターゲットの時空間表現を学習し、それからペア関係をモデル化し、最終的には学習を安定させるために多頭蒸留を用いてコヒーレントな三重項予測に構成する。
この設定を評価するため,Rux-en-Y胃バイパス法において,補助フェーズとステップアノテーションを併用した多中心的手術行動三重項認識データセット「textbf{MultiBypass-4C-T40}」を構築した。
複数の評価プロトコルを通して、SPIRITは、多中心三重項認識に対する明示的な関係推論の価値を強調し、常に強いベースラインを上回ります。
コードはhttps://github.com/CAMMA-public/multibypass-4c-t40で入手できる。
関連論文リスト
- CurConMix+: A Unified Spatio-Temporal Framework for Hierarchical Surgical Workflow Understanding [1.0692208281858493]
手術行動三重項認識は、楽器、行動、解剖学的標的間の相互作用をモデル化することによって、詳細な外科的行動を理解することを目的としている。
ワークフロー分析とスキルアセスメントにおいて臨床的に重要であるにもかかわらず、進行は重度のクラス不均衡、微妙な視覚的変化、三重項成分間の相互依存によって妨げられている。
本研究では,これらの課題に対処するための空間表現フレームワークであるCurConMixを構築した。
論文 参考訳(メタデータ) (2026-01-18T08:42:10Z) - ProstaTD: Bridging Surgical Triplet from Classification to Fully Supervised Detection [54.270188252068145]
ProstaTDは、ロボット補助前立腺切除術の技術的要求領域から開発された、外科的三重項検出のための大規模なデータセットである。
このデータセットは、71,775の動画フレームと196,490の注釈付きトリプルトインスタンスで構成され、複数の機関で実施された21の手術から収集された。
ProstaTDは、これまでで最大かつ最も多様な3重項データセットであり、単純な分類から正確な空間的境界と時間的境界を持つ完全な検出へとフィールドを移動している。
論文 参考訳(メタデータ) (2025-06-01T19:29:39Z) - Surgical Triplet Recognition via Diffusion Model [59.50938852117371]
外科的三重項認識は、次世代のコンテキスト対応手術室を実現するために必要不可欠なビルディングブロックである。
拡散モデルを用いた外科的三重項認識のための新しい生成フレームワークであるDifftを提案する。
CholecT45とColecT50データセットの実験は、手術用三重項認識のための新しい最先端性能を達成する上で、提案手法の優位性を示している。
論文 参考訳(メタデータ) (2024-06-19T04:43:41Z) - Surgical Action Triplet Detection by Mixed Supervised Learning of
Instrument-Tissue Interactions [5.033722555649178]
手術的三重奏法(英: surgery action triplet)は、楽器と音の相互作用を(構成、動詞、ターゲット)の組み合わせとして記述する。
この研究は、従来の三重項認識タスクよりも難しいが正確である外科的三重項検出に焦点を当てている。
マルチクラス・インスツルメンツ・アウェア・トランスフォーマー・インタラクショングラフの2段階ネットワークであるMCIT-IGを提案する。
論文 参考訳(メタデータ) (2023-07-18T18:47:48Z) - CholecTriplet2021: A benchmark challenge for surgical action triplet
recognition [66.51610049869393]
腹腔鏡下手術における三肢の認識のためにMICCAI 2021で実施した内視鏡的視力障害であるColecTriplet 2021を提案する。
課題の参加者が提案する最先端の深層学習手法の課題設定と評価について述べる。
4つのベースライン法と19の新しいディープラーニングアルゴリズムが提示され、手術ビデオから直接手術行動三重項を認識し、平均平均精度(mAP)は4.2%から38.1%である。
論文 参考訳(メタデータ) (2022-04-10T18:51:55Z) - Rendezvous: Attention Mechanisms for the Recognition of Surgical Action
Triplets in Endoscopic Videos [12.725586100227337]
アクショントリプレット認識は、外科的活動について、真にきめ細かな総合的な情報を提供することを目的とした唯一の方法である。
手術ビデオから直接三つ子を認識できる新しいモデルであるRendezvous(RDV)を紹介した。
提案したRDVモデルは,このデータセットの最先端手法と比較して,三重項予測のmAPを9%以上改善する。
論文 参考訳(メタデータ) (2021-09-07T17:52:52Z) - Robust Medical Instrument Segmentation Challenge 2019 [56.148440125599905]
腹腔鏡装置の術中追跡は、しばしばコンピュータとロボットによる介入の必要条件である。
本研究の課題は,30の手術症例から取得した10,040枚の注釈画像からなる外科的データセットに基づいていた。
結果は、初期仮説、すなわち、アルゴリズムの性能がドメインギャップの増大とともに低下することを確認する。
論文 参考訳(メタデータ) (2020-03-23T14:35:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。