論文の概要: TRCoRSurg: Temporal-Relational Co-Reasoning for Surgical Video Triplet Recognition
- arxiv url: http://arxiv.org/abs/2608.04606v1
- Date: Wed, 05 Aug 2026 09:13:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.79506
- Title: TRCoRSurg: Temporal-Relational Co-Reasoning for Surgical Video Triplet Recognition
- Title(参考訳): TRCoRSurg : 外科的ビデオトリプルト認識のための時間関係共振器
- Authors: Fang Li, Shihao Zou, Weixin Si, Yang Gao, Shuai Li, Aimin Hao,
- Abstract要約: 本稿では,三重項認識のための空間的・リレーショナル・時間的手がかりを統合した統合的枠組みを提案する。
本稿では,AP_IVTを5.1%,AP_IVTを7.8%向上させる手法を提案する。
- 参考スコア(独自算出の注目度): 34.668601827075676
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding complex surgical scenes requires recognizing multiple interdependent entities, such as instruments, actions, and targets, while maintaining their relational consistency across time. Existing surgical triplet recognition methods struggle to jointly model intra-frame label dependencies and inter-frame temporal semantics in a unified manner. To address these limitations, we propose a unified framework that integrates spatial, relational, and temporal cues for robust surgical triplet recognition. Specifically, class-specific spatial priors are first extracted through a multi-scale encoder. These priors are then refined by a Label Correlation Modeling module with multi-scale class activation map-guided relational extraction (MS-CAMRE), enabling the model to capture both static co-occurrence patterns and dynamic contextual dependencies among triplet components. Furthermore, a Bidirectional Temporal-Relational Fusion Attention (BTRFA) module harmonizes temporal and relational representations to achieve coherent temporal reasoning. We also introduce a new evaluation metric, the Triplet Consistency Error Rate (TCER), which quantitatively measures the model's ability to preserve causal and semantic consistency across triplets. Extensive experiments on the CholecT45 and ProstaTD datasets show that our method achieves state-of-the-art performance, improving AP_IVT by 5.1 percent and 7.8 percent, respectively. Moreover, according to TCER, our approach achieves relative reductions of more than 36 percent and 25 percent on the two datasets, respectively, demonstrating the effectiveness of our framework in temporal-relational co-reasoning.
- Abstract(参考訳): 複雑な手術シーンを理解するには、楽器、アクション、ターゲットなどの複数の相互依存した実体を認識しながら、時間をかけて関係性を維持する必要がある。
既存の外科的三重項認識法では,フレーム内ラベル依存とフレーム間時間意味論を統一的にモデル化することが困難である。
これらの制約に対処するため, 頑健な手術三重項認識のための空間的, リレーショナル, 時間的手がかりを統合した統合フレームワークを提案する。
特に、クラス固有の空間先行情報は、まずマルチスケールエンコーダによって抽出される。
これらの先行は、マルチスケールのクラスアクティベーションマップ誘導リレーショナル抽出(MS-CAMRE)を備えたラベル相関モデリングモジュールによって洗練され、モデルがトリプルトコンポーネント間の静的共起パターンと動的コンテキスト依存性の両方をキャプチャできる。
さらに、双方向時間関係融合注意(BTRFA)モジュールは、時間的および関係的な表現を調和させて、一貫性のある時間的推論を実現する。
また,三重項間の因果的・意味的整合性を維持するためのモデルの有効性を定量的に測定する,新しい評価基準である三重項整合率(TCER)を導入する。
CholecT45とProstaTDデータセットの大規模な実験は、我々の手法が最先端のパフォーマンスを実現し、AP_IVTをそれぞれ5.1%改善し、7.8%改善したことを示している。
さらに,TERによれば,本手法は2つのデータセットに対して,それぞれ36%以上と25%以上の相対的な削減を実現し,時間-関係共推論におけるフレームワークの有効性を実証する。
関連論文リスト
- SPIRIT: Spatio-temporal Pairwise Relational Modeling of Instrument-Tissue Interactions for Surgical Action Triplet Recognition [5.183200834703575]
textbfBypass-4C-T40はRux-en-Y胃バイパスにおける多中心性重度外科的作用三重項認識である。
textbfSPIRITは、センター間でより確実に転送されるインタラクション表現を学習するために設計された、外科的アクション三重項認識のための構造化フレームワークである。
論文 参考訳(メタデータ) (2026-08-03T13:12:45Z) - Multimodal Quantitative Measures for Multiparty Behaviour Evaluation [6.709251546882382]
骨格運動データにおける多人数社会的行動の客観的評価のための統合的介入駆動型フレームワークを提案する。
3つの理論駆動摂動による計量感度の検証を行った。
混合効果分析により、予測可能な、共同非依存的なシフトが明らかになる。
論文 参考訳(メタデータ) (2025-08-01T13:46:12Z) - Hierarchical Relation-augmented Representation Generalization for Few-shot Action Recognition [43.84348967231349]
アクション認識は、新しいアクションカテゴリーをほとんど見ない形で認識することを目的としている。
既存の手法は通常、フレーム間の時間的モデリング戦略を設計することで、各ビデオのフレームレベル表現を学習する。
FSARのための階層的関係強化表現一般化フレームワークHR2G-shotを提案する。
論文 参考訳(メタデータ) (2025-04-14T10:23:22Z) - AsyReC: A Multimodal Graph-based Framework for Spatio-Temporal Asymmetric Dyadic Relationship Classification [8.516886985159928]
ダイアドの社会的関係は、空間的経験と時間的経験の共有によって形成される。
これらの関係をモデル化するための現在の計算手法は3つの大きな課題に直面している。
非対称なダイアド関係分類のための多モードグラフベースのフレームワークAsyReCを提案する。
論文 参考訳(メタデータ) (2025-04-07T12:52:23Z) - HierRelTriple: Guiding Indoor Layout Generation with Hierarchical Relationship Triplet Losses [52.70183252341687]
本稿では,空間的関係学習に着目した階層型三重項に基づく屋内関係学習手法HierRelTripleを提案する。
階層型リレーショナル三重項モデリングフレームワークであるHierRelTripleを導入する。
非条件レイアウト合成、フロアプラン条件付きレイアウト生成、シーン再構成の実験により、HierRelは空間関係のメトリクスを15%以上改善することを示した。
論文 参考訳(メタデータ) (2025-03-26T07:31:52Z) - Bridging the Modality Gap: Dimension Information Alignment and Sparse Spatial Constraint for Image-Text Matching [10.709744162565274]
本稿では2つの側面からモダリティギャップを橋渡しするDIASと呼ばれる新しい手法を提案する。
この方法はFlickr30kとMSCOCOベンチマークで4.3%-10.2%のrSum改善を実現している。
論文 参考訳(メタデータ) (2024-10-22T09:37:29Z) - Surgical Triplet Recognition via Diffusion Model [59.50938852117371]
外科的三重項認識は、次世代のコンテキスト対応手術室を実現するために必要不可欠なビルディングブロックである。
拡散モデルを用いた外科的三重項認識のための新しい生成フレームワークであるDifftを提案する。
CholecT45とColecT50データセットの実験は、手術用三重項認識のための新しい最先端性能を達成する上で、提案手法の優位性を示している。
論文 参考訳(メタデータ) (2024-06-19T04:43:41Z) - Ret3D: Rethinking Object Relations for Efficient 3D Object Detection in
Driving Scenes [82.4186966781934]
Ret3Dと呼ばれるシンプルで効率的で効果的な2段階検出器を導入する。
Ret3Dの中核は、新しいフレーム内およびフレーム間関係モジュールの利用である。
無視できる余分なオーバーヘッドにより、Ret3Dは最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-08-18T03:48:58Z) - Cascaded Human-Object Interaction Recognition [175.60439054047043]
マルチステージで粗大なHOI理解のためのカスケードアーキテクチャを提案する。
各段階で、インスタンスローカライゼーションネットワークは、HOI提案を段階的に洗練し、インタラクション認識ネットワークにフィードする。
慎重に設計された人間中心の関係機能により、これらの2つのモジュールは効果的な相互作用理解に向けて協調的に機能する。
論文 参考訳(メタデータ) (2020-03-09T17:05:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。