論文の概要: SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding
- arxiv url: http://arxiv.org/abs/2608.04676v1
- Date: Wed, 05 Aug 2026 10:39:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.826711
- Title: SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding
- Title(参考訳): SurgNarrator: 外科的ビデオ理解のための生成検索フレームワーク
- Authors: Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin, Kun Yuan, Nicolas Padoy, Daniel S. Elson, Anh Nguyen, Stamatia Giannarou, Baoru Huang,
- Abstract要約: 本稿では,外科的ビデオ理解に適した新しい生成検索フレームワークであるSurgNarratorを提案する。
臨床的に意味のある検索空間を定義するために,外科的接頭辞から手術中心の語彙を高度に構築する。
推論中、階層的で手続き対応の検索戦略は、検索空間を関連するプロシージャタイプに絞り込み、高速で効果的な応答を提供する。
- 参考スコア(独自算出の注目度): 35.05885138023876
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Surgical procedures unfold as structured and recurring clinical events, whose real-time understanding via intraoperative surgical videos is critical for intraoperative decision-making and support. However, existing video understanding methods force a trade-off: autoregressive video-language models support comprehensive reasoning but are not practical for time-sensitive clinical applications, whereas contrastive models offer low latency but struggle with complex scene understanding. Recently, generative retrieval has been explored for general-domain video understanding, but transferring it to surgery is not trivial because near-identical visual appearances may indicate semantically distinct events, and the terminology involved is highly surgery-specific. To this end, we propose SurgNarrator, a new generative retrieval framework tailored for surgical video understanding. We construct a well-curated surgery-centric vocabulary from surgical captions to define a clinically meaningful retrieval space. We then adapt the pre-trained Qwen3-VL-Embedding-8B to learn discriminative clinical representations with a temporally-aware contrastive objective. During inference, a hierarchical, procedure-aware retrieval strategy narrows the search space to the relevant procedure type, delivering fast and effective responses. Our method is comprehensively evaluated on twelve benchmarks in a zero-shot setting and achieves consistent performance gains over state-of-the-art baselines, while reducing output-stage latency by more than two orders of magnitude compared with the generative baseline.
- Abstract(参考訳): 外科的手術は構造化され, 再発する臨床イベントとして展開され, 術中ビデオによるリアルタイム理解は術中意思決定と支援に不可欠である。
自己回帰型ビデオ言語モデルは包括的な推論をサポートするが、時間に敏感な臨床応用には実用的ではない。
近年,一般領域の映像理解のために生成的検索が検討されているが,近身の視覚的外観は意味的に異なる事象を示す可能性があり,関連する用語は極めて手術固有のものであるため,手術への転送は容易ではない。
そこで本研究では,外科的ビデオ理解に適した新しい生成検索フレームワークであるSurgNarratorを提案する。
臨床的に意味のある検索空間を定義するために,外科的接頭辞から手術中心の語彙を高度に構築する。
次に,事前訓練したQwen3-VL-Embedding-8Bを適応させて,時間的に認識された比較対象による差別的臨床表現を学習する。
推論中、階層的で手続き対応の検索戦略は、検索空間を関連するプロシージャタイプに絞り込み、高速で効果的な応答を提供する。
提案手法はゼロショット設定で12のベンチマークで総合的に評価し, 出力ステージ遅延を2桁以上低減し, 出力ステージ遅延を2桁以上低減する。
関連論文リスト
- SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy [12.553409376394162]
SurgTEMPは、外科的ビデオ質問応答のための多モード視覚記憶フレームワークである。
我々は,32KのオープンエンドQAペアと3,855の動画セグメントからなる外科的ビデオ質問応答データセットであるCholeVidQA-32Kを紹介する。
SurgTEMPは、最先端のオープンソースマルチモーダルおよびビデオLLM(ファインチューニングとゼロショット)に対する包括的な評価において、大幅な性能改善を実現している。
論文 参考訳(メタデータ) (2026-03-31T16:27:46Z) - Surgical Video Understanding with Label Interpolation [3.880707330499936]
ロボット補助手術 (RAS) は, 患者の回復を促進するとともに, 外科医の負担を軽減し, 近代的な手術において重要なパラダイムとなっている。
これまでの研究は主にシングルタスクのアプローチに焦点が当てられていたが、実際の手術シーンには複雑な時間的ダイナミクスと多様な楽器の相互作用が含まれる。
本稿では,光フローベースセグメンテーションラベルとマルチタスク学習を組み合わせた新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-23T08:49:07Z) - Surgeons vs. Computer Vision: A comparative analysis on surgical phase recognition capabilities [65.66373425605278]
自動手術相認識(SPR)は、人工知能(AI)を使用して、手術ワークフローをその重要なイベントに分割する。
従来の研究は、短い外科手術と直線的な外科手術に焦点を合わせており、時間的文脈が手術の段階をよりよく分類する専門家の能力に影響を与えるかどうかを探索していない。
本研究は,ロボットによる部分腎切除(RAPN)を高度に非直線的に行うことに焦点を当て,これらのギャップに対処する。
論文 参考訳(メタデータ) (2025-04-26T15:37:22Z) - OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining [60.75854609803651]
OphCLIPは、眼科手術ワークフロー理解のための階層的検索強化視覚言語事前学習フレームワークである。
OphCLIPは、短いビデオクリップと詳細な物語記述、構造化タイトルによるフルビデオの調整によって、細粒度と長期の視覚表現の両方を学習する。
我々のOphCLIPは、探索されていない大規模なサイレント手術ビデオを活用するために、検索強化事前訓練フレームワークも設計している。
論文 参考訳(メタデータ) (2024-11-23T02:53:08Z) - Procedure-Aware Surgical Video-language Pretraining with Hierarchical Knowledge Augmentation [51.222684687924215]
手術用ビデオ言語事前学習は、知識領域のギャップとマルチモーダルデータの不足により、独特な課題に直面している。
本稿では,これらの課題に対処するために,階層的知識向上手法と新しい手術的知識向上型ビデオランゲージ事前学習フレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-30T22:21:05Z) - Action Recognition in Video Recordings from Gynecologic Laparoscopy [4.002010889177872]
行動認識は腹腔鏡画像解析における多くの応用の前提条件である。
本研究では,CNN-RNNアーキテクチャと,カスタマイズしたトレーニング推論フレームワークの設計と評価を行う。
論文 参考訳(メタデータ) (2023-11-30T16:15:46Z) - GLSFormer : Gated - Long, Short Sequence Transformer for Step
Recognition in Surgical Videos [57.93194315839009]
本稿では,シーケンスレベルのパッチから時間的特徴を直接学習するための視覚変換器に基づくアプローチを提案する。
本研究では,白内障手術用ビデオデータセットである白内障-101とD99に対するアプローチを広範に評価し,各種の最先端手法と比較して優れた性能を示した。
論文 参考訳(メタデータ) (2023-07-20T17:57:04Z) - Relevance Detection in Cataract Surgery Videos by Spatio-Temporal Action
Localization [7.235239641693831]
白内障手術では、顕微鏡の助けを借りて手術を行います。
顕微鏡は最大2人程度でリアルタイム手術を観察できるため、記録されたビデオを用いて手術訓練の大部分を行う。
ビデオコンテンツでトレーニング手順を最適化するには、外科医は自動関連性検出アプローチが必要です。
本稿では,白内障映像における関連フェーズセグメントの検出と分類を行うための3モジュールフレームワークを提案する。
論文 参考訳(メタデータ) (2021-04-29T12:01:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。