論文の概要: RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
- arxiv url: http://arxiv.org/abs/2605.23068v1
- Date: Thu, 21 May 2026 21:58:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 17:29:20.117666
- Title: RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
- Title(参考訳): RoboSurg-VQA: 手術セグメンテーションのためのマルチモーダルベンチマーク
- Authors: Chengyi Zhang, Zi Ye, Ziyang Wang,
- Abstract要約: セグメント認識型視覚質問応答(VQA)ベンチマークである textbfRoboSurg-VQA を提案する。
各フレームは、手順コンテキスト、解剖学(領域を含む)、画像のモダリティ/ビュー、外科的アーティファクト、画像品質、基本的な可視性および空間特性にまたがる固定された一連の臨床的動機付けられた質問とペアリングされる。
本報告では, 手術条件下でのベンチマーク統計, 衛生基準, 共通評価課題について報告する。
- 参考スコア(独自算出の注目度): 15.020056500396478
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Reliable visual understanding in robot-assisted and minimally invasive surgery (RMIS/MIS) demands more than accurate masks: in clinical practice, clinicians pose language-like questions about procedural context, visibility, artefacts, and the presence of anatomical structures and surgical instruments, often under degraded views caused by occlusion, smoke, bleeding, and specular highlights. We present \textbf{RoboSurg-VQA}, a segmentation-aware visual question answering (VQA) benchmark built by repurposing public surgical segmentation datasets under a shared schema. Each frame is paired with a fixed set of clinically motivated questions spanning procedure context, anatomy (including region), imaging modality/view, surgical artefacts, image quality, and basic visibility and spatial attributes, with closed answer sets to enable consistent evaluation. To scale annotation, we generate candidate answers via constrained prompting with automatic validity and consistency checks, followed by human auditing to improve plausibility and label consistency. We report benchmark statistics, sanity baselines, and common evaluation challenges under challenging surgical conditions. The code will be available on https://github.com/ziyangwang007/Robosurg-VQA.
- Abstract(参考訳): 臨床実践において、臨床医は、手続き的コンテキスト、可視性、人工物、解剖学的構造や手術器具の存在について言語のような質問をする。
本稿では,共有スキーマ下での外科的セグメンテーションデータセットを再取得して構築したセグメンテーション対応視覚質問応答(VQA)ベンチマークである,textbf{RoboSurg-VQA}を提案する。
各フレームは、手順コンテキスト、解剖学(領域を含む)、画像モダリティ/ビュー、外科的アーティファクト、画像品質、および基本的な視認性および空間的属性の固定されたセットと組み合わせて、一貫した評価を可能にする。
アノテーションをスケールするために,制約付きプロンプトによる候補回答を自動妥当性と一貫性チェックで生成し,続いて人間の監査を行い,妥当性とラベルの整合性を改善する。
本報告では, 手術条件下でのベンチマーク統計, 衛生基準, 共通評価課題について報告する。
コードはhttps://github.com/ziyangwang007/Robosurg-VQAで入手できる。
関連論文リスト
- SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA? [4.831595834944456]
視覚言語モデル(VLM)は、外科的視覚質問応答(VQA)において有望な性能を示す。
報告されたパフォーマンスが、このような言語的ショートカットへの依存や視覚的理解を反映しているかどうかは不明である。
本稿では,外科的VQAにおける言語的ショートカット依存度を定量化するための診断ベンチマークであるSurgCheckを紹介する。
論文 参考訳(メタデータ) (2026-05-03T14:47:03Z) - SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy [12.553409376394162]
SurgTEMPは、外科的ビデオ質問応答のための多モード視覚記憶フレームワークである。
我々は,32KのオープンエンドQAペアと3,855の動画セグメントからなる外科的ビデオ質問応答データセットであるCholeVidQA-32Kを紹介する。
SurgTEMPは、最先端のオープンソースマルチモーダルおよびビデオLLM(ファインチューニングとゼロショット)に対する包括的な評価において、大幅な性能改善を実現している。
論文 参考訳(メタデータ) (2026-03-31T16:27:46Z) - ProstaTD: Bridging Surgical Triplet from Classification to Fully Supervised Detection [54.270188252068145]
ProstaTDは、ロボット補助前立腺切除術の技術的要求領域から開発された、外科的三重項検出のための大規模なデータセットである。
このデータセットは、71,775の動画フレームと196,490の注釈付きトリプルトインスタンスで構成され、複数の機関で実施された21の手術から収集された。
ProstaTDは、これまでで最大かつ最も多様な3重項データセットであり、単純な分類から正確な空間的境界と時間的境界を持つ完全な検出へとフィールドを移動している。
論文 参考訳(メタデータ) (2025-06-01T19:29:39Z) - Surgical Foundation Model Leveraging Compression and Entropy Maximization for Image-Guided Surgical Assistance [50.486523249499115]
低侵襲手術(MIS)におけるリアルタイム映像理解の重要性
手術ビデオからコンパクトで情報的表現を学習するための,新しい自己教師型フレームワークであるCompress-to-Explore (C2E)を提案する。
C2Eは、エントロピー最大化デコーダを使用して、臨床的に関連する詳細を保持しながら画像を圧縮し、ラベル付きデータなしでエンコーダのパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2025-05-16T14:02:24Z) - Surgeons vs. Computer Vision: A comparative analysis on surgical phase recognition capabilities [65.66373425605278]
自動手術相認識(SPR)は、人工知能(AI)を使用して、手術ワークフローをその重要なイベントに分割する。
従来の研究は、短い外科手術と直線的な外科手術に焦点を合わせており、時間的文脈が手術の段階をよりよく分類する専門家の能力に影響を与えるかどうかを探索していない。
本研究は,ロボットによる部分腎切除(RAPN)を高度に非直線的に行うことに焦点を当て,これらのギャップに対処する。
論文 参考訳(メタデータ) (2025-04-26T15:37:22Z) - Advancing Surgical VQA with Scene Graph Knowledge [45.05847978115387]
我々は,シーングラフの知識を用いて,外科的文脈における視覚的質問応答を推し進めることを目指している。
我々は,楽器や解剖の空間的および行動的情報を用いた手術シーングラフを構築した。
軽量Scene-embedded Interaction Module(SIM)を用いた新しい手術用VQAモデルであるSSG-QA-Netを提案する。
論文 参考訳(メタデータ) (2023-12-15T22:50:12Z) - Surgical-VQLA: Transformer with Gated Vision-Language Embedding for
Visual Question Localized-Answering in Robotic Surgery [18.248882845789353]
本研究では,ロボット支援型手術シーンと記録映像からのアクティビティ理解を容易にするための手術質問応答システムを開発した。
既存のVQA手法の多くは、視覚的特徴を抽出し、答え生成のための質問の埋め込みテキストと融合するために、オブジェクト検出器と領域ベースの特徴抽出器を必要とする。
そこで我々は,ロボット手術における視覚的質問の局所化-回答(Surgical-VQLA)を提案し,回答予測中に特定の手術領域を局所化する。
論文 参考訳(メタデータ) (2023-05-19T14:13:47Z) - Robust Medical Instrument Segmentation Challenge 2019 [56.148440125599905]
腹腔鏡装置の術中追跡は、しばしばコンピュータとロボットによる介入の必要条件である。
本研究の課題は,30の手術症例から取得した10,040枚の注釈画像からなる外科的データセットに基づいていた。
結果は、初期仮説、すなわち、アルゴリズムの性能がドメインギャップの増大とともに低下することを確認する。
論文 参考訳(メタデータ) (2020-03-23T14:35:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。