Fugu-MT 論文翻訳(概要): SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting

論文の概要: SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting

arxiv url: http://arxiv.org/abs/2506.23309v1
Date: Sun, 29 Jun 2025 15:55:01 GMT
ステータス: 翻訳完了
システム内更新日: 2025-07-01 21:27:53.822842
Title: SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting
Title（参考訳）: SurgTPGS: テキスト・プロンプタブル・ガウス・スプレイティングによる意味的3D手術シーン理解
Authors: Yiming Huang, Long Bai, Beilei Cui, Kun Yuan, Guankun Wang, Mobarakol Islam, Nicolas Padoy, Nassir Navab, Hongliang Ren,
Abstract要約: 本稿では,このギャップを埋めるために,新しいテキストプロンプタブルなガウス分割法であるSurgTPGSを提案する。本研究では,意味的特徴のシームレスな変形を捉え,テクスチャと意味的特徴の双方をより正確に再構築する意味認識変形追跡法を提案する。本研究では,SurgTPGSの最先端技術に対する優位性を示すために,実世界の2つの外科的データセットの総合的な実験を行った。
参考スコア（独自算出の注目度）: 49.446696229020866
License: http://creativecommons.org/licenses/by-nc-sa/4.0/
Abstract: In contemporary surgical research and practice, accurately comprehending 3D surgical scenes with text-promptable capabilities is particularly crucial for surgical planning and real-time intra-operative guidance, where precisely identifying and interacting with surgical tools and anatomical structures is paramount. However, existing works focus on surgical vision-language model (VLM), 3D reconstruction, and segmentation separately, lacking support for real-time text-promptable 3D queries. In this paper, we present SurgTPGS, a novel text-promptable Gaussian Splatting method to fill this gap. We introduce a 3D semantics feature learning strategy incorporating the Segment Anything model and state-of-the-art vision-language models. We extract the segmented language features for 3D surgical scene reconstruction, enabling a more in-depth understanding of the complex surgical environment. We also propose semantic-aware deformation tracking to capture the seamless deformation of semantic features, providing a more precise reconstruction for both texture and semantic features. Furthermore, we present semantic region-aware optimization, which utilizes regional-based semantic information to supervise the training, particularly promoting the reconstruction quality and semantic smoothness. We conduct comprehensive experiments on two real-world surgical datasets to demonstrate the superiority of SurgTPGS over state-of-the-art methods, highlighting its potential to revolutionize surgical practices. SurgTPGS paves the way for developing next-generation intelligent surgical systems by enhancing surgical precision and safety. Our code is available at: https://github.com/lastbasket/SurgTPGS.
Abstract（参考訳）: 現代における外科的研究と実践において,3D手術シーンをテキスト・プロンプト可能な能力で正確に理解することは,外科的計画や術中指導において特に重要であり,外科的ツールや解剖学的構造を正確に識別し,操作することが最重要である。しかし、既存の研究は、リアルタイムのテキストプロンプタブルな3Dクエリをサポートしていない、手術用視覚言語モデル(VLM)、3D再構成、セグメンテーションに重点を置いている。本稿では,このギャップを埋めるために,新しいテキストプロンプブルなガウス分割法であるSurgTPGSを提案する。本稿では,Segment Anythingモデルと最先端のビジョン言語モデルを取り入れた3Dセマンティクス機能学習戦略を提案する。本研究では,3次元手術シーン再構築のためのセグメント言語の特徴を抽出し,複雑な手術環境のより深い理解を可能にする。また,意味的特徴のシームレスな変形を捉え,テクスチャと意味的特徴の双方をより正確に再構築する意味認識変形追跡を提案する。さらに,地域ごとのセマンティック情報を利用してトレーニングを監督するセマンティック・リージョン・アウェア・最適化を提案する。我々は2つの実世界の外科的データセットに関する総合的な実験を行い、SurgTPGSが最先端の方法よりも優れていることを実証し、外科的プラクティスに革命をもたらす可能性を強調した。 SurgTPGSは、外科的精度と安全性を向上させることによって、次世代のインテリジェントな手術システムを開発するための道を開く。私たちのコードは、https://github.com/lastbasket/SurgTPGS.comで利用可能です。

関連論文リスト

Surgical Foundation Model Leveraging Compression and Entropy Maximization for Image-Guided Surgical Assistance [50.486523249499115]
低侵襲手術(MIS)におけるリアルタイム映像理解の重要性手術ビデオからコンパクトで情報的表現を学習するための,新しい自己教師型フレームワークであるCompress-to-Explore (C2E)を提案する。 C2Eは、エントロピー最大化デコーダを使用して、臨床的に関連する詳細を保持しながら画像を圧縮し、ラベル付きデータなしでエンコーダのパフォーマンスを向上させる。
論文参考訳（メタデータ） (2025-05-16T14:02:24Z)
OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining [60.75854609803651]
OphCLIPは、眼科手術ワークフロー理解のための階層的検索強化視覚言語事前学習フレームワークである。 OphCLIPは、短いビデオクリップと詳細な物語記述、構造化タイトルによるフルビデオの調整によって、細粒度と長期の視覚表現の両方を学習する。我々のOphCLIPは、探索されていない大規模なサイレント手術ビデオを活用するために、検索強化事前訓練フレームワークも設計している。
論文参考訳（メタデータ） (2024-11-23T02:53:08Z)
A Review of 3D Reconstruction Techniques for Deformable Tissues in Robotic Surgery [8.909938295090827]
NeRFベースの技術は、暗黙的にシーンを再構築する能力に注目が集まっている。一方、3D-GSは3Dガウシアンを明示的に使用し、NeRFの複雑なボリュームレンダリングの代替として2D平面に投影するシーンを表現している。この研究は、最先端のSOTA(State-of-the-art)アプローチを探求し、レビューし、彼らのイノベーションと実装原則について議論する。
論文参考訳（メタデータ） (2024-08-08T12:51:23Z)
SurgicalGaussian: Deformable 3D Gaussians for High-Fidelity Surgical Scene Reconstruction [17.126895638077574]
内視鏡的ビデオにおける変形性組織の動的再構成は、ロボット支援手術の鍵となる技術である。 NeRFは、シーン内のオブジェクトの複雑な詳細をキャプチャするのに苦労します。我々のネットワークは、レンダリング品質、レンダリング速度、GPU使用率など、多くの面で既存の手法よりも優れています。
論文参考訳（メタデータ） (2024-07-06T09:31:30Z)
HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition [51.222684687924215]
HecVLは、一般的な手術モデルを構築するための新しい階層型ビデオ言語事前学習手法である。異なる階層レベルの埋め込み空間を分離することにより、学習されたマルチモーダル表現は、同じモデルにおける短期的および長期的な外科的概念を符号化する。外科的位相認識のための同じHecVLモデルが、異なる外科手術と医療センター間で転送可能であることを示す。
論文参考訳（メタデータ） (2024-05-16T13:14:43Z)
SAMSNeRF: Segment Anything Model (SAM) Guides Dynamic Surgical Scene Reconstruction by Neural Radiance Field (NeRF) [4.740415113160021]
本稿では,Segment Anything Model(SAM)とNeRF技術を組み合わせたSAMSNeRFという新しい手法を提案する。内視鏡下外科的画像を用いた実験の結果,高忠実度ダイナミックな手術シーンの再構築に成功していることが示された。
論文参考訳（メタデータ） (2023-08-22T20:31:00Z)
Learning Multi-modal Representations by Watching Hundreds of Surgical Video Lectures [50.09187683845788]
手術用コンピュータビジョンの応用の最近の進歩は、視覚のみのモデルによって駆動されている。これらの手法は、固定されたオブジェクトカテゴリのセットを予測するために手動で注釈付き手術ビデオに依存する。本研究では,オープンな外科的eラーニングプラットフォームを通じて提供される外科的ビデオ講義が,効果的な視覚と言語監督の信号を提供することができるという考えを提起した。
論文参考訳（メタデータ） (2023-07-27T22:38:12Z)
Text Promptable Surgical Instrument Segmentation with Vision-Language Models [16.203166812021045]
そこで本研究では,手術器具の多様性と分化に関わる課題を克服するために,新たなテキストプロンプト可能な手術器具セグメンテーション手法を提案する。我々は、事前訓練された画像とテキストエンコーダをモデルバックボーンとして利用し、テキストプロンプト可能なマスクデコーダを設計する。いくつかの手術器具セグメンテーションデータセットの実験は、我々のモデルの優れた性能と有望な一般化能力を示す。
論文参考訳（メタデータ） (2023-06-15T16:26:20Z)
Semantic-SuPer: A Semantic-aware Surgical Perception Framework for Endoscopic Tissue Classification, Reconstruction, and Tracking [21.133420628173067]
外科的知覚の枠組みであるSemantic-SuPerを提案する。データアソシエーション、3D再構成、内視鏡的シーンの追跡を容易にするため、幾何学的および意味的な情報を統合する。
論文参考訳（メタデータ） (2022-10-29T19:33:21Z)
Multimodal Semantic Scene Graphs for Holistic Modeling of Surgical Procedures [70.69948035469467]
カメラビューから3Dグラフを生成するための最新のコンピュータビジョン手法を利用する。次に,手術手順の象徴的,意味的表現を統一することを目的としたマルチモーダルセマンティックグラフシーン(MSSG)を紹介する。
論文参考訳（メタデータ） (2021-06-09T14:35:44Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。