論文の概要: AI-based single-shot structured-light depth reconstruction for real-time laparoscopic surgical guidance
- arxiv url: http://arxiv.org/abs/2608.05109v1
- Date: Wed, 05 Aug 2026 17:44:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.064251
- Title: AI-based single-shot structured-light depth reconstruction for real-time laparoscopic surgical guidance
- Title(参考訳): リアルタイム腹腔鏡下手術指導のためのAIを用いたシングルショット構造化光深度再構成
- Authors: Wayne Wonseok Rodgers, Xiangyi Le, Seonghoon Jang, Shuwen Wei, Justin Opfermann, Michael Kam, Axel Krieger, Jin U. Kang,
- Abstract要約: 遅延空間深度再構成を施したLED照射型バイナリパターンプラットフォームにより,同期のないビデオレートの内視鏡深度推定が可能となった。
提案モデルはU-Net MaskNet+DepthNetベースラインよりも低いMAEを実現し,MAE,AbsRel,しきい値精度で既製の単分子深度モデルより優れていた。
- 参考スコア(独自算出の注目度): 3.241053244023025
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Significance. Accurate intraoperative depth perception is important for autonomous and semi-autonomous robotic laparoscopic surgery. Conventional fringe projection profilometry can achieve millimeter-scale accuracy but often requires multi-shot acquisition, digital-micromirror-device projection, and projector-camera synchronization, complicating integration into compact laparoscopic systems. Aim. To develop a synchronization-free, single-shot depth-sensing platform using a passive LED-illuminated binary mask and a VQ-VAE prior with a custom U-Net depth head. Approach. A compact projection module was coupled to one channel of a dual-channel laparoscope, while the second channel imaged the fringe-illuminated target. A Zivid 3D camera acquired reference depth for 722 paired phantom images. Zivid depth maps were reprojected into the SSLE image frame for supervised training and evaluation. The VQ-VAE encoded each input into a discrete latent representation, and a latent-space U-Net predicted depth without a separate mask-prediction branch. Results. Using a fixed train/validation/test split, the proposed model achieved an MAE of 3.70 mm, AbsRel of 0.0326, delta=1.1 accuracy of 0.962, and delta=1.1^2 accuracy of 0.970. It achieved lower MAE than the dual U-Net MaskNet + DepthNet baseline and outperformed off-the-shelf monocular depth models in MAE, AbsRel, and threshold accuracy. The pipeline operated at 26.0 Hz over 301 consecutive frames on an NVIDIA A100 GPU. Conclusions. The LED-illuminated binary-pattern platform with latent-space depth reconstruction enables synchronization-free, video-rate endoscopic depth estimation. Results demonstrate Zivid-referenced phantom reconstruction without an explicit segmentation stage, while emphasizing the importance of dataset size and SSLE-Zivid calibration accuracy.
- Abstract(参考訳): 重要なこと。
腹腔鏡下腹腔鏡下手術では,正確な術中深度知覚が重要である。
従来のフリンジプロファイロメトリーはミリスケールの精度を達成できるが、マルチショット取得、デジタル・マイクロミラー・デバイス・プロジェクション、プロジェクター・カメラ同期が必要であり、小型の腹腔鏡システムへの統合が複雑である。
エイム。
カスタムU-Net深度ヘッドに先立って、受動LED照明二面マスクとVQ-VAEを用いた同期不要単発深度センシングプラットフォームを開発する。
アプローチ。
小型の投射モジュールをデュアルチャネル腹腔鏡の1つのチャネルに結合し,第2のチャンネルはフリンジ照射されたターゲットを撮像した。
Zivid 3Dカメラが722対のファントム画像の基準深度を取得した。
Zividの深度マップはSSLE画像フレームに再投影され、教師付きトレーニングと評価が行われた。
VQ-VAEは各入力を離散的な潜時表現に符号化し、潜時空間のU-Netは個別のマスク予測枝なしで予測深度を予測した。
結果。
固定列車/バリデーション/テストスプリットを用いて、提案モデルは3.70mm、AbsRel 0.0326、delta=1.1精度0.962、delta=1.1^2精度0.970を達成した。
デュアルU-Net MaskNet + DepthNetベースラインよりも低いMAEを実現し、MAE、AbsRel、しきい値精度で既製の単分子深度モデルより優れていた。
パイプラインはNVIDIA A100 GPU上で301フレーム以上で26.0Hzで動作する。
結論。
遅延空間深度再構成を施したLED照射型バイナリパターンプラットフォームにより,同期のないビデオレートの内視鏡深度推定が可能となった。
Zivid-referenced phantom reconstruction without an explicit segmentation stage, in the importance of dataset size and SSLE-Zivid calibration accuracy。
関連論文リスト
- Three-Dimensional Retinal Microvasculature Restoration in OCT Angiography [4.442929593591647]
本稿では,1つのOCTAボリュームから解剖学的血管を復元する深層学習アルゴリズムを提案する。
提案モデルでは,元のOCTAボリュームに比べて画質が大幅に向上した。
論文 参考訳(メタデータ) (2026-06-03T19:23:09Z) - PFDepth: Heterogeneous Pinhole-Fisheye Joint Depth Estimation via Distortion-aware Gaussian-Splatted Volumetric Fusion [61.6340987158734]
ヘテロジニアス多視点深度推定のための最初のピンホール・フィッシュアイ・フレームワークPFDepthを提案する。
PFDepthは、ピンホールと魚眼カメラの任意の組み合わせを、様々な内在と外生とで処理できる統一アーキテクチャを採用している。
我々は,現在の主流深度ネットワーク上でのKITTI-360およびRealHetデータセットに対して,PFDepthが最先端の性能を示すことを示す。
論文 参考訳(メタデータ) (2025-09-30T09:38:59Z) - Enhanced Encoder-Decoder Architecture for Accurate Monocular Depth Estimation [0.0]
本稿では,拡張エンコーダデコーダアーキテクチャを用いた新しい深層学習手法を提案する。
マルチスケールの特徴抽出を取り入れ、様々な物体の大きさと距離の深さ予測精度を高める。
KITTIデータセットによる実験結果から,本モデルでは0.019秒でかなり高速な推定時間を達成できた。
論文 参考訳(メタデータ) (2024-10-15T13:46:19Z) - EndoPerfect: High-Accuracy Monocular Depth Estimation and 3D Reconstruction for Endoscopic Surgery via NeRF-Stereo Fusion [11.798218793025974]
内視鏡下副鼻腔手術(ESS)では,術中CTは術中評価に有用であるが,着床速度や放射線曝露に制約がある。
既存の技術は、しばしば密度の高い再建に必要なサブミリ精度を達成するのに苦労する。
本稿では,Neural Radiance Fields(NeRF)を中間表現として活用するオンライン学習手法を提案する。
提案手法では,0.5mm未満の点間精度が0.125$pm$0.443mmであることを示す。
論文 参考訳(メタデータ) (2024-10-05T05:26:21Z) - SDGE: Stereo Guided Depth Estimation for 360$^\circ$ Camera Sets [65.64958606221069]
マルチカメラシステムは、360ドル周の知覚を達成するために、しばしば自律走行に使用される。
360ドル(約3万3000円)のカメラセットは、しばしば制限または低品質のオーバーラップ領域を持ち、画像全体に対してマルチビューステレオメソッドを実現する。
重なりの重なりに多視点ステレオ結果を明示的に利用することにより、全画像の深さ推定を強化するステレオガイド深度推定法(SGDE)を提案する。
論文 参考訳(メタデータ) (2024-02-19T02:41:37Z) - Facial Depth and Normal Estimation using Single Dual-Pixel Camera [81.02680586859105]
DP指向のDepth/Normalネットワークを導入し,3次元顔形状を再構成する。
これは、メートル法スケールでの深度マップと表面正規を含む、対応する地上3次元モデルを含んでいる。
近年のDPベース深度/正規推定法で最先端の性能を実現している。
論文 参考訳(メタデータ) (2021-11-25T05:59:27Z) - A Single Stream Network for Robust and Real-time RGB-D Salient Object
Detection [89.88222217065858]
我々は、深度マップを用いて、RGBと深度の間の早期融合と中核融合を誘導する単一ストリームネットワークを設計する。
このモデルは、現在の最も軽量なモデルよりも55.5%軽く、32 FPSのリアルタイム速度で384倍の384ドルの画像を処理している。
論文 参考訳(メタデータ) (2020-07-14T04:40:14Z) - OmniSLAM: Omnidirectional Localization and Dense Mapping for
Wide-baseline Multi-camera Systems [88.41004332322788]
超広視野魚眼カメラ(FOV)を用いた広視野多視点ステレオ構成のための全方向位置決めと高密度マッピングシステムを提案する。
より実用的で正確な再構築のために、全方向深度推定のための改良された軽量のディープニューラルネットワークを導入する。
我々は全方位深度推定をビジュアル・オドメトリー(VO)に統合し,大域的整合性のためのループ閉鎖モジュールを付加する。
論文 参考訳(メタデータ) (2020-03-18T05:52:10Z) - D3VO: Deep Depth, Deep Pose and Deep Uncertainty for Monocular Visual
Odometry [57.5549733585324]
D3VOは、深度、ポーズ、不確実性推定という3つのレベルでディープネットワークを利用する、単眼の視覚計測のための新しいフレームワークである。
まず,ステレオビデオを用いた自己監督型単眼深度推定ネットワークを提案する。
入力画像上の画素の光度不確かさをモデル化し、深度推定精度を向上させる。
論文 参考訳(メタデータ) (2020-03-02T17:47:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。