論文の概要: Streamlining stereo differentiable rendering for marker-free real-time tracking of surgical robots
- arxiv url: http://arxiv.org/abs/2607.12604v1
- Date: Tue, 14 Jul 2026 10:28:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.118606
- Title: Streamlining stereo differentiable rendering for marker-free real-time tracking of surgical robots
- Title(参考訳): 手術ロボットのマーカーフリーリアルタイムトラッキングのためのステレオ微分レンダリング
- Authors: Yanghe Hao, Martin Huber, Christos Bergeles, Tom Vercauteren,
- Abstract要約: マーカーレスリアルタイムロボットのポーズトラッキングにおけるステレオ微分可能レンダリングの評価を行った。
リアルタイム1080pのトラッキングを30fps(バニラロベレグの14fpsからアップアップ)で達成し、カメラフレームレートにマッチする。
- 参考スコア(独自算出の注目度): 7.312849670879312
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Purpose: Marker-based tracking of surgical robots is occlusion-prone in cluttered operating rooms. We evaluate stereo differentiable rendering for marker-free, real-time robot pose tracking, potentially improving safety, reducing setup time, and enabling multi-robot interaction. Methods: We extend the markerless pose estimation framework roboreg to online dynamic tracking via (i) sequential optimisation that propagates pose estimates across frames with motion-adaptive hyperparameter tuning, and (ii) CUDA stream parallelisation of segmentation and optimisation, combined with CUDA-graph accelerated segmentation. We evaluate on 38 unobstructed and 5 occluded displacement sequences with static start/end ground-truth calibrations and dynamic marker-based reference tracking. Results: We achieve real-time 1080p tracking at 30 fps (up from 14 fps for vanilla roboreg), matching the camera frame rate. Accuracy reaches 1.7 cm / 0.6 deg against static ground truth and 1.2 cm mean 3D error over 27,460 frames against the marker-based reference (1.53 cm over 1,242 occluded frames). Our method outperforms FoundationPose by 11% in dynamic estimation (63% under occlusion) and 250% in static estimation, with 6x faster inference. Conclusions: Stereo differentiable rendering enables real-time, high-resolution marker-free surgical robot tracking, on par with marker-based approaches and surpassing foundation-model baselines.
- Abstract(参考訳): 目的: 乱雑な手術室において, 手術ロボットのマーカーによる追跡は閉塞性が高い。
マーカーレスリアルタイムロボットのポーズトラッキングにおけるステレオ微分可能レンダリングの評価,安全性の向上,セットアップ時間短縮,マルチロボットインタラクションの実現について検討した。
方法: マーカーレスポーズ推定フレームワークRoboreegをオンライン動的トラッキングに拡張する。
一 動き適応型ハイパーパラメータチューニングによるフレーム間のポーズ推定を伝播する逐次最適化、及び
(II)CUDAストリームのセグメンテーションと最適化の並列化とCUDAグラフ加速セグメンテーションを組み合わせた。
静的スタート/エンド接地トルースキャリブレーションと動的マーカーに基づく基準追跡を併用した38個の非閉塞および5個の隠蔽変位列について評価した。
結果: リアルタイム1080pのトラッキングは30fps(バニラ・ロベレグの14fpsから上昇)で達成し, カメラフレームレートと一致した。
静的接地真実に対して1.7 cm / 0.6 degに達し、1.2 cm は27,460フレーム以上の3D誤差をマーカーベースの参照(1.53 cm 以上の1,242個の隠蔽フレーム)に対して意味している。
提案手法は,動的推定が11%,静的推定が250%,推算が6倍に向上した。
結論:ステレオ微分レンダリングは、マーカーベースのアプローチと同等で、基礎モデルベースラインを超越したリアルタイムかつ高解像度のマーカーフリーな手術ロボット追跡を可能にする。
関連論文リスト
- Time-to-Collision Based Dynamic Obstacle Avoidance Using Pretrained Vision Models for Robots in Unstructured Environments [12.499778437707759]
実世界のデータに完全に依存する視覚に基づく動的障害物回避手法を提案する。
提案手法はシミュレーション訓練されたポリシーに固有のシム・トゥ・リアル・トランスファー問題を回避する。
テストシーケンスに存在する22種類の物理的障害のうち、少なくとも1フレームのTCCを1秒未満で検出する。
論文 参考訳(メタデータ) (2026-07-08T19:41:19Z) - RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics [53.053660003572965]
本稿では,3次元空間参照と計測の両方を初めて実現した3D対応VLMであるRoboTracerを提案する。
RoboTracerは、強化微調整により、多段階のメートル法推論を進める。
本稿では,空間的トレーシングを評価する上で困難なベンチマークであるTraceSpatial-Benchを提案する。
論文 参考訳(メタデータ) (2025-12-15T18:52:43Z) - Multi-View 3D Point Tracking [67.21282192436031]
本稿では,複数のカメラビューを用いた動的シーンにおける任意の点の追跡を目的とした,データ駆動型マルチビュー3Dポイントトラッカーについて紹介する。
本モデルでは,現実的な数のカメラを用いて直接3次元対応を推定する。
我々は5K合成多視点Kubricシーケンスをトレーニングし、2つの実世界のベンチマークで評価する。
論文 参考訳(メタデータ) (2025-08-28T17:58:20Z) - SpatialTrackerV2: 3D Point Tracking Made Easy [73.0350898700048]
SpaceTrackerV2はモノクロビデオのフィードフォワード3Dポイントトラッキング手法である。
これは、世界空間の3Dモーションをシーン幾何学、カメラエゴモーション、ピクセルワイドオブジェクトモーションに分解する。
このような異種データから幾何学と運動を共同で学習することで、SpatialTrackerV2は既存の3Dトラッキング方法よりも30%優れています。
論文 参考訳(メタデータ) (2025-07-16T17:59:03Z) - Towards Accurate State Estimation: Kalman Filter Incorporating Motion Dynamics for 3D Multi-Object Tracking [11.111388829965103]
本研究は、3次元多対象追跡(MOT)のためのカルマンフィルタにおける状態推定の精度の欠如に対処する。
既存の文献は、各物体に特有の複雑な運動力学を無視し、物体の状態の推定に一定の運動モデルに依存するのが一般的である。
この研究は、運動力学を取り入れたカルマンフィルタの新たな定式化を導入し、運動モデルが物体の動きの変化に応じて適応的に調整できるようにする。
論文 参考訳(メタデータ) (2025-05-12T06:09:32Z) - Modeling Continuous Motion for 3D Point Cloud Object Tracking [54.48716096286417]
本稿では,各トラックレットを連続ストリームとみなす新しいアプローチを提案する。
各タイムスタンプでは、現在のフレームだけがネットワークに送られ、メモリバンクに格納された複数フレームの履歴機能と相互作用する。
頑健な追跡のためのマルチフレーム機能の利用性を高めるために,コントラッシブシーケンス強化戦略を提案する。
論文 参考訳(メタデータ) (2023-03-14T02:58:27Z) - An Improved End-to-End Multi-Target Tracking Method Based on Transformer
Self-Attention [24.17627001939523]
本研究では,エンドツーエンドのマルチターゲット追跡アルゴリズムを提案する。
変換器のエンコーダ・デコーダ構造の自己検出機構に基づいてマルチビューのマルチスケールシーンに適応する。
論文 参考訳(メタデータ) (2022-11-11T04:58:46Z) - MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose
Estimation in Video [75.23812405203778]
近年, 学習時間相関のため, 全フレームのボディジョイントを世界規模で考慮し, 2次元キーポイントシーケンスから3次元人間のポーズを推定する手法が提案されている。
本研究では,各関節の時間的動きを別々にモデル化する時間的変圧器ブロックと,関節間空間相関を有する変圧器ブロックを有するミキシングミキシングを提案する。
さらに、ネットワーク出力は、中央フレームから入力ビデオの全フレームに拡張され、入力と出力のベンチマーク間のコヒーレンスが改善される。
論文 参考訳(メタデータ) (2022-03-02T04:20:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。