論文の概要: Recon2Servo: Robotic Ultrasound Visual Servoing via Learned Image-to-Motion Inference
- arxiv url: http://arxiv.org/abs/2610.06010v1
- Date: Mon, 05 Oct 2026 09:07:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 19:26:57.703206
- Title: Recon2Servo: Robotic Ultrasound Visual Servoing via Learned Image-to-Motion Inference
- Title(参考訳): Recon2Servo:学習した画像と運動の推論によるロボット超音波ビジュアルサーボ
- Abstract要約: 本研究では,6-DoFプローブ制御のためのBモード画像から直接画像と動きの推論を学習するビジュアルサーボフレームワークRecon2Servoを提案する。
低ランク適応DINOv3エンコーダと双方向関係モジュールは、電流と目標画像の間の相対プローブポーズを推定する。
このフレームワークは、教師付き相対目的学習、再構築誘導閉ループ適応、および有界残留ポーズ補正を組み合わせたものである。
- 参考スコア(独自算出の注目度): 11.68177464400208
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Ultrasound visual servoing is essential for autonomous robotic ultrasound, yet 6-DoF probe control from 2D B-mode images remains challenging due to limited and ambiguous out-of-plane motion cues. Existing methods typically rely on anatomical priors or handcrafted visual features, limiting their generalizability across imaging targets. Inspired by trackerless 3D ultrasound reconstruction, we propose Recon2Servo, a visual servoing framework that learns image-to-motion inference directly from B-mode images for 6-DoF probe control. A DINOv3 encoder with low-rank adaptation and a bidirectional relation module estimate the relative probe pose between current and target images to guide iterative closed-loop target-view alignment. The framework combines supervised relative-pose learning, reconstruction-guided closed-loop adaptation, and bounded residual pose correction to improve motion inference during servoing. Evaluations on a public dataset and an in-house dataset collected from 12 healthy volunteers using different ultrasound systems demonstrate its effectiveness in reconstructed-volume servoing. Additional real-robot demonstrations of target-view alignment and dynamic tracking on a human forearm are provided in the supplementary video: https://youtu.be/qwsOdI-GMYk.
- Abstract(参考訳): 超音波による視覚サーボは自律型ロボティクスには不可欠だが、2次元Bモード画像からの6-DoFプローブ制御は、限定的で曖昧な外面運動キューのため、依然として困難である。
既存の方法は通常、解剖学的な先行や手作りの視覚的特徴に頼り、撮像対象の一般化性を制限している。
Recon2Servoは6-DoFプローブ制御のためのBモード画像から直接画像と動きの推論を学習するビジュアルサーボフレームワークである。
低ランク適応のDINOv3エンコーダと双方向関係モジュールは、電流と目標画像の間の相対プローブポーズを推定し、反復的な閉ループターゲットビューアライメントを誘導する。
このフレームワークは、教師付き相対的目的学習、再構築誘導閉ループ適応、および有界残留ポーズ補正を組み合わせて、サーボ中の動き推論を改善する。
異なる超音波システムを用いた12人の健康なボランティアから収集した公開データセットと社内データセットの評価は、再建されたボリュームサーボにおける効果を示す。
人間の前腕にターゲットビューアライメントとダイナミックトラッキングのさらなる実ロボットデモが補足ビデオで提供されている。
関連論文リスト
- Contact-Adaptive Robotic Ultrasound Probe Control for Tissue Exploration and Continuous Task-Relevant Visualization Using Robot-Free Image-Motion Demonstration [3.915263615410247]
ロボットレス実験から得られた接触適応型ロボット超音波モニタリングについて述べる。
Sonologgerは6軸慣性センサーを臨床医が操作するプローブにクランプし、超音波とプローブフレームの相対回転をロボット、カメラ、トラッカーなしで記録する。
論文 参考訳(メタデータ) (2026-09-27T07:35:47Z) - 3D MRI Image Pretraining via Controllable 2D Slice Navigation Task [21.334351019760252]
自己教師付きプレトレーニングは、ラベルなしスキャンからMRI表現を学ぶための主流のアプローチとなっている。
マスクしたパッチの再構築と異なる、固有の自己超越信号が存在するかどうかを問う。
スライスを連続的な位置、向き、スケールでレンダリングすることで、3Dボリュームを高密度なビデオアクションシーケンスに変換することができる。
論文 参考訳(メタデータ) (2026-05-07T16:08:22Z) - Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation [57.28703268044067]
ロボット操作のための新しいデュアルストリームビュー変換器であるCortical Policyを提案する。
われわれのフレームワークは、ロボット操作の新しい視点を提供し、視覚に基づくロボット制御の幅広い応用の可能性を秘めている。
論文 参考訳(メタデータ) (2026-03-22T04:18:54Z) - Accurate Open-Loop Control of a Soft Continuum Robot Through Visually Learned Latent Representations [4.857795247230421]
本研究は,ビデオ学習型潜伏力学からソフト連続ロボット(SCR)のオープンループ制御に対処する。
ABCDベースのモデルは、画像空間追跡エラーを一貫して減少させる。
いくつかのアーキテクチャ選択とトレーニング設定は、オープンループ制御のパフォーマンスに寄与する。
論文 参考訳(メタデータ) (2026-03-20T05:43:26Z) - PoseDiff: A Unified Diffusion Model Bridging Robot Pose Estimation and Video-to-Action Control [67.17998939712326]
本稿では,ロボットの状態推定と制御を単一のフレームワーク内で統一する条件拡散モデルPoseDiffを提案する。
中心となるPoseDiffは、生の視覚を3Dキーポイントや関節角などの構造化されたロボットの状態にマッピングする。
この基盤の上に構築されたPoseDiffは、ビデオからアクションへの逆ダイナミクスに自然に拡張する。
論文 参考訳(メタデータ) (2025-09-29T10:55:48Z) - Accelerating 3D Photoacoustic Computed Tomography with End-to-End Physics-Aware Neural Operators [74.65171736966131]
光音響計算トモグラフィ(PACT)は、光コントラストと超音波分解能を組み合わせることで、光拡散限界を超える深部像を実現する。
現在の実装では、高密度トランスデューサアレイと長い取得時間を必要とし、臨床翻訳を制限している。
本研究では,センサ計測からボリューム再構成まで,逆音響マッピングを直接学習する物理認識モデルであるPanoを紹介する。
論文 参考訳(メタデータ) (2025-09-11T23:12:55Z) - EchoWorld: Learning Motion-Aware World Models for Echocardiography Probe Guidance [79.66329903007869]
本稿では,プローブ誘導のためのモーションアウェアな世界モデリングフレームワークであるEchoWorldを紹介する。
解剖学的な知識と運動によって引き起こされる視覚力学を符号化する。
200以上の定期的なスキャンから100万枚以上の超音波画像で訓練されている。
論文 参考訳(メタデータ) (2025-04-17T16:19:05Z) - Enhancing Free-hand 3D Photoacoustic and Ultrasound Reconstruction using Deep Learning [3.8426872518410997]
本研究では,携帯型光音響・超音波(PAUS)画像における3次元再構成を支援するため,グローバルローカル自己保持モジュール(MoGLo-Net)を用いたモーションベース学習ネットワークを提案する。
MoGLo-Netは、連続した超音波画像内の完全に発達したスペックル領域や高発癌組織領域などの臨界領域を利用して、運動パラメータを正確に推定する。
論文 参考訳(メタデータ) (2025-02-05T11:59:23Z) - Geometric-aware Pretraining for Vision-centric 3D Object Detection [77.7979088689944]
GAPretrainと呼ばれる新しい幾何学的事前学習フレームワークを提案する。
GAPretrainは、複数の最先端検出器に柔軟に適用可能なプラグアンドプレイソリューションとして機能する。
BEVFormer法を用いて, nuScenes val の 46.2 mAP と 55.5 NDS を実現し, それぞれ 2.7 と 2.1 点を得た。
論文 参考訳(メタデータ) (2023-04-06T14:33:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。