論文の概要: Strategy-Supervised Autonomous Laparoscopic Camera Control via Event-Driven Graph Mining
- arxiv url: http://arxiv.org/abs/2602.20500v1
- Date: Tue, 24 Feb 2026 02:56:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-25 17:34:53.587035
- Title: Strategy-Supervised Autonomous Laparoscopic Camera Control via Event-Driven Graph Mining
- Title(参考訳): イベント駆動グラフマイニングによる戦略監督型自律腹腔鏡カメラ制御
- Abstract要約: 本稿では,ハイレベルな視覚言語推論と低レベルなクローズドループ制御を併用したストラテジグラウンドフレームワークを提案する。
オフラインで生の外科的ビデオは、カメラ関連の時間的イベントに解析され、属性付きイベントグラフとして構造化される。
オンラインでは、微調整されたビジョン・ランゲージ・モデル(VLM)がライブ腹腔鏡像を処理し、支配的な戦略と離散的な画像ベースのモーションコマンドを予測する。
- 参考スコア(独自算出の注目度): 15.995867664955348
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous laparoscopic camera control must maintain a stable and safe surgical view under rapid tool-tissue interactions while remaining interpretable to surgeons. We present a strategy-grounded framework that couples high-level vision-language inference with low-level closed-loop control. Offline, raw surgical videos are parsed into camera-relevant temporal events (e.g., interaction, working-distance deviation, and view-quality degradation) and structured as attributed event graphs. Mining these graphs yields a compact set of reusable camera-handling strategy primitives, which provide structured supervision for learning. Online, a fine-tuned Vision-Language Model (VLM) processes the live laparoscopic view to predict the dominant strategy and discrete image-based motion commands, executed by an IBVS-RCM controller under strict safety constraints; optional speech input enables intuitive human-in-the-loop conditioning. On a surgeon-annotated dataset, event parsing achieves reliable temporal localization (F1-score 0.86), and the mined strategies show strong semantic alignment with expert interpretation (cluster purity 0.81). Extensive ex vivo experiments on silicone phantoms and porcine tissues demonstrate that the proposed system outperforms junior surgeons in standardized camera-handling evaluations, reducing field-of-view centering error by 35.26% and image shaking by 62.33%, while preserving smooth motion and stable working-distance regulation.
- Abstract(参考訳): 自律型腹腔鏡カメラコントロールは、外科医に解釈可能なまま、迅速なツールとタスクの相互作用の下で安定かつ安全な外科的視界を維持する必要がある。
本稿では,ハイレベルな視覚言語推論と低レベルなクローズドループ制御を併用したストラテジグラウンドフレームワークを提案する。
オフラインでは、生の外科的ビデオは、カメラに関連する時間的事象(例えば、相互作用、作業距離のずれ、ビュー品質の低下)に解析され、属性付きイベントグラフとして構造化される。
これらのグラフをマイニングすることで、再利用可能なカメラハンドリング戦略プリミティブのコンパクトなセットが得られ、学習のための構造化された監視を提供する。
オンラインでは、微調整されたビジョン・ランゲージ・モデル(VLM)がライブ・ラパロスコープ・ビューを処理し、厳密な安全制約の下でIBVS-RCMコントローラによって実行される、支配的な戦略と離散的な画像ベースのモーション・コマンドを予測する。
外科医がアノテートしたデータセットでは、イベント解析は信頼できる時間的局所化(F1スコア0.86)を実現し、マイニングされた戦略は専門家の解釈(クラスタ純度0.81)と強いセマンティックアライメントを示す。
シリコーンファントムとブタの組織に関する大規模な生体外実験により、提案システムは、カメラハンドリングの評価においてジュニア外科医よりも優れ、視野中心誤差を35.26%減らし、画像震動を62.33%減らし、スムーズな動きと安定した作業距離規制を維持した。
関連論文リスト
- SurgLAT: Surgical Latent Attention Tracking for Depth-Aware Robotic Laparoscope Control [32.598197128759146]
SurgLAT(SurgLAT)は遅発性手術注意モデルと自律腹腔鏡視下視力制御のための因果的オンラインフレームワークである。
SurgLATは、凍結したDINOv3エンコーダと状態条件の空間トークンミキサーを使用して、メモリ誘導された空間的事前の操作証拠を抽出する。
さらに,仮想軸の定式化に基づくラパロスコープ・リモート・センター・オブ・モーション(RCM)制約によるロボット配置フレームワークを導入する。
論文 参考訳(メタデータ) (2026-08-08T03:04:01Z) - Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach [60.596944437968524]
partialVisGraphは、制約されたフィールド・オブ・ビューの下で、堅牢なスケルトンベースのアクション認識のための新しいフレームワークである。
部分的な可視性の下では、最先端の精度を一貫して達成し、厳しいFoV制限のあるサブセットでは68.8%まで上昇する。
提案手法は,非拘束環境下でのスケルトンに基づく行動理解を実現するための,原則的かつ実践的な経路を提供する。
論文 参考訳(メタデータ) (2026-07-01T10:03:11Z) - BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation [6.2182538853159]
内視鏡的逆行性胆管膵管造影(ERCP)は正確な内視鏡ナビゲーションと安定した胆道狭窄を必要とする。
最近のロボットシステムと視覚に基づく支援技術は、オペレーター・エルゴノミクスを改善し、知覚的手がかりを提供する。
本稿では,ビジュモータ学習問題として胆道内視鏡ナビゲーションを定式化するシーン認識型視覚・言語・アクションフレームワークであるBiliVLAを提案する。
論文 参考訳(メタデータ) (2026-06-22T16:11:15Z) - SurgVista: Long-Horizon Surgical World Modeling with Plausible Instrument-Tissue Dynamics [49.771521708359955]
SurgVistaは、空間的相互作用の不整合と時間的忠実性の崩壊を緩和する外科的世界モデルである。
それは、視覚的品質、時間的一貫性、相互作用の忠実性にまたがる最先端の手法を一貫して上回ります。
論文 参考訳(メタデータ) (2026-06-18T07:47:28Z) - Event-based SLAM Benchmark for High-Speed Maneuvers [68.148886127117]
イベントベースのカメラはバイオインスパイアされたセンサーで、独立して、マイクロ秒の解像度で明るさの変化に非同期に反応する。
既存のイベントベースのアプローチは、高速操作による動きのぼかしを緩和することに成功したが、多くの制限に悩まされた。
イベントベースの状態推定のためのベンチマークフレームワークであるEvSLAMを導入する。
論文 参考訳(メタデータ) (2026-04-27T04:36:41Z) - AI-Enabled Image-Based Hybrid Vision/Force Control of Tendon-Driven Aerial Continuum Manipulators [0.6999740786886535]
本稿では、腱駆動型空中マニピュレータのためのAI対応ハイブリッドビジョン/フォース制御フレームワークを提案する。
提案したコントローラは、画像特徴誤差を安定化しつつ、静的環境との自律的物理的相互作用を可能にするように設計されている。
論文 参考訳(メタデータ) (2026-04-21T01:19:11Z) - Event-Level Detection of Surgical Instrument Handovers in Videos with Interpretable Vision Models [32.17113044802459]
手術ビデオにおける機器ハンドオーバの事象レベルの検出と方向分類のための視覚フレームワークを提案する。
統一マルチタスク定式化は、ハンドオーバの発生と相互作用方向を共同で予測する。
腎臓移植術のデータセットに関する実験は、強い性能を示す。
論文 参考訳(メタデータ) (2026-04-08T20:31:28Z) - UCM: Unifying Camera Control and Memory with Time-aware Positional Encoding Warping for World Models [54.564740558030245]
UCMは、長期記憶と正確なカメラ制御をタイムアウェアな位置符号化変換機構を介して統合する新しいフレームワークである。
我々はまた、ポイントクラウドベースのレンダリングを利用したスケーラブルなデータキュレーション戦略を導入し、シーンの再考をシミュレートする。
論文 参考訳(メタデータ) (2026-02-26T12:54:46Z) - SurgAtt-Tracker: Online Surgical Attention Tracking via Temporal Proposal Reranking and Motion-Aware Refinement [45.37105164372227]
SurgAtt-Trackerは外科的注意をしっかり追跡する総合的なフレームワークである。
複数の外科的データセットの実験は、SurgAtt-Trackerが一貫して最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2026-02-24T07:30:51Z) - Self-Supervised Contrastive Embedding Adaptation for Endoscopic Image Matching [7.674595072442547]
本研究では,内視鏡画像対の特徴対応性を確立するための新しいディープラーニングパイプラインを提案する。
提案手法は、新しいビュー合成パイプラインを利用して、接地トルース不整合対応を生成する。
パイプラインはSCAREDデータセットの最先端手法を超越し,マッチング精度とエピポーラ誤差の低減を実現した。
論文 参考訳(メタデータ) (2025-12-11T07:44:00Z) - EndoControlMag: Robust Endoscopic Vascular Motion Magnification with Periodic Reference Resetting and Hierarchical Tissue-aware Dual-Mask Control [10.426745597034204]
本研究では,内視鏡環境に適合したマスク条件の血管運動拡大機能を備えたトレーニングフリーフレームワークであるEndoControlMagを紹介する。
提案手法は2つの重要なモジュールを特徴付ける: エラーの蓄積を防ぐために、動画を動的に更新された参照フレームでショートオーバーラップするクリップに分割する定期参照リセット方式。
本研究では,EndoVMM24データセット上でのEndoControlMagの評価を行った。
論文 参考訳(メタデータ) (2025-07-21T06:47:44Z) - Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection [56.66677293607114]
オープンセットのリアクティブかつアクティブな障害検出のためのCode-as-Monitor(CaM)を提案する。
モニタリングの精度と効率を高めるために,制約関連エンティティを抽象化する制約要素を導入する。
実験により、CaMは28.7%高い成功率を達成し、厳しい乱れの下で実行時間を31.8%短縮することが示された。
論文 参考訳(メタデータ) (2024-12-05T18:58:27Z) - Self-Supervised Learning for Interventional Image Analytics: Towards Robust Device Trackers [6.262161803642583]
我々は,1600万以上の干渉X線フレームからなる非常に大きなデータコホートから手続き的特徴を学習するための新しい手法を提案する。
本手法は,フレームベース再構成を利用してフレーム間時間対応を微妙に学習するマスク付き画像モデリング技術に基づいている。
実験の結果,提案手法は参照解に対する最大追従誤差を66.31%削減できることがわかった。
論文 参考訳(メタデータ) (2024-05-02T10:18:22Z) - FLex: Joint Pose and Dynamic Radiance Fields Optimization for Stereo Endoscopic Videos [79.50191812646125]
内視鏡的シーンの再構築は、外科手術後の分析から教育訓練まで、様々な医療応用にとって重要な要素である。
変形組織の非常にダイナミックな環境下での移動内視鏡の挑戦的なセットアップに着目する。
複数重重なり合う4次元ニューラルラジアンスフィールド(NeRF)への暗黙的なシーン分離と、再構成とカメラのスクラッチからのポーズを協調的に最適化するプログレッシブ最適化手法を提案する。
これにより、使いやすさが向上し、5000フレーム以上の手術ビデオの処理に間に合うように復元能力を拡張できる。
論文 参考訳(メタデータ) (2024-03-18T19:13:02Z) - LoViT: Long Video Transformer for Surgical Phase Recognition [59.06812739441785]
短時間・長期の時間情報を融合する2段階のLong Video Transformer(LoViT)を提案する。
このアプローチは、Colec80とAutoLaparoデータセットの最先端メソッドを一貫して上回る。
論文 参考訳(メタデータ) (2023-05-15T20:06:14Z) - Next-generation Surgical Navigation: Marker-less Multi-view 6DoF Pose Estimation of Surgical Instruments [64.59698930334012]
静止カメラとヘッドマウントカメラを組み合わせたマルチカメラ・キャプチャー・セットアップを提案する。
第2に,手術用ウェットラボと実際の手術用劇場で撮影された元脊椎手術のマルチビューRGB-Dビデオデータセットを公表した。
第3に,手術器具の6DoFポーズ推定の課題に対して,最先端のシングルビューとマルチビューの3つの手法を評価した。
論文 参考訳(メタデータ) (2023-05-05T13:42:19Z) - Real-time Surgical Environment Enhancement for Robot-Assisted Minimally
Invasive Surgery Based on Super-Resolution [18.696539908774454]
本稿では,GAN(Generative Adversarial Network)に基づくビデオ超解像法を提案し,自動ズーム比調整のためのフレームワークを構築する。
外科手術中の関心領域(ROI)の高品質な可視化のために、自動リアルタイムズームを提供する。
論文 参考訳(メタデータ) (2020-11-08T15:40:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。