論文の概要: SurgWMBench: A Vision-Based Benchmark for World-Modeling Surgical Instrument Motion Planning
- arxiv url: http://arxiv.org/abs/2608.08070v1
- Date: Sat, 08 Aug 2026 11:30:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.647315
- Title: SurgWMBench: A Vision-Based Benchmark for World-Modeling Surgical Instrument Motion Planning
- Title(参考訳): SurgWMBench:World-Modeling Surgery Instrument Motion Planningのためのビジョンベースベンチマーク
- Abstract要約: SurgWMBenchは、短期手術運動計画と動的予測のための視覚ベースのベンチマークである。
世界モデルは、視覚状態遷移と運動力学を共同でモデル化するための自然なフレームワークを提供する。
- 参考スコア(独自算出の注目度): 20.03554949764767
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Reliable surgical planning requires models that move beyond recognizing the current surgical step or imitating expert demonstrations, and instead anticipate how instrument motion reshapes subsequent operative states. Most surgical video understanding methods focus on recognizing phases, actions, or workflow states, while providing limited support for explicitly modeling instrument motion. Conversely, existing tool motion prediction methods can forecast instrument trajectories, but they generally do not capture the coupled evolution of future surgical video states. World models offer a natural framework for jointly modeling visual state transitions and instrument motion dynamics. However, existing surgical world model studies remain largely centered on visual generation quality, relying on generation-oriented metrics such as FVD and CD-FVD. These metrics are poorly aligned with instrument motion planning, as they do not directly measure whether predicted trajectories are geometrically accurate, temporally coherent, or actionable for downstream planning. This limitation is partly structural, since the field lacks public datasets and standardized evaluation protocols that provide the benchmarking infrastructure needed to assess motion-centric capabilities in surgical world models. In this paper, we introduce SurgWMBench, a vision-based benchmark for short-horizon surgical motion planning and dynamics prediction. Given intraoperative image sequences and historical instrument trajectory, SurgWMBench evaluates both near-future instrument motion prediction and stability under continuous rollout or input perturbations.
- Abstract(参考訳): 信頼性の高い外科的計画には、現在の外科的ステップを認識したり、専門家によるデモンストレーションを模倣したりするだけでなく、楽器の動きがその後の手術状態にどう影響するかを予測するモデルが必要である。
ほとんどの外科的ビデオ理解法は、フェーズ、アクション、ワークフローの状態を認識することに焦点を当て、楽器の動きを明示的にモデル化するための限定的なサポートを提供する。
逆に、既存のツールモーション予測手法は、計器の軌跡を予測できるが、それらは一般的に、将来の外科的ビデオ状態の複合的な進化を捉えない。
世界モデルは、視覚状態遷移と運動力学を共同でモデル化するための自然なフレームワークを提供する。
しかし、既存の外科的世界モデル研究は、FVDやCD-FVDといった世代指向のメトリクスに依存して、視覚的生成品質に重点を置いている。
これらの指標は、予測された軌跡が幾何学的に正確であるか、時間的に整合的であるか、下流の計画に作用するかを直接測定しないため、計器の運動計画と不整合である。
この制限は、手術の世界モデルにおける運動中心の能力を評価するのに必要なベンチマークインフラストラクチャを提供するための、公開データセットと標準化された評価プロトコルが欠落しているため、部分的に構造的である。
本稿では,短時間の手術動作計画とダイナミックス予測のための視覚ベースのベンチマークであるSurgWMBenchを紹介する。
SurgWMBenchは、術中画像シーケンスと履歴機器の軌跡を考慮し、連続的なロールアウトや入力摂動下での近未来機器の動作予測と安定性を評価した。
関連論文リスト
- CST-WM: A Causally Structured World Model for Embodied Visual Tracking [9.902564083063973]
身体的な視覚的追跡には、移動対象の将来の証拠を保存または回収する行動を選択するロボットが必要である。
CST-WMは潜伏状態を標的証拠、ロボット、観察枝に分解する。
1つの計画フレームワークで、安定したフォローと一時的なターゲット再獲得の両方をサポートする。
論文 参考訳(メタデータ) (2026-09-05T23:24:32Z) - Towards Surgical World-Action Modeling: A Preliminary Joint Visual-Trajectory Forecasting for Surgical Motion Planning [37.17021354294023]
本稿では, 将来の視覚状態を同時に予測し, 歴史的外科的観察からトラジェクトリを計測する, 共同視覚軌道世界行動モデルを提案する。
より長い予測地平線上での進行的な視覚劣化と累積軌道誤差を観察する。
論文 参考訳(メタデータ) (2026-08-20T17:18:02Z) - EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation [12.580242508201827]
本稿では,ロボットの内視鏡ナビゲーションを一般化する最初のWAMについて紹介する。
映像ワールドモデルの中間的聴覚特徴から,今後の観測におけるタスク関連対象領域の予測を行う。
この設計は、目標認識の監視を予測力学モデリングに注入し、視覚的劣化と視点変化に対する堅牢性を改善する。
論文 参考訳(メタデータ) (2026-08-02T13:11:22Z) - From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence [54.62791372989525]
アクションモデル、ビジョン言語-アクションポリシー、世界モデルは、この目標を前進させた。
世界行動モデル(WAM)は、候補者の介入と予測された結果とを結びつけるため、特に有望である。
我々は、WAMへの進化をレビューし、これらの制限をモデルの役割と表現、目的と標準化、システム構成という3つの組み合わせのギャップにまとめる。
論文 参考訳(メタデータ) (2026-07-13T15:22:56Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model [73.03346643967309]
我々は、効果的な共同運動予測モデルには、時間的連続性と視覚的条件による監督的疎結合の両方が必要であると論じる。
FutureVLAは、視覚情報と運動情報を最初に分離することで、関節振動子埋め込みを抽出するように設計されている。
訓練後の段階において、我々は遅延埋め込みアライメント戦略を採用し、様々な下流VLAモデルによりこれらの時間的先行を内部化することができる。
論文 参考訳(メタデータ) (2026-03-11T12:39:55Z) - Vision-Centric 4D Occupancy Forecasting and Planning via Implicit Residual World Models [28.777224599594717]
Implicit Residual World Modelは、世界の現在の状態と進化をモデル化することに焦点を当てている。
IR-WMは4次元占有予測と軌道計画の両方において最高性能を達成する。
論文 参考訳(メタデータ) (2025-10-19T06:45:37Z) - Ego-centric Predictive Model Conditioned on Hand Trajectories [52.531681772560724]
自我中心のシナリオでは、次の行動とその視覚的結果の両方を予測することは、人間と物体の相互作用を理解するために不可欠である。
我々は,エゴセントリックなシナリオにおける行動と視覚的未来を共同でモデル化する,統合された2段階予測フレームワークを提案する。
我々のアプローチは、エゴセントリックな人間の活動理解とロボット操作の両方を扱うために設計された最初の統一モデルである。
論文 参考訳(メタデータ) (2025-08-27T13:09:55Z) - Human locomotor control timescales depend on the environmental context and sensory input modality [37.48294298569551]
制御時間スケールを定量化する統合データ駆動フレームワークを提案する。
ウォーキングやランニングといったタスクにこのフレームワークを適用します。
本研究の枠組みは,ロポモタ・フット配置制御の時間尺度に影響を与える要因を明らかにする。
論文 参考訳(メタデータ) (2025-03-20T16:57:15Z) - Multimodal Semantic Scene Graphs for Holistic Modeling of Surgical
Procedures [70.69948035469467]
カメラビューから3Dグラフを生成するための最新のコンピュータビジョン手法を利用する。
次に,手術手順の象徴的,意味的表現を統一することを目的としたマルチモーダルセマンティックグラフシーン(MSSG)を紹介する。
論文 参考訳(メタデータ) (2021-06-09T14:35:44Z) - Future Frame Prediction for Robot-assisted Surgery [57.18185972461453]
本稿では,ロボット手術用ビデオシーケンスにおけるフレーム予測のためのtpg-vaeモデルを提案する。
コンテンツ配信に加えて、私たちのモデルは、手術ツールの小さな動きを処理するために斬新な運動分布を学習します。
論文 参考訳(メタデータ) (2021-03-18T15:12:06Z) - daVinciNet: Joint Prediction of Motion and Surgical State in
Robot-Assisted Surgery [13.928484202934651]
本稿では,ロボット動作と手術状態予測のためのエンドツーエンドのデュアルタスクモデルdaVinciNetを提案する。
我々のモデルでは、最大93.85%の短期(0.5s)と82.11%の長期(2s)の予測精度、1.07mmの短期および5.62mmの長期軌道予測誤差が達成される。
論文 参考訳(メタデータ) (2020-09-24T20:28:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。