論文の概要: Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning
- arxiv url: http://arxiv.org/abs/2608.11204v1
- Date: Tue, 11 Aug 2026 17:59:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:46.149135
- Title: Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning
- Title(参考訳): 手術用WAM:データ効率のよい手術ロボット学習のための世界行動モデル
- Abstract要約: 本稿では,将来の内視鏡的観察と手術ロボットの動作チャンクを予測できる統合生成モデルであるSurgical World-Action Model(Surgical WAM)を紹介する。
手術用WAMは、まずアクションフリービデオから外科的視覚力学を学習し、固定されたアクションラベルの予算に基づいて微調整される。
4つのシミュレートされた手術作業において、ビデオプレトレーニングは平均成功率を63.5%から77.8%に改善し、ペグトランスファーでは20ポイントが絶対的に上昇した。
- 参考スコア(独自算出の注目度): 46.22753169557017
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Learning reliable surgical manipulation policies is bottlenecked by the scarcity of action-labeled demonstrations: teleoperated surgical robot (e.g., dVRK) trajectories with synchronized kinematics are costly to collect, while surgical tasks demand precise contact handling, long-horizon reasoning, and bimanual coordination. Endoscopic video is comparatively inexpensive and abundant relative to synchronized video--kinematics trajectories, and a natural way to exploit it is to learn world models of surgical scenes. However, existing surgical world models use video primarily for simulation or policy evaluation, and rarely translate the learned dynamics into closed-loop control. This gap raises our central question: under a fixed budget of action-labeled demonstrations, does action-free video pretraining improve closed-loop surgical manipulation? To answer it, we introduce the Surgical World-Action Model (Surgical WAM), a unified generative model built on Cosmos Policy that jointly predicts future endoscopic observations and executable surgical robot action chunks. Surgical WAM first learns surgical visual dynamics from action-free video and is then fine-tuned on the fixed action-labeled budget; at deployment, it acts as a closed-loop, receding-horizon controller that executes a short prefix of each predicted action chunk and replans from the resulting observation. On a suite of four simulated surgical manipulation tasks, video pretraining improves the average success rate from 63.5% to 77.8%, including an absolute gain of 20 percentage points on PegTransfer, with the largest improvements on contact-rich and bimanual tasks. These results demonstrate that action-free video provides transferable visual dynamics priors for learning surgical robot control with limited action supervision, positioning data-efficient video pretraining as a practical path toward scaling up surgical robot learning.
- Abstract(参考訳): 遠隔操作型手術ロボット(eg, dVRK)軌道と同期キネマティクスのトラジェクトリは収集にコストがかかり、手術タスクは正確な接触処理、長距離推論、双方向調整を必要とする。
内視鏡的ビデオは比較的安価で、シンクロナイズドビデオ(キネマティックス・トラジェクトリー)と比較して豊富であり、それを利用する自然な方法は、手術シーンの世界モデルを学ぶことである。
しかし、既存の外科的世界モデルは、主にシミュレーションや政策評価にビデオを使用し、学習されたダイナミクスをクローズドループ制御に変換することは滅多にない。
このギャップは我々の中心的な疑問を提起する: アクションラベル付きデモの固定された予算の下で、アクションフリービデオプレトレーニングはクローズドループ手術を改善するか?
そこで我々は,将来の内視鏡的観察と手術ロボットの動作チャンクを共同で予測する,コスモス政策に基づく統一的生成モデルであるSurgical World-Action Model(Surgical WAM)を紹介する。
手術用WAMは、まずアクションフリービデオから外科的視覚力学を学習し、固定されたアクションラベルの予算に基づいて微調整され、展開時には、予測されたアクションチャンクの短いプレフィックスを実行し、その結果の観察から再設計するクローズドループ、リテーディング・ホライゾンコントローラとして機能する。
4つのシミュレートされた手術作業において、ビデオプレトレーニングは平均成功率を63.5%から77.8%に改善し、ペグトランスファーでは20ポイントが絶対的に上昇した。
これらの結果から, 動作自由ビデオは, 手術ロボットの制御を学習する上で, 移動可能な視覚力学を先導し, 動作監督を限定し, 手術ロボットの学習を拡大するための実践的な方法として, データ効率のよいビデオ事前学習を位置づけることが示唆された。
関連論文リスト
- SurgVIL: Scaling Surgical Robot Imitation Learning with Open-source Surgical Videos [3.1495623798952823]
SurgVILは、オープンソースの手術ビデオを使って、手術ロボットの模倣学習をスケールするためのフレームワークである。
ニードルピックアップと胆嚢摘出術の2つのロボット作業におけるSurgVILの評価を行った。
論文 参考訳(メタデータ) (2026-08-17T03:33:03Z) - SurgWorld: Learning Surgical Robot Policies from Videos via World Modeling [19.99022199561975]
SurgWorldは外科用物理AI用に設計された世界モデルである。
SurgeWorldは多様な、一般化可能な、リアルな手術ビデオを生成する。
合成外科的ビデオから擬似キネマティクスを推測するために逆動力学モデルを用いた最初の例である。
論文 参考訳(メタデータ) (2025-12-29T03:03:00Z) - SurgiPose: Estimating Surgical Tool Kinematics from Monocular Video for Surgical Robot Learning [5.304104136888954]
大規模な外科的デモンストレーションの有望な情報源は、モノラルな外科的ビデオがオンラインで公開されていることである。
本稿では,単眼手術映像から運動情報を推定するための,微分レンダリングに基づくアプローチであるSurgiPoseを提案する。
本研究の結果から, 推定キネマティクスに基づいてトレーニングした政策は, 真理データに基づいてトレーニングした政策に匹敵する成功率を示した。
論文 参考訳(メタデータ) (2025-12-19T21:15:26Z) - FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation [50.39748673817223]
本稿では,ロボットビデオ生成における明示的な動作パラメータを完全に活用する2つのトレーニング不要な推論時間手法を提案する。
第一に、アクションスケールの分類器フリーガイダンスは、動作の大きさに比例して誘導強度を動的に調整し、運動強度に対する制御性を高める。
第二に、アクションスケールノイズトランケーションは、初期サンプルノイズの分布を調整し、所望の運動力学とよりよく一致させる。
論文 参考訳(メタデータ) (2025-09-29T03:30:40Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z) - SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model [67.8359850515282]
SurgVidLMは、完全かつきめ細かい外科的ビデオ理解に対処するために設計された最初のビデオ言語モデルである。
我々は,SurgVidLMが,映像理解タスクと細粒度ビデオ理解タスクの両方において,同等のパラメータスケールの最先端のVid-LLMを著しく上回ることを示す。
論文 参考訳(メタデータ) (2025-06-22T02:16:18Z) - Towards Suturing World Models: Learning Predictive Models for Robotic Surgical Tasks [0.35087986342428684]
微小なロボットサブスティッチ動作のダイナミクスを捉える拡散型時間モデルを導入する。
我々は2つの最先端ビデオ拡散モデルを微調整し、50ドルLox解像度と49ドルフレームの高忠実度手術アクションシーケンスを生成する。
実験の結果, これらの世界モデルは縫合のダイナミクスを効果的に捉え, トレーニング, スキルアセスメントツール, 自律型手術システムなどを改善することができることがわかった。
論文 参考訳(メタデータ) (2025-03-16T14:51:12Z) - Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos [101.26467307473638]
我々はMotoを紹介する。Motoは、映像コンテンツをラテントモーションTokenizerでラテントモーションTokenシーケンスに変換する。
我々は、モーショントークンによるMoto-GPTの事前学習を行い、多様な視覚的動きの知識を捉えることができる。
実際のロボット動作に先立って学習した動きを転送するために、潜伏した動きのトークン予測と実際のロボット制御をシームレスにブリッジするコファインチューニング戦略を実装した。
論文 参考訳(メタデータ) (2024-12-05T18:57:04Z) - VISAGE: Video Synthesis using Action Graphs for Surgery [34.21344214645662]
腹腔鏡下手術における映像生成の新しい課題について紹介する。
提案手法であるVISAGEは,アクションシーングラフのパワーを利用して,腹腔鏡下手術のシーケンシャルな特徴を捉える。
腹腔鏡下手術における高忠実度ビデオ生成について検討した。
論文 参考訳(メタデータ) (2024-10-23T10:28:17Z) - Future Frame Prediction for Robot-assisted Surgery [57.18185972461453]
本稿では,ロボット手術用ビデオシーケンスにおけるフレーム予測のためのtpg-vaeモデルを提案する。
コンテンツ配信に加えて、私たちのモデルは、手術ツールの小さな動きを処理するために斬新な運動分布を学習します。
論文 参考訳(メタデータ) (2021-03-18T15:12:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。