論文の概要: Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- arxiv url: http://arxiv.org/abs/2604.21017v2
- Date: Wed, 29 Apr 2026 01:10:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 13:51:53.85784
- Title: Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- Title(参考訳): Open-H-Embodiment:医療ロボットの基礎モデル構築のための大規模データセット
- Abstract要約: 医療用ロボットビデオの最大のオープンデータセットであるOpen-H-Embodimentを紹介した。
GR00T-Hは、医療ロボティクスのための最初のオープン・ファンデーション・ビジョン・ランゲージ・アクション・モデルである。
我々は,多体手術シミュレーションを可能にする最初の行動条件世界モデルであるCosmos-H-Surgical-Simulatorを訓練する。
- 参考スコア(独自算出の注目度): 131.25998619318702
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous medical robots hold promise to improve patient outcomes, reduce provider workload, democratize access to care, and enable superhuman precision. However, autonomous medical robotics has been limited by a fundamental data problem: existing medical robotic datasets are small, single-embodiment, and rarely shared openly, restricting the development of foundation models that the field needs to advance. We introduce Open-H-Embodiment, the largest open dataset of medical robotic video with synchronized kinematics to date, spanning more than 49 institutions and multiple robotic platforms including the CMR Versius, Intuitive Surgical's da Vinci, da Vinci Research Kit (dVRK), Rob Surgical BiTrack, Virtual Incision's MIRA, Moon Surgical Maestro, and a variety of custom systems, spanning surgical manipulation, robotic ultrasound, and endoscopy procedures. We demonstrate the research enabled by this dataset through two foundation models. GR00T-H is the first open foundation vision-language-action model for medical robotics, which is the only evaluated model to achieve full end-to-end task completion on a structured suturing benchmark (25% of trials vs. 0% for all others) and achieves 64% average success across a 29-step ex vivo suturing sequence. We also train Cosmos-H-Surgical-Simulator, the first action-conditioned world model to enable multi-embodiment surgical simulation from a single checkpoint, spanning nine robotic platforms and supporting in silico policy evaluation and synthetic data generation for the medical domain. These results suggest that open, large-scale medical robot data collection can serve as critical infrastructure for the research community, enabling advances in robot learning, world modeling, and beyond.
- Abstract(参考訳): 自律医療ロボットは、患者の成果を改善し、提供者の作業量を削減し、ケアへのアクセスを民主化し、超人的精度を実現することを約束する。
しかし、自律型医療ロボティクスは基本的なデータ問題によって制限されており、既存の医療ロボティクスデータセットは小さく、単体であり、オープンに共有されることは滅多になく、フィールドが前進する必要がある基礎モデルの開発を制限する。
これまでに49以上の機関と、CMR Versius、Intuitive surgery's da Vinci、da Vinci Research Kit (dVRK)、Rob Surgery BiTrack、Virtual IncisionのMIRA、Moon Surgery Maestro、およびさまざまなカスタムシステム、手術手術、ロボットロボット、内視鏡手術を含む複数のロボットプラットフォームにまたがる、同期キネマティクスを備えた医療ロボットビデオの最大のオープンデータセットであるOpen-H-Embodimentを紹介した。
2つの基礎モデルを用いて、このデータセットによって実現された研究を実証する。
GR00T-Hは、構造化された縫合ベンチマークで完全なエンドツーエンドのタスク完了を達成する唯一の評価モデルであり、29ステップの体外縫合シーケンスで平均64%の成功を達成している。
また,第1の行動条件付き世界モデルであるCosmos-H-Surgical-Simulatorをトレーニングし,単一のチェックポイントから多体手術シミュレーションを可能にする。
これらの結果は、オープンで大規模な医療ロボットデータ収集が、研究コミュニティにとって重要な基盤となり、ロボット学習や世界モデリングなどの進歩を可能にすることを示唆している。
関連論文リスト
- SurgVIL: Scaling Surgical Robot Imitation Learning with Open-source Surgical Videos [3.1495623798952823]
SurgVILは、オープンソースの手術ビデオを使って、手術ロボットの模倣学習をスケールするためのフレームワークである。
ニードルピックアップと胆嚢摘出術の2つのロボット作業におけるSurgVILの評価を行った。
論文 参考訳(メタデータ) (2026-08-17T03:33:03Z) - MiDAS: A Multimodal Data Acquisition System and Dataset for Robot-Assisted Minimally Invasive Surgery [4.287077788799387]
MiDASは、手術用ロボットプラットフォーム全体にわたる、時間同期で非侵襲的なマルチモーダルデータ取得のためのプラットフォームに依存しないシステムである。
オープンソース Raven-II と da Vinci Xi のMIDAS をペグ転送とヘルニア修復作業のマルチモーダルデータセットを用いて検証した。
論文 参考訳(メタデータ) (2026-02-12T20:56:15Z) - SurgWorld: Learning Surgical Robot Policies from Videos via World Modeling [19.99022199561975]
SurgWorldは外科用物理AI用に設計された世界モデルである。
SurgeWorldは多様な、一般化可能な、リアルな手術ビデオを生成する。
合成外科的ビデオから擬似キネマティクスを推測するために逆動力学モデルを用いた最初の例である。
論文 参考訳(メタデータ) (2025-12-29T03:03:00Z) - A Large-Scale Vision-Language Dataset Derived from Open Scientific Literature to Advance Biomedical Generalist AI [70.06771291117965]
PubMed Central Open Accessサブセットから派生したオープンソースのデータセットであるBiomedicaを紹介する。
Biomedicaには600万以上の科学論文と2400万の画像テキストペアが含まれている。
私たちは、Webサーバを通じてスケーラブルなストリーミングと検索APIを提供し、AIシステムとのシームレスな統合を容易にします。
論文 参考訳(メタデータ) (2025-03-26T05:56:46Z) - GR00T N1: An Open Foundation Model for Generalist Humanoid Robots [133.23509142762356]
汎用ロボットには多目的体と知的な心が必要だ。
近年のヒューマノイドロボットの進歩は、汎用的な自律性を構築するためのハードウェアプラットフォームとして大きな可能性を秘めている。
我々はヒューマノイドロボットのオープン基盤モデルであるGR00T N1を紹介する。
論文 参考訳(メタデータ) (2025-03-18T21:06:21Z) - Towards a clinically accessible radiology foundation model: open-access and lightweight, with automated evaluation [113.5002649181103]
オープンソースの小型マルチモーダルモデル(SMM)を訓練し、放射線学における未測定臨床ニーズに対する能力ギャップを埋める。
トレーニングのために,697万以上の画像テキストペアからなる大規模なデータセットを組み立てる。
評価のために,GPT-4に基づく実測値CheXpromptを提案する。
LlaVA-Radの推論は高速で、単一のV100 GPU上でプライベート設定で実行できる。
論文 参考訳(メタデータ) (2024-03-12T18:12:02Z) - General-purpose foundation models for increased autonomy in
robot-assisted surgery [4.155479231940454]
本稿では,ロボット支援手術における自律性向上を目指す。
手術ロボットは汎用モデルの利点を享受し,ロボット支援手術における自律性向上に向けた3つの指針を提供する。
論文 参考訳(メタデータ) (2024-01-01T06:15:16Z) - Robotic Navigation Autonomy for Subretinal Injection via Intelligent
Real-Time Virtual iOCT Volume Slicing [88.99939660183881]
網膜下注射のための自律型ロボットナビゲーションの枠組みを提案する。
提案手法は,機器のポーズ推定方法,ロボットとi OCTシステム間のオンライン登録,およびインジェクションターゲットへのナビゲーションに適した軌道計画から構成される。
ブタ前眼の精度と再現性について実験を行った。
論文 参考訳(メタデータ) (2023-01-17T21:41:21Z) - RT-1: Robotics Transformer for Real-World Control at Scale [98.09428483862165]
我々は,有望なスケーラブルなモデル特性を示す,ロボティクストランスフォーマーと呼ばれるモデルクラスを提示する。
実世界の課題を遂行する実ロボットの大規模データ収集に基づいて,様々なモデルクラスと,データサイズ,モデルサイズ,データの多様性の関数として一般化する能力について検証した。
論文 参考訳(メタデータ) (2022-12-13T18:55:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。