論文の概要: EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation
- arxiv url: http://arxiv.org/abs/2608.01221v1
- Date: Sun, 02 Aug 2026 13:11:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.127033
- Title: EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation
- Title(参考訳): EndoWAM: 一般化可能な内視鏡ナビゲーションのための接地型ワールド・アクション・モデル
- Abstract要約: 本稿では,ロボットの内視鏡ナビゲーションを一般化する最初のWAMについて紹介する。
映像ワールドモデルの中間的聴覚特徴から,今後の観測におけるタスク関連対象領域の予測を行う。
この設計は、目標認識の監視を予測力学モデリングに注入し、視覚的劣化と視点変化に対する堅牢性を改善する。
- 参考スコア(独自算出の注目度): 12.580242508201827
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous endoscopic navigation can reduce clinicians' operational burden, yet robust control remains challenging due to tissue deformation, transient occlusions, and rapidly changing viewpoints. Existing learning-based policies typically predict actions from current observations without explicitly modeling future dynamics, limiting their robustness and reliability in safety-critical settings. World Action Models (WAMs) offer a promising alternative by coupling predictive visual dynamics with action generation, but extending them to robotic endoscopy remains challenging due to limited training data, restricted viewpoint diversity, deformable anatomy, and high inference latency. We present EndoWAM, which is, to our knowledge, the first WAM for generalizable robotic endoscopic navigation. EndoWAM introduces future grounding, which predicts task-relevant target regions in future observations from intermediate denoising features of a video world model. Specifically, EndoWAM couples a lightweight diffusion transformer for future target-region prediction with a discrete action expert through a shared predictive representation. This design injects target-aware supervision into predictive dynamics modeling, improving robustness to visual degradation and viewpoint changes while enabling real-time control in a single denoising pass. We further introduce EndoMotion, a robotic endoscopic motion dataset spanning three anatomically distinct procedures: ureteroscopy, esophagoscopy, and endoscopic retrograde cholangiopancreatography (ERCP). EndoWAM consistently outperforms all baselines and alternative grounding strategies, while demonstrating strong zero-shot generalization to unseen viewpoints, environments, and targets. These results establish EndoWAM as a predictive, target-grounded framework for accurate, generalizable, and long-horizon navigation in visually constrained endoscopic environments.
- Abstract(参考訳): 自律内視鏡ナビゲーションは、臨床医の手術負担を軽減することができるが、組織変形、一過性閉塞、そして急速に変化する視点のために、頑健な制御は難しいままである。
既存の学習ベースのポリシーは、通常、将来のダイナミクスを明示的にモデル化することなく、現在の観測からアクションを予測する。
World Action Models (WAMs)は、予測的視覚力学とアクション生成を結合することで有望な代替手段を提供するが、限られたトレーニングデータ、制限された視点の多様性、変形可能な解剖学、高い推論遅延のためにロボット内視鏡に拡張することは依然として困難である。
本稿では,ロボットの内視鏡ナビゲーションを一般化する最初のWAMであるEndoWAMについて紹介する。
endoWAMでは,映像ワールドモデルの中間的聴覚特徴からタスク関連対象領域の予測を行う。
具体的には、将来の目標領域予測のための軽量拡散変換器を、共有された予測表現を通じて個別のアクションエキスパートと結合する。
この設計は、目標認識の監視を予測力学モデリングに注入し、視覚的劣化や視点変化に対する堅牢性を向上し、一方の認知パスにおけるリアルタイム制御を可能にする。
さらに,尿管内視鏡,食道内視鏡,内視鏡的逆行性胆管膵管造影(ERCP)の3つの解剖学的手順にまたがる内視鏡的運動データセットであるEndoMotionを紹介した。
EndoWAMは、すべてのベースラインと代替基盤戦略を一貫して上回り、目に見えない視点、環境、ターゲットに対して強力なゼロショットの一般化を示している。
これらの結果は、視覚的に制約された内視鏡環境下での、正確で、一般化可能で、長い水平ナビゲーションのための予測的、目標となる基盤となるフレームワークとして、EndoWAMを確立している。
関連論文リスト
- Freezing of Gait Prediction Under Spatial Occlusion: An IMU-Supervised Cross-Modal Distillation Approach [0.0]
パーキンソン病(英: Parkinson disease)は、運動制御の段階的な低下を特徴とする進行性神経変性疾患である。
自動フリーズ・オブ・ゲイト(FOG)検出は歩行関連運動障害の客観的評価を支援する。
FOG予測には, (i) 患者の動作の映像記録を分析し, (ii) 下肢に装着した慣性計測装置(IMU) ウェアラブルセンサを用いて収集したデータを解析する。
ビデオベースのアプローチは、下肢が相当な幾何学的自己閉塞を受けており、ポーズ推定の精度が低下するため、連続的なターン・イン・プレイス・タスク中に検出エラーを被る可能性がある。
論文 参考訳(メタデータ) (2026-09-09T07:29:13Z) - Supervised Cross-Modal Feature Alignment for Zero-Wearable Freezing of Gait Detection in Parkinsonism [0.0]
パーキンソン病における歩行凍結(FoG)の客観的評価は主にウェアラブル慣性計測装置(IMU)に依存している
本稿では,これらの物理観測限界を解決するために,教師付きクロスモーダルサブスペース蒸留フレームワークを提案する。
最適化の間、IMUセンサーからの事前トレーニングされたキネマティックデータと文脈的臨床メタデータは、デプロイ可能なビジュアルアーキテクチャを導くためのオラクルとして機能する。
論文 参考訳(メタデータ) (2026-09-08T06:40:50Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - SurgVista: Long-Horizon Surgical World Modeling with Plausible Instrument-Tissue Dynamics [49.771521708359955]
SurgVistaは、空間的相互作用の不整合と時間的忠実性の崩壊を緩和する外科的世界モデルである。
それは、視覚的品質、時間的一貫性、相互作用の忠実性にまたがる最先端の手法を一貫して上回ります。
論文 参考訳(メタデータ) (2026-06-18T07:47:28Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - Synthetic Cardiac MRI Image Generation using Deep Generative Models [0.4733942082447995]
人工心臓MRI(CMRI)は, 注記医用画像データの不足を克服するための有望な戦略として浮上している。
GAN、VAE、拡散確率モデル、フローマッチング技術の最近の進歩は、解剖学的に正確な画像を生成することを目的としている。
このレビューは、忠実度、実用性、プライバシのレンズによる既存のCMRI生成アプローチを比較することを目的としている。
論文 参考訳(メタデータ) (2026-03-25T19:37:05Z) - FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model [73.03346643967309]
我々は、効果的な共同運動予測モデルには、時間的連続性と視覚的条件による監督的疎結合の両方が必要であると論じる。
FutureVLAは、視覚情報と運動情報を最初に分離することで、関節振動子埋め込みを抽出するように設計されている。
訓練後の段階において、我々は遅延埋め込みアライメント戦略を採用し、様々な下流VLAモデルによりこれらの時間的先行を内部化することができる。
論文 参考訳(メタデータ) (2026-03-11T12:39:55Z) - DINO-CVA: A Multimodal Goal-Conditioned Vision-to-Action Model for Autonomous Catheter Navigation [0.33727511459109777]
本研究は,マルチモーダルな目標条件行動クローニングフレームワークであるDINO-CVAの導入により,自律カテーテルナビゲーションへ移行する。
提案モデルでは,視覚観測とジョイスティックのキネマティクスを統合埋め込み空間に融合し,視覚とキネマティクスの両方を意識したポリシーを実現する。
その結果, DINO-CVAは動作予測の精度が高く, キネマティクスのみのベースラインの性能と一致していることがわかった。
論文 参考訳(メタデータ) (2025-10-19T22:59:32Z) - EndoVLA: Dual-Phase Vision-Language-Action Model for Autonomous Tracking in Endoscopy [26.132684811981143]
VLA(Vision-Language-Action)モデルは、視覚知覚、言語接地、モーションプランニングをエンドツーエンドのフレームワークに統合する。
EndoVLAは,(1)ポリープ追跡,(2)異常粘膜領域の脱線・追尾,(3)周囲切削時の円形マーカーへの付着の3つのコアタスクを実行する。
論文 参考訳(メタデータ) (2025-05-21T07:35:00Z) - EchoWorld: Learning Motion-Aware World Models for Echocardiography Probe Guidance [79.66329903007869]
本稿では,プローブ誘導のためのモーションアウェアな世界モデリングフレームワークであるEchoWorldを紹介する。
解剖学的な知識と運動によって引き起こされる視覚力学を符号化する。
200以上の定期的なスキャンから100万枚以上の超音波画像で訓練されている。
論文 参考訳(メタデータ) (2025-04-17T16:19:05Z) - Towards Better Surgical Instrument Segmentation in Endoscopic Vision:
Multi-Angle Feature Aggregation and Contour Supervision [22.253074722129053]
本稿では、現在のディープニューラルネットワーク(DNN)セグメンテーションモデルを改善するための汎用的な埋め込み可能なアプローチを提案する。
本手法は,外科医の手術から収集したSinus-Surgeryデータセットのアブレーション実験により検証した。
論文 参考訳(メタデータ) (2020-02-25T05:28:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。