論文の概要: MoSS: Monocular Shape Sensing for Continuum Robots
- arxiv url: http://arxiv.org/abs/2303.00891v2
- Date: Tue, 27 Jun 2023 22:40:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2023-06-29 18:00:11.579472
- Title: MoSS: Monocular Shape Sensing for Continuum Robots
- Title(参考訳): MoSS:連続ロボットのための単眼形状センシング
- Abstract要約: 本稿では,連続体型ロボットの形状センサに対する目と手の一眼的アプローチを提案する。
MoSSNetはステレオマッチングのコストを削減し、センサーハードウェアの要求を削減している。
データ収集とテストには2段式の腱駆動連続体ロボットが使用される。
- 参考スコア(独自算出の注目度): 11.377027568901038
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Continuum robots are promising candidates for interactive tasks in medical
and industrial applications due to their unique shape, compliance, and
miniaturization capability. Accurate and real-time shape sensing is essential
for such tasks yet remains a challenge. Embedded shape sensing has high
hardware complexity and cost, while vision-based methods require stereo setup
and struggle to achieve real-time performance. This paper proposes the first
eye-to-hand monocular approach to continuum robot shape sensing. Utilizing a
deep encoder-decoder network, our method, MoSSNet, eliminates the computation
cost of stereo matching and reduces requirements on sensing hardware. In
particular, MoSSNet comprises an encoder and three parallel decoders to uncover
spatial, length, and contour information from a single RGB image, and then
obtains the 3D shape through curve fitting. A two-segment tendon-driven
continuum robot is used for data collection and testing, demonstrating accurate
(mean shape error of 0.91 mm, or 0.36% of robot length) and real-time (70 fps)
shape sensing on real-world data. Additionally, the method is optimized
end-to-end and does not require fiducial markers, manual segmentation, or
camera calibration. Code and datasets will be made available at
https://github.com/ContinuumRoboticsLab/MoSSNet.
- Abstract(参考訳): continuumロボットは、独自の形状、コンプライアンス、小型化能力のため、医療や産業用途におけるインタラクティブなタスクの候補として有望である。
このようなタスクには正確かつリアルタイムな形状認識が不可欠だが、依然として課題である。
組込み型形状センサはハードウェアの複雑さとコストが高いが、視覚ベースの手法ではステレオセットアップが必要であり、リアルタイムのパフォーマンスを達成するのに苦労する。
本稿では,連続体ロボット形状センシングに対する最初の単眼的アプローチを提案する。
ディープエンコーダ・デコーダネットワークを利用するmossnetは,ステレオマッチングの計算コストを削減し,センシングハードウェアの要求量を削減した。
特に、MOSSNetは、エンコーダと3つの並列デコーダから構成され、単一のRGB画像から空間、長さ、輪郭情報を発見し、曲線フィッティングにより3次元形状を得る。
2セグメントの腱駆動型連続体ロボットをデータ収集とテストに使用し、実世界データを用いた正確な精度(ロボットの長さ0.36%の形状誤差)とリアルタイム(70fps)形状センシングを実証する。
さらに、この方法はエンドツーエンドに最適化されており、fiducial marker、手動セグメンテーション、カメラキャリブレーションを必要としない。
コードとデータセットはhttps://github.com/ContinuumRoboticsLab/MoSSNetで入手できる。
関連論文リスト
- RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction [51.76737991200891]
H2R(Human-to-robot)オブジェクトハンドオーバは、人間とロボットのコラボレーションの基本的な能力である。
本稿では,RGB-DビデオデータセットであるHand2Botを紹介する。
ハンドオブジェクトの一貫性を確保しつつ,現実的なハンドオーバシーケンスを合成する生成パイプラインであるPassGenを提案する。
論文 参考訳(メタデータ) (2026-08-13T09:55:59Z) - Time-to-Collision Based Dynamic Obstacle Avoidance Using Pretrained Vision Models for Robots in Unstructured Environments [12.499778437707759]
実世界のデータに完全に依存する視覚に基づく動的障害物回避手法を提案する。
提案手法はシミュレーション訓練されたポリシーに固有のシム・トゥ・リアル・トランスファー問題を回避する。
テストシーケンスに存在する22種類の物理的障害のうち、少なくとも1フレームのTCCを1秒未満で検出する。
論文 参考訳(メタデータ) (2026-07-08T19:41:19Z) - Robo3R: Enhancing Robotic Manipulation with Accurate Feed-Forward 3D Reconstruction [70.06600045165905]
3D空間認識は、一般的なロボット操作の基本であるが、信頼性が高く高品質な3D形状の取得は依然として困難である。
本稿では,RGB画像やロボットの状態から直接,正確な距離スケールのシーン形状をリアルタイムで予測する操作可能な3次元再構成モデルであるRobo3Rを紹介する。
我々は、ロボット操作のためのこの代替3Dセンシングモジュールの約束を示唆し、パフォーマンスの連続的な向上を観察する。
論文 参考訳(メタデータ) (2026-02-10T18:58:15Z) - Subsecond 3D Mesh Generation for Robot Manipulation [4.928999092350224]
本稿では,単一のRGB-D画像から高品質な3Dメッシュを1秒以内で生成するエンドツーエンドシステムを提案する。
我々のパイプラインは、オープン語彙オブジェクトセグメンテーション、拡散ベースのメッシュ生成の高速化、ロバストポイントクラウド登録を統合している。
実世界の操作タスクにおいて、その効果を実証し、メッシュをロボットの知覚と計画のための実用的でオンデマンドな表現として使用できることを示す。
論文 参考訳(メタデータ) (2025-12-30T19:08:36Z) - Efficient Slice Anomaly Detection Network for 3D Brain MRI Volume [2.3633885460047765]
現在の異常検出法は, 基準産業データより優れているが, 「正常」 と「異常」の定義の相違により, 医療データに苦慮している。
我々は,ImageNet上で事前学習し,MRIデータセットを2次元スライス特徴抽出器として微調整したモデルを用いたSimple Slice-based Network (SimpleSliceNet) というフレームワークを提案する。
論文 参考訳(メタデータ) (2024-08-28T17:20:56Z) - EmbodiedSAM: Online Segment Any 3D Thing in Real Time [61.2321497708998]
身体的なタスクは、エージェントが探索と同時に3Dシーンを完全に理解する必要がある。
オンライン、リアルタイム、微粒化、高度に一般化された3D知覚モデルは、必死に必要である。
論文 参考訳(メタデータ) (2024-08-21T17:57:06Z) - DatasetNeRF: Efficient 3D-aware Data Factory with Generative Radiance Fields [68.94868475824575]
本稿では,無限で高品質な3Dアノテーションを3Dポイントクラウドセグメンテーションとともに生成できる新しいアプローチを提案する。
我々は3次元生成モデルに先立って強力なセマンティクスを活用してセマンティクスデコーダを訓練する。
トレーニングが完了すると、デコーダは遅延空間を効率よく一般化し、無限のデータの生成を可能にする。
論文 参考訳(メタデータ) (2023-11-18T21:58:28Z) - HEDNet: A Hierarchical Encoder-Decoder Network for 3D Object Detection
in Point Clouds [19.1921315424192]
ポイントクラウドにおける3Dオブジェクト検出は、自律運転システムにとって重要である。
3Dオブジェクト検出における主な課題は、3Dシーン内の点のスパース分布に起因する。
本稿では3次元オブジェクト検出のための階層型エンコーダデコーダネットワークであるHEDNetを提案する。
論文 参考訳(メタデータ) (2023-10-31T07:32:08Z) - Joint-MAE: 2D-3D Joint Masked Autoencoders for 3D Point Cloud
Pre-training [65.75399500494343]
Masked Autoencoders (MAE) は、2Dおよび3Dコンピュータビジョンのための自己教師型学習において有望な性能を示した。
自己監督型3次元点雲事前学習のための2D-3DジョイントMAEフレームワークであるJoint-MAEを提案する。
論文 参考訳(メタデータ) (2023-02-27T17:56:18Z) - StereoVoxelNet: Real-Time Obstacle Detection Based on Occupancy Voxels
from a Stereo Camera Using Deep Neural Networks [32.7826524859756]
障害物検出は、ステレオマッチングが一般的な視覚ベースのアプローチであるロボットナビゲーションにおいて、安全に重要な問題である。
本稿では,ステレオ画像の占有率を直接検出するために,ディープニューラルネットワークを利用する計算効率のよい手法を提案する。
提案手法は,32mの範囲の障害物を正確に検出し,最新ステレオモデルの計算コストのわずか2%に留まらず,IoU (Intersection over Union) とCD (Chamfer Distance) のスコアが向上する。
論文 参考訳(メタデータ) (2022-09-18T03:32:38Z) - MetaGraspNet: A Large-Scale Benchmark Dataset for Vision-driven Robotic
Grasping via Physics-based Metaverse Synthesis [78.26022688167133]
本稿では,物理に基づくメタバース合成による視覚駆動型ロボットグルーピングのための大規模ベンチマークデータセットを提案する。
提案するデータセットには,10万の画像と25種類のオブジェクトが含まれている。
また,オブジェクト検出とセグメンテーション性能を評価するためのデータセットとともに,新しいレイアウト重み付け性能指標を提案する。
論文 参考訳(メタデータ) (2021-12-29T17:23:24Z) - Learnable Online Graph Representations for 3D Multi-Object Tracking [156.58876381318402]
3D MOT問題に対する統一型学習型アプローチを提案します。
我々は、完全にトレーニング可能なデータアソシエーションにNeural Message Passing Networkを使用します。
AMOTAの65.6%の最先端性能と58%のIDスウィッチを達成して、公開可能なnuScenesデータセットに対する提案手法のメリットを示す。
論文 参考訳(メタデータ) (2021-04-23T17:59:28Z) - Where is my hand? Deep hand segmentation for visual self-recognition in
humanoid robots [129.46920552019247]
本稿では、画像からロボットの手を切り離すための畳み込みニューラルネットワーク(CNN)を提案する。
ヒューマノイドロボットVizzyの手のセグメンテーションのために,Mask-RCNNネットワークを微調整した。
論文 参考訳(メタデータ) (2021-02-09T10:34:32Z) - A data-set of piercing needle through deformable objects for Deep
Learning from Demonstrations [0.21096737598952847]
本稿では,ダ・ヴィンチ・リサーチ・キットの2本の腕で針を挿入/ピアスするデータセットについて述べる。
我々は、単純なフィードフォワードCNNと異なるリカレント畳み込みネットワーク(RCN)を含む、いくつかの深いRLfDアーキテクチャを実装している。
本研究は、ベースラインフィードフォワードCNNが、ロボットの視覚情報と次のステップ制御動作の関係をうまく学習しているにもかかわらず、RCNがモデルの予測精度を向上させることを示唆している。
論文 参考訳(メタデータ) (2020-12-04T08:27:06Z) - Event-based Robotic Grasping Detection with Neuromorphic Vision Sensor
and Event-Stream Dataset [8.030163836902299]
ニューロモルフィック・ビジョンは、小さくて若い研究コミュニティである。従来のフレームベースのコンピュータビジョンと比較すると、ニューロモルフィック・ビジョンは小さくて若い研究コミュニティである。
91個のオブジェクトからなるイベントストリームデータセットという,ロボットによる把握データセットを構築した。
リードが高周波でブリンクするため、Event-Streamデータセットは1kHzの高周波でアノテートされる。
我々は、角度学習問題を回帰ではなく分類として考慮した、検出を把握するためのディープニューラルネットワークを開発した。
論文 参考訳(メタデータ) (2020-04-28T16:55:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。