論文の概要: Depth-Aware Rover: A Study of Edge AI and Monocular Vision for Real-World Implementation
- arxiv url: http://arxiv.org/abs/2604.22331v1
- Date: Fri, 24 Apr 2026 08:03:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-27 15:36:26.391833
- Title: Depth-Aware Rover: A Study of Edge AI and Monocular Vision for Real-World Implementation
- Title(参考訳): Depth-Aware Rover: エッジAIとモノクロビジョンによる実世界の実装
- Abstract要約: 本研究ではエッジAIを用いた深度認識ローバーナビゲーションのシミュレーションおよび実世界の実装について分析する。
ステレオカメラを搭載したUnityベースの月面シミュレータとOpenCVのStereoSGBMは、異質マップを生成するために使用された。
Raspberry Pi 4に搭載された物理ローバーは、モノクラー計量深度推定にUniDepthV2、リアルタイム物体検出にYOLO12nを採用した。
- 参考スコア(独自算出の注目度): 0.2333246928962179
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This study analyses simulated and real-world implementations of depth-aware rover navigation, highlighting the transition from stereo vision to monocular depth estimation using edge AI. A Unity-based lunar terrain simulator with stereo cameras and OpenCV's StereoSGBM was used to generate disparity maps. A physical rover built on Raspberry Pi 4 employed UniDepthV2 for monocular metric depth estimation and YOLO12n for real-time object detection. While stereo vision yielded higher accuracy in simulation, the monocular approach proved more robust and cost-effective in real-world deployment, achieving 0.1 FPS for depth and 10 FPS for detection.
- Abstract(参考訳): 本研究では,エッジAIを用いた立体視から単眼深度推定への遷移に注目し,深度認識ローバーナビゲーションのシミュレーションおよび実世界の実装について分析する。
ステレオカメラを搭載したUnityベースの月面シミュレータとOpenCVのStereoSGBMは、異質マップを生成するために使用された。
Raspberry Pi 4に搭載された物理ローバーは、モノクラー計量深度推定にUniDepthV2、リアルタイム物体検出にYOLO12nを採用した。
ステレオビジョンはシミュレーションにおいて精度が高くなったが、現実世界の展開において単分子のアプローチはより堅牢でコスト効率が良く、深さは0.1FPS、検出は10FPSであった。
関連論文リスト
- Deep Learning Aided Vision System for Planetary Rovers [0.2333246928962179]
本研究では、リアルタイム認識とオフライン地形再構成を組み合わせた惑星探査機の視覚システムを提案する。
リアルタイムモジュールは、CLAHE強化ステレオ画像、YOLOv11nに基づくオブジェクト検出、および物体距離を推定するニューラルネットワークを統合する。
このアーキテクチャは、自律的な惑星探査のためのスケーラブルで計算効率の良いビジョンソリューションを提供する。
論文 参考訳(メタデータ) (2026-03-26T07:34:14Z) - Stereo-Inertial Poser: Towards Metric-Accurate Shape-Aware Motion Capture Using Sparse IMUs and a Single Stereo Camera [54.967647497048205]
本稿では,距離精度と形状を考慮した3次元動作を推定するリアルタイムモーションキャプチャシステムであるStereo-Inertial Poserを提案する。
モノクラーRGBをステレオビジョンに置き換え、直接3次元キーポイント抽出と形状パラメータ推定を可能にした。
ドリフトフリーなグローバル翻訳を長い記録時間で生成し,フットスケート効果を低減させる。
論文 参考訳(メタデータ) (2026-03-02T17:46:38Z) - DeFM: Learning Foundation Representations from Depth for Robotics [49.77188649197404]
DeFMはロボットアプリケーションのための深度画像に基づいて訓練された自己教師型基礎モデルである。
DeFMは幾何学的および意味的な表現を学び、様々な環境、タスク、センサーに一般化する。
最先端の性能を達成し、シミュレーションから実環境への強力な一般化を実証する。
論文 参考訳(メタデータ) (2026-01-26T19:45:31Z) - VIMD: Monocular Visual-Inertial Motion and Depth Estimation [8.959715109842742]
我々は,高密度な距離深さを推定するために,単眼の視覚-慣性運動と深度学習フレームワークを開発した。
中心となるVIMDは、複数ビュー情報を利用してピクセル単位のスケールを反復的に洗練することである。
以上の結果から,画像あたり10~20メートルの奥行きが極めて少ない場合でも,VIMDの精度と頑健性は極めて高いことがわかった。
論文 参考訳(メタデータ) (2025-09-24T02:50:55Z) - Boosting Omnidirectional Stereo Matching with a Pre-trained Depth Foundation Model [70.67610495024459]
カメラベースの設定は、立体深度推定を用いて高解像度の高解像度深度マップを生成することで、コスト効率のよい選択肢を提供する。
既存の全方位ステレオマッチング手法は、様々な環境において限られた深度精度しか達成できない。
DFI-OmniStereoは, 大規模事前学習基礎モデルを用いて, 相対的な単眼深度推定を行う新しい全方位ステレオマッチング法である。
論文 参考訳(メタデータ) (2025-03-30T16:24:22Z) - Vision-in-the-loop Simulation for Deep Monocular Pose Estimation of UAV in Ocean Environment [0.21427777919040414]
本論文では,海洋環境下でのUAVの深部単分子ポーズ推定のためのビジョン・イン・ザ・ループシミュレーション環境を提案する。
ガウススプラッティングの最近の進歩を生かしたフォトリアリスティックな3次元仮想環境を提案する。
結果として得られたシミュレーションにより、飛行ソフトウェア、ハードウェア、深層単眼のポーズ推定スキームのすべての側面を検証しながら、飛行操作の屋内テストが可能になる。
論文 参考訳(メタデータ) (2025-02-08T02:19:42Z) - ClearDepth: Enhanced Stereo Perception of Transparent Objects for Robotic Manipulation [18.140839442955485]
我々は透明物体の立体深度回復のための視覚変換器に基づくアルゴリズムを開発した。
提案手法は,効率的なデータ生成のためのパラメータ整合,ドメイン適応,物理的に現実的なSim2Realシミュレーションを含む。
実世界のシナリオにおけるSim2Realの例外的な一般化性を示す実験結果を得た。
論文 参考訳(メタデータ) (2024-09-13T15:44:38Z) - VFMM3D: Releasing the Potential of Image by Vision Foundation Model for Monocular 3D Object Detection [80.62052650370416]
モノクル3Dオブジェクト検出は、自律運転やロボティクスなど、さまざまなアプリケーションにおいて重要な役割を担っている。
本稿では,VFMM3Dを提案する。VFMM3Dは,ビジョンファウンデーションモデル(VFM)の機能を利用して,単一ビュー画像を正確にLiDARポイントクラウド表現に変換する,革新的なフレームワークである。
論文 参考訳(メタデータ) (2024-04-15T03:12:12Z) - Depth Estimation Matters Most: Improving Per-Object Depth Estimation for
Monocular 3D Detection and Tracking [47.59619420444781]
検出・追跡を含む単眼的3D知覚へのアプローチは、LiDARベースの手法と比較して性能が劣ることが多い。
本稿では,オブジェクト(トラックレット)の複数のフレームに異なる表現(RGBと擬似LiDAR)と時間情報を組み合わせた多層融合手法を提案する。
論文 参考訳(メタデータ) (2022-06-08T03:37:59Z) - SGM3D: Stereo Guided Monocular 3D Object Detection [62.11858392862551]
SGM3Dと呼ばれるステレオ誘導単分子物体検出ネットワークを提案する。
ステレオ画像から抽出したロバストな3次元特徴を利用して、モノクル画像から得られた特徴を強化する。
本手法は,余分な計算コストを伴わずに性能を向上させるために,他の多くの単分子的手法に統合することができる。
論文 参考訳(メタデータ) (2021-12-03T13:57:14Z) - TANDEM: Tracking and Dense Mapping in Real-time using Deep Multi-view
Stereo [55.30992853477754]
本稿では,リアルタイムな単分子追跡と高密度フレームワークであるTANDEMを紹介する。
ポーズ推定のために、TANDEMはアライメントのスライディングウィンドウに基づいて光度バンドル調整を行う。
TANDEMは最先端のリアルタイム3D再構成性能を示す。
論文 参考訳(メタデータ) (2021-11-14T19:01:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。