論文の概要: SonarVoxNet: Diver Detection in 3D Bounding Box using 3D Sonar
- arxiv url: http://arxiv.org/abs/2610.01644v1
- Date: Thu, 01 Oct 2026 13:08:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.144511
- Title: SonarVoxNet: Diver Detection in 3D Bounding Box using 3D Sonar
- Title(参考訳): SonarVoxNet:3次元ソナーを用いた3次元境界箱のダイバー検出
- Abstract要約: SonarVoxNetは、ボクセルベースのエンコーダとアンカーフリーのセンターベースの検出ヘッドを3Dソナーデータに適応させる。
正確な3次元ソナーベースダイバー検出の背景にある要因は、ヨーオンオンローテーションからフルSO(3)ローテーションへの移行である。
- 参考スコア(独自算出の注目度): 5.128586774272875
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous underwater vehicles (AUVs) assisting human divers must continuously track not only the diver's 3D position but also their full-body orientation. However, vision-based perception is unreliable underwater, and forward-looking sonar -- despite being widely used -- discards the elevation information needed for orientation estimation, posing a fundamental limitation. Recently commercialized 3D sonar preserves elevation but produces sparse, noisy returns, and existing detectors are built for dense LiDAR data and for targets that remain upright and rotate only about the yaw axis (e.g., vehicles, pedestrians), making them unable to represent a freely pitching and rolling diver. To address this gap, we present two contributions. First, SonarVoxNet adapts a voxel-based encoder and an anchor-free center-based detection head to 3D sonar data, replacing the conventional yaw-only rotation representation with a continuous 6D rotation parameterization to predict full 9-DoF oriented bounding boxes -- to our knowledge, the first 3D sonar diver detector to do so. Second, Diver3D is the first public 3D sonar dataset with full 3D orientation labels for divers in diverse, non-upright poses, collected at a natural cave-diving site. Through controlled ablations over the backbone and detection head, we show that the dominant factor behind accurate 3D sonar-based diver detection is the transition from yaw-only rotation to full-SO(3) rotation. This transition substantially improves detection accuracy and reduces orientation error. These results demonstrate that full-body diver orientation is recoverable from 3D sonar alone, laying the groundwork for future work on diver pose estimation and diver-robot interaction.
- Abstract(参考訳): 人間のダイバーを支援する自律型水中車両(AUV)は、ダイバーの3D位置だけでなく、全体の向きも継続的に追跡しなければならない。
しかし、視覚に基づく知覚は水中では信頼性が低く、前方のソナーは、広く使われているにもかかわらず、方向推定に必要な高度情報を捨て、基本的な制限を課している。
最近、商業化された3Dソナーは標高を保っているが、疎水性、ノイズリターンを発生し、既存の検出器は密集したLiDARデータと、ヨー軸(例えば車、歩行者)の周りで直立して回転するターゲットのために構築されており、自由に投球して回転するダイバーを表現できない。
このギャップに対処するため、私たちは2つのコントリビューションを提示します。
まず、SonarVoxNetはボクセルベースのエンコーダとアンカーフリーのセンターベース検出ヘッドを3Dソナーデータに適応させ、従来のヨーのみの回転表現を連続した6D回転パラメータ化に置き換え、完全な9-DoF指向境界ボックスを予測する。
第二に、Diver3Dは、自然の洞窟ダイビング場で収集された多様な、直立しないポーズのダイバーのための完全な3Dオリエンテーションラベルを持つ最初の公開3Dソナーデータセットである。
背骨のアブレーションと検出ヘッドの制御により, 正確な3次元ソナーベースダイバー検出の背景となる要因は, ヨーオンオンローテーションからフルSO(3)ローテーションへの移行であることがわかった。
この遷移は検出精度を大幅に向上し、方向誤差を低減する。
これらの結果から,3次元ソナーだけでは全体のダイバー方向が復元可能であることが示され,ダイバーポーズ推定とダイバーロボット間相互作用に関する今後の研究の基盤となっている。
関連論文リスト
- Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs [62.865932175477035]
計量3Dオブジェクト検出は、エンボディエージェントのコア機能であるが、最も信頼性の高いシステムは深度センサーに頼っている。
提案するMap-Det3Dは,RGBから再構成した3次元空間に直接検出を行うオンラインマルチビュー3Dオブジェクト検出モデルである。
論文 参考訳(メタデータ) (2026-08-12T15:33:42Z) - NAP3D: NeRF Assisted 3D-3D Pose Alignment for Autonomous Vehicles [1.1168121941015012]
この研究は、エージェントの現在の深度画像と事前訓練されたニューラルレージアンスフィールド(NeRF)の3D-3D対応を利用する補完的アプローチである、NeRF-Assisted 3D Pose Alignment (NAP3D)を導入している。
NAP3Dは、これまで観測された場所を再考することに頼ることなく、新しい視点からでも推定されたポーズを洗練させる。
実験により、NAP3Dはカスタムデータセット上で5cm以内のカメラポーズ補正を達成し、2D-3D Perspective-N-Pointベースラインを頑健に上回っている。
論文 参考訳(メタデータ) (2025-12-17T04:56:38Z) - RQR3D: Reparametrizing the regression targets for BEV-based 3D object detection [0.4604003661048266]
Bird's-eye view (BEV)ベースの知覚アプローチは、パースペクティブベースのソリューションの優れた代替手段として現れている。
本稿では,3次元回帰目標を定義するために,制限付き四辺形表現を提案する。
RQR3Dは、2つのボックスの隅の間にあるオフセットとともに、指向するボックスをカプセル化する最小の水平境界ボックスを回帰する。
論文 参考訳(メタデータ) (2025-05-23T10:52:34Z) - Training an Open-Vocabulary Monocular 3D Object Detection Model without 3D Data [57.53523870705433]
我々はOVM3D-Detと呼ばれる新しいオープン語彙単分子オブジェクト検出フレームワークを提案する。
OVM3D-Detは、入力または3Dバウンディングボックスを生成するために高精度のLiDARや3Dセンサーデータを必要としない。
オープンボキャブラリ2Dモデルと擬似LiDARを使用して、RGB画像に3Dオブジェクトを自動的にラベル付けし、オープンボキャブラリ単分子3D検出器の学習を促進する。
論文 参考訳(メタデータ) (2024-11-23T21:37:21Z) - NaviNeRF: NeRF-based 3D Representation Disentanglement by Latent Semantic Navigation [48.08517291377735]
3D表現のゆがみは、3Dデータの基本的な説明因子を特定し、分解し、操作することを目的としている。
NeRFは生成するNeRFパイプライン上に構築されており、アウターナビゲーションブランチとインナーリファインメントブランチを備えている。
NaviNeRFは、従来の3D対応モデルよりもきめ細かい3Dディスタングル能力が優れている。
論文 参考訳(メタデータ) (2023-04-22T07:48:17Z) - Aerial Monocular 3D Object Detection [67.20369963664314]
DVDETは2次元画像空間と3次元物理空間の両方で空中単分子3次元物体検出を実現するために提案される。
高度視差変形問題に対処するため,新しい測地変形変換モジュールを提案する。
より多くの研究者がこの領域を調査するよう促すため、データセットと関連するコードをリリースします。
論文 参考訳(メタデータ) (2022-08-08T08:32:56Z) - A Lightweight and Detector-free 3D Single Object Tracker on Point Clouds [50.54083964183614]
生のLiDARスキャンにおける物体の点雲は、通常スパースで不完全であるため、正確な目標固有検出を行うのは簡単ではない。
DMTは、複雑な3D検出器の使用を完全に除去する3Dトラッキングネットワークである。
論文 参考訳(メタデータ) (2022-03-08T17:49:07Z) - Anchor-free 3D Single Stage Detector with Mask-Guided Attention for
Point Cloud [79.39041453836793]
我々は、点雲をアンカーフリーで検出する新しい1段3次元検出器を開発した。
ボクセルをベースとしたスパース3D特徴量からスパース2D特徴量マップに変換することでこれを克服する。
検出信頼度スコアとバウンディングボックス回帰の精度との相関性を改善するために,IoUに基づく検出信頼度再校正手法を提案する。
論文 参考訳(メタデータ) (2021-08-08T13:42:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。