論文の概要: Double-Helix Active Geometry: LiDAR-Anchored Multi-View Depth with Selective Abstention
- arxiv url: http://arxiv.org/abs/2607.02561v1
- Date: Sun, 28 Jun 2026 17:15:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.322585
- Title: Double-Helix Active Geometry: LiDAR-Anchored Multi-View Depth with Selective Abstention
- Title(参考訳): 二重ヘリックス能動幾何:LiDAR- Anchored Multi-View Depth with Selective Absstention
- Authors: Jinwen Wen,
- Abstract要約: DH-Activeは、センサを唯一の深度源ではなくメートル法定規として扱う軽量な幾何学的バックエンドである。
スパイラルサンプリング、スパースバックプロジェクション、ホール分類を含む測定されたコアフロントエンドは、CPU上で1.11msの中央遅延で動作する(14スレッドで開く)。
2つのiPhoneキャプチャーとパブリックなARKitScenesベンチマークで、ホールドアウト深さは1.4から6.7%の中央値エラーで回復される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Consumer depth sensors such as the LiDAR scanner on recent iPhones provide metric range, but their useful range is short and their returns are sparse. We present DH-Active, a lightweight, training-free geometry back-end that treats the sensor as a metric ruler rather than the sole source of depth. Near-field returns anchor the metric relative pose of two views through PnP; visually trackable samples without a valid depth return are then triangulated under that pose. A parallax/reprojection gate abstains wherever the geometry is ill-conditioned, leaving an explicit hole and a selective score instead of forcing an estimate. The measured core front end, including spiral sampling, sparse back-projection, and hole taxonomy but excluding preprocessing and multi-view recovery, runs at 1.11 ms median latency on CPU (OpenCV using 14 threads), about 38 times faster than a DINOv2-L visual branch on GPU in our timing setup. Across two iPhone captures and the public TUM RGB-D and ARKitScenes benchmarks, held-out depth is recovered at 1.4 to 6.7 percent median relative error. In a controlled ARKitScenes protocol that uses only returns within 2 m to set scale and an independent laser scan as ground truth, DH-Active achieves 64.2 percent scene-median coverage of evaluable far-field candidates at 13.4 percent scene-median relative error; direct triangulation from the device trajectory is not usable. We also report the alternatives that failed in our tests: single-frame defocus, classical focus-stack depth, defocus-LiDAR fusion, point-to-point ICP over a good visual-inertial track, and attention-to-holes resampling. A 1.26 B learned model remains more accurate after oracle scale alignment. The contribution here is narrower: metric sparse depth, explicit abstention, zero learned parameters, and near-millisecond CPU cost.
- Abstract(参考訳): 最近のiPhoneのLiDARスキャナーのような消費者の深度センサーはメートル法の範囲を提供しているが、有用範囲は短く、リターンは少ない。
DH-Activeは、センサを唯一の深度源ではなくメートル法定規として扱う軽量でトレーニング不要な幾何学バックエンドである。
近接場戻りは、PnPを通して2つのビューのメートル法的な相対的なポーズをアンカーし、有効な深さ戻りのない視覚的に追跡可能なサンプルは、そのポーズの下で三角測量される。
パララックス/再射ゲートは、幾何が不調であるかを断定し、推定を強制するのではなく、明示的な穴と選択的なスコアを残す。
スパイラルサンプリング、スパースバックプロジェクション、ホール分類を含む測定されたコアフロントエンドは、前処理とマルチビューリカバリを除いて、CPU(14スレッドを使用したOpenCV)上で1.11msのレイテンシで動作し、われわれのタイミング設定ではGPU上のDINOv2-Lビジュアルブランチよりも約38倍高速である。
2つのiPhoneキャプチャーとパブリックなTUM RGB-DとARKitScenesベンチマークで、ホールドアウト深さは1.4から6.7%の相対誤差で回復される。
スケールを2m以内で設定し、独立したレーザースキャンを基底として使用する制御されたARKitScenesプロトコルでは、DH-Activeは、評価可能な遠距離場候補を13.4%のシーン中間相対誤差で64.2%のシーン中間カバレッジを達成する。
また,1フレームのデフォーカス,古典的なフォーカススタック深度,デフォーカス-LiDAR融合,良質なビジュアル慣性軌道上のポイント・ツー・ポイントICP,アテンション・ツー・ホールのリサンプリングなど,テストで失敗した代替案も報告した。
1.26Bの学習モデルは、オラクルスケールアライメント後の精度が向上したままである。
ここでのコントリビューションは、メトリックスパース深さ、明示的な棄権、学習パラメータのゼロ、ほぼミリ秒のCPUコストである。
関連論文リスト
- Systematic Evaluation of Depth Backbones and Semantic Cues for Monocular Pseudo-LiDAR 3D Detection [0.0]
KITTI検証において,深度バックボーンと機能工学が単分子Pseudo-LiDARパイプラインに与える影響を評価する。
既製のLiDAR検出器の下では、奥行きバックボーンの選択と幾何学的忠実度が二次的特徴注入よりも優れていた。
論文 参考訳(メタデータ) (2026-01-07T05:57:19Z) - SpotNet: An Image Centric, Lidar Anchored Approach To Long Range Perception [3.627834388176496]
SpotNetは高速で単一ステージのイメージ中心だが、長距離3Dオブジェクト検出のためのLiDARアンロックアプローチである。
我々は,LiDAR/画像センサフュージョンへのアプローチと2次元および3次元検出タスクの連成学習が組み合わさって,LiDARの精度が低い3次元物体検出に繋がることを示した。
論文 参考訳(メタデータ) (2024-05-24T17:25:48Z) - NeRF-Det++: Incorporating Semantic Cues and Perspective-aware Depth
Supervision for Indoor Multi-View 3D Detection [72.0098999512727]
NeRF-Detは、NeRFを用いた屋内マルチビュー3次元検出において、表現学習の強化による優れた性能を実現している。
セマンティックエンハンスメント(セマンティックエンハンスメント)、パースペクティブ・アウェア・サンプリング(パースペクティブ・アウェア・サンプリング)、および順序深度監視を含む3つのソリューションを提案する。
結果として得られたアルゴリズムであるNeRF-Det++は、ScanNetV2とAR KITScenesデータセットで魅力的なパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-02-22T11:48:06Z) - Dense Optical Tracking: Connecting the Dots [82.79642869586587]
DOTは、ビデオにおけるポイントトラッキングの問題を解決するための、新しくてシンプルで効率的な方法である。
OmniMotionのような高度な"ユニバーサルトラッカー"を上回り、CoTrackerのような最良のポイントトラッキングアルゴリズムと同等か、あるいはそれ以上の精度で、DOTが現在の光フロー技術よりもはるかに正確であることを示す。
論文 参考訳(メタデータ) (2023-12-01T18:59:59Z) - RayMVSNet++: Learning Ray-based 1D Implicit Fields for Accurate
Multi-View Stereo [21.209964556493368]
RayMVSNetは、シーン深度を示すゼロクロスポイントを用いて、各カメラ線に沿った1次元暗黙フィールドの逐次予測を学習する。
RayMVSNet++はScanNetデータセット上で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-07-16T02:10:47Z) - Embracing Single Stride 3D Object Detector with Sparse Transformer [63.179720817019096]
自律走行のためのLiDARを用いた3次元物体検出では、物体サイズと入力シーンサイズとの比が2次元検出の場合に比べて有意に小さい。
多くの3D検出器は2D検出器の一般的な慣習に従っており、点雲の定量化後も特徴マップを分解する。
本稿では,SST(Single-stride Sparse Transformer)を提案する。
論文 参考訳(メタデータ) (2021-12-13T02:12:02Z) - Is Pseudo-Lidar needed for Monocular 3D Object detection? [32.772699246216774]
我々は,擬似ライダー法のような深度事前学習の恩恵を受けることができるエンド・ツー・エンドの単分子3次元物体検出器DD3Dを提案する。
我々のアーキテクチャは、深度推定と3次元検出の効果的な情報伝達のために設計されており、ラベルなし事前学習データの量でスケールすることができる。
論文 参考訳(メタデータ) (2021-08-13T22:22:51Z) - Dense Label Encoding for Boundary Discontinuity Free Rotation Detection [69.75559390700887]
本稿では,分類に基づく比較的研究の少ない方法論について検討する。
我々は2つの側面でフロンティアを推し進めるための新しい手法を提案する。
航空画像のための大規模公開データセットの実験と視覚解析は,我々のアプローチの有効性を示している。
論文 参考訳(メタデータ) (2020-11-19T05:42:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。