論文の概要: SurroundNEXO: Ego-Centric Metric Bridging for Spatially Consistent Geometry in Autonomous Driving
- arxiv url: http://arxiv.org/abs/2606.16960v1
- Date: Mon, 15 Jun 2026 17:00:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 18:36:05.075103
- Title: SurroundNEXO: Ego-Centric Metric Bridging for Spatially Consistent Geometry in Autonomous Driving
- Title(参考訳): SurroundNEXO: 自律運転における空間的一貫した幾何学のための自我中心距離ブリッジ
- Authors: Shuai Yuan, Runxi Tang, Yuzhou Ji, Fudong Ge, Hanshi Wang, Yifei Wang, Xianming Zeng, Jianyun Xu, Xingliang Liu, Yanfeng Wang, Zhipeng Zhang,
- Abstract要約: SurroundNEXOは低オーバーラップマルチカメラ・メトリディープ・フレームワークである。
これは、視覚的対応ではなく、エゴ中心の幾何学におけるクロスビュー推論を基礎としている。
シングルビューエラーを33.2%削減し、クロスビュー一貫性を10.5%向上し、SOTA法に比べて25.6%向上した。
- 参考スコア(独自算出の注目度): 38.85333609536219
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern autonomous driving depends on accurate metric 3D understanding for perception, reconstruction, and planning, which in turn requires reliable multi-camera depth prediction. However, the outward-facing nature of vehicle-mounted surround-view camera rigs inherently limits visual overlap across views, challenging the correspondence-based assumptions that underpin conventional multi-view geometry. To bridge this gap, we present SurroundNEXO, named after the Spanish word nexo for a geometric link, a low-overlap multi-camera metric depth framework that grounds cross-view reasoning in ego-centric geometry rather than dense visual correspondences. Instead of directly enforcing early global fusion, SurroundNEXO first assigns image tokens globally comparable ego-frame viewing directions through Ego-Ray Positional Encoding, then uses sparse LiDAR measurements as metric anchors to propagate absolute scale cues, and finally expands feature interaction progressively from view-local modeling to decomposed spatio-temporal reasoning and global integration. This design enables metric-scale depth prediction with improved spatial consistency across weakly overlapping cameras. Across low-overlap autonomous driving benchmarks, including NuScenes, Waymo and DDAD, SurroundNEXO reduces single-view error by 33.2%, improves cross-view consistency by 10.5%, and enhances metric reconstruction quality by 25.6% compared with SOTA methods. It further remains robust under extremely sparse depth prompts and exhibits strong zero-shot generalization to unseen camera layouts.
- Abstract(参考訳): 現代の自律運転は、認識、再構築、計画のための正確な3次元理解に依存しており、それによって信頼性の高いマルチカメラ深度予測が必要とされる。
しかし、車載サラウンドビューカメラの対向特性は本質的にビュー間の視覚的重なりを制限し、従来のマルチビュー幾何学の基盤となる対応ベースの仮定に挑戦する。
このギャップを埋めるために、我々はSurroundNEXOを紹介した。SurroundNEXOは、濃密な視覚通信ではなく、エゴ中心の幾何学におけるクロスビュー推論を基盤とした、低オーバーラップのマルチカメラメートル法深度フレームワークである。
初期のグローバルフュージョンを直接強制する代わりに、SurroundNEXOは、Ego-Ray Positional Encodingを通じて、グローバルに匹敵するエゴフレーム表示方向を割り当て、次に、測定アンカーとしてスパースLiDARを使用して絶対スケールキューを伝播し、最終的に、ビューローカルモデリングから、時空間推論とグローバル統合の分解まで、機能相互作用を徐々に拡大する。
この設計により、弱い重なり合うカメラ間の空間整合性を改善したメートルスケール深度予測が可能となる。
NuScenes、Waymo、DDADを含む低オーバーラップの自動運転ベンチマークでは、SurroundNEXOはシングルビューエラーを33.2%削減し、クロスビュー一貫性を10.5%改善し、SOTA法と比較して25.6%改善している。
さらに、非常に狭い深さのプロンプトの下では頑丈であり、見えないカメラレイアウトに対して強いゼロショットの一般化を示す。
関連論文リスト
- LiAuto-GeoX: Efficient Grounded Driving Transformer [54.23823436153608]
デプロイ可能なエゴ中心の3Dシーン理解のための効率的な基底駆動トランスフォーマである textbfLiAuto-GeoX を提案する。
textbfLiAuto-GeoX は KITTI 上で 220 FPS で動作し,高忠実度高密度化を保ち,リアルタイムな展開を実現している。
論文 参考訳(メタデータ) (2026-06-04T06:58:44Z) - Cross-Vehicle 3D Geometric Consistency for Self-Supervised Surround Depth Estimation on Articulated Vehicles [3.512352303010361]
そこで本研究では,車体の周囲視深度推定のための自己教師型フレームワークを提案する。
構造コヒーレンスを改善するために,多視点空間拡張戦略とクロスビュー表面正規制約を導入する。
提案手法を検証するために,その上で収集したデータセットを用いて車載実験プラットフォームを構築した。
論文 参考訳(メタデータ) (2026-04-03T02:10:11Z) - DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation [72.89376712495464]
DAGEは、グローバルコヒーレンスを細部から切り離すデュアルストリームトランスフォーマーである。
低解像度ストリームは、フレーム/言語的注意を交互に交互に付加したアグレッシブなダウンサンプリングフレームで動作し、ビュー一貫性表現を構築する。
高解像度のストリームは、フレーム毎に元のイメージを処理し、シャープな境界と小さな構造を保存する。
この設計は、解像度とクリップ長を独立にスケールし、2Kまでの入力をサポートし、実用的な推論コストを維持する。
論文 参考訳(メタデータ) (2026-03-04T05:29:29Z) - Geometry-Aware Rotary Position Embedding for Consistent Video World Model [48.914346802616414]
ViewRopeは、ビデオトランスフォーマーの自己アテンション層に直接カメラの方向を注入するジオメトリ対応のエンコーディングである。
Geometry-Aware Frame-Sparse Attentionは、これらの幾何学的手がかりを利用して、関連する歴史的なフレームに選択的に参加する。
この結果から,ViewRopeは長期的整合性を大幅に向上し,計算コストを低減できることがわかった。
論文 参考訳(メタデータ) (2026-02-08T08:01:16Z) - TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction [57.46712611558817]
3次元視覚基礎モデルでは、1つのフィードフォワードパスを通して、未校正画像からキー3D属性を再構成する際の強力な一般化が示されている。
近年の戦略は,グローバルトランスフォーメーションの解決によって連続的な予測と整合するが,本分析では,仮定の妥当性,局所的なアライメント範囲,雑音的幾何の下でのロバスト性といった基本的な限界を明らかにしている。
本研究では,グローバルに伝播する制御点を利用して空間的に異なる不整合を補正する,Tin Plate Splineに基づく高DOFおよび長期アライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-02T02:22:20Z) - Semi-SMD: Semi-Supervised Metric Depth Estimation via Surrounding Cameras for Autonomous Driving [21.827292830060728]
Semi-SMDは、自動運転における周囲のカメラ機器に適した新しいメートル法深度推定フレームワークである。
本稿では,視覚的融合機能を構築するために,空間空間-時間-意味融合モジュールを提案する。
DDADおよびnuScenesデータセットを用いてアルゴリズムの評価を行い,本手法が最先端の性能を実現することを示す。
論文 参考訳(メタデータ) (2025-03-25T14:39:04Z) - A Simple Baseline for Supervised Surround-view Depth Estimation [25.81521612343612]
本稿では,S3Depthを提案する。
我々はCNNとトランスフォーマー層を組み合わせたグローバル・ローカルな特徴抽出モジュールを用いて表現を豊かにする。
本手法は,既存のDDADおよびnuScenesデータセット上での最先端手法よりも優れた性能を実現する。
論文 参考訳(メタデータ) (2023-03-14T10:06:19Z) - SurroundDepth: Entangling Surrounding Views for Self-Supervised
Multi-Camera Depth Estimation [101.55622133406446]
本研究では,複数の周囲からの情報を組み込んだSurroundDepth法を提案し,カメラ間の深度マップの予測を行う。
具体的には、周囲のすべてのビューを処理し、複数のビューから情報を効果的に融合するクロスビュー変換器を提案する。
実験において,本手法は,挑戦的なマルチカメラ深度推定データセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2022-04-07T17:58:47Z) - Full Surround Monodepth from Multiple Cameras [31.145598985137468]
自己監督単眼深度と自我運動推定を大型フォトベースラインマルチカメラリグに拡張します。
私たちは、典型的なLiDARスキャナーと同じ全周360度の視野をカバーする、高密度で一貫性のあるスケールアウェアポイントクラウドを生成する単一のネットワークを学びます。
論文 参考訳(メタデータ) (2021-03-31T22:52:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。