論文の概要: Geometry-Grounded Unified 3D Perception for Autonomous Driving
- arxiv url: http://arxiv.org/abs/2608.13147v1
- Date: Thu, 13 Aug 2026 12:17:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.514269
- Title: Geometry-Grounded Unified 3D Perception for Autonomous Driving
- Title(参考訳): 自動走行のための幾何学的周囲の統一3次元知覚
- Abstract要約: カメラベースの自律運転認識には、同期マルチカメラストリーム間のメートル法3D構造を保存する共有表現が必要である。
本稿では、VGGTの再構成指向の潜伏を校正・ストリーミング駆動シーンに適応させる、幾何グラウンドの統一3次元知覚フレームワークを提案する。
- 参考スコア(独自算出の注目度): 36.11730832045922
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Camera-based autonomous driving perception requires a shared representation that preserves metric 3D structure across synchronized multi-camera streams. However, existing image-based frameworks often rely on backbones pretrained for semantic recognition, and introduce 3D geometry through downstream task-specific modules. As a result, their shared representations may fail to preserve explicit metric geometry and consistent 3D scene structure. In this paper, we present a Geometry-grounded Unified 3D Perception (GeoUP) framework that adapts the reconstruction-oriented latent of VGGT to calibrated, streaming multi-camera driving scenes. GeoUP factorizes cross-image interaction into self, temporal, and view attention to capture structurally distinct temporal and cross-view correspondences. It further injects calibration-aware raymap encodings to provide metric scale and camera geometry. The resulting geometry-grounded latent is decoded for metric depth estimation, 3D object detection, and semantic occupancy prediction, corresponding to surface-, instance-, and volume-level readouts of the same 3D scene. Through joint multi-task and multi-dataset training, GeoUP effectively leverages heterogeneous annotations and generalizes across diverse sensor configurations and perception ranges. Extensive experiments on nuScenes, Argoverse 2, Waymo, KITTI, and DDAD demonstrate that GeoUP achieves SOTA performance across detection, occupancy, and depth estimation. These results validate the effectiveness of geometry-grounded representations for unified 3D driving perception.
- Abstract(参考訳): カメラベースの自律運転認識には、同期マルチカメラストリーム間のメートル法3D構造を保存する共有表現が必要である。
しかし、既存の画像ベースのフレームワークは、しばしばセマンティック認識のために事前訓練されたバックボーンに依存し、下流のタスク固有のモジュールを通して3D幾何学を導入する。
結果として、それらの共有表現は、明示的な幾何学的幾何学と一貫性のある3Dシーン構造を保存できない可能性がある。
本稿では,VGGTの再構成指向の潜在性に適応し,マルチカメラ駆動シーンを校正・ストリーミングするGeometry-grounded Unified 3D Perception (GeoUP) フレームワークを提案する。
GeoUPは、横断的な相互作用を自己、時間的、視点的な注意に分解し、構造的に異なる時間的および横断的な対応を捉える。
さらに、キャリブレーション対応のレイマップエンコーディングを注入し、メートル法スケールとカメラ幾何学を提供する。
得られた幾何学的接地潜水剤は、同じ3Dシーンの表面、インスタンス、ボリュームレベルの読み出しに対応する、メートル法深度推定、3次元オブジェクト検出、セマンティック占有予測のためにデコードされる。
共同マルチタスクとマルチデータセットのトレーニングを通じて、GeoUPはヘテロジニアスアノテーションを効果的に活用し、多様なセンサー構成と知覚範囲にわたって一般化する。
nuScenes, Argoverse 2, Waymo, KITTI, DDAD に関する大規模な実験により,GeoUP が検出,占有,深度推定を通じてSOTA 性能を達成することが示された。
これらの結果は,3次元駆動知覚の統一化のための幾何学的接地表現の有効性を検証した。
関連論文リスト
- USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes [57.4583999658488]
自律運転のための空間表現学習は、生の視覚信号を構造化された3次元シーン表現にマッピングすることを目的としている。
既存の方法は動的再構成とインスタンスレベルの認識を別々のタスクとして扱う。
共有シーン表現における高密度な動的幾何とインスタンスレベルのオブジェクトレイアウトを復元する統一条件生成フレームワークUSR-Driveを提案する。
論文 参考訳(メタデータ) (2026-08-19T15:29:06Z) - IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation [76.36174247570716]
ポーズレス多視点画像から連続的かつ一貫性のある幾何を暗黙的にモデル化するインプリシトビジュアル幾何変換器IVGTを提案する。
IVGTは標準座標系で連続的なニューラルネットワークシーン表現を学習し、任意の3D位置での連続的な空間クエリをサポートする。
連続的かつコヒーレントな表面形状の直接抽出を可能にし、任意の視点からRGB画像、深度マップ、表面正規写像のレンダリングを可能にする。
論文 参考訳(メタデータ) (2026-05-15T17:59:57Z) - GemDepth: Geometry-Embedded Features for 3D-Consistent Video Depth [12.866152238833104]
ビデオ深度推定は、一眼的予測を時間領域に拡張し、コヒーレンスを確保する。
現在のアプローチは主にトランスフォーマーによる時間的平滑化に依存しており、厳密な3次元幾何学的整合性を維持するのに苦労している。
GemDepthは,カメラモーションとグローバル3D構造を明確に認識することが3D一貫性の前提条件である,という知見に基づいて構築されたフレームワークである。
論文 参考訳(メタデータ) (2026-05-11T13:11:54Z) - Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding [34.1504914582344]
3D Visual Groundingは、自然言語記述を通じてオブジェクトを3Dシーンにローカライズすることを目的としている。
生のRGB-Dストリーム上で直接動作する2次元から3次元の再生パラダイムである"Think, Act, Build (TAB)"を提案する。
厳密なVLMセマンティックトラッキングによる多視点カバレッジ障害を克服するために,セマンティックアンコレッド幾何拡張を導入する。
論文 参考訳(メタデータ) (2026-04-01T06:12:16Z) - IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction [82.53307702809606]
人間は自然に3次元世界の幾何学的構造と意味的内容を中間次元として知覚する。
本稿では,空間再構成とインスタンスレベルの文脈理解の両面での知識を統合するために,IGGT (InstanceGrounded Geometry Transformer) を提案する。
論文 参考訳(メタデータ) (2025-10-26T14:57:44Z) - AutoDecoding Latent 3D Diffusion Models [95.7279510847827]
本稿では,3次元オートデコーダをコアとした静的・明瞭な3次元アセットの生成に対して,新しいアプローチを提案する。
3D Autodecoderフレームワークは、ターゲットデータセットから学んだプロパティを潜時空間に埋め込む。
次に、適切な中間体積潜在空間を特定し、ロバストな正規化と非正規化演算を導入する。
論文 参考訳(メタデータ) (2023-07-07T17:59:14Z) - SeMLaPS: Real-time Semantic Mapping with Latent Prior Networks and
Quasi-Planar Segmentation [53.83313235792596]
本稿では,RGB-Dシーケンスからのリアルタイム意味マッピングのための新しい手法を提案する。
2DニューラルネットワークとSLAMシステムに基づく3Dネットワークと3D占有マッピングを組み合わせる。
本システムは,2D-3Dネットワークベースシステムにおいて,最先端のセマンティックマッピング品質を実現する。
論文 参考訳(メタデータ) (2023-06-28T22:36:44Z) - Viewpoint Equivariance for Multi-View 3D Object Detection [35.4090127133834]
最先端の手法は多視点カメラ入力からのオブジェクト境界ボックスの推論と復号化に重点を置いている。
本稿では,3次元多視点幾何を利用した新しい3次元オブジェクト検出フレームワークであるVEDetを紹介する。
論文 参考訳(メタデータ) (2023-03-25T19:56:41Z) - GTT-Net: Learned Generalized Trajectory Triangulation [26.80678903445168]
GTT-Netはスパースダイナミック3次元形状の再構成のための教師あり学習フレームワークである。
GTT-Netは精度とロバスト性という点で最先端であることを示す。
論文 参考訳(メタデータ) (2021-09-08T03:01:25Z) - Improving Point Cloud Semantic Segmentation by Learning 3D Object
Detection [102.62963605429508]
ポイントクラウドセマンティックセグメンテーションは、自動運転において重要な役割を果たす。
現在の3Dセマンティックセグメンテーションネットワークは、よく表現されたクラスに対して優れた性能を発揮する畳み込みアーキテクチャに焦点を当てている。
Aware 3D Semantic Detection (DASS) フレームワークを提案する。
論文 参考訳(メタデータ) (2020-09-22T14:17:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。