論文の概要: OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras
- arxiv url: http://arxiv.org/abs/2607.03038v1
- Date: Fri, 03 Jul 2026 07:31:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.501253
- Title: OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras
- Title(参考訳): OmniDS:魚眼カメラによる全方位深度のためのデュアルストリームコンテキストフュージョン
- Abstract要約: 我々は,厳密な凝集を代替する反復的な深度改善フレームワークであるOmniDSを提案する。
デュアルストリームエンコーダは、幾何学的詳細のためにCNNと、セマンティック先行のために凍結されたDINOv3とをペアリングする。
効率的なデプロイのために、デュアルストリーム表現を単一のMobileNetベースのエンコーダに蒸留する。
- 参考スコア(独自算出の注目度): 4.710825549574638
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Omnidirectional depth estimation from multi-fisheye camera rigs is complicated by visibility conflicts: wide baselines cause different cameras to observe different portions, or even different faces, of the same object, so aggregating their features into a unified equirectangular (ERP) representation under fixed projection produces ambiguous matching evidence near occlusion boundaries and thin structures. Although existing methods mitigate this by down-weighting unreliable views, they do not resolve the underlying discrepancy because context formation and cross-view fusion remain tied to rigid fisheye-to-ERP sampling. We present OmniDS, an iterative depth refinement framework that replaces rigid aggregation by combining dynamic context fusion with consensus-aware multi-view similarity. A dual-stream encoder pairs a lightweight CNN for geometric detail with a frozen DINOv3 for semantic priors; their features are reprojected into ERP space at each refinement step via learned view weighting and deformable cross-attention with geometric distortion bias. In parallel, a multi-view consensus volume captures global cross-camera agreement through group-wise correlation and feature variance, regularized by a 3D U-Net. For efficient deployment, we distill the dual-stream representation into a single MobileNet-based encoder. OmniDS achieves state-of-the-art performance on the OmniThings, OmniHouse, and Sunny benchmarks while maintaining competitive inference speed. Project page and codes are available at https://parkchaesong.github.io/omnids.
- Abstract(参考訳): 広基線は異なるカメラに同じ物体の異なる部分、あるいは異なる面を観察させるので、固定射影の下でそれらの特徴を統一された正方形(ERP)表現に集約することで、閉塞境界や細い構造の近くであいまいな一致の証拠を生み出す。
既存の手法では、信頼性の低いビューを下げることによってこれを緩和しているが、コンテキスト形成と相互視融合が厳密な魚眼対ERPサンプリングに結びついているため、基本的な相違は解決されない。
我々は,動的コンテキスト融合とコンセンサス対応のマルチビュー類似性を組み合わせることで,厳密な集約を置き換える反復的深度改善フレームワークOmniDSを提案する。
デュアルストリームエンコーダは、幾何学的詳細のために軽量なCNNと、セマンティック先行のために凍結されたDINOv3とをペアリングし、それらの特徴は、学習されたビュー重み付けと幾何学的歪みバイアスを伴う変形可能なクロスアテンションによって、各洗練ステップでERP空間に再投影される。
並行して、マルチビューコンセンサスボリュームは、3次元U-Netで正規化されたグループワイド相関と特徴分散を通じて、グローバルなクロスカメラ合意をキャプチャする。
効率的なデプロイのために、デュアルストリーム表現を単一のMobileNetベースのエンコーダに蒸留する。
OmniDSは競合推論速度を維持しながら、OmniThings、OmniHouse、Sunnyベンチマークで最先端のパフォーマンスを達成する。
プロジェクトページとコードはhttps://parkchaesong.github.io/omnids.comで公開されている。
関連論文リスト
- OmniPoint: Universal Monocular Metric Pointcloud from Any Camera [79.24417597712802]
OmniPointは、様々な画像センサにまたがるメートル法再構成を一般化するために設計された統合されたフレームワークである。
射影剛性を克服するため、OmniPointは従来の平面深度回帰を放棄する。
代わりに、分離された訓練目標とともに、分離された光線と距離の表現を採用する。
論文 参考訳(メタデータ) (2026-09-08T19:45:58Z) - GeoMAD: Geometry-Aware Multi-View Anomaly Detection via Deformable Fusion and Distributional Alignment [32.33973839948303]
マルチビュー異常検出(MvAD)は、複数のカメラ視点からの相補的な観察を利用して欠陥を検出する。
既存の方法は通常2つの極端に該当する: ボクセルベースの融合は明示的な幾何学的アライメントを提供するが、コストがかかる3次元構造とクラス固有の仮定を必要とする。
幾何対応の不整合と分布不整合の両方に対処する統合多視点多クラスADフレームワークGeoMADを提案する。
論文 参考訳(メタデータ) (2026-08-27T07:15:15Z) - USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes [57.4583999658488]
自律運転のための空間表現学習は、生の視覚信号を構造化された3次元シーン表現にマッピングすることを目的としている。
既存の方法は動的再構成とインスタンスレベルの認識を別々のタスクとして扱う。
共有シーン表現における高密度な動的幾何とインスタンスレベルのオブジェクトレイアウトを復元する統一条件生成フレームワークUSR-Driveを提案する。
論文 参考訳(メタデータ) (2026-08-19T15:29:06Z) - FlexSplat: Flexible Feed-Forward 3D Gaussian Splatting without Point Cloud Correspondence [9.30167648098673]
我々は、新しいビュー合成(NVS)のためのフィードフォワードフレームワークであるFlexSplatを紹介した。
幾何学変換器はガウスデコーダと共同で訓練され、画像当たりのカメラパラメータと深さを予測する。
ShapeNet-SRN と Google Scanned Objects (GSO) では、FlexSplat のマッチングやアプローチが最先端のコンストラクタとして提案されている。
論文 参考訳(メタデータ) (2026-08-08T05:52:26Z) - UniD-Shift: Towards Unified Semantic Segmentation via Interpretable Share-Private Multimodal Decomposition [9.578297917595377]
本稿では,2次元と3次元のセマンティックセグメンテーションのための統合フレームワークを提案する。
我々は、SAMベースの視覚エンコーダとSPTNetベースの幾何学エンコーダを組み合わせて、補完的意味論と幾何学的表現を抽出する。
軽量アテンションベースの融合モジュールは、共有された機能を一貫したクロスモーダル表現に集約する。
論文 参考訳(メタデータ) (2026-05-08T07:09:08Z) - DP-SfM: Dual-Pixel Structure-from-Motion without Scale Ambiguity [25.991973883422677]
マルチビュー3D再構成は、シーンに既知の大きさの参照オブジェクトが存在しない限り、未知のスケールの曖昧さに悩まされる。
デュアルピクセル(DP)センサを用いて撮像したマルチビュー画像は,そのスケールのあいまいさを自動的に解消できることを示す。
論文 参考訳(メタデータ) (2026-05-03T12:45:17Z) - A Global Depth-Range-Free Multi-View Stereo Transformer Network with Pose Embedding [76.44979557843367]
本稿では,事前の深度範囲を排除した新しい多視点ステレオ(MVS)フレームワークを提案する。
長距離コンテキスト情報を集約するMDA(Multi-view Disparity Attention)モジュールを導入する。
ソース画像のエピポーラ線上のサンプリング点に対応する電流画素の品質を明示的に推定する。
論文 参考訳(メタデータ) (2024-11-04T08:50:16Z) - Geometry-aware Reconstruction and Fusion-refined Rendering for Generalizable Neural Radiance Fields [18.474371929572918]
Generalizable NeRFは、目に見えないシーンのための新しいビューを合成することを目的としている。
我々は、一貫したピクセル対の寄与を増幅するために、適応コスト集約(ACA)アプローチを導入する。
既存の2つのデコード戦略が相補的な異なる領域で優れていることを観察する。
論文 参考訳(メタデータ) (2024-04-26T16:46:28Z) - OPA-3D: Occlusion-Aware Pixel-Wise Aggregation for Monocular 3D Object
Detection [51.153003057515754]
OPA-3Dは、Occlusion-Aware Pixel-Wise Aggregationネットワークである。
密集した風景深度と、奥行きのある箱残量と物の境界箱を共同で推定する。
メインカーのカテゴリーでは最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2022-11-02T14:19:13Z) - BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View Representation [105.96557764248846]
本稿では,汎用マルチタスクマルチセンサ融合フレームワークであるBEVFusionを紹介する。
共有鳥眼ビュー表示空間におけるマルチモーダル特徴を統一する。
3Dオブジェクト検出では1.3%高いmAPとNDS、BEVマップのセグメンテーションでは13.6%高いmIoU、コストは1.9倍である。
論文 参考訳(メタデータ) (2022-05-26T17:59:35Z) - DeepFusion: Lidar-Camera Deep Fusion for Multi-Modal 3D Object Detection [83.18142309597984]
ライダーとカメラは、自動運転における3D検出を補完する情報を提供する重要なセンサーである。
我々はDeepFusionという名前の汎用マルチモーダル3D検出モデル群を開発した。
論文 参考訳(メタデータ) (2022-03-15T18:46:06Z) - FPS-Net: A Convolutional Fusion Network for Large-Scale LiDAR Point
Cloud Segmentation [30.736361776703568]
LiDARポイントクラウドに基づくシーン理解は、自動運転車が安全に運転するのに不可欠なタスクです。
既存のほとんどのメソッドは、情報容量を増やすために、画像チャネルとして異なるポイント属性/モダリティを積み重ねる。
fps-netは,最適なポイントクラウドセグメンテーションのために,投影画像チャネル間の一意性と不一致を生かす畳み込み型融合ネットワークである。
論文 参考訳(メタデータ) (2021-03-01T04:08:28Z) - 6D Camera Relocalization in Ambiguous Scenes via Continuous Multimodal
Inference [67.70859730448473]
あいまいさと不確かさを捉えるマルチモーダルカメラ再ローカライズフレームワークを提案する。
我々は、複数のカメラのポーズ仮説を予測し、それぞれの予測の不確実性も予測する。
あいまいな環境下でのカメラローカライゼーション研究を促進するための新しいデータセットを提案する。
論文 参考訳(メタデータ) (2020-04-09T20:55:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。