論文の概要: X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras
- arxiv url: http://arxiv.org/abs/2607.12993v1
- Date: Tue, 14 Jul 2026 17:45:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.238486
- Title: X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras
- Title(参考訳): X線量:不均質カメラによるリアルタイム距離推定
- Abstract要約: X-lensは魚眼およびピンホールビューからメートル法深度を推定するためのコンパクトフィードフォワードモデルである。
X-lensは、幾何学的に認識された2つの重要なコンポーネントを持つ異種カメラの定式化を中心に構築されている。
実世界および合成室内および屋外両方のデータセットの実験は、優れたヘテロジニアス・カメラのメートル法深度精度を示している。
- 参考スコア(独自算出の注目度): 7.678841903200207
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present X-lens, a compact feed-forward model for metric depth estimation from a variable number of calibrated fisheye and pinhole views. To support real-time downstream perception, X-lens is built around a geometry-aware heterogeneous camera formulation with two key components. Learnable calibration tokens provide a coarse alignment between fisheye and pinhole projective spaces, while a Jacobian-parameterized distortion bias injected into cross-attention models local projection changes and promotes cross-camera consistency, enabling robust generalization with only 0.04B parameters and up to 41 FPS. The model predicts dense depth together with a global metric scale, avoiding auxiliary reconstruction targets that increase computation and optimization complexity. To learn such cross-camera generalization at scale and depth, X-lens is trained on multiple public datasets and OmniScene, our newly released large-scale synthetic dataset containing approximately 266K synchronized six-view frames, 1.7M individual images, and 103 indoor and outdoor scenes. Extensive experiments on both real-world and synthetic indoor and outdoor datasets demonstrate superior heterogeneous-camera metric depth accuracy, reducing AbsRel by 25.4\% on OmniScene-Full over the strongest baseline while using 88.9\% fewer parameters, with competitive performance on conventional fisheye-only and pinhole-only settings.
- Abstract(参考訳): 魚眼およびピンホールビューの変動数から距離深度推定を行うためのコンパクトフィードフォワードモデルであるX-lensを提案する。
リアルタイム下流認識をサポートするために、X-lensは2つのキーコンポーネントを持つ幾何認識の不均一なカメラの定式化を中心に構築されている。
学習可能なキャリブレーショントークンは、魚眼とピンホールの射影空間間の粗いアライメントを提供し、一方、ジャコビアン偏光歪バイアスは、交差アテンションモデルに注入され、局所投影が変化し、カメラ間の一貫性が向上し、0.04Bパラメータと41FPSまでの堅牢な一般化を可能にする。
このモデルは、大域的なメートル法スケールとともに密度の深い深さを予測し、計算と最適化の複雑さを増大させる補助的な再構成ターゲットを避ける。
複数の公開データセットとOmniSceneで、X-lensを学習するために、約266Kの同期6ビューフレーム、1.7Mの個別画像、103の屋内・屋外シーンを含む大規模な合成データセットを新たにリリースした。
実世界および合成屋内および屋外のデータセットの大規模な実験は、より優れた均一なカメラ距離の精度を示し、AbsRelは、88.9%のパラメータを使用しながら、最強のベースライン上でOmniScene-Fullを25.4\%削減する。
関連論文リスト
- OmniPoint: Universal Monocular Metric Pointcloud from Any Camera [79.24417597712802]
OmniPointは、様々な画像センサにまたがるメートル法再構成を一般化するために設計された統合されたフレームワークである。
射影剛性を克服するため、OmniPointは従来の平面深度回帰を放棄する。
代わりに、分離された訓練目標とともに、分離された光線と距離の表現を採用する。
論文 参考訳(メタデータ) (2026-09-08T19:45:58Z) - AI-based single-shot structured-light depth reconstruction for real-time laparoscopic surgical guidance [3.241053244023025]
遅延空間深度再構成を施したLED照射型バイナリパターンプラットフォームにより,同期のないビデオレートの内視鏡深度推定が可能となった。
提案モデルはU-Net MaskNet+DepthNetベースラインよりも低いMAEを実現し,MAE,AbsRel,しきい値精度で既製の単分子深度モデルより優れていた。
論文 参考訳(メタデータ) (2026-08-05T17:44:21Z) - DepthART: Scaling Foundation Monocular Depth to Tiny Models [51.10174763031444]
DepthARTは、様々なシーンにまたがるデバイス上のデプロイメントのためのコンパクトなMDEモデルである。
ゼロショット一般化とメートル法精度の両方において、DepthARTが従来の小さなベースラインを一貫して上回っていることを示す。
また、GTX A6000で347/245 FPS (strict FP32)、Orin NX 8GBで2242/4482ドル、102 FPS (TF32)、Jetson Nano 4GBで15 FPS (FP32) に達したスケーラブルなモデルファミリも提供しています。
論文 参考訳(メタデータ) (2026-07-19T06:54:52Z) - Sphere-VIO: Fast and Robust Visual-Inertial Odometry via Unified Spherical Representation for Heterogeneous Multi-Camera Systems [11.777651307702174]
マルチカメラ・ビジュアル・慣性オドメトリー(VIO)は、視野を広げることによって純粋な視覚系の固有の限界を克服する。
ヘテロジニアスマルチカメラシステムのための球面表現を統一した軽量フィルタベースのVIOフレームワークであるSphere-VIOを提案する。
Sphere-VIOは, 精度, 堅牢性, 効率, クロスカメラの汎用性とのトレードオフが優れていることを示す。
論文 参考訳(メタデータ) (2026-06-29T07:46:08Z) - SurroundNEXO: Ego-Centric Metric Bridging for Spatially Consistent Geometry in Autonomous Driving [38.85333609536219]
SurroundNEXOは低オーバーラップマルチカメラ・メトリディープ・フレームワークである。
これは、視覚的対応ではなく、エゴ中心の幾何学におけるクロスビュー推論を基礎としている。
シングルビューエラーを33.2%削減し、クロスビュー一貫性を10.5%向上し、SOTA法に比べて25.6%向上した。
論文 参考訳(メタデータ) (2026-06-15T17:00:32Z) - CalibAnyView: Beyond Single-View Camera Calibration in the Wild [59.66873936532375]
カメラキャリブレーションは、信頼性の高い幾何学的知覚の基本的な前提条件である。
近年の学習に基づく手法では、単一ビューの校正には有望な結果が得られたが、本質的に複数のビューにまたがる幾何的整合性は無視されている。
任意の数の入力ビューをサポートする統一的な定式化であるCalibAnyViewを紹介します。
論文 参考訳(メタデータ) (2026-05-14T09:32:12Z) - Stereo-Inertial Poser: Towards Metric-Accurate Shape-Aware Motion Capture Using Sparse IMUs and a Single Stereo Camera [54.967647497048205]
本稿では,距離精度と形状を考慮した3次元動作を推定するリアルタイムモーションキャプチャシステムであるStereo-Inertial Poserを提案する。
モノクラーRGBをステレオビジョンに置き換え、直接3次元キーポイント抽出と形状パラメータ推定を可能にした。
ドリフトフリーなグローバル翻訳を長い記録時間で生成し,フットスケート効果を低減させる。
論文 参考訳(メタデータ) (2026-03-02T17:46:38Z) - Visual Odometry with Transformers [68.453547770334]
特徴抽出により単眼フレームのシーケンスを処理するビジュアル・オドメトリ・トランスフォーマ(VoT)を導入する。
従来の方法とは異なり、VoTは密度の高い幾何学を推定することなくカメラの動きを直接予測し、監視のためにカメラのポーズのみに依存する。
VoTは、より大きなデータセットで効果的にスケールし、より強力なトレーニング済みバックボーンの恩恵を受け、多様なカメラモーションとキャリブレーション設定を一般化し、従来のメソッドよりも3倍以上高速に動作しながらパフォーマンスを向上する。
論文 参考訳(メタデータ) (2025-10-02T17:00:14Z) - PFDepth: Heterogeneous Pinhole-Fisheye Joint Depth Estimation via Distortion-aware Gaussian-Splatted Volumetric Fusion [61.6340987158734]
ヘテロジニアス多視点深度推定のための最初のピンホール・フィッシュアイ・フレームワークPFDepthを提案する。
PFDepthは、ピンホールと魚眼カメラの任意の組み合わせを、様々な内在と外生とで処理できる統一アーキテクチャを採用している。
我々は,現在の主流深度ネットワーク上でのKITTI-360およびRealHetデータセットに対して,PFDepthが最先端の性能を示すことを示す。
論文 参考訳(メタデータ) (2025-09-30T09:38:59Z) - AlignDiff: Learning Physically-Grounded Camera Alignment via Diffusion [0.5277756703318045]
本稿では,カメラ内在パラメータと外在パラメータをジェネリック・レイ・カメラ・モデルを用いて扱う新しいフレームワークを提案する。
従来のアプローチとは異なり、AlignDiffは意味論から幾何学的特徴へ焦点を移し、局所歪みのより正確なモデリングを可能にした。
実験により,提案手法は,推定光束の角誤差を8.2度,全体のキャリブレーション精度で著しく低減し,課題のある実世界のデータセットに対する既存手法よりも優れていることを示した。
論文 参考訳(メタデータ) (2025-03-27T14:59:59Z) - RePoseD: Efficient Relative Pose Estimation With Known Depth Information [45.40994214285799]
本稿では,2つのカメラの相対的なポーズを,関連する単眼深度に対応する点対応から推定する新しい枠組みを提案する。
新しいソルバは、スピードと精度の点で最先端のディープ・アウェア・ソルバより優れている。
論文 参考訳(メタデータ) (2025-01-13T23:13:33Z) - GVDepth: Zero-Shot Monocular Depth Estimation for Ground Vehicles based on Probabilistic Cue Fusion [0.0]
計量単分子深度推定の一般化は、その不適切な性質のために重要な課題となる。
本稿では,様々なカメラ設定の整合性を維持する新しい標準表現を提案する。
また,物体の大きさや垂直位置の手がかりによって推定される深度を適応的かつ確率的に融合する新しいアーキテクチャを提案する。
論文 参考訳(メタデータ) (2024-12-08T22:04:34Z) - Universal and Flexible Optical Aberration Correction Using Deep-Prior
Based Deconvolution [51.274657266928315]
そこで本研究では,収差画像とpsfマップを入力とし,レンズ固有深層プリエントを組み込んだ潜在高品質版を生成する,psf対応プラグイン・アンド・プレイ深層ネットワークを提案する。
具体的には、多彩なレンズの集合からベースモデルを事前訓練し、パラメータを迅速に精製して特定のレンズに適応させる。
論文 参考訳(メタデータ) (2021-04-07T12:00:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。