論文の概要: Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes
- arxiv url: http://arxiv.org/abs/2606.30047v2
- Date: Thu, 02 Jul 2026 06:59:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 15:16:32.242779
- Title: Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes
- Title(参考訳): Argus:室内シーンにおける3次元パノラマ画像再構成
- Abstract要約: 提案するRealsee3Dは,299Kパノラマ視点と正確なメートル法アノテーションを備えた10K屋内シーン(実写1K,合成9K)のハイブリッドデータセットである。
また,計測パノラマ3次元再構成のためのフィードフォワードネットワークであるArgusも紹介した。
- 参考スコア(独自算出の注目度): 9.410255130676182
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Metric feed-forward 3D reconstruction for panoramic data remains under-explored due to the lack of large-scale panoramic RGB-D training data. We present Realsee3D, a hybrid dataset of 10K indoor scenes (1K real, 9K synthetic) with 299K panoramic viewpoints and precise metric annotations, and Argus, a feed-forward network trained on it for metric panoramic 3D reconstruction. In the sparse unordered capture setting of Realsee3D, a poorly chosen coordinate anchor can cause global pose drift. Argus addresses this with a learned covisibility module that selects the geometrically optimal reference view to anchor the metric world frame. To further improve multi-task learning, we decompose the bidirectional pixel-to-world mapping into interpretable sub-steps with per-step supervision and cross-coordinate joint constraints, reinforcing geometric consistency across prediction branches. On the Realsee3D benchmark, Argus achieves state-of-the-art metric performance in camera pose estimation, depth estimation, and point cloud reconstruction. Project page: https://argus-paper.realsee.ai.
- Abstract(参考訳): 大規模パノラマRGB-Dトレーニングデータの欠如により,パノラマデータに対する3次元定量的フィードフォワード再構成はいまだに未検索のままである。
299Kパノラマ視点と正確なメートル法アノテーションを備えた10K屋内シーンのハイブリッドデータセットであるRealsee3Dと、それをトレーニングしたフィードフォワードネットワークであるArgusを提示する。
Realsee3Dの未秩序なキャプチャ設定では、不適切な座標アンカーがグローバルなポーズドリフトを引き起こす可能性がある。
Argus氏はこれを、幾何学的に最適な参照ビューを選択してメトリックワールドフレームをアンカーする、学習された可視性モジュールで対処する。
マルチタスク学習をさらに改善するため、双方向の画素間マッピングを、ステップごとの監督と相互調整による関節制約で解釈可能なサブステップに分解し、予測枝間の幾何的整合性を強化する。
Realsee3Dベンチマークでは、Argusはカメラポーズ推定、深さ推定、点雲再構成において最先端のメトリック性能を達成する。
プロジェクトページ: https://argus-paper.realsee.ai
関連論文リスト
- RIDE: Relocalization-Informed Depth Estimation with 3D Gaussian Splatting [20.29273985020268]
本稿では,ロボットのRGBマップから深度を推定するRIDEを提案する。
実験では、深度精度が向上し、時間的整合性尺度のみの校正が可能になった。
論文 参考訳(メタデータ) (2026-09-10T04:36:58Z) - S3KF: Spherical State-Space Kalman Filtering for Panoramic 3D Multi-Object Tracking [24.79542959759503]
パノラマ多対象追跡は、産業安全監視、広域ロボット認識、大規模ワークスペースにおけるインフラストラクチャライト展開において重要である。
既存の画像平面トラッカーは、カメラ投影に強く結合され、パノラマ画像では信頼性が低い。
回転する電動LiDARとクワッドフィッシュカメラリグをベースとしたパノラマ3次元多物体追跡フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-29T06:01:29Z) - MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources [25.21242040780486]
Metric Anythingは、メートル法深度推定のためのシンプルでスケーラブルな事前トレーニングフレームワークである。
手作業によるプロンプトなしで、ノイズの多い多様な3Dソースからメトリクスの深さを学習する。
Metric Anythingは、現代的な基礎モデルを動かすのと同じスケーリング法則の恩恵を受けることができることを示す。
論文 参考訳(メタデータ) (2026-01-29T17:52:41Z) - PLANA3R: Zero-shot Metric Planar 3D Reconstruction via Feed-Forward Planar Splatting [56.188624157291024]
提案するPLANA3Rは,提案しない2次元画像から平面3次元再構成を計測するためのポーズレスフレームワークである。
トレーニング中に3次元平面アノテーションを必要とする以前のフィードフォワード法とは異なり、PLANA3Rは明確な平面監督なしで平面3次元構造を学習する。
本研究は,複数の室内環境データセットに対するPLANA3Rの有効性を検証するとともに,領域外屋内環境への強力な一般化を実証する。
論文 参考訳(メタデータ) (2025-10-21T15:15:33Z) - WorldMirror: Universal 3D World Reconstruction with Any-Prior Prompting [51.69408870574092]
汎用的な3次元幾何予測タスクのためのオールインワンフィードフォワードモデルであるWorldMirrorを提案する。
我々のフレームワークは、カメラのポーズ、内在性、深度マップなど、様々な幾何学的先入観を柔軟に統合する。
WorldMirrorは、カメラ、ポイントマップ、深さ、表面正規推定から新しいビュー合成に至るまで、さまざまなベンチマークで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-10-12T17:59:09Z) - MapAnything: Universal Feed-Forward Metric 3D Reconstruction [63.79151976126576]
MapAnythingは1つ以上の画像を取り込み、カメラの内在性、ポーズ、深さ、部分的な再構築など、任意の幾何学的入力を行う。
そして、メーター3Dシーンの幾何学とカメラを直接補強する。
MapAnythingは、単一のフィードフォワードパスで幅広い3Dビジョンタスクに対処する。
論文 参考訳(メタデータ) (2025-09-16T18:00:14Z) - Dynamic Point Maps: A Versatile Representation for Dynamic 3D Reconstruction [56.32589034046427]
本研究では,ダイナミックポイントマップ(DPM)を導入し,モーションセグメンテーション,シーンフロー推定,3次元物体追跡,2次元対応などの4次元タスクをサポートする標準点マップを拡張した。
我々は,合成データと実データを組み合わせたDPM予測器を訓練し,映像深度予測,ダイナミックポイントクラウド再構成,3次元シーンフロー,オブジェクトポーズ追跡,最先端性能の達成など,様々なベンチマークで評価する。
論文 参考訳(メタデータ) (2025-03-20T16:41:50Z) - PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models [20.379104447051155]
我々は、市販の視覚基盤モデルを利用して、3Dシーン認識タスクに対処する学習自由パラダイムであるPointSegを提案する。
PointSegは正確な3Dプロンプトを取得してフレーム間で対応するピクセルを調整することで、任意の3Dシーンを分割することができる。
ScanNet、ScanNet++、KITTI-360データセット上の14.1$%、12.3$%、12.6$%のmAPは、最先端のトレーニングフリーモデルを大きく上回っている。
論文 参考訳(メタデータ) (2024-03-11T03:28:20Z) - FrozenRecon: Pose-free 3D Scene Reconstruction with Frozen Depth Models [67.96827539201071]
本稿では,3次元シーン再構成のための新しいテスト時間最適化手法を提案する。
本手法は5つのゼロショットテストデータセット上で,最先端のクロスデータセット再構築を実現する。
論文 参考訳(メタデータ) (2023-08-10T17:55:02Z) - Metric3D: Towards Zero-shot Metric 3D Prediction from A Single Image [85.91935485902708]
ゼロショット単視距離深度モデルの鍵は、大規模データトレーニングと様々なカメラモデルからの距離あいまいさの解消の組合せにあることを示す。
本稿では,あいまいさ問題に明示的に対処し,既存の単分子モデルにシームレスに接続可能な標準カメラ空間変換モジュールを提案する。
本手法は, ランダムに収集したインターネット画像上での計測3次元構造の正確な復元を可能にする。
論文 参考訳(メタデータ) (2023-07-20T16:14:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。