論文の概要: SURE-Map: Self-Correcting Streaming Geometric Foundation Models
- arxiv url: http://arxiv.org/abs/2609.15795v2
- Date: Mon, 21 Sep 2026 15:50:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 03:38:27.35647
- Title: SURE-Map: Self-Correcting Streaming Geometric Foundation Models
- Title(参考訳): SURE-Map: 自己修正型ストリーミング幾何学基礎モデル
- Abstract要約: SLAMシステムの代替として、ストリーミング幾何学の基礎モデルが登場している。
小さな局所誤差は、厳密な幾何学的歪みと長い水平スケールのドリフトに蓄積する。
2つの相補的な原則に基づいて構築された自己修正フレームワークであるSURE-Mapを紹介します。
- 参考スコア(独自算出の注目度): 11.79108359897763
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming geometric foundation models are emerging as a compelling alternative to SLAM systems. Yet this streaming nature introduces a fundamental issue: each prediction is made from limited context, which is vulnerable to dynamic objects and weak textures. Small local errors accumulate into severe geometric distortion and long-horizon scale drift. We argue that reliable streaming reconstruction requires geometric foundation models to be not only predictive, but also self-correcting. We introduce SURE-Map, a self-correcting framework built upon two complementary principles. First, we explicitly model cross-view geometric uncertainty. Unlike conventional depth or point confidence, which primarily reflects the reliability of individual-view prediction, our uncertainty directly measures whether the jointly predicted pose and depth induce geometrically consistent cross-view pixel correspondences. Second, because local correction alone cannot eliminate slowly accumulating scale errors, we introduce multi-timescale self-correction: fast consecutive-frame inference preserves streaming efficiency, while sparse keyframe-window inference provides longer-range geometric evidence to periodically recalibrate the scale of recent trajectories. SURE-Map establishes new state-of-the-art performance for online feed-forward reconstruction across long-horizon benchmarks, reducing ATE-RMSE from 24.00 to 17.24 m on KITTI, 5.11 to 4.74 m on Oxford Spires, and 31.37 to 28.58 m on VBR, with further improvements to 15.17, 4.63, and 22.12 m when incorporating loop-closure refinement. Project page: https://mingkai-liu.github.io/projects/sure-map/.
- Abstract(参考訳): SLAMシステムの代替として、ストリーミング幾何学の基礎モデルが登場している。
それぞれの予測は、動的オブジェクトや弱いテクスチャに対して脆弱な、限られたコンテキストから作られています。
小さな局所誤差は、厳密な幾何学的歪みと長い水平スケールのドリフトに蓄積する。
信頼性のあるストリーミング再構成には、幾何学的基礎モデルが必要であり、予測だけでなく自己修正も必要である、と我々は主張する。
2つの相補的な原則に基づいて構築された自己修正フレームワークであるSURE-Mapを紹介します。
まず、クロスビュー幾何学的不確実性を明示的にモデル化する。
個別視点予測の信頼性を主に反映する従来の深度や点の信頼性とは異なり、我々の不確実性は、共同予測されたポーズと深度が幾何学的に一貫したクロスビュー画素対応を誘導するかどうかを直接的に測定する。
第2に,局所補正だけでは緩やかなスケール誤差を排除できないため,高速連続フレーム推論はストリーミング効率を保ちながら,キーフレームウィンドウ推論は近年の軌道の規模を周期的に補正するための長距離幾何学的証拠を提供する。
SURE-Mapは、長い水平のベンチマークでオンラインフィードフォワード再構築のための新しい最先端のパフォーマンスを確立し、ATE-RMSEを24.00から17.24m、オックスフォード・スパイルズで5.11から4.74m、VBRで31.37から28.58mに減らし、15.17、4.63、22.12mに改善した。
プロジェクトページ:https://mingkai-liu.github.io/projects/sure-map/。
関連論文リスト
- Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction [10.383154504465232]
ABot-Reconは、前の11フレームからKV機能をキャッシュするシンプルなストリーミングモデルである。
現在のカメラ座標系における点マップと、隣接するフレームの相対的なポーズを予測する。
蓄積ドリフトを低減するために、最近の視覚と運動のコンテキストを用いて、軽量の時間リファインダは相対回転を改善する。
論文 参考訳(メタデータ) (2026-08-27T15:07:38Z) - GeoWeaver: Accurate Long-Sequence 3D Reconstruction via Hierarchical Geometric Assembly [23.486108847409856]
RGBビデオからの長時間の3D再構成には、正確な局所幾何学と一貫したカメラモーションの両方が必要である。
Geometric Prior Model(GPM)とTest-Time Adaptation(TTA)を組み合わせた統合フレームワークGeoWeaverを提案する。
TTAは、シーケンシャルでグローバルなチャンクレベルSim(3)アライメントと、カメラのポーズ、アフィン深さ補正、および本質的な精細化を行う。
さまざまな時系列ベンチマークによる実験では、カメラの精度の向上、グローバルな一貫性、ポイントクラウドの品質が示されている。
論文 参考訳(メタデータ) (2026-08-18T05:29:31Z) - DepthART: Scaling Foundation Monocular Depth to Tiny Models [51.10174763031444]
DepthARTは、様々なシーンにまたがるデバイス上のデプロイメントのためのコンパクトなMDEモデルである。
ゼロショット一般化とメートル法精度の両方において、DepthARTが従来の小さなベースラインを一貫して上回っていることを示す。
また、GTX A6000で347/245 FPS (strict FP32)、Orin NX 8GBで2242/4482ドル、102 FPS (TF32)、Jetson Nano 4GBで15 FPS (FP32) に達したスケーラブルなモデルファミリも提供しています。
論文 参考訳(メタデータ) (2026-07-19T06:54:52Z) - Online Distributional Prediction via Latent Cluster Geometry Under Drift and Corruption [14.35871574542677]
ドリフトおよび敵対的汚職下でのオンライン分布予測について検討した。
これらの構成上のギブス準ポストは、後部平均化によってオンライン予測器を生成する。
我々は,時変真の法則に対する累積ワッサースタイン1の後悔による性能評価を行った。
論文 参考訳(メタデータ) (2026-06-17T07:41:41Z) - PnP-Corrector: A Universal Correction Framework for Coupled Spatiotemporal Forecasting [62.22445401483844]
既存の手法は複雑なエラーのボトルネックによって厳しく制約されている。
我々は-Cast-Corrector (Plug-and-Play Corrector)と呼ばれる普遍的なフレームワークを提案する。
本手法は,結合予測システムの長期安定性を著しく向上させる。
論文 参考訳(メタデータ) (2026-05-09T13:12:33Z) - Keep It CALM: Toward Calibration-Free Kilometer-Level SLAM with Visual Geometry Foundation Models via an Assistant Eye [34.902300948471314]
CAL2Mは任意のVGFMと互換性のあるプラグイン・アンド・プレイのフレームワークである。
一定の物理的間隔の先行を利用するためだけに「補助眼」を使用する。
不正確な内因論による回転と翻訳の誤りを効果的に正すことができる。
論文 参考訳(メタデータ) (2026-04-16T08:58:57Z) - Geometric Context Transformer for Streaming 3D Reconstruction [51.19524805829903]
LingBot-Mapは、ストリーミングデータからシーンを再構築するためのフィードフォワード3Dファウンデーションモデルである。
LingBot-Mapの定義的な側面は、アンカーコンテキスト、ポーズ参照ウィンドウ、トラジェクトリメモリを統合した、慎重に設計されたアテンションメカニズムにある。
この設計は、リッチな幾何学的コンテキストを維持しながら、ストリーミング状態をコンパクトに保ち、518 x 378の解像度入力に対して、20FPS程度の安定した効率的な推論を可能にする。
論文 参考訳(メタデータ) (2026-04-15T17:58:13Z) - LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels [49.35636088613484]
JEPA(Joint Embedding Predictive Architectures)は、コンパクトな潜在空間で世界モデルを学習するための魅力的なフレームワークを提供する。
最初のJEPAであるLeModelWorldを紹介します。
数時間で1つのGPU上で15万のパラメータをトレーニングできるため、LeWMはファンデーションモデルベースの世界モデルよりも48倍高速に計画している。
論文 参考訳(メタデータ) (2026-03-13T19:48:14Z) - CMG-Net: Robust Normal Estimation for Point Clouds via Chamfer Normal
Distance and Multi-scale Geometry [23.86650228464599]
この研究は、点雲から正規度を推定するための正確で堅牢な方法を示す。
まず,この問題に対処するため,シャンファー正規距離(Chamfer Normal Distance)と呼ばれる新しい尺度を提案する。
マルチスケールな局所的特徴集約と階層的幾何情報融合を含む革新的なアーキテクチャを考案する。
論文 参考訳(メタデータ) (2023-12-14T17:23:16Z) - Global-to-Local Modeling for Video-based 3D Human Pose and Shape
Estimation [53.04781510348416]
フレーム内精度とフレーム間スムーズさにより,映像に基づく3次元人間のポーズと形状推定を評価する。
エンドツーエンドフレームワークGLoT(Global-to-Local Transformer)における長期的・短期的相関のモデル化を構造的に分離することを提案する。
我々のGLoTは、一般的なベンチマーク(3DPW、MPI-INF-3DHP、Human3.6M)において、最も低いモデルパラメータを持つ従来の最先端の手法を上回る。
論文 参考訳(メタデータ) (2023-03-26T14:57:49Z) - Confidence Adaptive Anytime Pixel-Level Recognition [86.75784498879354]
任意の時間推論は、いつでも停止される可能性のある予測の進行を行うモデルを必要とする。
我々は,任意のピクセルレベルの認識に対して,最初の統一とエンドツーエンドのモデルアプローチを提案する。
論文 参考訳(メタデータ) (2021-04-01T20:01:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。