論文の概要: TRIG: Trajectory-Rig Decoupled Metric Geometry Learning
- arxiv url: http://arxiv.org/abs/2607.05801v2
- Date: Tue, 14 Jul 2026 11:59:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.308347
- Title: TRIG: Trajectory-Rig Decoupled Metric Geometry Learning
- Title(参考訳): TRIG: 軌跡結合型計量幾何学学習
- Abstract要約: Trajectory-Rig Decoupled Metric Geometry Learning (TRIG)は、自律走行のための幾何学的認識フレームワークである。
本稿では,距離一貫性学習のための軌跡進化とリグ幾何学を別々に制約する,分離されたポーズエンコーディングと監督を導入する。
5つの自律走行ベンチマーク実験により、TRIGはポーズ推定、メートル法深度予測、および3次元再構成において最先端の性能を達成することが示された。
- 参考スコア(独自算出の注目度): 33.69899077340302
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-centric autonomous driving requires accurate metric geometry and ego-motion estimation from synchronized multi-camera observations. Recent visual geometry models show strong performance in pose estimation, depth prediction, and 3D reconstruction, but are not tailored to rigid multi-camera driving systems. They often encode camera poses as entangled representations, in which time-varying ego-motion and static camera-rig geometry are jointly modeled, limiting the utilization of vehicle-side geometric priors. We propose Trajectory-Rig Decoupled Metric Geometry Learning (TRIG), a geometry perception framework for autonomous driving. TRIG factorizes camera poses into ego-trajectory and camera-rig components, enabling separate modeling of ego-motion and static multi-camera topology. We introduce decoupled pose encoding and supervision, which separately constrain trajectory evolution and rig geometry for metric-consistent learning. Moreover, sparse Temporal--Spatial attention separates cross-camera interaction from temporal aggregation, reducing global attention cost while preserving geometric reasoning. Experiments on five autonomous driving benchmarks show that TRIG achieves state-of-the-art performance in pose estimation, metric depth prediction, and 3D reconstruction.
- Abstract(参考訳): 視覚中心の自律運転は、同期マルチカメラ観測から正確な距離幾何学とエゴモーション推定を必要とする。
最近の視覚幾何学モデルは、ポーズ推定、深度予測、三次元再構成において強い性能を示すが、剛性のあるマルチカメラ駆動システムには適していない。
しばしば、カメラのポーズを絡み合った表現としてエンコードし、時間変化のエゴモーションとスタティックカメラ・リグの幾何学が共同でモデル化され、車両側の幾何学的事前利用が制限される。
本稿では,自律走行のための幾何学的認識フレームワークであるTrjectory-Rig Decoupled Metric Geometry Learning (TRIG)を提案する。
TRIGは、カメラのポーズをエゴ軌道とカメラリグコンポーネントに分解し、エゴモーションと静的マルチカメラトポロジーのモデリングを可能にする。
本稿では,距離一貫性学習のための軌跡進化とリグ幾何学を別々に制約する,分離されたポーズエンコーディングと監督を導入する。
さらに、スパーステンポラル-空間的アテンションは、カメラ間相互作用と時間的アグリゲーションを分離し、幾何学的推論を保ちながら、グローバルなアテンションコストを低減させる。
5つの自律走行ベンチマーク実験により、TRIGはポーズ推定、メートル法深度予測、および3次元再構成において最先端の性能を達成することが示された。
関連論文リスト
- TourPhysics: Bringing Physics to World Models for Exploration and Manipulation from a Single Image [53.206752160427065]
TourPhysicsは、単一のイメージと宣言的な物理的な設定から得られるオンラインフレームワークである。
各動作について、シミュレータは、対応する観測が生成される前に、有限の物理およびカメラ軌道を計算する。
TourPhysicsは、評価されたベースラインよりも、所定のカメラとオブジェクトの軌跡に従う。
論文 参考訳(メタデータ) (2026-09-04T09:15:03Z) - TAPVid-MV: A Benchmark for Tracking Any Point in 3D Across Multiple Views [50.26507994908593]
この設定の最初のベンチマークであるTAPVid-MV(Tracking Any Point in Video across Multiple Views)を紹介します。
キュレートされた284のシーケンス、1,142のキャリブレーションされたカメラストリーム、109,769のトラックが、屋内と屋外のドメインにまたがる7つのサブセットにまたがっている。
本研究では,センサ深度,LiDAR,SLAM,SfM点,ヒューマンメッシュ,ポーズされたオブジェクトメッシュ,シミュレーションといった,データセット固有の補助的モダリティを用いてこれらのトラジェクトリを解析し,各シーケンスとトラジェクトリを人間のアノテーションによって視覚的に検証する。
論文 参考訳(メタデータ) (2026-09-01T21:58:51Z) - Seeing the World and the Self from Egocentric Video [9.841166134702467]
既存の手法では、シーン再構成と動き推定を別々に扱う。
決定論的幾何再構成と幾何条件の運動生成を結合した統合フレームワークRESELFを提案する。
実験により、RESELFは個々のタスク用に設計された最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2026-09-01T14:10:13Z) - Geometry-Grounded Unified 3D Perception for Autonomous Driving [36.11730832045922]
カメラベースの自律運転認識には、同期マルチカメラストリーム間のメートル法3D構造を保存する共有表現が必要である。
本稿では、VGGTの再構成指向の潜伏を校正・ストリーミング駆動シーンに適応させる、幾何グラウンドの統一3次元知覚フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-13T12:17:50Z) - MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation [50.65653874052261]
MVTrack4Genは、カメラコンディショニングのみの新規ビュービデオ拡散モデルのためのモーションアウェアトレーニングフレームワークである。
我々の重要な発見は、特定の注意層が強い対応の手がかりを符号化することであり、そこでは、クエリ機能は幾何学的に対応する場所で重要な特徴に付随する。
これらの動き認識対応を明示的に強化することにより、MVTrack4Genは既存のモデルを改善し、参照ビューにおける動きをより良く追従し、クロスビューの幾何的一貫性を維持する。
論文 参考訳(メタデータ) (2026-06-24T17:56:33Z) - SurroundNEXO: Ego-Centric Metric Bridging for Spatially Consistent Geometry in Autonomous Driving [38.85333609536219]
SurroundNEXOは低オーバーラップマルチカメラ・メトリディープ・フレームワークである。
これは、視覚的対応ではなく、エゴ中心の幾何学におけるクロスビュー推論を基礎としている。
シングルビューエラーを33.2%削減し、クロスビュー一貫性を10.5%向上し、SOTA法に比べて25.6%向上した。
論文 参考訳(メタデータ) (2026-06-15T17:00:32Z) - LiAuto-GeoX: Efficient Grounded Driving Transformer [54.23823436153608]
デプロイ可能なエゴ中心の3Dシーン理解のための効率的な基底駆動トランスフォーマである textbfLiAuto-GeoX を提案する。
textbfLiAuto-GeoX は KITTI 上で 220 FPS で動作し,高忠実度高密度化を保ち,リアルタイムな展開を実現している。
論文 参考訳(メタデータ) (2026-06-04T06:58:44Z) - Geometry-Aware Rotary Position Embedding for Consistent Video World Model [48.914346802616414]
ViewRopeは、ビデオトランスフォーマーの自己アテンション層に直接カメラの方向を注入するジオメトリ対応のエンコーディングである。
Geometry-Aware Frame-Sparse Attentionは、これらの幾何学的手がかりを利用して、関連する歴史的なフレームに選択的に参加する。
この結果から,ViewRopeは長期的整合性を大幅に向上し,計算コストを低減できることがわかった。
論文 参考訳(メタデータ) (2026-02-08T08:01:16Z) - GPA-VGGT:Adapting VGGT to Large Scale Localization by Self-Supervised Learning with Geometry and Physics Aware Loss [15.633839321933385]
近年のVisual Geometry Grounded Transformer (VGGT) モデルの進歩は、カメラのポーズ推定と3次元再構成において大きな可能性を秘めている。
これらのモデルは通常、トレーニングのために真実のラベルを頼りにしており、ラベルのない、目に見えないシーンに適応する際の課題を提起している。
本稿では,VGGTをラベルのないデータで訓練する自己教師型フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-23T16:46:59Z) - DVGT: Driving Visual Geometry Transformer [63.38483879291505]
駆動対象の高密度幾何知覚モデルは、異なるシナリオやカメラ構成に適応することができる。
提案するドライビング・ビジュアル・ジオメトリ・トランスフォーマ (DVGT) は, 広義の高密度な3Dポイントマップを, 複数視点の視覚入力の列から再構成する。
DVGTには、任意のカメラ構成のフレキシブルな処理を可能にする、明示的な3D幾何学的事前処理がない。
論文 参考訳(メタデータ) (2025-12-18T18:59:57Z) - FLARE: Feed-forward Geometry, Appearance and Camera Estimation from Uncalibrated Sparse Views [100.45129752375658]
FLAREは、高品質カメラのポーズと3次元幾何を、補正されていないスパースビュー画像から推定するために設計されたフィードフォワードモデルである。
本ソリューションでは,3次元構造を2次元画像平面にマッピングする上で,カメラポーズが重要なブリッジとして機能するケースケード学習パラダイムを特徴とする。
論文 参考訳(メタデータ) (2025-02-17T18:54:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。