論文の概要: Robust 4D Visual Geometry Transformer with Uncertainty-Aware Priors
- arxiv url: http://arxiv.org/abs/2604.09366v1
- Date: Fri, 10 Apr 2026 14:36:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-13 17:57:53.907912
- Title: Robust 4D Visual Geometry Transformer with Uncertainty-Aware Priors
- Title(参考訳): 不確実性を考慮したロバスト4次元形状変換器
- Abstract要約: 再構成プロセスの異なる段階にわたる不確実性をモデル化し,動的および静的なコンポーネントをアンタングル化するフレームワークを提案する。
提案手法は平均精度の誤差を13.43%削減し,セグメント化F尺度を10.49%改善する。
我々のフレームワークはフィードフォワード推論の効率を維持しており、タスク固有の微調整やシーンごとの最適化は不要である。
- 参考スコア(独自算出の注目度): 38.939519059502025
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reconstructing dynamic 4D scenes is an important yet challenging task. While 3D foundation models like VGGT excel in static settings, they often struggle with dynamic sequences where motion causes significant geometric ambiguity. To address this, we present a framework designed to disentangle dynamic and static components by modeling uncertainty across different stages of the reconstruction process. Our approach introduces three synergistic mechanisms: (1) Entropy-Guided Subspace Projection, which leverages information-theoretic weighting to adaptively aggregate multi-head attention distributions, effectively isolating dynamic motion cues from semantic noise; (2) Local-Consistency Driven Geometry Purification, which enforces spatial continuity via radius-based neighborhood constraints to eliminate structural outliers; and (3) Uncertainty-Aware Cross-View Consistency, which formulates multi-view projection refinement as a heteroscedastic maximum likelihood estimation problem, utilizing depth confidence as a probabilistic weight. Experiments on dynamic benchmarks show that our approach outperforms current state-of-the-art methods, reducing Mean Accuracy error by 13.43\% and improving segmentation F-measure by 10.49\%. Our framework maintains the efficiency of feed-forward inference and requires no task-specific fine-tuning or per-scene optimization.
- Abstract(参考訳): ダイナミックな4Dシーンの再構築は重要な課題ですが、難しい作業です。
VGGTのような3Dファウンデーションモデルは静的な設定では優れているが、運動が大きな幾何学的曖昧さを引き起こす動的なシーケンスにしばしば苦労する。
そこで本稿では, 動的および静的なコンポーネントを, 再構成過程の異なる段階にわたる不確かさをモデル化することにより, 動的および静的なコンポーネントをアンタングル化するフレームワークを提案する。
提案手法では,情報理論的重み付けを応用して多面的注意分布を適応的に集約し,セマンティックノイズから動的運動キューを効果的に分離するEntropy-Guided Subspace Projection,構造外乱を除去するために半径ベース近傍制約を通した空間連続性を強制するローカル一貫性駆動幾何精製,不確実性認識のクロスビュー・コンシステンシー,マルチビュー・プロジェクション・リフレクションをヘテロセシス的最大推定問題として定式化し,確率的重みとして深度を生かした,3つの相乗的メカニズムを導入する。
動的ベンチマーク実験により,提案手法は現在の最先端手法よりも優れ,平均精度が13.43\%,セグメンテーションF尺度が10.49\%向上していることがわかった。
我々のフレームワークはフィードフォワード推論の効率を維持しており、タスク固有の微調整やシーンごとの最適化は不要である。
関連論文リスト
- Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation [81.44955493339835]
DeGOは変形可能なガウスの占有機構であり、分解したガウスの変形と分解された4次元基礎モデル蒸留を統一する。
Occ3D-NuScenesベンチマーク実験により,本手法が弱い監督下での最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2026-05-27T15:09:55Z) - 4DVGGT-D: 4D Visual Geometry Transformer with Improved Dynamic Depth Estimation [38.64669047442234]
そこで本研究では,静的から大まかに動的に切り離す学習自由なプログレッシブデカップリングフレームワークを提案する。
本手法は, 微調整を必要とせず, 頑健な4次元シーン再構成における競争性能を示す。
論文 参考訳(メタデータ) (2026-05-12T12:13:36Z) - Mesh Based Simulations with Spatial and Temporal awareness [2.867517731896504]
本稿では,幾何学的深層学習と厳密な数値解析のギャップを埋める統一的な枠組みを提案する。
1) ノードの全局所トポロジのフィールド値を予測するステンシルレベルの目的であるマルチノード予測,(2) 時間的微分整合性,(3) 時間的交叉による不安定な定性的スキームを予測器・コレクタに置き換える時間的補正,(3) 幾何学的インダクティブ・ビアース,3) 3次元回転位置埋め込み(RoPE)を利用して非構造メッシュの回転対称性を頑健に捉える。
論文 参考訳(メタデータ) (2026-05-02T17:09:31Z) - NRGS: Neural Regularization for Robust 3D Semantic Gaussian Splatting [41.21645092733966]
本稿では,多視点不整合な2次元特徴を持ち上げることで生成されるノイズの多い3次元セマンティックフィールドを改良するニューラル正規化手法を提案する。
実験により,提案手法は昇降セマンティクスの精度を高め,ロバストな3次元セマンティクス・ガウス・スプラッティングへの効率的かつ効果的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-24T10:57:05Z) - DRoPS: Dynamic 3D Reconstruction of Pre-Scanned Objects [39.92394397834325]
DRoPSは動的物体の静的前スキャンを明示的な幾何学的・外見的手法として活用する新しい手法である。
本手法は,レンダリング品質と3次元トラッキング精度において,最先端の技術を著しく向上させる。
論文 参考訳(メタデータ) (2026-03-25T19:41:50Z) - GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometry [61.24189040578178]
そこで本研究では,注目機構を介し,潜在特徴表現から移動対象を直接推論する完全学習型アプローチを提案する。
我々の重要な洞察は、明示的な対応推定を回避し、代わりに、モデルが暗黙的にオブジェクトとカメラの動きを歪めることを学ぶことである。
提案手法は,最先端の動作セグメンテーション性能を高い効率で達成する。
論文 参考訳(メタデータ) (2026-02-25T11:36:33Z) - From Tokens to Nodes: Semantic-Guided Motion Control for Dynamic 3D Gaussian Splatting [26.57713792657793]
制御密度と動きの複雑さを一致させる動き適応フレームワークを提案する。
既存の最先端手法に比べて,復元品質と効率が大幅に向上したことを示す。
論文 参考訳(メタデータ) (2025-10-03T05:33:58Z) - Adaptive Dual Uncertainty Optimization: Boosting Monocular 3D Object Detection under Test-Time Shifts [80.32933059529135]
TTA(Test-Time Adaptation)メソッドが出現し、推論中にターゲット分布に適応する。
我々は、堅牢なM3ODの両不確実性を共同で最小化するために設計された、最初のTTAフレームワークであるDual Uncertainity Optimization (DUO)を提案する。
並列に,明瞭な意味的手がかりを持つ領域における幾何学的コヒーレンスを保存する意味認識型正規場制約を設計する。
論文 参考訳(メタデータ) (2025-08-28T07:09:21Z) - Delving into Dynamic Scene Cue-Consistency for Robust 3D Multi-Object Tracking [16.366398265001422]
3D多目的追跡は、自動運転分野において重要かつ困難な課題である。
本稿では,この原理を実現するために動的シーンCue-Consistency Tracker(DSC-Track)を提案する。
論文 参考訳(メタデータ) (2025-08-15T08:48:13Z) - Tensor-Var: Efficient Four-Dimensional Variational Data Assimilation [30.63086465547801]
4次元変分同化(4D-Var)は複雑な非線形系において高い計算コストに直面し、不完全な状態-観測写像に依存する。
深層学習(DL)は、より表現力のある近似器を提供する一方、DLモデルを4D-Varに統合することは、それらの非線形性と同化結果における理論的保証の欠如により困難である。
本稿では,カーネル条件付き平均埋め込み(CME)を4D-Varと統合して非線形力学を線形化し,学習した特徴空間における凸最適化を実現する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-01-23T01:43:31Z) - 3D Equivariant Pose Regression via Direct Wigner-D Harmonics Prediction [50.07071392673984]
既存の方法は、角度や四元数を用いて空間領域でパラメータ化された3次元回転を学習する。
本稿では,3次元回転回帰のためのWigner-D係数を直接予測する周波数領域アプローチを提案する。
提案手法は, ModelNet10-SO(3) や PASCAL3D+ などのベンチマーク上での最先端結果を実現する。
論文 参考訳(メタデータ) (2024-11-01T12:50:38Z) - MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion [118.74385965694694]
我々は動的シーンから時間ステップごとの幾何を直接推定する新しい幾何学的アプローチであるMotion DUSt3R(MonST3R)を提案する。
各タイムステップのポイントマップを単純に推定することで、静的シーンにのみ使用されるDUST3Rの表現を動的シーンに効果的に適応させることができる。
我々は、問題を微調整タスクとしてポーズし、いくつかの適切なデータセットを特定し、この制限されたデータ上でモデルを戦略的に訓練することで、驚くほどモデルを動的に扱えることを示す。
論文 参考訳(メタデータ) (2024-10-04T18:00:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。