論文の概要: Depth Anything V4: Dynamic 4D Scene Reconstruction via Riemannian Flow Matching on 4D Gaussian Splatting
- arxiv url: http://arxiv.org/abs/2608.18388v2
- Date: Thu, 20 Aug 2026 09:04:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 14:00:35.519228
- Title: Depth Anything V4: Dynamic 4D Scene Reconstruction via Riemannian Flow Matching on 4D Gaussian Splatting
- Title(参考訳): 深さV4:4次元ガウス平板上でのリーマン流マッチングによる動的4次元シーン再構成
- Abstract要約: 本稿では,モノクロ映像からの動的4次元シーン再構成のためのフレームワークであるDepth Anything V4(DAV4)を提案する。
主な貢献はリーマンフローマッチング(RFM)を4次元ガウススプラッティングパラメータに適用することである。
DAV4は、動的再構成とノベルビュー合成において、Depth Anythingモデルとシーンごとの4D-GSより優れている。
- 参考スコア(独自算出の注目度): 9.090610968599192
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Depth Anything V4 (DAV4), a framework for dynamic 4D scene reconstruction from monocular video. Our key contribution is the application of Riemannian Flow Matching (RFM) to 4D Gaussian Splatting parameters, defining probability paths directly on non-Euclidean manifolds (scale, rotation, opacity), ensuring all intermediate states are valid. Through controlled experiments, we isolate RFM's contribution from test-time optimization (TTO) and pre-training. A deterministic MLP baseline with the same data, architecture, and TTO achieves F-score 0.762; RFM achieves 0.806 - the +0.044 gain is RFM's isolated contribution. We provide corrected computational cost analysis: pre-training is 360 GPU-hours, amortizing for large-scale deployment (over 10,000 scenes). Uncertainty is quantified via Negative Gaussian Log-Likelihood and Expected Calibration Error. DAV4 outperforms prior Depth Anything models and per-scene 4D-GS on dynamic reconstruction and novel-view synthesis, while using no human-annotated depth labels as training losses.
- Abstract(参考訳): 本稿では,モノクロ映像からの動的4次元シーン再構成のためのフレームワークであるDepth Anything V4(DAV4)を提案する。
我々の重要な貢献は、リーマンフローマッチング(RFM)を4次元ガウススプラッティングパラメータに適用し、非ユークリッド多様体(スケール、回転、不透明性)上の確率パスを定義し、すべての中間状態が有効であることを保証することである。
制御実験により,テスト時間最適化(TTO)と事前学習からRAMの寄与を分離する。
同じデータ、アーキテクチャ、TTOを持つ決定論的MLPベースラインはFスコア0.762を達成する。
事前トレーニングは360GPU時間で、大規模なデプロイメント(10,000シーン以上)を償却します。
不確実性は負のガウス対数と期待校正誤差によって定量化される。
DAV4はDrepth AnythingモデルとSceneの4D-GSで動的再構成と新規ビューの合成に優れており、人間の注意深度ラベルをトレーニング損失として使用していない。
関連論文リスト
- DepthART: Scaling Foundation Monocular Depth to Tiny Models [51.10174763031444]
DepthARTは、様々なシーンにまたがるデバイス上のデプロイメントのためのコンパクトなMDEモデルである。
ゼロショット一般化とメートル法精度の両方において、DepthARTが従来の小さなベースラインを一貫して上回っていることを示す。
また、GTX A6000で347/245 FPS (strict FP32)、Orin NX 8GBで2242/4482ドル、102 FPS (TF32)、Jetson Nano 4GBで15 FPS (FP32) に達したスケーラブルなモデルファミリも提供しています。
論文 参考訳(メタデータ) (2026-07-19T06:54:52Z) - Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models [79.06910348413861]
Diff4Splatは、単一の画像から制御可能で明示的な4Dシーンを合成するフィードフォワード方式である。
単一の入力画像、カメラ軌跡、オプションのテキストプロンプトが与えられた場合、Diff4Splatは外見、幾何学、動きを符号化する変形可能な3Dガウス場を直接予測する。
論文 参考訳(メタデータ) (2025-11-01T11:16:25Z) - Optimized Minimal 4D Gaussian Splatting [50.29519144753797]
4D Gaussian Splattingは動的シーン表現の新しいパラダイムとして登場し、複雑な動きを持つシーンのリアルタイムレンダリングを可能にした。
何百万人ものガウス人が高忠実度再構築を必要としているため、ストレージオーバーヘッドの大きな課題に直面している。
OMG4は、4次元ガウス模型を忠実に表現できる有能なガウスのコンパクトな集合を構成するフレームワークである。
論文 参考訳(メタデータ) (2025-10-04T16:11:13Z) - 4DRGS: 4D Radiative Gaussian Splatting for Efficient 3D Vessel Reconstruction from Sparse-View Dynamic DSA Images [49.170407434313475]
既存の手法は、しばしば最適以下の結果を生成するか、過剰な計算時間を必要とする。
高品質な高精細化を実現するため、4次元ガウススプラッティング(4DRGS)を提案する。
4DRGSは5分間のトレーニングで印象的な結果を得る。
論文 参考訳(メタデータ) (2024-12-17T13:51:56Z) - Self-Calibrating 4D Novel View Synthesis from Monocular Videos Using Gaussian Splatting [14.759265492381509]
本稿では,カメラパラメータの自己校正による高忠実度 4D GS シーン表現の学習手法を提案する。
3次元構造を頑健に表現する2次元点特徴の抽出を含む。
その結果,4次元新規ビュー合成における最先端手法の大幅な改善が示された。
論文 参考訳(メタデータ) (2024-06-03T06:52:35Z) - Q-SLAM: Quadric Representations for Monocular SLAM [85.82697759049388]
四角形のレンズを通して体積表現を再現する。
我々は、RGB入力からノイズの深い深さ推定を正すために二次仮定を用いる。
本研究では,新たな二次分割変換器を導入し,二次情報を集約する。
論文 参考訳(メタデータ) (2024-03-12T23:27:30Z) - Fully Differentiable and Interpretable Model for VIO with 4 Trainable
Parameters [16.347927939872488]
単眼の視覚-慣性オドメトリーは、ロボット工学と自律運転において重要な問題である。
本稿では,4つのトレーニング可能なパラメータのみを含む完全微分可能,解釈可能,軽量な単分子VIOモデルを提案する。
合成および実世界のデータセットに関する実験結果は、我々の単純なアプローチが最先端の手法と競合することを示している。
論文 参考訳(メタデータ) (2021-09-25T06:54:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。