論文の概要: Towards Consistent Video Geometry Estimation
- arxiv url: http://arxiv.org/abs/2605.30060v2
- Date: Fri, 29 May 2026 10:24:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 13:54:21.113289
- Title: Towards Consistent Video Geometry Estimation
- Title(参考訳): 連続的ビデオ幾何推定に向けて
- Abstract要約: ViGeoは、ビデオシーケンスから空間的に密度が高く時間的に一貫した幾何を復元するためのフィードフォワード基礎モデルである。
統合モデル内でのストリーミング、フルシーケンス、ロングビデオ推論をサポートする。
ViGeoは、オンライン、オフライン、ロングビデオの深さ推定、表面正規推定、ビデオポイントマップ推定など、最先端のパフォーマンスを実現する。
- 参考スコア(独自算出の注目度): 43.41144311719224
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This work presents ViGeo, a feed-forward foundation model for recovering spatially dense and temporally consistent geometry from video sequences. Built upon a plain transformer architecture without task-specific architectural modifications, ViGeo supports streaming, full-sequence, and long-video inference within a unified model. The key design is dynamic chunking attention, which exposes the model to both bidirectional and causal temporal contexts during training and allows it to adapt its attention pattern at test time without retraining. To improve supervision quality, we further introduce a completion-based data refinement framework. This framework trains a video depth completion teacher that conditions on sparse and noisy annotations and exploits video/multi-view context to produce dense, temporally coherent, and geometrically reliable training targets. Beyond depth and point maps, ViGeo also predicts surface normals within the same framework. Trained solely on public datasets, ViGeo achieves state-of-the-art performance across online, offline, and long-video depth estimation, surface normal estimation, and video point map estimation.
- Abstract(参考訳): この研究は、ビデオシーケンスから空間的に密度が高く時間的に一貫した幾何を復元するためのフィードフォワード基礎モデルであるViGeoを提示する。
ViGeoは、タスク固有のアーキテクチャ変更なしに、プレーンなトランスフォーマーアーキテクチャに基づいて構築され、ストリーミング、フルシーケンス、および統合モデル内でのロングビデオ推論をサポートする。
鍵となる設計は動的チャンキングアテンションであり、トレーニング中の双方向と因果両方の時間的コンテキストにモデルを公開し、再トレーニングせずにテスト時にそのアテンションパターンを適応できるようにする。
さらに, 監視品質を向上させるために, 完成度に基づくデータ改質フレームワークを導入する。
このフレームワークは、疎密でノイズの多いアノテーションを条件としたビデオ深度補完教師を訓練し、ビデオ/マルチビューコンテキストを利用して、密で時間的に整合性があり、幾何学的に信頼性のあるトレーニングターゲットを生成する。
深さと点マップ以外にも、ViGeoは同じフレームワーク内の表面の正規性を予測している。
パブリックデータセットのみに基づいてトレーニングされたViGeoは、オンライン、オフライン、ロングビデオの深さ推定、表面正規推定、ビデオポイントマップ推定など、最先端のパフォーマンスを達成する。
関連論文リスト
- VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling [49.98112719317813]
ビデオ拡散モデルは、時間とともに3D構造を保存できないことが多い。
既存の手法は通常、明示的な幾何再構成を用いて幾何整合を強制する。
我々は,暗黙的幾何モデルを用いて生成分布を制約する潜在空間後学習フレームワークであるVideoWeaveを提案する。
論文 参考訳(メタデータ) (2026-06-12T06:41:13Z) - Geo-Align: Video Generation Alignment via Metric Geometry Reward [53.65904111864641]
Geo-Alignは、カメラ制御ビデオ再レンダリング用に特別に設計された最初の強化学習フレームワークである。
事前訓練されたモデルに基づいて、スケールアウェアの知覚報酬機構を用いてモデルを最適化する。
実験により、Geo-Alignは、カメラの正確な制御性と視覚的忠実性の両方において、既存の教師付き学習ベースラインを一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-05-22T17:59:43Z) - GemDepth: Geometry-Embedded Features for 3D-Consistent Video Depth [12.866152238833104]
ビデオ深度推定は、一眼的予測を時間領域に拡張し、コヒーレンスを確保する。
現在のアプローチは主にトランスフォーマーによる時間的平滑化に依存しており、厳密な3次元幾何学的整合性を維持するのに苦労している。
GemDepthは,カメラモーションとグローバル3D構造を明確に認識することが3D一貫性の前提条件である,という知見に基づいて構築されたフレームワークである。
論文 参考訳(メタデータ) (2026-05-11T13:11:54Z) - Emergent Temporal Correspondences from Video Diffusion Transformers [30.83001895223298]
DiffTrackは、この問題に答えるために設計された最初の定量的分析フレームワークである。
分析の結果,特定のクエリキーの類似性がすべてではないが,時間的マッチングにおいて重要な役割を担っていることが明らかとなった。
本研究は,映像の時間的整合性を改善する新たなガイダンス法により,動画の動作向上に拡張する。
論文 参考訳(メタデータ) (2025-06-20T17:59:55Z) - UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation [63.90470530428842]
本研究では、適切な設計と微調整により、ビデオ生成モデルの本質的な一貫性を一貫した幾何推定に有効に活用できることを実証する。
その結果,ビデオのグローバルな幾何学的属性の予測性能が向上し,再構成作業に直接適用できることがわかった。
論文 参考訳(メタデータ) (2025-05-30T12:31:59Z) - GeometryCrafter: Consistent Geometry Estimation for Open-world Videos with Diffusion Priors [47.21120442961684]
オープンワールドビデオから時間的コヒーレンスで高忠実度点マップシーケンスを復元する新しいフレームワークであるGeometryCrafterを提案する。
GeometryCrafterは最先端の3D精度、時間的一貫性、一般化能力を実現する。
論文 参考訳(メタデータ) (2025-04-01T17:58:03Z) - MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion [118.74385965694694]
我々は動的シーンから時間ステップごとの幾何を直接推定する新しい幾何学的アプローチであるMotion DUSt3R(MonST3R)を提案する。
各タイムステップのポイントマップを単純に推定することで、静的シーンにのみ使用されるDUST3Rの表現を動的シーンに効果的に適応させることができる。
我々は、問題を微調整タスクとしてポーズし、いくつかの適切なデータセットを特定し、この制限されたデータ上でモデルを戦略的に訓練することで、驚くほどモデルを動的に扱えることを示す。
論文 参考訳(メタデータ) (2024-10-04T18:00:07Z) - Learning Temporally Consistent Video Depth from Video Diffusion Priors [62.36887303063542]
本研究は,ストリーム映像深度推定の課題に対処する。
フレームやクリップ間でコンテキスト情報を共有することは、時間的一貫性を育む上で重要である、と我々は主張する。
本稿では,任意の長さの動画に対して一貫したコンテキスト認識学習と推論戦略を提案し,クロスクリップなコンテキストを提供する。
論文 参考訳(メタデータ) (2024-06-03T16:20:24Z) - A Graph Attention Spatio-temporal Convolutional Network for 3D Human
Pose Estimation in Video [7.647599484103065]
我々は,アテンション機構を用いた局所的グローバル空間情報のモデリングにより,人間の骨格における制約の学習を改善する。
提案手法は, 奥行きのあいまいさと自己閉塞性を効果的に軽減し, 半上半身推定を一般化し, 2次元から3次元映像のポーズ推定における競合性能を実現する。
論文 参考訳(メタデータ) (2020-03-11T14:54:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。