論文の概要: Seeing the World and the Self from Egocentric Video
- arxiv url: http://arxiv.org/abs/2609.01276v1
- Date: Tue, 01 Sep 2026 14:10:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.72304
- Title: Seeing the World and the Self from Egocentric Video
- Title(参考訳): エゴセントリックビデオから世界と自己を見る
- Authors: Kai Guan, Minchao Jiang, Ruichen WangLi, Wentao Zhu, Lei Zhang,
- Abstract要約: 既存の手法では、シーン再構成と動き推定を別々に扱う。
決定論的幾何再構成と幾何条件の運動生成を結合した統合フレームワークRESELFを提案する。
実験により、RESELFは個々のタスク用に設計された最先端の手法より優れていることが示された。
- 参考スコア(独自算出の注目度): 9.841166134702467
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Complete 3D perception from egocentric video requires recovering the surrounding scene and the wearer's full-body motion in a shared metric frame. Existing methods typically address scene reconstruction and motion estimation separately: scene reconstruction methods ignore the wearer, whereas motion estimation methods lack explicit scene geometry and often depend on external trajectories. Joint recovery is challenging because the two tasks exhibit asymmetric visibility and require different prediction paradigms. The largely visible scene supports deterministic geometric regression, whereas the severely occluded body requires generative motion inference. We therefore propose RESELF (REconstructing the Scene and the sELF), a unified framework that couples deterministic metric geometry reconstruction with geometry-conditioned motion generation. RESELF adapts a geometry foundation model pre-trained on large-scale exocentric data to egocentric video using frame-wise scale and relative-pose consistency objectives. The resulting camera trajectory and latent geometric features condition a diffusion model that recovers the wearer's motion. A subsequent closed-loop kinematic feedback stage further refines the camera head while preserving the reconstructed scene geometry. To support training and evaluation, we curate EE4D-JSM from EgoExo4D by aligning egocentric video, sparse metric scene geometry, camera trajectories, and full-body motion annotations. Experiments show that RESELF outperforms state-of-the-art methods designed for the individual tasks across depth estimation, camera tracking, and full-body motion estimation. Code, models, and datasets will be available at https://ka1guan.github.io/RESELF/.
- Abstract(参考訳): エゴセントリックビデオからの完全な3D知覚は、周囲のシーンと着用者のフルボディの動きを共有のメトリクスフレームで再現する必要がある。
シーン再構成法は着用者を無視するが、動作推定法は明示的なシーン形状を欠き、しばしば外部軌跡に依存する。
2つのタスクは非対称な可視性を示し、異なる予測パラダイムを必要とするため、共同回復は困難である。
おおむね目に見える場面は決定論的幾何学的回帰をサポートするが、酷い閉塞体は生成的な動きの推論を必要とする。
そこで我々は、決定論的幾何再構成と幾何条件の運動生成を結合した統合フレームワークRESELF(Reconstructing the Scene and the sELF)を提案する。
RESELFは、大規模なエクソセントリックなデータに基づいて事前訓練された幾何学基礎モデルを、フレームワイドスケールと相対的目的整合性目標を用いて、エゴセントリックなビデオに適用する。
結果として生じるカメラ軌跡と潜時幾何学は、着用者の動きを回復する拡散モデルとして条件付けされる。
その後の閉ループキネマティックフィードバックステージは、再構成されたシーン形状を維持しながら、さらにカメラヘッドを洗練させる。
トレーニングと評価を支援するため,EgoExo4Dから脳4D-JSMをキュレートする。
実験の結果,RESELFは深度推定,カメラトラッキング,フルボディモーション推定など,個々のタスクを対象とした最先端の手法よりも優れていた。
コード、モデル、データセットはhttps://ka1guan.github.io/RESELF/.comで入手できる。
関連論文リスト
- TRIG: Trajectory-Rig Decoupled Metric Geometry Learning [33.69899077340302]
Trajectory-Rig Decoupled Metric Geometry Learning (TRIG)は、自律走行のための幾何学的認識フレームワークである。
本稿では,距離一貫性学習のための軌跡進化とリグ幾何学を別々に制約する,分離されたポーズエンコーディングと監督を導入する。
5つの自律走行ベンチマーク実験により、TRIGはポーズ推定、メートル法深度予測、および3次元再構成において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2026-07-07T03:55:13Z) - GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation [46.507099021313074]
生成した映像中の動きがコヒーレントなシーンと互換性があるかどうかを測定する。
我々はこれを光学的流れ、奥行き予測、および剛性領域と動的領域の分離に対応する特徴ベースの対応を用いて運用する。
実験は、知覚品質を保ちながら、強いベースライン上での時間的幾何学的アーティファクトの大幅な減少を示す。
論文 参考訳(メタデータ) (2026-05-18T13:17:08Z) - LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models [52.656349227001925]
モノクロビデオが与えられた場合、ビデオの再レンダリングの目的は、新しいカメラの軌跡からシーンのビューを生成することである。
既存の方法は2つの異なる課題に直面している。
大規模な4次元再構成モデルの潜在空間に埋め込まれた暗黙的幾何学的知識を用いて,これらの課題に対処することを提案する。
論文 参考訳(メタデータ) (2026-01-21T05:46:03Z) - CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives [65.89192712575797]
本研究では,モノクロ映像から再現可能な人物の動きとシーン形状を復元するCRISPを紹介する。
我々の手法は、人中心のビデオベンチマークにおいて、モーショントラッキングの失敗率を55.2%から6.9%に下げる。
このことは、CRISPが物理的に有意な人間の動きと対話環境を大規模に生成する能力を示している。
論文 参考訳(メタデータ) (2025-12-16T18:59:50Z) - GaVS: 3D-Grounded Video Stabilization via Temporally-Consistent Local Reconstruction and Rendering [54.489285024494855]
ビデオの安定化は、元のユーザの動きの意図を保ちながら、望ましくないシャキネスを除去するので、ビデオ処理に欠かせない。
既存のアプローチは、運用するドメインによって、ユーザエクスペリエンスを低下させるいくつかの問題に悩まされます。
ビデオの安定化を時間的に一貫性のある局所的再構成とレンダリングのパラダイムとして再構成する,新しい3Dグラウンドアプローチである textbfGaVS を紹介する。
論文 参考訳(メタデータ) (2025-06-30T15:24:27Z) - Self-Supervised Monocular 4D Scene Reconstruction for Egocentric Videos [25.41337525728398]
EgoMono4Dは、Egocentric Monocular 4D再構成に必要な複数の変数を統一する新しいモデルである。
全てのベースラインと比較して高密度の点雲列再構成において優れた性能を発揮する。
論文 参考訳(メタデータ) (2024-11-14T02:57:11Z) - FrozenRecon: Pose-free 3D Scene Reconstruction with Frozen Depth Models [67.96827539201071]
本稿では,3次元シーン再構成のための新しいテスト時間最適化手法を提案する。
本手法は5つのゼロショットテストデータセット上で,最先端のクロスデータセット再構築を実現する。
論文 参考訳(メタデータ) (2023-08-10T17:55:02Z) - Attentive and Contrastive Learning for Joint Depth and Motion Field
Estimation [76.58256020932312]
単眼視システムからシーンの3次元構造とともにカメラの動きを推定することは複雑な作業である。
モノクロ映像からの3次元物体運動場推定のための自己教師付き学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-10-13T16:45:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。