論文の概要: Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video
- arxiv url: http://arxiv.org/abs/2607.00157v1
- Date: Tue, 30 Jun 2026 20:32:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.62594
- Title: Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video
- Title(参考訳): モノクローナルビデオによるプログレッシブ・ポーズガイドによる4次元動物再構成
- Authors: Siyuan Li, Weiying Chen, Yilin Wang, Xinxin Zuo, Xingyu Li, Li Cheng,
- Abstract要約: 本研究では,高忠実度4D動物再構成のための3次元ガウス平板上に構築したテスト時間最適化フレームワークを提案する。
我々は、カメラ推定ドリフトを吸収しながら左右の手がかりを利用する対称性を意識した時間符号化を用いる。
本手法は多種多様な種にまたがって頑健に一般化し, 優れた幾何学的精度, 時間的一貫性, 視覚的忠実度を実現している。
- 参考スコア(独自算出の注目度): 35.57694046820891
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reconstructing 4D animals from monocular videos is challenging due to large inter-species variation, complex articulations, and the lack of reliable templates. Existing approaches typically rely on either strict category-specific priors that restrict generalization, or unconstrained generative models that sacrifice input fidelity. To bridge this gap, we present a progressive test-time optimization framework built on 3D Gaussian Splatting for high-fidelity 4D animal reconstruction from a single video. Our key insight is that a coarse shape prior suffices when coupled with a progressive strategy that disentangles articulated pose from non-rigid deformation. Specifically, we employ a symmetry-aware temporal encoding that exploits bilateral cues while absorbing camera estimation drift and a part-conditioned deformation mechanism guided by learnable part anchors and a learnable skinning field. Extensive experiments demonstrate that our approach generalizes robustly across diverse species, achieving superior geometric accuracy, temporal consistency, and visual fidelity compared to existing baselines, even under severe prior mismatch.
- Abstract(参考訳): モノクロビデオから4D動物を再構成することは、大きな種間変異、複雑な調音、信頼性のあるテンプレートの欠如により困難である。
既存のアプローチは典型的には、一般化を制限する厳密なカテゴリー固有の先例や、入力忠実性を犠牲にする制約のない生成モデルに依存している。
このギャップを埋めるために,高忠実度4D動物再構成のための3次元ガウス平板上に構築したプログレッシブテスト時間最適化フレームワークを提案する。
我々の重要な洞察は、粗い形状が非剛性変形から引き離される進行戦略と組み合わさって、より粗い形状になるということである。
具体的には、カメラ推定ドリフトを吸収しながら双方向の手がかりを利用する対称対応時間符号化と、学習可能な部分アンカーと学習可能なスキンフィールドによって誘導される部分条件変形機構を用いる。
大規模な実験により,本手法は多種多様な種にまたがって頑健に一般化され,高精度,時間的整合性,視覚的忠実度が既存のベースラインに比べて高いことが確認された。
関連論文リスト
- CORGI: Consistency-Aware 3D Dog Reconstruction from a Single Image in the Wild [13.416281912804633]
CORGIは、単一の制約のない画像から、一貫性を意識した3D犬の再構築のための新しいフレームワークである。
生成的不整合とマルチビューキャプチャの欠如を克服するために,パイプラインには3つのコアコンポーネントが導入されている。
我々は,CORGIが最先端のパフォーマンスを達成し,多種多様な犬種をシームレスに一般化することを示す。
論文 参考訳(メタデータ) (2026-07-01T01:38:29Z) - Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild [87.49244020695505]
モノクロビデオから動的非剛体オブジェクトを再構成するには、幾何学と外観に関するデータ駆動の先行と直接観察から視覚的手がかりを統合する必要がある。
以前のアプローチでは、視覚的な入力から直接4D表現を予測するか、ビデオエビデンスに基づいて変形して洗練される3D表現を初期化する。
We present Lift4D, a test-time optimization framework that handle both limits。
論文 参考訳(メタデータ) (2026-06-22T17:59:54Z) - PRIMA: Boosting Animal Mesh Recovery with Biological Priors and Test-Time Adaptation [3.599033387924161]
PRIMAは、厳しい種の下で頑丈な3次元四重項メッシュ回復のためのフレームワークであり、不均衡を引き起こす。
本研究は,BioCLIP埋め込みを生物前駆体として組み込んで,再建プロセスに意味的および形態学的知識を注入する。
多様な種をカバーし,バリエーションを呈する大規模擬似3DデータセットであるQuadruped3Dを構築した。
論文 参考訳(メタデータ) (2026-06-01T15:13:47Z) - ShapeGaussian: High-Fidelity 4D Human Reconstruction in Monocular Videos via Vision Priors [41.01643771040251]
ShapeGaussianは、カジュアルなモノクロビデオから4Dの人間を再構築するための、高忠実でテンプレートのない方法だ。
提案手法は,高忠実度かつ堅牢なシーン再構築を実現するために,テンプレートフリービジョンを前もって統合する。
論文 参考訳(メタデータ) (2026-02-05T11:52:15Z) - Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models [79.06910348413861]
Diff4Splatは、単一の画像から制御可能で明示的な4Dシーンを合成するフィードフォワード方式である。
単一の入力画像、カメラ軌跡、オプションのテキストプロンプトが与えられた場合、Diff4Splatは外見、幾何学、動きを符号化する変形可能な3Dガウス場を直接予測する。
論文 参考訳(メタデータ) (2025-11-01T11:16:25Z) - G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior [53.762256749551284]
我々は,3次元シーン再構成を効果的に活用するための基本的な前提条件として,正確な幾何学を同定する。
生成パイプライン全体にこの幾何学的ガイダンスを導入し、可視性マスク推定を改善し、新しいビュー選択をガイドし、ビデオ拡散モデルに着色した場合の多視点一貫性を向上させる。
本手法は,屋内および屋外の両方のシナリオにおいて,高い一般化性を有するシングルビュー入力とアンポーズ映像を自然にサポートする。
論文 参考訳(メタデータ) (2025-10-14T03:06:28Z) - ShapeGen4D: Towards High Quality 4D Shape Generation from Videos [85.45517487721257]
ビデオからエンドツーエンドに1つの動的3次元表現を合成する,ネイティブなビデオから4次元の形状生成フレームワークを提案する。
本手法は,フレームごとの最適化を行なわずに,非剛性運動,体積変化,および位相遷移を正確にキャプチャする。
論文 参考訳(メタデータ) (2025-10-07T17:58:11Z) - OracleGS: Grounding Generative Priors for Sparse-View Gaussian Splatting [78.70702961852119]
OracleGSは、Gaussian Splattingのスパースビューのために、生成的完全性と回帰的忠実性を調整している。
提案手法は,多視点幾何学的証拠に先立って強力な生成条件を定め,幻覚的アーティファクトをフィルタリングし,非拘束領域における可塑性完備を保存している。
論文 参考訳(メタデータ) (2025-09-27T11:19:32Z) - 4DPV: 4D Pet from Videos by Coarse-to-Fine Non-Rigid Radiance Fields [16.278222277579655]
野生の複数のRGB配列からカメラのポーズと未知の物体の4次元再構成を復元するための粗大なニューラルモデルを提案する。
提案手法では,事前構築した3Dテンプレートや3Dトレーニングデータ,制御条件を考慮しない。
複素および実世界の変形を伴う挑戦シナリオにおいて,本手法を徹底的に検証する。
論文 参考訳(メタデータ) (2024-11-15T15:31:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。