論文の概要: CoGS: Compositional Dynamic Human-Object Scenes Gaussian Splatting from Monocular Video
- arxiv url: http://arxiv.org/abs/2606.28820v1
- Date: Sat, 27 Jun 2026 09:10:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.69813
- Title: CoGS: Compositional Dynamic Human-Object Scenes Gaussian Splatting from Monocular Video
- Title(参考訳): CoGS: モノクロビデオからガウス的スプレイティングを合成するダイナミックなヒューマンオブジェクトシーン
- Authors: Jerrin Bright, John Zelek,
- Abstract要約: 本稿では,モノクルな人-物体再構成のための合成ガウス平滑化フレームワークを提案する。
CoGSは、動画を3つの調整されたブランチに分解する: 完全な正準前の人間のシーン、推定対象軌跡によって駆動される剛体物体フィールド、弱いシーンのみの平面プリミティブによって正規化された静的シーンフィールド。
6段階の最適化スケジュールは、まず人間とオブジェクトを独立に安定化させ、次にフルイメージの監督、可視性に敏感な人間のアンカー、オブジェクトシルエットとモーションの制約、シーンの規則化を遅らせる。
- 参考スコア(独自算出の注目度): 3.3660382321886217
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reconstructing dynamic human--object interaction scenes from monocular video is difficult because the human, manipulated object, and background obey different motion models while sharing the same pixels. Existing dynamic radiance-field and Gaussian-splatting methods often entangle these components, causing object motion to leak into the human or static scene, and monocular human reconstruction remains underconstrained in regions that are rarely observed. We present CoGS, a compositional Gaussian-splatting framework for monocular human--object scene reconstruction. CoGS decomposes the video into three coordinated branches: an articulated human initialized from a complete canonical prior, a rigid object field driven by an estimated object trajectory, and a static scene field regularized by weak scene-only planar primitives when available. A six-stage optimization schedule first stabilizes the human and object independently, then fuses them with the scene under full-image supervision, visibility-aware human anchoring, object silhouette and motion constraints, and delayed scene regularization. This design keeps each component responsible for its own geometry and motion while allowing photometric evidence to correct the final composite. Experiments on HOSNeRF and NeuMan show that CoGS improves both human--object interaction reconstruction and in-the-wild human--scene rendering, achieving stronger fidelity and perceptual quality across full-frame and human-focused evaluations. Code will be released upon publication.
- Abstract(参考訳): 同じピクセルを共有しながら、人間、操作対象、背景が異なる動きモデルに従うため、モノクロビデオから動的人間と物体の相互作用シーンを再構築することは困難である。
既存の動的放射場とガウス散乱法は、しばしばこれらの成分を絡み合わせることで、物体の動きが人間や静的なシーンに漏れ、単眼の人間の復元は、ほとんど観察されない領域で過小評価されている。
モノクラー・ヒューマン・オブジェクト・シーン再構築のための合成ガウス・スプレイティング・フレームワークであるCoGSについて述べる。
CoGSは、映像を3つの調整された枝に分解する: 完全な正準前者から初期化された調音された人間、推定対象軌跡によって駆動される剛体物体場、そして利用可能なとき、弱いシーンのみの平面的プリミティブによって正規化された静的シーン場。
6段階の最適化スケジュールは、まず人間とオブジェクトを独立に安定化させ、次にフルイメージの監督、可視性に敏感な人間のアンカー、オブジェクトシルエットとモーションの制約、シーンの規則化を遅らせる。
この設計では、各コンポーネントが自身の幾何学と運動に責任を持ちながら、光学的証拠で最終合成を補正することができる。
HOSNeRFとNeuManの実験によると、CoGSは人間と物体の相互作用の再構築と、その中間の人間のレンダリングの両方を改善し、フルフレームおよび人間に焦点を当てた評価において、より強固な忠実性と知覚的品質を達成する。
コードは出版時に公開される。
関連論文リスト
- Scene and Human in One World: Reconstruction in a Feedforward Pass [32.88487546112625]
Showはマスクプロンプト可能なヒューマンメッシュリカバリフレームワークで、フィードフォワード3Dシーンリカバリとヒューマンメッシュリカバリを結合する。
SHOWは、パラメトリックな人間のモデルから人間の意味論とスケール先を正規化されたポイントマップ予測に注入する。
人間のメッシュ推定を制限し、空間的に一貫した人間の配置を奨励し、人間のシーンアライメントを改善します。
論文 参考訳(メタデータ) (2026-06-26T05:08:55Z) - TROPHIES: Temporal Reconstruction of Places, Humans, and Cameras from Multi-view Videos [13.556917488868661]
TROPHIESは、動的な人間、静的シーン、カメラのポーズを1つのグローバル座標フレームで共同で推定することを目的としている。
グローバルアライメントと最適化モジュールは、スケール整合性、コンタクト先、およびクロスビューの時間的コヒーレンスを強制することによって、両方のブランチを結合する。
EgoHuman と EgoExo4D の実験では、TROPHIES はグローバルな忠実さとヒューマンシーンの一貫性の両方において、既存のパラダイムを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-01T15:00:18Z) - EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents [85.77432303199176]
EmbodMocapは2つの動くiPhoneを使ったポータブルで安価なデータ収集パイプラインである。
私たちのキーとなるアイデアは、二重RGB-Dシーケンスを共同で校正し、人間とシーンの両方を再構築することです。
収集したデータに基づいて、我々は3つの具体的AIタスクを強化した: モノクラーヒューマン・シーン・リコンストラクション(モノクラーヒューマン・シーン・リコンストラクション)、メトリックスケールで世界空間に整合した人間とシーンを出力するフィードフォワードモデル、物理ベースのキャラクターアニメーション。
論文 参考訳(メタデータ) (2026-02-26T16:53:41Z) - CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives [65.89192712575797]
本研究では,モノクロ映像から再現可能な人物の動きとシーン形状を復元するCRISPを紹介する。
我々の手法は、人中心のビデオベンチマークにおいて、モーショントラッキングの失敗率を55.2%から6.9%に下げる。
このことは、CRISPが物理的に有意な人間の動きと対話環境を大規模に生成する能力を示している。
論文 参考訳(メタデータ) (2025-12-16T18:59:50Z) - Physics-based Human Pose Estimation from a Single Moving RGB Camera [47.50334809388003]
MoviCamは、地上のトラジェクトリを含む最初の非合成データセットである。
PhysDynPoseは、シーン幾何学と物理的な制約を組み込んだ物理ベースの手法である。
我々の手法は世界座標における人間とカメラの両方のポーズを頑健に推定する。
論文 参考訳(メタデータ) (2025-07-23T11:04:30Z) - ODHSR: Online Dense 3D Reconstruction of Humans and Scenes from Monocular Videos [18.73641648585445]
最近のニューラルレンダリングの進歩により、全体的人間シーンの再構築が可能になったが、事前に校正されたカメラと人間のポーズが必要である。
本稿では,オンライン形式でカメラトラッキング,ポーズ推定,ヒューマンシーン再構築を同時に行う新しい統合フレームワークを提案する。
具体的には,人間の変形モジュールを設計し,細部を再構築し,分布外への一般化性を高める。
論文 参考訳(メタデータ) (2025-04-17T17:59:02Z) - WonderHuman: Hallucinating Unseen Parts in Dynamic 3D Human Reconstruction [63.666166249633385]
我々はWonderHumanをモノクラービデオから再構成し、高忠実なノベルビューの合成を行う。
提案手法は,与えられたモノクロ映像からフォトリアリスティックなレンダリングを生成する場合のSOTA性能を実現する。
論文 参考訳(メタデータ) (2025-02-03T04:43:41Z) - Joint Optimization for 4D Human-Scene Reconstruction in the Wild [59.322951972876716]
モノクロビデオから野生の4次元人間シーンを再現する新しい最適化手法JOSHを提案する。
実験の結果,JOSHはグローバルな人間の動き推定と密集したシーン再構築において,より良い結果が得られることが示された。
さらに、より効率的なモデルJOSH3Rを設計し、Webビデオから直接擬似ラベルでトレーニングします。
論文 参考訳(メタデータ) (2025-01-04T01:53:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。