論文の概要: GUSH3R: Everyone Everywhere All at Once as Gaussians
- arxiv url: http://arxiv.org/abs/2607.05243v1
- Date: Mon, 06 Jul 2026 15:53:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.229981
- Title: GUSH3R: Everyone Everywhere All at Once as Gaussians
- Title(参考訳): GUSH3R: あらゆる場所でガウシアンとして
- Authors: Keito Abe, Kaede Shiohara, Takashi Otonari, Toshihiko Yamasaki,
- Abstract要約: GUSH3R(Gaussian-Unified Scene Human 3D Reconstruction)は,オンライン動的ヒューマンシーン再構築のためのフィードフォワードフレームワークである。
単眼の人間シーン映像から, ダイナミックな人間(すべて)と静的なシーン(どこでも)を1回の前方通過で再構成する。
単眼のヒトシーンデータセットを用いた実験により,本手法が競争力のある新規な合成品質を実現することを示す。
- 参考スコア(独自算出の注目度): 30.884035795245946
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reconstructing dynamic human-scene environments from monocular videos is a challenging problem that requires jointly modeling scene geometry, camera motion, and non-rigid human dynamics while enabling photorealistic rendering. Recent feed-forward methods can efficiently predict geometry, but they are often limited to non-photorealistic representations such as point clouds and meshes, or they fail to handle non-rigid objects, particularly dynamic humans. To fill this gap, we present GUSH3R (Gaussian-Unified Scene Human 3D Reconstruction), a feed-forward framework for online dynamic human-scene reconstruction. From a monocular human-scene video, our method reconstructs dynamic humans (everyone) and static scenes (everywhere) in a single forward pass (all at once) as 3D Gaussian Splatting (3DGS) primitives (as gaussians), which are geometrically consistent and capable of novel view synthesis. Experiments on monocular human-scene datasets demonstrate that our approach achieves competitive novel view synthesis quality while significantly improving inference efficiency compared to optimization-based methods.
- Abstract(参考訳): モノクロビデオから動的なヒューマンシーン環境を再構築することは、シーンの幾何学、カメラの動き、および非剛体な人間のダイナミクスを共同でモデル化し、フォトリアリスティックなレンダリングを可能にするという難しい問題である。
最近のフィードフォワード法は幾何学を効率的に予測できるが、しばしば点雲やメッシュのような非フォトリアリスティックな表現に制限される。
このギャップを埋めるために、オンライン動的ヒューマンシーン再構築のためのフィードフォワードフレームワークであるGUSH3R(Gaussian-Unified Human 3D Reconstruction)を提案する。
一つの前方通過(すべて一度に)における動的人間(すべての場所)と静的シーン(すべての場所)を、幾何学的に整合性があり、新しいビュー合成が可能な3Dガウスススティング(3DGS)プリミティブとして再構成する。
単眼のヒトシーンデータセットを用いた実験により,提案手法は,最適化手法と比較して推論効率を著しく向上させながら,競争力のある新規なビュー合成品質を実現することを示した。
関連論文リスト
- CoGS: Compositional Dynamic Human-Object Scenes Gaussian Splatting from Monocular Video [3.3660382321886217]
本稿では,モノクルな人-物体再構成のための合成ガウス平滑化フレームワークを提案する。
CoGSは、動画を3つの調整されたブランチに分解する: 完全な正準前の人間のシーン、推定対象軌跡によって駆動される剛体物体フィールド、弱いシーンのみの平面プリミティブによって正規化された静的シーンフィールド。
6段階の最適化スケジュールは、まず人間とオブジェクトを独立に安定化させ、次にフルイメージの監督、可視性に敏感な人間のアンカー、オブジェクトシルエットとモーションの制約、シーンの規則化を遅らせる。
論文 参考訳(メタデータ) (2026-06-27T09:10:22Z) - CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives [65.89192712575797]
本研究では,モノクロ映像から再現可能な人物の動きとシーン形状を復元するCRISPを紹介する。
我々の手法は、人中心のビデオベンチマークにおいて、モーショントラッキングの失敗率を55.2%から6.9%に下げる。
このことは、CRISPが物理的に有意な人間の動きと対話環境を大規模に生成する能力を示している。
論文 参考訳(メタデータ) (2025-12-16T18:59:50Z) - AHA! Animating Human Avatars in Diverse Scenes with Gaussian Splatting [26.560838721184435]
3次元ガウススプラッティング(3DGS)を用いた3次元シーンにおける人間アニメーションのための新しい枠組みを提案する。
ヒトとシーンをガウスとして表現することで、我々のアプローチは3Dシーンと相互作用する人間の幾何学的に一貫性のある自由視点レンダリングを可能にする。
我々は,Scannet++とSuperSplatライブラリのシーンに対するアプローチと,疎密で高密度なマルチビュー・ヒューマンキャプチャから再構成したアバターに対するアプローチを評価した。
論文 参考訳(メタデータ) (2025-11-13T00:19:18Z) - HumanRAM: Feed-forward Human Reconstruction and Animation Model using Transformers [60.86393841247567]
HumanRAMは、モノクル画像やスパース画像から人間の再構築とアニメーションを一般化するための、新しいフィードフォワードアプローチである。
提案手法は,人間の再構築とアニメーションを,明示的なポーズ条件を導入することによって統合された枠組みに統合する。
実験の結果,HumanRAMは再現精度,アニメーション忠実度,実世界のデータセット上での一般化性能において,従来の手法をはるかに上回っていることがわかった。
論文 参考訳(メタデータ) (2025-06-03T17:50:05Z) - WonderHuman: Hallucinating Unseen Parts in Dynamic 3D Human Reconstruction [63.666166249633385]
我々はWonderHumanをモノクラービデオから再構成し、高忠実なノベルビューの合成を行う。
提案手法は,与えられたモノクロ映像からフォトリアリスティックなレンダリングを生成する場合のSOTA性能を実現する。
論文 参考訳(メタデータ) (2025-02-03T04:43:41Z) - EgoGaussian: Dynamic Scene Understanding from Egocentric Video with 3D Gaussian Splatting [95.44545809256473]
エゴガウスアン(EgoGaussian)は、3Dシーンを同時に再構築し、RGBエゴセントリックな入力のみから3Dオブジェクトの動きを動的に追跡する手法である。
動的オブジェクトと背景再構築の品質の両面で,最先端技術と比較して大きな改善が見られた。
論文 参考訳(メタデータ) (2024-06-28T10:39:36Z) - Guess The Unseen: Dynamic 3D Scene Reconstruction from Partial 2D Glimpses [9.529416246409355]
本研究では,モノクロ映像から世界と複数の動的人間を3次元に再構成する手法を提案する。
キーとなるアイデアとして、最近出現した3Dガウススプラッティング(3D-GS)表現を通じて、世界と複数の人間の両方を表現します。
論文 参考訳(メタデータ) (2024-04-22T17:59:50Z) - Vid2Avatar: 3D Avatar Reconstruction from Videos in the Wild via
Self-supervised Scene Decomposition [40.46674919612935]
Vid2Avatarは、モノクラー・イン・ザ・ワイルドビデオから人間のアバターを学習する手法である。
提案手法は,大規模な人間のスキャンデータから抽出した基礎的監督や先行データを必要としない。
シーンの人間と背景の両方を共同でモデル化することで、シーンの分解と表面の再構築を3Dで直接行う。
論文 参考訳(メタデータ) (2023-02-22T18:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。