論文の概要: Real-Time Human Reconstruction and Animation using Feed-Forward Gaussian Splatting
- arxiv url: http://arxiv.org/abs/2604.10259v1
- Date: Sat, 11 Apr 2026 15:52:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:15.927782
- Title: Real-Time Human Reconstruction and Animation using Feed-Forward Gaussian Splatting
- Title(参考訳): フィードフォワードガウス法によるリアルタイム人体再構成とアニメーション
- Authors: Devdoot Chatterjee, Zakaria Laskar, C. V. Jawahar,
- Abstract要約: 本稿では,人間の3次元再構成とリアルタイムアニメーションのためのフィードフォワードガウススプレイティングフレームワークを提案する。
このフレームワークは、マルチビューのRGBイメージとその関連するSMPL-Xのポーズを直接操作する。
我々は,THuman 2.1,AvatarReX,THuman 4.0データセットを用いて評価を行った。
- 参考スコア(独自算出の注目度): 15.927245773921287
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a generalizable feed-forward Gaussian splatting framework for human 3D reconstruction and real-time animation that operates directly on multi-view RGB images and their associated SMPL-X poses. Unlike prior methods that rely on depth supervision, fixed input views, UV map, or repeated feed-forward inference for each target view or pose, our approach predicts, in a canonical pose, a set of 3D Gaussian primitives associated with each SMPL-X vertex. One Gaussian is regularized to remain close to the SMPL-X surface, providing a strong geometric prior and stable correspondence to the parametric body model, while an additional small set of unconstrained Gaussians per vertex allows the representation to capture geometric structures that deviate from the parametric surface, such as clothing and hair. In contrast to recent approaches such as HumanRAM, which require repeated network inference to synthesize novel poses, our method produces an animatable human representation from a single forward pass; by explicitly associating Gaussian primitives with SMPL-X vertices, the reconstructed model can be efficiently animated via linear blend skinning without further network evaluation. We evaluate our method on the THuman 2.1, AvatarReX and THuman 4.0 datasets, where it achieves reconstruction quality comparable to state-of-the-art methods while uniquely supporting real-time animation and interactive applications. Code and pre-trained models are available at https://github.com/Devdoot57/HumanGS .
- Abstract(参考訳): 我々は,多視点RGB画像とそれに関連するSMPL-Xポーズを直接操作する,人間の3次元再構成とリアルタイムアニメーションのための一般化可能なフィードフォワードガウススプレイティングフレームワークを提案する。
提案手法では,各SMPL-X頂点に関連付けられた3次元ガウス的プリミティブの集合を標準的ポーズで予測する。
1つのガウスは、SMPL-X表面に近いように規則化され、パラメトリックボディモデルと強い幾何学的事前および安定した対応を提供する一方、頂点ごとに制限されていないガウスの小さな集合は、衣服や髪のようなパラメトリック表面から逸脱する幾何学的構造を捉えることができる。
提案手法は,新しいポーズを合成するために繰り返しネットワーク推論を必要とするHumanRAMのような最近のアプローチとは対照的に,ガウス的プリミティブをSMPL-X頂点に明示的に関連付けることで,ネットワーク評価を行なわずに線形ブレンドスキンで効率的にアニメーションすることができる。
我々はTHuman 2.1, AvatarReX, THuman 4.0データセットを用いて, リアルタイムアニメーションとインタラクティブなアプリケーションを一意にサポートしながら, 最先端の手法に匹敵する再現性を実現する。
コードと事前トレーニングされたモデルはhttps://github.com/Devdoot57/HumanGS で公開されている。
関連論文リスト
- HumanRAM: Feed-forward Human Reconstruction and Animation Model using Transformers [60.86393841247567]
HumanRAMは、モノクル画像やスパース画像から人間の再構築とアニメーションを一般化するための、新しいフィードフォワードアプローチである。
提案手法は,人間の再構築とアニメーションを,明示的なポーズ条件を導入することによって統合された枠組みに統合する。
実験の結果,HumanRAMは再現精度,アニメーション忠実度,実世界のデータセット上での一般化性能において,従来の手法をはるかに上回っていることがわかった。
論文 参考訳(メタデータ) (2025-06-03T17:50:05Z) - RoGSplat: Learning Robust Generalizable Human Gaussian Splatting from Sparse Multi-View Images [39.03889696169877]
RoGSplatは、スパースマルチビュー画像から見えない人間の高忠実な新しいビューを合成するための新しいアプローチである。
提案手法は,新しいビュー合成とクロスデータセットの一般化において,最先端の手法よりも優れている。
論文 参考訳(メタデータ) (2025-03-18T12:18:34Z) - GPS-Gaussian+: Generalizable Pixel-wise 3D Gaussian Splatting for Real-Time Human-Scene Rendering from Sparse Views [67.34073368933814]
スパースビューカメラ設定下での高解像度画像レンダリングのための一般化可能なガウススプラッティング手法を提案する。
我々は,人間のみのデータや人景データに基づいてガウスパラメータ回帰モジュールをトレーニングし,深度推定モジュールと共同で2次元パラメータマップを3次元空間に引き上げる。
いくつかのデータセットに対する実験により、我々の手法はレンダリング速度を超越しながら最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2024-11-18T08:18:44Z) - Generalizable Human Gaussians from Single-View Image [52.100234836129786]
単視点一般化可能なHuman Gaussian Model(HGM)を導入する。
提案手法では, 粗い予測されたヒトガウスの背景画像を改良するために, ControlNet を用いる。
非現実的な人間のポーズや形状の潜在的な発生を緩和するために、SMPL-Xモデルからの人間の先行を二重分岐として組み込む。
論文 参考訳(メタデータ) (2024-06-10T06:38:11Z) - GVA: Reconstructing Vivid 3D Gaussian Avatars from Monocular Videos [56.40776739573832]
モノクロビデオ入力(GVA)から鮮明な3Dガウスアバターの作成を容易にする新しい手法を提案する。
私たちのイノベーションは、高忠実な人体再構築を実現するという、複雑な課題に対処することにあります。
通常の地図とシルエットを整列させて手足のポーズ精度を向上させるためにポーズ改善手法を提案する。
論文 参考訳(メタデータ) (2024-02-26T14:40:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。