論文の概要: Scene and Human in One World: Reconstruction in a Feedforward Pass
- arxiv url: http://arxiv.org/abs/2606.27720v1
- Date: Fri, 26 Jun 2026 05:08:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.370702
- Title: Scene and Human in One World: Reconstruction in a Feedforward Pass
- Title(参考訳): 一世界のシーンと人間:フィードフォワードパスでの再構築
- Authors: Boao Shi, Qiao Feng, Yiming Huang, Lingjie Liu,
- Abstract要約: Showはマスクプロンプト可能なヒューマンメッシュリカバリフレームワークで、フィードフォワード3Dシーンリカバリとヒューマンメッシュリカバリを結合する。
SHOWは、パラメトリックな人間のモデルから人間の意味論とスケール先を正規化されたポイントマップ予測に注入する。
人間のメッシュ推定を制限し、空間的に一貫した人間の配置を奨励し、人間のシーンアライメントを改善します。
- 参考スコア(独自算出の注目度): 32.88487546112625
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reconstructing humans in dynamic scenes from moving monocular cameras remains challenging due to scale ambiguity, human-scene misalignment, and occlusion interference. Rather than treating human mesh recovery and scene reconstruction as separate tasks, we believe that accurate human-scene reconstruction requires the two tasks to mutually inform each other: parametric human models offer semantic structure and metric-scale priors, while scene geometry provides spatial context for human localization and alignment. Built on this insight, we introduce SHOW, a mask-promptable human mesh recovery framework that couples feed-forward 3D scene reconstruction with Human Mesh Recovery in a unified metric space. SHOW injects human semantics and scale priors from parametric human models into normalized point-map prediction, enabling metric-scale scene reconstruction from inherently scale-ambiguous monocular input. In turn, the recovered scene geometry constrains human mesh estimation, encouraging spatially consistent human placement and improved human-scene alignment. To handle complex multi-person and cluttered scenes, SHOW further incorporates a promptable masking mechanism that enables flexible target-human selection while suppressing background distractions and occlusion interference. Through joint training, the model learns both human-aware geometric features and geometry-constrained human features, producing aligned metric-scale reconstructions from monocular human-centric videos. Extensive experiments demonstrate that SHOW improves metric-scale consistency, human-scene alignment, and reconstruction accuracy under challenging camera motion, occlusion, and cluttered backgrounds.
- Abstract(参考訳): 動いたモノクラーカメラのダイナミックなシーンで人間を再構成することは、あいまいさ、人間のシーンのミスアライメント、オクルージョンの干渉などにより、依然として困難である。
人間のメッシュ回復とシーン再構築を個別のタスクとして扱うのではなく、人間とシーンの正確な再構築は、相互に情報を伝達するために2つのタスクを必要とすると信じている。
この知見に基づいて,Human Meshリカバリとフィードフォワード3Dシーンを結合したマスクプロンプタブルなヒューマンメッシュリカバリフレームワークSHOWを紹介した。
SHOWは、パラメトリックな人間のモデルから人間のセマンティクスとスケール先行を正規化されたポイントマップ予測に注入し、本質的にスケールの曖昧な単分子入力からメートルスケールのシーン再構築を可能にする。
復元されたシーン形状は、人間のメッシュ推定を制約し、空間的に一貫した人間の配置を奨励し、人間のシーンアライメントを改善します。
複雑なマルチパーソンと散らかったシーンを扱うため、SHOWはさらに、背景の邪魔や閉塞の干渉を抑えつつ、柔軟なターゲットと人間の選択を可能にするプロンプト可能なマスキング機構を取り入れている。
ジョイントトレーニングを通じて、モデルは、人間の認識した幾何学的特徴と幾何学的制約のある人間の特徴の両方を学び、モノクルな人間中心のビデオから整列したメートルスケールの再構成を生成する。
大規模な実験により、SHOWは、挑戦的なカメラモーション、オクルージョン、乱雑な背景の下で、メートルスケールの一貫性、人間シーンのアライメント、再構築の精度を向上させることが示されている。
関連論文リスト
- HumanSplatHMR: Closing the Loop Between Human Mesh Recovery and Gaussian Splatting Avatar [19.538398405782996]
映像から人間のポーズや外観を正確に復元することは、シーン再構築の重要な要素である。
本稿では3次元人間のポーズを洗練する共同最適化フレームワークであるHumanSplatHMRを提案する。
アバター復元からポーズ推定を分離したポーズ回復ベースラインに対して、実験により一貫した改善が示された。
論文 参考訳(メタデータ) (2026-05-04T16:26:11Z) - AHAP: Reconstructing Arbitrary Humans from Arbitrary Perspectives with Geometric Priors [81.50960055126156]
任意のカメラ視点から任意の人間を再構築するためのフィードフォワードフレームワークである textbfAHAP を提案する。
私たちの中核は、人間同士の結びつき、再構築、局在化を支援するために、多視点幾何学を効果的に融合することにあります。
Human Headは、SMPL予測のためのクロスビュー機能とシーンコンテキストを融合し、ボディポーズの一貫性を強制するために、クロスビューの再投影損失によってガイドされる。
論文 参考訳(メタデータ) (2026-02-27T11:53:45Z) - CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives [65.89192712575797]
本研究では,モノクロ映像から再現可能な人物の動きとシーン形状を復元するCRISPを紹介する。
我々の手法は、人中心のビデオベンチマークにおいて、モーショントラッキングの失敗率を55.2%から6.9%に下げる。
このことは、CRISPが物理的に有意な人間の動きと対話環境を大規模に生成する能力を示している。
論文 参考訳(メタデータ) (2025-12-16T18:59:50Z) - HuPrior3R: Incorporating Human Priors for Better 3D Dynamic Reconstruction from Monocular Videos [20.256869569776118]
本稿では,SMPLの人体モデルと単眼深度推定を併用したハイブリッド幾何学的先行モデルを提案する。
HuPrior3Rは階層的なパイプラインと精製部品を備え、その後、戦略的な収穫と人間固有の詳細強化に相互注意融合を適用した。
TUM DynamicsとGTA-IMデータセットの実験は、人間の動的再構成において優れた性能を示す。
論文 参考訳(メタデータ) (2025-12-06T09:42:56Z) - Dynamic Avatar-Scene Rendering from Human-centric Context [75.95641456716373]
分離されたモデルと最適化されたモデルをブリッジするbf分離マップ(StM)戦略を提案する。
StMは、視覚的品質とレンダリングの精度の両方において、既存の最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-11-13T17:39:06Z) - ODHSR: Online Dense 3D Reconstruction of Humans and Scenes from Monocular Videos [18.73641648585445]
最近のニューラルレンダリングの進歩により、全体的人間シーンの再構築が可能になったが、事前に校正されたカメラと人間のポーズが必要である。
本稿では,オンライン形式でカメラトラッキング,ポーズ推定,ヒューマンシーン再構築を同時に行う新しい統合フレームワークを提案する。
具体的には,人間の変形モジュールを設計し,細部を再構築し,分布外への一般化性を高める。
論文 参考訳(メタデータ) (2025-04-17T17:59:02Z) - Realistic Clothed Human and Object Joint Reconstruction from a Single Image [26.57698106821237]
モノクラービューからリアルな3D衣服と物体を共同で再構築するための新しい暗黙のアプローチを導入する。
初めて、私たちは暗黙の表現で人間と物体の両方をモデル化し、衣服のようなより現実的な詳細を捉えます。
論文 参考訳(メタデータ) (2025-02-25T12:26:36Z) - Reconstructing People, Places, and Cameras [57.81696692335401]
Humans and Structure from Motion (HSfM) は、メカニカルワールド座標系において、複数の人メッシュ、シーンポイント雲、カメラパラメータを共同で再構築する手法である。
以上の結果から,SfMパイプラインに人体データを組み込むことで,カメラのポーズ推定が改善された。
論文 参考訳(メタデータ) (2024-12-23T18:58:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。