論文の概要: Feed-Forward Multi-view Multi-person Reconstruction with Contrastive Human-Aware 3D Representation
- arxiv url: http://arxiv.org/abs/2609.00745v1
- Date: Tue, 01 Sep 2026 05:24:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.401121
- Title: Feed-Forward Multi-view Multi-person Reconstruction with Contrastive Human-Aware 3D Representation
- Title(参考訳): コントラスト型ヒューマン・アウェア3次元表現を用いたフィードフォワード多視点複数人物再構成
- Authors: Yuanwang Yang, Buzhen Huang, Zongxuan Ren, Jing Huang, Kun Li,
- Abstract要約: 統合された、インスタンス中心の人間中心の3D空間を維持するための新しいトップダウンパラダイムを提案する。
クロスモーダルコントラスト学習は、カメラキャリブレーション、クロスビューアソシエーション、人間の再構築を同時に行うことができる。
実験は、実世界の挑戦的なシナリオにおいて、堅牢で、正確で、効率的なマルチビューの人間の再構築を示す。
- 参考スコア(独自算出の注目度): 12.32801567231421
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-view human reconstruction has been extensively studied under simplified settings, yet robust and efficient multi-person reconstruction in unconstrained environments remains challenging. Existing bottom-up methods often rely on accurate camera calibration and explicit cross-view matching, and therefore struggle with severe occlusions and ambiguities. We propose a new top-down paradigm that maintains a unified, instance-centric human-aware 3D space, enabling simultaneous camera calibration, cross-view association, and human reconstruction via cross-modal contrastive learning. Observations from multiple views are lifted and fused into this shared 3D space, where geometric structure, visual appearance, and human-centric semantic cues are jointly encoded at the instance level. We further introduce a spatial contrastive learning strategy that aligns 3D features corresponding to the same human instance across different views and modalities while separating different instances. This enables correspondence reasoning, semantic aggregation, and instance discrimination to be performed natively in 3D, improving cross-view consistency and robustness under severe occlusions. Finally, structured human body models are recovered in a feed-forward manner by regressing SMPL parameters from instance-level 3D human tokens. Extensive experiments demonstrate robust, accurate, and efficient multi-view human reconstruction in challenging real-world scenarios.
- Abstract(参考訳): マルチビュー・ヒューマン・リコンストラクションは、簡易な設定で広く研究されてきたが、制約のない環境下での堅牢で効率的なマルチパーソン・リコンストラクションは依然として困難である。
既存のボトムアップ法は、しばしば正確なカメラキャリブレーションと明示的なクロスビューマッチングに依存しているため、厳密な閉塞と曖昧さに悩まされる。
本稿では,カメラキャリブレーション,クロスビューアソシエーション,およびクロスモーダルコントラスト学習による人間再構築を実現するため,統合されたインスタンス中心の3D空間を維持するための新しいトップダウンパラダイムを提案する。
複数のビューからの観察は、この共有された3D空間に持ち上げられ、幾何学的構造、視覚的外観、人間中心のセマンティックキューがインスタンスレベルで共同で符号化される。
さらに、異なる視点とモダリティにまたがって、同じ人間のインスタンスに対応する3次元特徴を、異なるインスタンスを分離しながら整列する空間的コントラスト学習戦略を導入する。
これにより、対応推論、セマンティックアグリゲーション、インスタンス識別を3Dでネイティブに行うことができ、厳密な閉塞下でのクロスビューの一貫性と堅牢性を向上させることができる。
最後に、SMPLパラメータをインスタンスレベルの3Dトークンから回帰することで、構造化された人体モデルをフィードフォワード形式で復元する。
大規模な実験は、実世界の挑戦的なシナリオにおいて、堅牢で正確で効率的なマルチビューの人間再構成を実証する。
関連論文リスト
- DisPOSE: Projected Polystochastic Diffusion for Self-Supervised Multi-View 3D Human Pose Estimation [58.47973015036709]
DisPOSEは、本質的に離散的な多視点人物割り当て問題を近似する自己教師型フレームワークである。
特定可能なシンクホーン射影を用いることにより、本モデルは有効かつ実現可能な課題への解の導出を学ぶ。
提案手法は、標準データセット上での最先端の自己教師手法よりも優れている。
論文 参考訳(メタデータ) (2026-06-05T16:14:39Z) - AHAP: Reconstructing Arbitrary Humans from Arbitrary Perspectives with Geometric Priors [81.50960055126156]
任意のカメラ視点から任意の人間を再構築するためのフィードフォワードフレームワークである textbfAHAP を提案する。
私たちの中核は、人間同士の結びつき、再構築、局在化を支援するために、多視点幾何学を効果的に融合することにあります。
Human Headは、SMPL予測のためのクロスビュー機能とシーンコンテキストを融合し、ボディポーズの一貫性を強制するために、クロスビューの再投影損失によってガイドされる。
論文 参考訳(メタデータ) (2026-02-27T11:53:45Z) - InpaintHuman: Reconstructing Occluded Humans with Multi-Scale UV Mapping and Identity-Preserving Diffusion Inpainting [64.42884719282323]
InpaintHumanは、モノクロビデオから高忠実で完全でアニマタブルなアバターを生成する新しい方法である。
我々のアプローチは、アイデンティティの忠実性を保証するために、直接ピクセルレベルの監視を採用する。
論文 参考訳(メタデータ) (2026-01-05T13:26:02Z) - HumanCrafter: Synergizing Generalizable Human Reconstruction and Semantic 3D Segmentation [51.27178551863772]
本研究では,1つの画像から外見と人間部分のセマンティクスをモデリングする統合的なフレームワークを提案する。
HumanCrafterは、3Dの人間の部分分割と1枚の画像からの3Dの人間の再構築の両方において、既存の最先端の手法を超越している。
論文 参考訳(メタデータ) (2025-11-01T09:29:36Z) - CHROME: Clothed Human Reconstruction with Occlusion-Resilience and Multiview-Consistency from a Single Image [37.16845070245751]
我々は,1つの隠蔽画像から複数視点の整合性を持つ3次元人体を再構成するための新しいパイプラインを提案する。
そして、3次元再構成モデルを用いて、隠蔽された入力と合成されたビューの両方に条件付き3次元ガウスの集合を予測する。
新規なビュー合成(最大3dbPSNR)と、挑戦的な条件下での幾何学的再構成の両方において、大幅な改善が達成されている。
論文 参考訳(メタデータ) (2025-03-19T19:56:18Z) - Progressive Multi-view Human Mesh Recovery with Self-Supervision [68.60019434498703]
既存のソリューションは通常、新しい設定への一般化性能の低下に悩まされる。
マルチビューヒューマンメッシュリカバリのためのシミュレーションに基づく新しいトレーニングパイプラインを提案する。
論文 参考訳(メタデータ) (2022-12-10T06:28:29Z) - Multi-person Implicit Reconstruction from a Single Image [37.6877421030774]
本稿では,1つの画像から複数の人物の詳細な空間的コヒーレントな再構築を実現するための新しいエンドツーエンド学習フレームワークを提案する。
既存のマルチパーソンメソッドは、モデルベースで、ゆるい服と髪の人々の正確な3dモデルをキャプチャできないことが多いという、2つの大きな欠点を抱えている。
論文 参考訳(メタデータ) (2021-04-19T13:21:55Z) - HMOR: Hierarchical Multi-Person Ordinal Relations for Monocular
Multi-Person 3D Pose Estimation [54.23770284299979]
本稿では, 階層型多人数常連関係(HMOR)を新たに導入する。
HMORは相互作用情報を階層的に深さと角度の順序関係として符号化する。
統合トップダウンモデルは、学習プロセスにおけるこれらの順序関係を活用するように設計されている。
提案手法は, 公開されている多人数の3Dポーズデータセットにおいて, 最先端の手法を著しく上回っている。
論文 参考訳(メタデータ) (2020-08-01T07:53:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。