論文の概要: GenFusion: Feed-forward Human Performance Capture via Progressive Canonical Space Updates
- arxiv url: http://arxiv.org/abs/2603.28997v1
- Date: Mon, 30 Mar 2026 20:55:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:02.85946
- Title: GenFusion: Feed-forward Human Performance Capture via Progressive Canonical Space Updates
- Title(参考訳): GenFusion: プログレッシブな標準空間更新によるフィードフォワードヒューマンパフォーマンスキャプチャ
- Abstract要約: 単眼のRGBストリームからパフォーマーの新たなビューを描画するフィードフォワード人間パフォーマンスキャプチャ手法を提案する。
我々は、各フレームで徐々に更新される標準空間を維持することで、より多くのボディパーツが観測可能であるという事実を生かしている。
この標準空間は、時間とともに外観情報を蓄積し、現在のライブフレームに直接観測が欠落している場合にコンテキストバンクとして機能する。
- 参考スコア(独自算出の注目度): 17.25826599799299
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a feed-forward human performance capture method that renders novel views of a performer from a monocular RGB stream. A key challenge in this setting is the lack of sufficient observations, especially for unseen regions. Assuming the subject moves continuously over time, we take advantage of the fact that more body parts become observable by maintaining a canonical space that is progressively updated with each incoming frame. This canonical space accumulates appearance information over time and serves as a context bank when direct observations are missing in the current live frame. To effectively utilize this context while respecting the deformation of the live state, we formulate the rendering process as probabilistic regression. This resolves conflicts between past and current observations, producing sharper reconstructions than deterministic regression approaches. Furthermore, it enables plausible synthesis even in regions with no prior observations. Experiments on in-domain (4D-Dress) and out-of-distribution (MVHumanNet) datasets demonstrate the effectiveness of our approach.
- Abstract(参考訳): 単眼のRGBストリームからパフォーマーの新たなビューを描画するフィードフォワード人間パフォーマンスキャプチャ手法を提案する。
この設定における重要な課題は、特に目に見えない領域において、十分な観測の欠如である。
被写体が時間とともに連続的に動き続けると仮定すると、各フレームで徐々に更新される標準空間を維持することにより、より多くの身体部分が観測可能であるという事実を利用する。
この標準空間は、時間とともに外観情報を蓄積し、現在のライブフレームに直接観測が欠落している場合にコンテキストバンクとして機能する。
実状態の変形を尊重しながら、この文脈を効果的に活用するために、レンダリングプロセスを確率回帰として定式化する。
これは過去の観測と現在の観測の矛盾を解消し、決定論的回帰アプローチよりもよりシャープな再構成を生み出す。
さらに、事前の観測のない領域でも、可塑性合成が可能となる。
ドメイン内(4D-Dress)およびアウト・オブ・ディストリビューション(MVHumanNet)データセットの実験は、我々のアプローチの有効性を実証している。
関連論文リスト
- L2A: Learning to Accumulate Pose History for Accurate 3D Human Pose Estimation [15.020290085816583]
既存の2D-3Dリフトヒトポーズ推定法は高い性能を達成している。
しかし,ネットワーク深度にまたがる歴史的ポーズ表現の利用は見過ごされた。
ネットワーク間履歴の特徴を効果的に活用するための履歴認識フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-09T08:48:20Z) - VFMF: World Modeling by Forecasting Vision Foundation Model Features [67.09340259579761]
本稿では,視覚基礎モデルの特徴空間における自己回帰フローマッチングを行う生成予測器を提案する。
この潜伏情報の方がPCAベースの代替案よりも効果的であることを示す。
一致したアーキテクチャと計算により、本手法はすべてのモダリティにおける回帰よりもシャープで正確な予測を生成する。
論文 参考訳(メタデータ) (2025-12-12T02:10:05Z) - Kinaema: a recurrent sequence model for memory and pose in motion [25.677034515160567]
我々は,潜在的に大きなシーンで移動しながら,視覚的観察の流れを統合できる新しいモデルであるキナマとエージェントを導入する。
我々のモデルは観測履歴を明示的に保存しないので、文脈長に厳しい制約はない。
我々の大容量リカレントモデルでは、シーンの有用な表現を維持し、実際のエピソード開始前に観測されたゴールにナビゲートし、計算効率がよいことを示す。
論文 参考訳(メタデータ) (2025-10-23T06:34:53Z) - StateSpaceDiffuser: Bringing Long Context to Diffusion World Models [52.92249035412797]
本稿では、状態空間モデルから機能を統合することで、拡散モデルが長時間コンテキストタスクの実行を可能にするStateSpaceDiffuserを紹介する。
この設計は拡散モデルの高忠実性合成を保ちながら長期記憶を復元する。
論文 参考訳(メタデータ) (2025-05-28T11:27:54Z) - A Study of Posterior Stability for Time-Series Latent Diffusion [59.41969496514184]
まず,後部崩壊により可変オートエンコーダ(VAE)への潜伏拡散が減少し,表現性が低下することを示す。
次に、入力変数に対するリカレントデコーダの感度を定量化する、依存性測度という原則的手法を導入する。
理論的および実証的研究に基づいて,潜伏拡散を延長し,後部が安定な新しい枠組みを導入する。
論文 参考訳(メタデータ) (2024-05-22T21:54:12Z) - Rethinking Efficient and Effective Point-based Networks for Event Camera Classification and Regression: EventMamba [11.400397931501338]
イベントカメラは生物学的システムからインスピレーションを受け、低レイテンシと高ダイナミックレンジを持ち、最小限の電力を消費する。
Event Cloudの処理に対する現在のアプローチは、フレームベースの表現に変換することが多い。
我々はPoint Cloud表現に基づく効率的かつ効果的なフレームワークであるEventMambaを提案する。
論文 参考訳(メタデータ) (2024-05-09T21:47:46Z) - STARFlow: Spatial Temporal Feature Re-embedding with Attentive Learning for Real-world Scene Flow [5.476991379461233]
両ユークリッド空間における全点対に一致する大域的注意流埋め込みを提案する。
我々は、新しいドメイン適応損失を利用して、合成から実世界への動き推論のギャップを埋める。
提案手法は,実世界のLiDARスキャンデータセットにおいて特に顕著な結果を得て,各種データセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-03-11T04:56:10Z) - Streaming Factor Trajectory Learning for Temporal Tensor Decomposition [33.18423605559094]
時相テンソル分解のためのストリーム係数軌道学習を提案する。
我々はガウス過程(GP)を用いて因子の軌道をモデル化し、その時間的進化を柔軟に推定する。
合成タスクと実世界のアプリケーションの両方において、SFTLの利点を示してきた。
論文 参考訳(メタデータ) (2023-10-25T21:58:52Z) - Reconstructing Spatiotemporal Data with C-VAEs [49.1574468325115]
移動領域の条件付き連続表現は一般的に用いられる。
本研究では,条件変数自動エンコーダ(C-VAE)モデルを用いて,領域の進化を現実的に表現する機能について検討する。
論文 参考訳(メタデータ) (2023-07-12T15:34:10Z) - Inverse Dynamics Pretraining Learns Good Representations for Multitask
Imitation [66.86987509942607]
このようなパラダイムを模倣学習でどのように行うべきかを評価する。
本稿では,事前学習コーパスがマルチタスクのデモンストレーションから成り立つ環境について考察する。
逆動力学モデリングはこの設定に適していると主張する。
論文 参考訳(メタデータ) (2023-05-26T14:40:46Z) - Multi-level Motion Attention for Human Motion Prediction [132.29963836262394]
本研究は, 関節, 身体部分, フルポーズレベルなど, 異なる種類の注意力の使用について検討した。
我々は,Human3.6M,AMASS,3DPWを用いて,周期的および非周期的両方の行動に対するアプローチの利点を検証した。
論文 参考訳(メタデータ) (2021-06-17T08:08:11Z) - Crop Classification under Varying Cloud Cover with Neural Ordinary
Differential Equations [23.93148719731374]
作物分類の最先端の手法は、観測間の時間間隔を暗黙的に仮定する手法に依存している。
本稿では,ニューラル常微分方程式 (NODE) とリカレントニューラルネットワーク (RNN) を組み合わせることで,不規則に空間化された画像列における作物の種類を分類することを提案する。
論文 参考訳(メタデータ) (2020-12-04T11:56:50Z) - Latent World Models For Intrinsically Motivated Exploration [140.21871701134626]
画像に基づく観察のための自己教師付き表現学習法を提案する。
我々は、部分的に観測可能な環境の探索を導くために、エピソードおよび寿命の不確実性を考慮する。
論文 参考訳(メタデータ) (2020-10-05T19:47:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。