論文の概要: FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head
- arxiv url: http://arxiv.org/abs/2607.20922v1
- Date: Thu, 23 Jul 2026 04:57:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.291078
- Title: FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head
- Title(参考訳): FA-LAM:ワンショット4Dアニマタブルガウスヘッドのための焦点対応大型アバターモデル
- Authors: Yingdong Hu, Yisheng He, Yiming Jiang, Zehong Lin, Steven Hoi, Jun Zhang,
- Abstract要約: FA-LAMは1ショットのアニマタブルガウスヘッド作成のためのフォーカス対応大型アバターモデルである。
我々は,大画面幻覚とアニメーションのモデル機能を分離した,新しい2相学習パイプラインを開発した。
我々は,マルチビューとストリーミング4D再構成を効率的かつメモリフレンドリーな方法でサポートするモデルを強化した。
- 参考スコア(独自算出の注目度): 17.360653071975936
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose FA-LAM, a Focus-Aware Large Avatar Model for one-shot animatable Gaussian head creation, while simultaneously enabling static 3D and dynamic 4D full-head recovery. The core of our method lies in a thorough analysis of the attention mechanisms and the entangled reconstruction and animation training pipeline adopted by prior state-of-the-art approaches. Our analysis identifies two main factors that compromise the quality of 3D full-head generation: (1) incorrect and noisy attention activations, and (2) conflicts between the tasks of reconstruction and animation. To address the first issue, we introduce a symmetric and semantic attention regularization strategy that leverages the inherent semantics and structural symmetry of human heads. To disentangle the objectives of reconstruction and animation, we develop a novel dual-phase training pipeline that separates the model's capabilities for large-view hallucination and animation into distinct modules. Moreover, we enhance our model to support multi-view and streaming 4D reconstruction in an efficient and memory-friendly manner through a core autoregressive modification with tailored visibility-aware token fusion. Collectively, these innovations enable FA-LAM to reconstruct animatable Gaussian full heads with superior quality, particularly in fine facial regions and large viewing angles.
- Abstract(参考訳): FA-LAM(Focus-Aware Large Avatar Model for one-shot animatable Gaussian head creation)を提案する。
提案手法のコアとなるのは,注意機構の徹底的な解析と,従来の最先端手法に取り入れられた絡み合った再構築とアニメーション訓練パイプラインである。
本分析では,3次元フルヘッド生成の質を損なう要因として,(1)不正確でノイズの多い注意喚起,(2)再建作業とアニメーションの相違,の2つを同定した。
最初の課題に対処するために、人間の頭の構造的意味と構造的対称性を利用する対称的・意味的注意規則化戦略を導入する。
再構成とアニメーションの目的を解消するために,大規模幻覚とアニメーションのモデル能力を異なるモジュールに分割する,新しい2相学習パイプラインを開発した。
さらに,マルチビューとストリーミング4D再構成を,高効率かつメモリフレンドリな方法でサポートするために,最適化された可視性トークン融合を用いたコア自己回帰修正を行った。
これらの革新により、FA-LAMは優れた品質、特に細かい顔領域と大きな視角で、アニマタブルなガウスのフルヘッドを再構築することができる。
関連論文リスト
- ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video [51.951128822418774]
ReViVは、総合的なエゴセントリックな4D再構成のためのフレームワークである。
Masked Generative Egocentric Transformerにより、ReViVは単一のフィードフォワードアーキテクチャ内で動作する。
論文 参考訳(メタデータ) (2026-07-20T10:22:53Z) - FFAvatar: Feed-Forward 4D Head Avatar Reconstruction from Sparse Portrait Images [14.13683759834114]
高品質でアニマタブルな4Dヘッドアバターを高速に構築するためのトランスフォーマーベースの3次元ガウスフレームワークであるFFAvatarを提案する。
視覚的忠実度と計算効率のバランスをとるために,スパース・トゥ・ディエンス学習パラダイムを導入する。
実験により、FFAvatarは効率よく高忠実で制御可能な4Dヘッドアバターを生産することが示された。
論文 参考訳(メタデータ) (2026-06-29T14:21:33Z) - Hand-4DGS: Feed-Forward 3D Gaussian Splatting for 4D Hand Reconstruction from Egocentric Videos [54.612320509347825]
我々は,エゴセントリックビデオから直接動的4Dハンドを再構築するための最初のフィードフォワードフレームワークであるHand-4DGSを紹介する。
提案手法は,動的運動をモデル化するために,構造的先行と時間的畳み込みのためのメッシュ誘導表現を取り入れている。
論文 参考訳(メタデータ) (2026-06-17T14:58:37Z) - GSwap: Realistic Head Swapping with Dynamic Neural Gaussian Field [66.31636070843516]
GSwapは一貫したリアルなビデオヘッドスワッピングシステムで、ダイナミック・ニューラル・ガウシアン・ポートレートによって強化されている。
GSwapは、視覚的品質、時間的コヒーレンス、アイデンティティの保存、3D整合性など、様々な面で既存の手法を超越している。
論文 参考訳(メタデータ) (2026-03-24T13:11:25Z) - UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework [54.337290937468175]
統合された枠組み内での2次元映像と3次元映像の協調モデリングのための自己回帰モデルUniMoを提案する。
本手法は,正確なモーションキャプチャを行いながら,対応する映像と動きを同時に生成することを示す。
論文 参考訳(メタデータ) (2025-12-03T16:03:18Z) - Puppeteer: Rig and Animate Your 3D Models [105.11046762553121]
Puppeteerは、さまざまな3Dオブジェクトの自動リギングとアニメーションの両方に対処する包括的なフレームワークである。
本システムはまず, 自己回帰変換器を用いて, 可塑性骨格構造を推定する。
その後、注意に基づくアーキテクチャにより、皮膚の重量を推定する。
論文 参考訳(メタデータ) (2025-08-14T17:59:31Z) - LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds [21.99354901986186]
フィードフォワードパスで3次元ガウススプラッティングを表現した高忠実度アバターを推定するためのLHM(Large Animatable Human Reconstruction Model)を提案する。
本モデルでは,マルチモーダルトランスフォーマーアーキテクチャを用いて,人体の位置や画像の特徴を効果的に符号化する。
我々のLHMは、顔と手を後処理することなく、数秒で可塑性アニマタブルな人間を生成し、再現精度と一般化能力の両方において既存の手法より優れています。
論文 参考訳(メタデータ) (2025-03-13T17:59:21Z) - EgoGaussian: Dynamic Scene Understanding from Egocentric Video with 3D Gaussian Splatting [95.44545809256473]
エゴガウスアン(EgoGaussian)は、3Dシーンを同時に再構築し、RGBエゴセントリックな入力のみから3Dオブジェクトの動きを動的に追跡する手法である。
動的オブジェクトと背景再構築の品質の両面で,最先端技術と比較して大きな改善が見られた。
論文 参考訳(メタデータ) (2024-06-28T10:39:36Z) - HeadRecon: High-Fidelity 3D Head Reconstruction from Monocular Video [37.53752896927615]
任意のモノクラービデオから高忠実度3Dヘッドモデルの再構成について検討する。
本稿では,これらの問題に対処するために,事前誘導型動的暗黙的ニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2023-12-14T12:38:56Z) - InvertAvatar: Incremental GAN Inversion for Generalized Head Avatars [40.10906393484584]
本稿では,複数フレームからの忠実度向上を目的としたアルゴリズムを用いて,アバター復元性能を向上させる新しいフレームワークを提案する。
本アーキテクチャでは,画素対応画像-画像変換を重要視し,観測空間と標準空間の対応を学習する必要性を緩和する。
提案手法は,1ショットと数ショットのアバターアニメーションタスクにおける最先端の性能を示す。
論文 参考訳(メタデータ) (2023-12-03T18:59:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。