論文の概要: 3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement
- arxiv url: http://arxiv.org/abs/2606.30514v2
- Date: Wed, 01 Jul 2026 14:11:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.067599
- Title: 3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement
- Title(参考訳): カメラの動きを考慮した3次元シーン適応軌道制御型人体画像アニメーション
- Authors: Deyin Liu, Jicheng Xu, Lin Yuanbo Wu, Xiaowei Zhao, Xiatian Zhu, Zhe Jin, Anjan Dutta,
- Abstract要約: 映像生成のための再構成3次元環境において,人間の動作軌跡を制御できる3次元モーションアニメーションフレームワークを提案する。
我々は,視点適応型潜伏融合機構を設計し,映像視認性マスキングによる点-雲の幾何前兆を生成過程に注入する。
2つの標準的な人体画像アニメーションベンチマークデータセットによる実験は、関連する映像生成のメカティクスにおける芸術的状況に対する我々の手法の顕著な改善を実証している。
- 参考スコア(独自算出の注目度): 51.22216867938034
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Human image animation, which aims to generate a video of a reference subject following a provided action sequence, has received increasing research interest. With the development of diffusion-based/flow-based video foundation models, existing animation works have began to upgrade the guidance information from 2D skeleton/pose to 3D modeling conditions. Despite achieving reasonable results, these approaches face challenges in synthesizing trajectory-controllable human motion within natural scene under changed camera views. In this work, we present a scene-adaptive human image animation framework that controls both human motion and camera trajectories within a reconstructed 3D environment for video generation. To achieve this, we first develop a ground-adaptive 3D motion retargeting approach to enable user-friendly motion trajectory control adapting to the changes of elevations of ground and orientations automatically. Then we design a viewpoint-adaptive latent fusion mechanism to inject point-cloud geometric priors through scene-visibility masking into the generative process, providing precise guidance of viewpoint changes under camera control. Experiments on two standard human image animation benchmark datasets demonstrate remarkable improvements of our method over the state of the arts in related video generation metics. Project page: https://robinhood256100.github.io/web-disp
- Abstract(参考訳): 人間の画像アニメーションは、提供されたアクションシーケンスに従って参照対象のビデオを生成することを目的としており、研究の関心が高まっている。
拡散ベース/フローベースビデオ基盤モデルの開発により、既存のアニメーションは2Dスケルトン/目的から3Dモデリング条件へのガイダンス情報をアップグレードし始めている。
合理的な結果を得たにも拘わらず、これらのアプローチは、変化したカメラビューの下で自然のシーン内で軌道制御可能な人間の動きを合成する際の課題に直面している。
本研究では、映像生成のための再構成3D環境において、人間の動きとカメラ軌跡の両方を制御するシーン適応型ヒューマンイメージアニメーションフレームワークを提案する。
これを実現するために,まず,地上と方位の高度変化に適応したユーザフレンドリーな移動軌跡制御を実現するために,地上適応型3次元モーションリターゲティング手法を開発した。
次に,映像視認性マスキングによる視点適応型潜伏融合機構を設計し,カメラ制御下での視点変化の高精度なガイダンスを提供する。
2つの標準的な人体画像アニメーションベンチマークデータセットの実験は、関連ビデオ生成機構における最先端技術よりも、我々の手法の顕著な改善を実証している。
プロジェクトページ:https://robinhood256100.github.io/web-disp
関連論文リスト
- AnimaSpark: A Feed-Forward Method for Animating Arbitrary 3D Objects [9.201202105097991]
カテゴリーに依存しないアニメーション生成の現在の手法は、推論速度、運動品質、テキストプロンプトへの付着に限界がある。
本稿では,カテゴリに依存しない3Dアニメーション生成のための新しいパイプラインであるAnimaSparkを紹介する。
本手法は,テキスト・モーションアライメント,動きの質,計算効率など,従来の最先端技術よりも優れた性能を実現する。
論文 参考訳(メタデータ) (2026-06-09T15:25:39Z) - RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space [28.70181587812075]
本研究では,外見,背景,軌道からの動作を明示的に分離する枠組みを提案する。
本手法は,要素ワイド制御性と全映像品質の両面において,最先端性能を実現する。
論文 参考訳(メタデータ) (2025-08-12T03:02:23Z) - DreamJourney: Perpetual View Generation with Video Diffusion Models [91.88716097573206]
永続ビュー生成は、単一の入力画像からのみ任意のカメラ軌跡に対応する長期映像を合成することを目的としている。
近年の手法では、予め訓練されたテキスト・画像拡散モデルを用いて、カメラの動きに沿った未確認領域の新しいコンテンツを合成する。
本稿では,映像拡散モデルの世界シミュレーション能力を活用して,新たなシーンビュー生成タスクを起動する2段階フレームワークであるDreamJourneyを紹介する。
論文 参考訳(メタデータ) (2025-06-21T12:51:34Z) - Animating the Uncaptured: Humanoid Mesh Animation with Video Diffusion Models [71.78723353724493]
ヒューマノイド文字のアニメーションは、様々なグラフィックス応用において不可欠である。
入力された静的な3次元ヒューマノイドメッシュの4次元アニメーションシーケンスを合成する手法を提案する。
論文 参考訳(メタデータ) (2025-03-20T10:00:22Z) - Move-in-2D: 2D-Conditioned Human Motion Generation [54.067588636155115]
そこで我々は,シーンイメージに条件付けされた人間の動作シーケンスを生成する新しい手法であるMove-in-2Dを提案する。
本手法はシーンイメージとテキストプロンプトの両方を入力として受け入れ,シーンに合わせた動作シーケンスを生成する。
論文 参考訳(メタデータ) (2024-12-17T18:58:07Z) - Cinematic Behavior Transfer via NeRF-based Differentiable Filming [63.1622492808519]
既存のSLAM手法は動的シーンの制限に直面し、人間のポーズ推定はしばしば2次元投影に焦点を当てる。
まず,逆撮影行動推定手法を提案する。
次に,新しい2Dビデオや3D仮想環境に様々な撮影タイプを転送できる映像転送パイプラインを導入する。
論文 参考訳(メタデータ) (2023-11-29T15:56:58Z) - 3D Cinemagraphy from a Single Image [73.09720823592092]
3Dシネマグラフィー(3D Cinemagraphy)は、3D画像と2Dアニメーションを融合させる新しい技術である。
静止画1枚を入力として、視覚コンテンツアニメーションとカメラモーションの両方を含むビデオを生成することを目標としています。
論文 参考訳(メタデータ) (2023-03-10T06:08:23Z) - Physically Plausible Animation of Human Upper Body from a Single Image [41.027391105867345]
制御可能で動的に応答し,フォトリアリスティックな人間のアニメーションを生成する新しい方法を提案する。
本システムでは,画像空間におけるインタラクションを用いて,物理的に可視な上半身アニメーション(PUBA)を生成することができる。
論文 参考訳(メタデータ) (2022-12-09T09:36:59Z) - Action2video: Generating Videos of Human 3D Actions [31.665831044217363]
我々は、所定のアクションカテゴリから多様で自然な人間の動きのビデオを生成するという、興味深いが挑戦的な課題に取り組むことを目的としている。
重要な問題は、視覚的な外観で現実的な複数の異なる動き列を合成する能力にある。
Action2motionallyは、所定のアクションカテゴリのもっともらしい3Dポーズシーケンスを生成し、モーション2ビデオによって処理され、レンダリングされ、2Dビデオを形成する。
論文 参考訳(メタデータ) (2021-11-12T20:20:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。