論文の概要: Follow Your Track: Precise Skeleton Animation Controlled by 3D Trajectories
- arxiv url: http://arxiv.org/abs/2606.25344v1
- Date: Wed, 24 Jun 2026 03:18:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.202369
- Title: Follow Your Track: Precise Skeleton Animation Controlled by 3D Trajectories
- Title(参考訳): トラックをフォローする:3Dトラジェクトリーで制御された精密な骨格アニメーション
- Abstract要約: 4Dジェネレーションは、3Dオブジェクトをリアルなモーションでアニメーション化することを目的としており、アプリケーションには大きな可能性を秘めている。
既存の方法は通常、モーション合成から3Dアセット生成を分離する。
トポロジ一般骨格アニメーションのための軌道条件付きフレームワークである textttACT について述べる。
- 参考スコア(独自算出の注目度): 93.39170866007431
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 4D generation aims to animate 3D objects with realistic motion, holding great promise for applications. Existing methods typically decouple 3D asset generation from motion synthesis: acquire a 3D asset, prepare a structural representation like mesh and Gaussians, and synthesize motion from text or video control signals. However, dense mesh and Gaussian representations incur high computational costs and are prone to temporal artifacts, limiting animation quality and duration to only short clips. Meanwhile, text lacks fine-grained spatial and temporal details such as timing and coordination, while video entangles motion with appearance and background. Together, these limitations result in 4D animations that suffer from poor temporal consistency, wrong identification, and limited controllability. We address these issues with \texttt{ACT}, a trajectory-conditioned framework for topology-general skeletal animation. ACT uses skeletons as a compact structured and compute-efficient representation and 3D point trajectories from monocular video as explicit motion guidance which provide detailed motion patterns without appearance entanglement. At the core of ACT is a Routed Trajectory Injector, which achieves accurate and robust trajectory-to-joint transfer through three complementary designs: prior-guided hard routing establishes precise skeleton-to-mesh correspondences, global routing enables holistic joint-track interaction for full-body motion awareness, and local windowed cross-attention enforces fine-grained temporal alignment, improving micro-timing and reducing motion misalignment across varying motion rates. Extensive experiments demonstrate that \texttt{ACT} significantly outperforms existing methods in fidelity and temporal consistency.
- Abstract(参考訳): 4Dジェネレーションは、3Dオブジェクトをリアルなモーションでアニメーション化することを目的としており、アプリケーションには大きな可能性を秘めている。
既存の方法では、モーション合成から3Dアセット生成を分離し、3Dアセットを取得し、メッシュやガウスのような構造表現を作成し、テキストやビデオ制御信号からモーションを合成する。
しかし、高密度メッシュとガウス表現は計算コストが高く、時間的アーティファクトの傾向があり、アニメーションの品質と期間は短いクリップに限られる。
一方、テキストはタイミングや調整などの微妙な空間的・時間的詳細を欠き、ビデオは外見や背景と動きを絡み合わせる。
これらの制限により、4Dアニメーションは時間的一貫性の低下、識別の誤り、制御可能性の制限に悩まされる。
トポロジ一般骨格アニメーションのための軌道条件付きフレームワークである texttt{ACT} を用いてこれらの問題に対処する。
ACTは、スケルトンをコンパクトで計算効率のよい表現として、モノクロビデオからの3Dポイントトラジェクトリを明示的なモーションガイダンスとして使用し、外見の絡みのない詳細な動きパターンを提供する。
事前誘導ハードルーティングは正確な骨格間対応を確立し、グローバルルーティングはフルボディの運動認識のための全体的ジョイントトラックインタラクションを可能にし、ローカルウィンドウのクロスアテンションは微妙な時間的アライメントを強制し、微調整を改善し、動きの微調整を改善する。
大規模な実験により、 texttt{ACT} は既存手法の忠実性と時間的整合性を著しく上回ることを示した。
関連論文リスト
- BLARM: Animating 3D Objects from Video via Blending Latent Rigid Motion Primitives [14.13122283409208]
BLARMはビデオに追従する時間的コヒーレントなアニメーションメッシュを予測する。
学習した時間変化のある剛体動き成分のコンパクトな集合を用いてアニメーションを表現する。
BLARMは、モノクロビデオからコンパクトで解釈可能なモーション構造を復元しながら、正確で時間的に安定したアニメーションを生成する。
論文 参考訳(メタデータ) (2026-08-31T17:21:54Z) - AnimaSpark: A Feed-Forward Method for Animating Arbitrary 3D Objects [9.201202105097991]
カテゴリーに依存しないアニメーション生成の現在の手法は、推論速度、運動品質、テキストプロンプトへの付着に限界がある。
本稿では,カテゴリに依存しない3Dアニメーション生成のための新しいパイプラインであるAnimaSparkを紹介する。
本手法は,テキスト・モーションアライメント,動きの質,計算効率など,従来の最先端技術よりも優れた性能を実現する。
論文 参考訳(メタデータ) (2026-06-09T15:25:39Z) - Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence [16.685702628989212]
Tora3は、物体軌跡を共有キネマティック先行として使用することにより、物理的コヒーレンスを改善する軌道誘導型AV生成フレームワークである。
具体的には、トラジェクティブ・アラインメントの動画表現と、トラジェクトリから導出される2次運動状態によって駆動されるキネマティック・オーディオアライメント・モジュールと、ハイブリッドフローマッチング・スキームを設計する。
大規模な実験により、Tora3は強力なオープンソースベースラインよりも動きリアリズム、動き音の同期、全体的なAV生成品質を改善していることが示された。
論文 参考訳(メタデータ) (2026-04-10T07:37:03Z) - IM-Animation: An Implicit Motion Representation for Identity-decoupled Character Animation [58.297199313494]
インプシット法は、動画から直接動作の意味をキャプチャするが、動作と外観の絡み合いやアイデンティティの漏洩に悩まされる。
本稿では,フレームごとの動作をコンパクトな1次元モーショントークンに圧縮する新しい暗黙の動作表現を提案する。
本手法では,3段階のトレーニング戦略を用いて,トレーニング効率を高め,高い忠実性を確保する。
論文 参考訳(メタデータ) (2026-02-07T11:17:20Z) - In-2-4D: Inbetweening from Two Single-View Images to 4D Generation [63.68181731564576]
Inbetween-2-4Dという,2枚のシングルビュー画像を補間する4次元(つまり3D + モーション)の生成問題を提案する。
テキストや1つの画像のみからの映像/4D生成とは対照的に、補間タスクはより正確なモーション制御を利用して生成をよりよく制約することができる。
論文 参考訳(メタデータ) (2025-04-11T09:01:09Z) - Tracktention: Leveraging Point Tracking to Attend Videos Faster and Better [61.381599921020175]
時間的一貫性は、出力が一貫性があり、アーティファクトがないことを保証するために、ビデオ予測において重要である。
時間的注意や3D畳み込みといった伝統的な手法は、重要な物体の動きに苦しむことがある。
本稿では,ポイントトラックを用いた動き情報を明示的に統合する新しいアーキテクチャコンポーネントであるトラックキート・レイヤを提案する。
論文 参考訳(メタデータ) (2025-03-25T17:58:48Z) - Exploring Vision Transformers for 3D Human Motion-Language Models with Motion Patches [12.221087476416056]
動き系列の新しい表現である「動きパッチ」を導入し、移動学習を通して視覚変換器(ViT)をモーションエンコーダとして用いることを提案する。
これらの動きパッチは、運動配列に基づく骨格関節の分割と分類によって作成され、様々な骨格構造に対して堅牢である。
2次元画像データを用いたトレーニングにより得られたViTの事前学習による伝達学習により,動作解析の性能が向上することが判明した。
論文 参考訳(メタデータ) (2024-05-08T02:42:27Z) - MotionBERT: A Unified Perspective on Learning Human Motion
Representations [46.67364057245364]
本研究では,大規模・異種データ資源から人の動き表現を学習することで,人間中心のビデオタスクに取り組むための統一的な視点を示す。
本研究では,ノイズのある部分的な2次元観測から基礎となる3次元運動を復元するために,モーションエンコーダを訓練する事前学習段階を提案する。
動作エンコーダをDST(Dual-stream Spatio-temporal Transformer)ニューラルネットワークで実装する。
論文 参考訳(メタデータ) (2022-10-12T19:46:25Z) - Exploring Optical-Flow-Guided Motion and Detection-Based Appearance for
Temporal Sentence Grounding [61.57847727651068]
テンポラルな文グラウンドディングは、与えられた文クエリに従って、意図しないビデオのターゲットセグメントをセマンティックにローカライズすることを目的としている。
これまでのほとんどの研究は、ビデオ全体のフレーム全体のフレームレベルの特徴を学習することに集中しており、それらをテキスト情報と直接一致させる。
我々は,光フロー誘導型モーションアウェア,検出ベース外観アウェア,3D認識オブジェクトレベル機能を備えた,動き誘導型3Dセマンティック推論ネットワーク(MA3SRN)を提案する。
論文 参考訳(メタデータ) (2022-03-06T13:57:09Z) - Spatiotemporal Bundle Adjustment for Dynamic 3D Human Reconstruction in
the Wild [49.672487902268706]
本稿では,カメラの時間的アライメントと3次元点三角測量を共同で推定する枠組みを提案する。
複数の無同期・無同期ビデオカメラで捉えたイベントにおいて、人間の身体の3次元運動軌跡を再構成する。
論文 参考訳(メタデータ) (2020-07-24T23:50:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。