論文の概要: SkelGen4D: Weakly-Supervised Skeleton-Based 4D Generation for Text-Driven Mesh Animation
- arxiv url: http://arxiv.org/abs/2607.08246v1
- Date: Thu, 09 Jul 2026 08:48:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.473104
- Title: SkelGen4D: Weakly-Supervised Skeleton-Based 4D Generation for Text-Driven Mesh Animation
- Title(参考訳): SkelGen4D:テキスト駆動メッシュアニメーションのための弱い改良された骨格に基づく4D生成
- Abstract要約: アニメーションとコンテンツ作成のための3次元幾何の時間的コヒーレントなシーケンスを合成する4D生成について検討する。
テキスト駆動メッシュアニメーションのための弱教師付きフィードフォワードフレームワークであるSkelGen4Dを提案する。
- 参考スコア(独自算出の注目度): 34.243362993499964
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study 4D generation to synthesize temporally coherent sequences of 3D geometry for animation and content creation. In contrast to existing SDS-based optimization methods and video-driven animation approaches, we adopt a skeleton-driven animation framework aligned with standard industrial pipelines, which enables explicit control and editing. To this end, we propose SkelGen4D, a weakly supervised feed-forward framework for text-driven mesh animation that generates explicit skeleton motions without requiring per-frame skeleton annotations. SkelGen4D first recovers temporally consistent pseudo-skeletons from animated meshes via differentiable fitting, and then generates text-conditioned skeleton motion sequences in a feed-forward manner, further refined with Motion-GRPO to ensure temporally coherent, physically plausible, and articulated animation. We evaluate our method on two large-scale benchmarks, Truebones Zoo and Diffusion4D. Our results show that our weakly supervised skeleton modeling matches or surpasses fully supervised baselines while scaling to diverse object categories for high-quality text-driven mesh animation. Further, our method supports flexible motion editing and is aligned with standard animation production pipelines.
- Abstract(参考訳): アニメーションとコンテンツ作成のための3次元幾何の時間的コヒーレントなシーケンスを合成する4D生成について検討する。
既存のSDSベースの最適化手法やビデオ駆動型アニメーション手法とは対照的に,我々は,明示的な制御と編集を可能にする,標準的な産業用パイプラインに合わせたスケルトン駆動型アニメーションフレームワークを採用する。
そこで本研究では,フレーム単位のスケルトンアノテーションを必要とせず,明示的なスケルトン動作を生成するテキスト駆動メッシュアニメーションのための,弱教師付きフィードフォワードフレームワークであるSkelGen4Dを提案する。
SkelGen4Dは最初、アニメーションメッシュから異なるフィッティングによって時間的に一貫した擬似骨格を復元し、その後、フィードフォワード方式でテキストコンディショニングされた骨格の動きシーケンスを生成し、さらにMotion-GRPOで改良して、時間的に一貫性があり、物理的に可視であり、関節化されたアニメーションを確実にする。
本稿では,Truebones Zoo と Diffusion4D の2つの大規模ベンチマークで評価を行った。
この結果から,テキスト駆動メッシュアニメーションの多種多様なカテゴリにスケールしながら,弱教師付きスケルトンモデリングが完全に教師付きベースラインに適合しているか,あるいは超越しているかが判明した。
さらに、フレキシブルなモーション編集をサポートし、標準的なアニメーション制作パイプラインと整合する。
関連論文リスト
- AnimaSpark: A Feed-Forward Method for Animating Arbitrary 3D Objects [9.201202105097991]
カテゴリーに依存しないアニメーション生成の現在の手法は、推論速度、運動品質、テキストプロンプトへの付着に限界がある。
本稿では,カテゴリに依存しない3Dアニメーション生成のための新しいパイプラインであるAnimaSparkを紹介する。
本手法は,テキスト・モーションアライメント,動きの質,計算効率など,従来の最先端技術よりも優れた性能を実現する。
論文 参考訳(メタデータ) (2026-06-09T15:25:39Z) - MotionDreamer: Universal Skeletal Motion Generation for 3D Rigged Shapes [52.45449797329548]
MotionDreamerは、2Dビデオガイダンスからカテゴリに依存しない骨格アニメーションを生成するための拡散ベースのフレームワークである。
本研究では,2次元視覚運動キューとヘテロジニアスな3次元骨格構造とのギャップを埋める構造的意味注入機構を提案する。
提案手法は既存の手法を著しく上回り、堅牢で効率的な4Dアセット生成のための最先端のベンチマークを新たに設定する。
論文 参考訳(メタデータ) (2026-06-01T00:42:31Z) - Stroke3D: Lifting 2D strokes into rigged 3D model via latent diffusion models [53.32092058519587]
Stroke3Dは、ユーザ入力から2D描画ストロークと記述テキストプロンプトを直接生成する新しいフレームワークである。
私たちの知識を最大限に活用するために、私たちの研究は、ユーザ引き起こされた2Dストロークに条件付けされたトリグされた3Dメッシュを初めて生成しました。
論文 参考訳(メタデータ) (2026-02-10T12:17:00Z) - ShapeGen4D: Towards High Quality 4D Shape Generation from Videos [85.45517487721257]
ビデオからエンドツーエンドに1つの動的3次元表現を合成する,ネイティブなビデオから4次元の形状生成フレームワークを提案する。
本手法は,フレームごとの最適化を行なわずに,非剛性運動,体積変化,および位相遷移を正確にキャプチャする。
論文 参考訳(メタデータ) (2025-10-07T17:58:11Z) - Puppeteer: Rig and Animate Your 3D Models [105.11046762553121]
Puppeteerは、さまざまな3Dオブジェクトの自動リギングとアニメーションの両方に対処する包括的なフレームワークである。
本システムはまず, 自己回帰変換器を用いて, 可塑性骨格構造を推定する。
その後、注意に基づくアーキテクチャにより、皮膚の重量を推定する。
論文 参考訳(メタデータ) (2025-08-14T17:59:31Z) - AnimateAnyMesh: A Feed-Forward 4D Foundation Model for Text-Driven Universal Mesh Animation [57.199352741915625]
本稿では,任意の3Dメッシュの効率的なテキスト駆動アニメーションを可能にする最初のフィードフォワードフレームワークであるAnimateAnyMeshを紹介する。
我々のアプローチは、動的メッシュシーケンスを効果的に圧縮し再構成する新しいDyMeshVAEアーキテクチャを活用する。
また、DyMeshデータセットにもコントリビュートし、テキストアノテーション付き4M以上の動的メッシュシーケンスを格納しています。
論文 参考訳(メタデータ) (2025-06-11T17:55:16Z) - CT4D: Consistent Text-to-4D Generation with Animatable Meshes [53.897244823604346]
我々は,任意のユーザ供給プロンプトから一貫した4Dコンテンツを生成するために,アニマタブルメッシュを直接操作するCT4Dという新しいフレームワークを提案する。
我々のフレームワークは、テキスト整列メッシュの作成を強化するために、ユニークなGenerate-Refine-Animate (GRA)アルゴリズムを組み込んでいる。
定性的かつ定量的な実験結果から,我々のCT4Dフレームワークは,フレーム間の整合性の維持とグローバルジオメトリの保存において,既存のテキスト・ツー・4D技術を超えていることが示された。
論文 参考訳(メタデータ) (2024-08-15T14:41:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。