論文の概要: OpenT2M: No-frill Motion Generation with Open-source,Large-scale, High-quality Data
- arxiv url: http://arxiv.org/abs/2603.18623v1
- Date: Thu, 19 Mar 2026 08:43:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.037889
- Title: OpenT2M: No-frill Motion Generation with Open-source,Large-scale, High-quality Data
- Title(参考訳): OpenT2M: オープンソース,大規模,高品質なデータによるフリールフリーモーション生成
- Authors: Bin Cao, Sipeng Zheng, Hao Luo, Boyuan Li, Jing Liu, Zongqing Lu,
- Abstract要約: テキスト・トゥ・モーション(T2M)生成は、テキスト記述からリアルな人間の動きを作り出すことを目的としている。
現在のT2Mモデルは、小さなスケールと既存の動きデータセットの多様性が制限されているため、目に見えないテキスト記述では不十分である。
OpenT2MとMonoFrillは、長年のデータ品質とベンチマークの課題に対処することによって、T2Mフィールドを前進させる。
- 参考スコア(独自算出の注目度): 32.853640288433304
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-motion (T2M) generation aims to create realistic human movements from text descriptions, with promising applications in animation and robotics. Despite recent progress, current T2M models perform poorly on unseen text descriptions due to the small scale and limited diversity of existing motion datasets. To address this problem, we introduce OpenT2M, a million-level, high-quality, and open-source motion dataset containing over 2800 hours of human motion. Each sequence undergoes rigorous quality control through physical feasibility validation and multi-granularity filtering, with detailed second-wise text annotations. We also develop an automated pipeline for creating long-horizon sequences, enabling complex motion generation. Building upon OpenT2M, we introduce MonoFrill, a pretrained motion model that achieves compelling T2M results without complicated designs or technique tricks as "frills". Its core component is 2D-PRQ, a novel motion tokenizer that captures spatiotemporal dependencies by dividing the human body into biology parts. Experiments show that OpenT2M significantly improves generalization of existing T2M models, while 2D-PRQ achieves superior reconstruction and strong zero-shot performance. We expect OpenT2M and MonoFrill will advance the T2M field by addressing longstanding data quality and benchmarking challenges.
- Abstract(参考訳): テキスト・トゥ・モーション(T2M)生成は、テキスト記述からリアルな人間の動きを作り出すことを目的としており、アニメーションやロボティクスに有望な応用が期待できる。
最近の進歩にもかかわらず、現在のT2Mモデルは、小さなスケールと既存の動きデータセットの多様性の制限により、目に見えないテキスト記述では不十分である。
この問題に対処するために、100万レベル、高品質、オープンソースのモーションデータセットであるOpenT2Mを紹介します。
各シーケンスは、物理的実現可能性検証と多粒度フィルタリングを通じて厳密な品質制御を行う。
我々はまた、複雑な動きを生成するために、長い水平列を生成するための自動パイプラインも開発している。
OpenT2MをベースとしたMonoFrillは,複雑な設計やテクニックのトリックを使わずに,魅力的なT2M結果を実現する,事前訓練されたモーションモデルである。
コアコンポーネントである2D-PRQは、人体を生物学的部分に分割することで時空間依存を捉える新しいモーショントークンである。
実験の結果、OpenT2Mは既存のT2Mモデルの一般化を著しく改善し、2D-PRQは優れた再構成と強力なゼロショット性能を実現していることがわかった。
OpenT2MとMonoFrillは、長年のデータ品質とベンチマークの課題に対処することによって、T2M分野を前進させることを期待しています。
関連論文リスト
- Toward Rich Video Human-Motion2D Generation [16.58311138197227]
本稿では,15万本のビデオシーケンスからなる大規模リッチビデオモーション2Dデータセット(Motion2D-Video-150K)を紹介する。
Motion2D-Video-150Kは多様な単一文字のバランスの取れた分布を特徴としている。
拡散型リッチビデオモーション2D生成モデル(RVHM2D)を提案する。
論文 参考訳(メタデータ) (2025-06-17T11:45:33Z) - Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization [63.37161241355025]
Video-MSGはマルチモーダル計画と構造化雑音初期化に基づくT2V生成のトレーニング不要手法である。
ノイズインバージョンとデノベーションを通じて、ビデオスケッチで下流のT2V拡散モデルを導出する。
ビデオMSGは、推論時間にメモリを追加して微調整や注意操作を必要としないため、大きなT2Vモデルを採用するのが簡単である。
論文 参考訳(メタデータ) (2025-04-11T15:41:43Z) - EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models [73.96414072072048]
既存の動き伝達法は、ガイド生成のための参照ビデオの動作表現を探索した。
本稿では,ビデオモーション転送のための新しい,効率的なエンドツーエンドフレームワークであるEfficientMTを提案する。
我々の実験は, フレキシブルな動作制御性を維持しつつ, 既存の手法よりも効率が良いことを示した。
論文 参考訳(メタデータ) (2025-03-25T05:51:14Z) - Motion Anything: Any to Motion Generation [24.769413146731264]
Motion Anythingはマルチモーダルモーション生成フレームワークである。
我々のモデルは、テキストや音楽を含む多モード条件を適応的に符号化し、制御性を向上させる。
Text-Music-Danceデータセットは2,153対のテキスト、音楽、ダンスで構成されており、AIST++の2倍の大きさである。
論文 参考訳(メタデータ) (2025-03-10T06:04:31Z) - KETA: Kinematic-Phrases-Enhanced Text-to-Motion Generation via Fine-grained Alignment [5.287416596074742]
最先端のT2M技術は主に拡散モデルを利用してテキストプロンプトをガイダンスとして動作を生成する。
与えられたテキストを複数の分解されたテキストに分解するKETAを言語モデルを用いて提案する。
実験により、KETAはベースモデルの両バックボーン、モーション拡散モデルにおいて、最大1.19倍、2.34倍のR精度とFID値を達成することが示された。
論文 参考訳(メタデータ) (2025-01-25T03:43:33Z) - T2M-X: Learning Expressive Text-to-Motion Generation from Partially Annotated Data [6.6240820702899565]
既存の方法は、表情や手の動きを除いて、身体の動きデータのみを生成する。
このようなデータセットを作成しようとする最近の試みは、異なる身体部位間での運動の不整合をもたらす。
部分注釈付きデータから表現力のあるテキスト・ツー・モーション生成を学習する2段階の方法であるT2M-Xを提案する。
論文 参考訳(メタデータ) (2024-09-20T06:20:00Z) - FineMoGen: Fine-Grained Spatio-Temporal Motion Generation and Editing [56.29102849106382]
FineMoGenは拡散ベースのモーション生成および編集フレームワークである。
微細な動きを合成し、ユーザの指示に時空間の合成を施す。
FineMoGenはさらに、現代の大規模言語モデルの助けを借りて、ゼロショットモーション編集機能を可能にする。
論文 参考訳(メタデータ) (2023-12-22T16:56:02Z) - Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs [112.39389727164594]
テキスト・ツー・ビデオ(T2V)合成は,最近出現した拡散モデル (DM) が,過去のアプローチよりも有望な性能を示したコミュニティで注目を集めている。
既存の最先端のDMは高精細なビデオ生成を実現する能力があるが、ビデオ合成の要点である時間力学モデリングに関して重要な制限(例えば、アクション発生障害、粗雑なビデオ運動)に悩まされる。
本研究では,高品位T2V生成のためのDMの映像ダイナミックスに対する意識向上について検討する。
論文 参考訳(メタデータ) (2023-08-26T08:31:48Z) - SimDA: Simple Diffusion Adapter for Efficient Video Generation [102.90154301044095]
本稿では,強力なT2Iモデルの1.1Bパラメータのうち24Mしか微調整せず,パラメータ効率のよいビデオ生成に適応できる簡易拡散適応器(SimDA)を提案する。
野生でのT2V生成に加えて、SimDAは2分間のチューニングでワンショットビデオ編集にも使えるようになった。
論文 参考訳(メタデータ) (2023-08-18T17:58:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。