論文の概要: XmoPipe: A Pipeline for Large-Scale In-the-Wild Human Motion Dataset Construction
- arxiv url: http://arxiv.org/abs/2606.20731v1
- Date: Wed, 17 Jun 2026 09:33:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 13:28:12.081562
- Title: XmoPipe: A Pipeline for Large-Scale In-the-Wild Human Motion Dataset Construction
- Title(参考訳): XmoPipe: 大規模In-the-Wildヒューマンモーションデータセット構築のためのパイプライン
- Authors: Nathan Salazar, Emmanuel Dellandréa, Mathieu Lefort, Alexandre Meyer,
- Abstract要約: 大規模人間の動きデータセットは、分析、合成、理解のための堅牢な動きモデルのトレーニングに不可欠である。
モノクロモーションキャプチャーとビデオ言語理解の最近の進歩は、オンラインビデオから可視モーションを抽出する方法を開く。
そこで本研究では,人間の動作データセットを構築するためのスケーラブルなパイプラインを提案する。
- 参考スコア(独自算出の注目度): 39.41824537790665
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large-scale human motion datasets are essential for training robust motion models for analysis, synthesis, and understanding. While marker-based motion capture provides precise data, it is costly and limited in scale and diversity. Recent advances in monocular motion capture and video-language understanding open the way to extract plausible motion from unconstrained online videos. We present a scalable pipeline for constructing in-the-wild human motion datasets. From a few keywords, the system retrieves videos, extracts 3D body and facial motion, and generates high-level textual descriptions. The pipeline is flexible, enabling targeted collection of various motions, multi-person interactions, or expressive behaviors. We demonstrate its quality by training motion reconstruction and motion generation models, showing performance comparable to models trained on traditional motion capture datasets and strong cross-dataset generalization.
- Abstract(参考訳): 大規模人間の動きデータセットは、分析、合成、理解のための堅牢な動きモデルのトレーニングに不可欠である。
マーカーベースのモーションキャプチャーは正確なデータを提供するが、コストが高く、スケールと多様性に制限がある。
モノクロモーションキャプチャーとビデオ言語理解の最近の進歩は、制約のないオンラインビデオから可塑性モーションを抽出する方法を開く。
そこで本研究では,人間の動作データセットを構築するためのスケーラブルなパイプラインを提案する。
いくつかのキーワードから、システムはビデオを取得し、3Dボディと顔の動きを抽出し、ハイレベルなテキスト記述を生成する。
パイプラインはフレキシブルで、さまざまな動作、複数対人インタラクション、表現的な動作を対象とするコレクションを可能にする。
従来のモーションキャプチャデータセットと強力なクロスデータセットの一般化に基づいてトレーニングされたモデルに匹敵する性能を示す。
関連論文リスト
- Kimodo: Scaling Controllable Human Motion Generation [77.66868439601062]
キモド(Kimodo)は、700時間の光学式モーションキャプチャーデータに基づいて訓練された、制御可能な運動拡散モデルである。
本モデルでは,テキストと包括的キネマティック制約によって制御し,高品質な動作を生成する。
論文 参考訳(メタデータ) (2026-03-16T17:09:30Z) - FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos [109.99404241220039]
大規模なモーションデータセットを構築する完全自動データキュレーションパイプラインであるFoundationMotionを紹介した。
提案手法は,まずビデオ中のオブジェクトを検出してトラジェクトリを抽出し,次にこれらのトラジェクトリとビデオフレームを大規模言語モデルで活用する。
我々はNVILA-Video-15BやQwen2.5-7Bなどのオープンソースモデルを微調整し、性能を損なうことなく動作理解を大幅に改善した。
論文 参考訳(メタデータ) (2025-12-11T18:53:15Z) - Motion Prompting: Controlling Video Generation with Motion Trajectories [57.049252242807874]
スパースもしくは高密度なビデオ軌跡を条件とした映像生成モデルを訓練する。
ハイレベルなユーザリクエストを,詳細なセミセンスな動作プロンプトに変換する。
我々は、カメラや物体の動き制御、画像との「相互作用」、動画転送、画像編集など、様々な応用を通してアプローチを実証する。
論文 参考訳(メタデータ) (2024-12-03T18:59:56Z) - Exploring Vision Transformers for 3D Human Motion-Language Models with Motion Patches [12.221087476416056]
動き系列の新しい表現である「動きパッチ」を導入し、移動学習を通して視覚変換器(ViT)をモーションエンコーダとして用いることを提案する。
これらの動きパッチは、運動配列に基づく骨格関節の分割と分類によって作成され、様々な骨格構造に対して堅牢である。
2次元画像データを用いたトレーニングにより得られたViTの事前学習による伝達学習により,動作解析の性能が向上することが判明した。
論文 参考訳(メタデータ) (2024-05-08T02:42:27Z) - Render In-between: Motion Guided Video Synthesis for Action
Interpolation [53.43607872972194]
本研究では、リアルな人間の動きと外観を生成できる動き誘導型フレームアップサンプリングフレームワークを提案する。
大規模モーションキャプチャーデータセットを活用することにより、フレーム間の非線形骨格運動を推定するために、新しいモーションモデルが訓練される。
私たちのパイプラインでは、低フレームレートのビデオと不自由な人間のモーションデータしか必要としませんが、トレーニングには高フレームレートのビデオは必要ありません。
論文 参考訳(メタデータ) (2021-11-01T15:32:51Z) - Recognition and Synthesis of Object Transport Motion [0.0]
このプロジェクトでは、小さなモーションキャプチャデータセット上で、特別なデータ拡張テクニックとともに、ディープ畳み込みネットワークをどのように使用できるかを説明します。
このプロジェクトは、運動合成のより複雑なタスクのために、これらの同じ拡張テクニックをどのようにスケールアップするかを示している。
近年のGAN(Generative Adversarial Models)の概念、特にWasserstein GAN(英語版)の展開を探求することにより、このプロジェクトは生命に似た物体の移動運動をうまく生成できるモデルの概要を述べる。
論文 参考訳(メタデータ) (2020-09-27T22:13:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。