論文の概要: HuC-VideoMAE: Human-Centric Video Masked Autoencoding from synthetic data
- arxiv url: http://arxiv.org/abs/2610.08433v1
- Date: Tue, 06 Oct 2026 14:30:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.043484
- Title: HuC-VideoMAE: Human-Centric Video Masked Autoencoding from synthetic data
- Title(参考訳): HuC-VideoMAE:人工データから人間中心のビデオマスケ自動エンコーディング
- Abstract要約: ビデオトランスフォーマーの自己教師型事前学習を人工人間動作データセット上で検討する。
本手法は, 合成データを用いたビデオMAEプレトレーニングにおいて, 性能を著しく向上させる。
倫理的行動認識モデルの使用を促進するため、事前訓練されたモデルを公開する。
- 参考スコア(独自算出の注目度): 1.5136747790595215
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Modern action recognition models rely on video transformers pretrained on massive collections of web-crawled videos, such as Kinetics-700. However, the use of such data raises ethical concerns, as subjects' consent is typically not obtained. Recent high-quality synthetic video datasets generated from motion-capture data, such as BEDLAM2.0, offer a promising ethical alternative. In this work, we investigate self-supervised pretraining of video transformers on synthetic human-motion datasets. We first show that directly applying the standard VideoMAE masking strategy leads to substantially worse performance than pretraining on Kinetics. To address this limitation, we propose a human-centric masking scheme that leverages body keypoints and person bounding box regions. Our approach encourages the model to focus on the structure and dynamics of human motion during pretraining. Experiments on NTU RGB+D and Toyota-Smarthome demonstrate that our method significantly outperforms standard VideoMAE pretraining on synthetic data, closing 49% of the gap to Kinetics pretraining on NTU RGB+D cross-view-subject without using a single real frame during pretraining. To promote the use of ethical action recognition models, we will publicly release our pretrained models.
- Abstract(参考訳): 現代のアクション認識モデルは、Kinetics-700のようなWebcrawledビデオの膨大なコレクションに事前訓練されたビデオトランスフォーマーに依存している。
しかし、そのようなデータを使用することは、被験者の同意が得られないため、倫理的な懸念を生じさせる。
BEDLAM2.0のようなモーションキャプチャーデータから生成される最近の高品質な合成ビデオデータセットは、有望な倫理的代替手段を提供する。
本研究では,ビデオトランスフォーマーの自己教師型事前学習を人工人間動作データセット上で検討する。
まず,標準のTVMAEマスキング戦略を直接適用すると,キネティクスの事前学習よりも性能が著しく低下することを示す。
この制限に対処するために,身体キーポイントと人身境界ボックス領域を利用した人中心マスキング手法を提案する。
我々のアプローチは、プレトレーニング中の人間の動きの構造とダイナミクスに焦点を合わせることを奨励する。
NTU RGB+DとToyota-Smarthomeの実験により,本手法は合成データ上での標準ビデオMAEプレトレーニングを著しく上回り,NTU RGB+Dクロスビューサブジェクト上でのKineeticsプレトレーニングのギャップの49%を事前トレーニング中に1つの実フレームを使わずに埋めることを示した。
倫理的行動認識モデルの使用を促進するため、事前訓練されたモデルを公開する。
関連論文リスト
- mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - Physical Autoregressive Model for Robotic Manipulation without Action Pretraining [65.8971623698511]
我々は、自己回帰ビデオ生成モデルを構築し、物理自己回帰モデル(PAR)を提案する。
PARは、アクション事前トレーニングを必要とせず、物理力学を理解するために、ビデオ事前トレーニングに埋め込まれた世界の知識を活用する。
ManiSkillベンチマークの実験は、PARがPushCubeタスクで100%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-08-13T13:54:51Z) - Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression [23.99292102237088]
本稿では,アクション・ビデオ・ダイナミックスをモデル化するためのヘテロジニアス・マスケッド・オートレグレス(HMA)を提案する。
ポストトレーニング後、このモデルは、ポリシーを評価し、合成データを生成するためのビデオシミュレータとして使用できる。
論文 参考訳(メタデータ) (2025-02-06T18:38:26Z) - Pre-training for Action Recognition with Automatically Generated Fractal Datasets [23.686476742398973]
本稿では,短い合成ビデオクリップの大規模データセットを自動生成する手法を提案する。
生成されたビデオクリップは、複雑なマルチスケール構造を生成するフラクタルの自然能力に起因した顕著な多様性によって特徴づけられる。
通常のKineeticsの事前トレーニングと比較すると、報告結果が近くなり、下流のデータセットよりも優れています。
論文 参考訳(メタデータ) (2024-11-26T16:51:11Z) - VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation [79.00294932026266]
VidManは、安定性を高め、データ利用効率を向上させるために、2段階のトレーニングメカニズムを使用する新しいフレームワークである。
我々のフレームワークは、CALVINベンチマークで最先端のベースラインモデルGR-1を上回り、11.7%の相対的な改善を実現し、OXEの小規模データセットで9%以上の精度向上を示す。
論文 参考訳(メタデータ) (2024-11-14T03:13:26Z) - Learning Human Action Recognition Representations Without Real Humans [66.61527869763819]
そこで本研究では,仮想人間を含む合成データを用いて,実世界の映像を活用してモデルを事前学習するベンチマークを提案する。
次に、このデータに基づいて学習した表現を、下流行動認識ベンチマークの様々なセットに転送可能であるかを評価する。
私たちのアプローチは、以前のベースラインを最大5%上回ります。
論文 参考訳(メタデータ) (2023-11-10T18:38:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。