論文の概要: Image Classifiers are Efficient Self-Supervised Video Representation Learners
- arxiv url: http://arxiv.org/abs/2609.40347v1
- Date: Wed, 30 Sep 2026 17:59:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.349059
- Title: Image Classifiers are Efficient Self-Supervised Video Representation Learners
- Title(参考訳): 画像分類器は効率的な自己監督型映像表現学習者である
- Abstract要約: VideoMSNは、ビデオにおける効率的な自己教師型表現学習のためのMasked Siamese Networkフレームワークである。
提案手法はローショット分類において高い性能を示し,ラベル・スカースシナリオにおける学習表現の転送可能性を確認する。
- 参考スコア(独自算出の注目度): 6.046647666003287
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce VideoMSN, a Masked Siamese Network framework for efficient self-supervised spatio-temporal representation learning in videos. Instead of relying on heavy 3D architectures or reconstruction-based autoencoders for learning with unlabeled data, we repurpose standard image Vision Transformers by representing videos as super images which are grids composed of frames sampled from videos. From each super image, we construct two views: one with spatial patch masking and the other with temporal frame masking, ensuring no information leakage across frames. A shared Vision Transformer (ViT) encoder aligns their embeddings using a masked Siamese loss, capturing both motion and appearance cues without reconstruction. Our decoder-free formulation leverages an image foundation model towards efficient video representation learning. Starting from pretrained DINO-v3 and DeiT-v3 image encoders, VideoMSN achieves state-of-the-art performance on Kinetics-400, UCF101, and HMDB51 while requiring up to $32\times$ fewer and $160\times$ fewer video pretraining epochs compared to prior video self-supervised learning methods. Our proposed approach also shows strong performance in low-shot classification, confirming the transferability of the learned representations in a label-scarce scenario. Project Page: https://cvir.github.io/projects/videomsn.
- Abstract(参考訳): 本稿では,ビデオにおける自己教師付き時空間表現学習のためのMasked Siamese NetworkフレームワークであるVideoMSNを紹介する。
ビデオからサンプリングされたフレームで構成されたグリッドであるスーパーイメージとしてビデオを表現することで、標準画像のVision Transformerを再利用し、重度な3Dアーキテクチャや再構成ベースのオートエンコーダを非ラベルデータで学習する。
各スーパー画像から空間パッチマスキングと時間フレームマスキングの2つのビューを構築し,フレーム間の情報漏洩を確実にする。
共有ビジョン変換器(ViT)エンコーダは、マスクされたシームズ損失を使用して埋め込みを調整し、復元することなく動きと外観の両方をキャプチャする。
我々のデコーダフリーな定式化は,画像基礎モデルを効率的な映像表現学習に活用する。
事前トレーニングされたDINO-v3とDeiT-v3イメージエンコーダからスタートしたVideoMSNは、Kinetics-400、UCF101、HMDB51の最先端のパフォーマンスを達成し、32\times$少額と160\times$の動画事前トレーニングエポックを従来のビデオ自己教師型学習手法と比較して少なくする。
提案手法は,ローショット分類において高い性能を示し,ラベル・スカースシナリオにおける学習表現の転送可能性を確認する。
Project Page: https://cvir.github.io/projects/videomsn.com
関連論文リスト
- Efficient Image Pre-Training with Siamese Cropped Masked Autoencoders [89.12558126877532]
そこで我々は,SiamMAE が導入した Siamese プレトレーニングの代替手法である CropMAE を提案する。
本手法では, ビデオから抽出した従来のフレームの対から切り離して, 同一画像から抽出した画像の対を別々に抽出する。
CropMAEは、これまでで最も高いマスキング比(98.5%)を達成し、2つの目に見えるパッチのみを使用して画像の再構成を可能にする。
論文 参考訳(メタデータ) (2024-03-26T16:04:19Z) - MV2MAE: Multi-View Video Masked Autoencoders [33.61642891911761]
本稿では,同期型マルチビュービデオから自己教師付き学習を行う手法を提案する。
モデルに幾何情報を注入するために、クロスビュー再構成タスクを使用する。
我々のアプローチは、マスク付きオートエンコーダ(MAE)フレームワークに基づいている。
論文 参考訳(メタデータ) (2024-01-29T05:58:23Z) - Concatenated Masked Autoencoders as Spatial-Temporal Learner [6.475592804311682]
自己教師型ビデオ表現学習のための時空間学習システムとして,Concatenated Masked Autoencoders (CatMAE)を導入した。
そこで本研究では,ビデオフレームをモデル再構成ターゲットとして用いた新しいデータ拡張戦略であるVideo-Reverse(ViRe)を提案する。
論文 参考訳(メタデータ) (2023-11-02T03:08:26Z) - ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked Autoencoders [11.727612242016871]
ViC-MAEはMasked AutoEncoders(MAE)とコントラスト学習を組み合わせたモデルである。
ViC-MAEで学習した視覚表現は、映像分類と画像分類の両方によく当てはまる。
論文 参考訳(メタデータ) (2023-03-21T16:33:40Z) - Masked Video Distillation: Rethinking Masked Feature Modeling for
Self-supervised Video Representation Learning [123.63301596019522]
Masked Video distillation (MVD) は、ビデオ表現学習のための単純な2段階マスク付き特徴モデリングフレームワークである。
教師モデルを選択するために,ビデオ教師が教える生徒が時間重のビデオタスクにおいて,より優れたパフォーマンスを発揮することを観察する。
我々は,異なる教師の利点を活用するために,MVDのための時空間協調学習法を設計する。
論文 参考訳(メタデータ) (2022-12-08T18:59:59Z) - Frozen CLIP Models are Efficient Video Learners [86.73871814176795]
ビデオ認識はエンドツーエンドの学習パラダイムに支配されている。
Contrastive Vision-Language Pre-Trainingの最近の進歩は、視覚認識タスクのための新しいルートの道を開く。
高品質なビデオ認識モデルを直接トレーニングする効率的なフレームワークである、効率的なビデオ学習を提案する。
論文 参考訳(メタデータ) (2022-08-06T17:38:25Z) - Masked Autoencoders Are Scalable Vision Learners [60.97703494764904]
Masked Autoencoders (MAE) は、コンピュータビジョンのためのスケーラブルな自己教師型学習システムである。
我々は入力画像のランダムなパッチを隠蔽し、欠落したピクセルを再構成する。
これら2つの設計を結合することで,大規模モデルを効率的かつ効率的にトレーニングすることが可能になります。
論文 参考訳(メタデータ) (2021-11-11T18:46:40Z) - Long-Short Temporal Contrastive Learning of Video Transformers [62.71874976426988]
ビデオのみのデータセットにおけるビデオトランスフォーマーの自己教師付き事前トレーニングは、大規模画像データセットでの教師付き事前トレーニングで得られたものよりも、同等以上のアクション認識結果につながる可能性がある。
我々の手法は、長短時空間コントラスト学習(Long-Short Temporal Contrastive Learning)と呼ばれ、ビデオトランスフォーマーが、より長い時間的範囲から捉えた時間的文脈を予測することによって、効果的なクリップレベルの表現を学習することを可能にする。
論文 参考訳(メタデータ) (2021-06-17T02:30:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。