論文の概要: A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources
- arxiv url: http://arxiv.org/abs/2608.13183v1
- Date: Thu, 13 Aug 2026 12:47:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.52225
- Title: A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources
- Title(参考訳): 限られた資源下での自己監督画像とビデオ事前学習の制御に関する研究
- Abstract要約: 本研究では,資源制約下での自己教師型学習目標の振る舞いについて検討する。
以上の結果から, DINOv2スタイルのプレトレーニングは, 限られた資源下での総合的な性能を継続的に向上させることがわかった。
これらの結果は、画像とビデオのSSLの目的を組み合わせることは、リソース制限の設定において有益であることが示唆された。
- 参考スコア(独自算出の注目度): 10.264594750976089
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual foundation models are a cornerstone of image and video understanding but typically require large amounts of data and computation. The current scale required for pretraining visual foundation models may be unsustainable or unnecessary, and significant benefits arise when effective models can be obtained with fewer resources. To better understand how self-supervised learning (SSL) objectives behave under resource constraints, we conduct a controlled study of image and video SSL objectives under matched data, architecture, and compute budgets. We compare contrastive, reconstruction, feature-prediction, and diffusion objectives and evaluate both standalone and jointly trained image-video SSL formulations across a diverse set of image and video understanding tasks. Our results show that DINOv2-style pretraining consistently provides the strongest overall performance under limited resources. Furthermore, combining DINOv2 with video SSL objectives such as VideoMAE substantially improves image classification and segmentation performance, but degrades video tracking and camera-pose estimation performance, revealing an important tradeoff between semantic and geometric representation learning. These findings suggest that combining image and video SSL objectives can be beneficial in resource-limited settings, while highlighting the need for improved methods that better balance semantic, temporal, and geometric supervision.
- Abstract(参考訳): 視覚基礎モデルは画像と映像の理解の基礎であるが、通常大量のデータと計算を必要とする。
視覚基礎モデルの事前訓練に必要な現在のスケールは、持続不可能または不要であり、有効モデルが少ないリソースで得られる場合、大きなメリットが生じる。
自己教師型学習(SSL)の目的がリソース制約の下でどのように振る舞うかをよりよく理解するために、マッチングされたデータ、アーキテクチャ、計算予算の下で、画像とビデオのSSL目標の制御された研究を行う。
コントラスト, 再構成, 特徴予測, 拡散目標を比較し, 多種多様な画像・映像理解タスクにおいて, スタンドアロンおよび共同で訓練された画像・ビデオSSLの定式化を評価する。
以上の結果から,DINOv2スタイルのプレトレーニングは,限られたリソース下での総合的なパフォーマンスを継続的に向上させることがわかった。
さらに、DINOv2とVideoMAEのようなビデオSSLの目的とを組み合わせることで、画像の分類とセグメンテーション性能は大幅に向上するが、ビデオトラッキングとカメラ位置推定性能は低下し、意味的表現学習と幾何学的表現学習の重要なトレードオフが明らかになる。
これらの結果は、画像とビデオのSSLの目的を組み合わせることは、リソース制限された設定において有益であり、セマンティック、時間的、幾何学的監督のバランスを改善する方法の必要性を強調している。
関連論文リスト
- From Sight to Insight: Unleashing Eye-Tracking in Weakly Supervised Video Salient Object Detection [60.11169426478452]
本稿では,弱い監督下での健全な物体の検出を支援するために,固定情報を導入することを目的とする。
特徴学習過程における位置と意味のガイダンスを提供するために,位置と意味の埋め込み (PSE) モジュールを提案する。
Intra-Inter Mixed Contrastive (MCII)モデルは、弱い監督下での時間的モデリング能力を改善する。
論文 参考訳(メタデータ) (2025-06-30T05:01:40Z) - Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency [56.475612147721264]
本稿では、離散的かつ連続的な報酬信号を通して意味的推論と時間的推論の両方を監督する二重回帰定式化を提案する。
我々は,ビデオQA,テンポラルビデオグラウンディング,グラウンドドビデオQAを含む8つの代表的なビデオ理解タスクに対するアプローチを評価した。
その結果、MLLMを用いた推論中心のビデオ理解の進展において、報酬設計とデータ選択の重要性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-06-02T17:28:26Z) - Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives [36.297745473653166]
視覚言語モデリング(VLM)は、画像と自然言語の間の情報ギャップを埋めることを目的としている。
大規模な画像テキストペアを事前学習し、タスク固有のデータを微調整するという新しいパラダイムの下で、リモートセンシング領域のVLMは大きな進歩を遂げた。
論文 参考訳(メタデータ) (2025-05-20T13:47:40Z) - PooDLe: Pooled and dense self-supervised learning from naturalistic videos [32.656425302538835]
PooDLeは、プール表現上の不変性に基づく目的と、密度の高いSSL目的とを組み合わせた自己教師型学習手法である。
この結果から,複数の特徴尺度に適用した統一目的が,自然主義的映像から効果的な画像表現の学習に不可欠であることが示唆された。
論文 参考訳(メタデータ) (2024-08-20T21:40:48Z) - In-Context Learning Improves Compositional Understanding of Vision-Language Models [2.762909189433944]
合成画像理解は、トレーニングデータに存在する物体バイアスのため、かなり難しい課題である。
コントラストモデルと生成モデルを比較し、アーキテクチャの違い、事前学習データ、トレーニングタスクと損失を分析します。
提案手法は,複数の構成的理解データセットにまたがるベースラインモデルより優れている。
論文 参考訳(メタデータ) (2024-07-22T09:03:29Z) - SOLO: A Single Transformer for Scalable Vision-Language Modeling [74.05173379908703]
我々はvisiOn-Language mOdelingのための単一変換器SOLOを提案する。
SOLOのような統一された単一トランスフォーマーアーキテクチャは、LVLMにおけるこれらのスケーラビリティ上の懸念に効果的に対処する。
本稿では,オープンソースの7B LVLMであるSOLOの開発のための,最初のオープンソーストレーニングレシピを紹介する。
論文 参考訳(メタデータ) (2024-07-08T22:40:15Z) - Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models [81.71651422951074]
CoS(Chain-of-Spot)法は,注目領域に着目して特徴抽出を強化する手法である。
この技術により、LVLMは元の画像解像度を変更することなく、より詳細な視覚情報にアクセスすることができる。
実験の結果,LVLMの視覚的内容の理解と推論能力は著しく改善した。
論文 参考訳(メタデータ) (2024-03-19T17:59:52Z) - iBoot: Image-bootstrapped Self-Supervised Video Representation Learning [45.845595749486215]
ビデオデータセットは通常、画像データセットほど大きくない。
本稿では,映像表現学習フレームワークにおいて,自己や言語を事前訓練した強力な画像ベースモデルを提案する。
提案アルゴリズムはより少ないエポックと少ないバッチでより効率的に学習できることが示されている。
論文 参考訳(メタデータ) (2022-06-16T17:42:48Z) - Support-Set Based Cross-Supervision for Video Grounding [98.29089558426399]
サポートセットベースのクロススーパービジョン(Sscs)モジュールは、追加の推論コストなしでトレーニングフェーズ中に既存のメソッドを改善することができる。
提案するSscsモジュールは、識別的コントラスト目的と生成的キャプション目的の2つの主要成分を含む。
我々は3つの挑戦的データセット上でSscsを広範囲に評価し、我々の手法が最先端の手法を大きなマージンで改善できることを示す。
論文 参考訳(メタデータ) (2021-08-24T08:25:26Z) - Object Relational Graph with Teacher-Recommended Learning for Video
Captioning [92.48299156867664]
本稿では,新しいモデルと効果的なトレーニング戦略の両方を含む完全なビデオキャプションシステムを提案する。
具体的には,オブジェクトリレーショナルグラフ(ORG)に基づくエンコーダを提案する。
一方,教師推薦学習(TRL)手法を設計し,成功した外部言語モデル(ELM)をフル活用し,豊富な言語知識をキャプションモデルに統合する。
論文 参考訳(メタデータ) (2020-02-26T15:34:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。