論文の概要: Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?
- arxiv url: http://arxiv.org/abs/2607.13192v1
- Date: Tue, 14 Jul 2026 18:45:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.568031
- Title: Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?
- Title(参考訳): 自己監督型視覚表現学習--プレトレイン・フィネッチングか, ジョイントトレーニングか?
- Abstract要約: 自己監督(Self-supervision)は、ラベルのないデータから視覚表現を学ぶための強力なテクニックである。
既存の手法では、ラベル付きデータに対する事前訓練段階とラベル付きデータに対する微調整段階の2段階学習(SSL)が採用されている。
訓練中に自己監督的・監督的目的を協調的に最適化することがより良い選択肢となるかどうかを検討する。
- 参考スコア(独自算出の注目度): 0.07340017786387766
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-supervision is a powerful technique for learning visual representations from unlabeled data. Existing techniques primarily adopt a two-stage approach for self-supervised learning (SSL): a pretraining stage on unlabeled data followed by a finetuning stage on labeled data. While this pipeline has demonstrated extreme effectiveness, the interaction between self-supervised and supervised learning objectives remains insufficiently understood. In this work, we systematically investigate whether jointly optimizing the self-supervised and supervised objectives during training provides a better alternative. We compare two training paradigms: (1) the aforementioned pretraining followed by finetuning (PFT) and (2) joint training (JT), where self-supervised and supervised losses are optimized simultaneously in the same network. Across eight representative SSL methods and diverse computer vision tasks on natural, medical, crisis response, and remote sensing data, we evaluate performance under varying percentages of labeled data. Our results reveal that the relative effectiveness of PFT and JT depends strongly on the task at hand, the availability of labeled data, and the complexity of the domain. We find that JT consistently improves data and training efficiency while being robust in low-label settings, while PFT is more reliable in more specialized domains. We further analyze representation quality, robustness, and cross-domain generalization, providing new insights into how self-supervised and supervised objectives interact during optimization. We establish a comprehensive empirical benchmark for hybrid SSL-based semi-supervised learning and offer practical guidance for selecting appropriate training strategies across diverse vision applications.
- Abstract(参考訳): 自己監督(Self-supervision)は、ラベルのないデータから視覚表現を学ぶための強力なテクニックである。
既存の技術は主に、自己教師付き学習(SSL)のための2段階のアプローチを採用しており、ラベル付きデータに対する事前訓練段階とラベル付きデータに対する微調整段階である。
このパイプラインは極めて有効性を示しているが、自己教師付き学習と教師付き学習の相互作用は未だに十分に理解されていない。
本研究では,学習中の自己監督的・監督的目的を協調的に最適化することが,よりよい代替手段となるかどうかを体系的に検討する。
トレーニングパラダイムとして,(1) 前述の事前訓練と(2) 微調整(PFT),(2) 共同訓練(JT)を比較した。
8つの代表的SSL手法と,自然,医療,危機応答,リモートセンシングデータに基づく多様なコンピュータビジョンタスクを用いて,ラベル付きデータの異なる割合で性能を評価する。
その結果, PFT と JT の相対的有効性は, 対象のタスク, ラベル付きデータの可用性, ドメインの複雑さに強く依存していることが判明した。
JTは低ラベル設定で堅牢でありながら、データとトレーニング効率を継続的に改善し、PFTはより専門的なドメインでより信頼性が高いことが分かりました。
さらに、表現品質、堅牢性、ドメイン間の一般化を分析し、最適化中に自己監督的および監督的目的がどのように相互作用するかについて、新たな洞察を提供する。
我々は、SSLベースの半教師付きハイブリッド学習のための総合的な実証的ベンチマークを確立し、多様な視覚アプリケーションにまたがる適切なトレーニング戦略を選択するための実践的なガイダンスを提供する。
関連論文リスト
- Underlying Semantic Diffusion for Effective and Efficient In-Context Learning [113.4003355229632]
Underlying Semantic Diffusion (US-Diffusion)は、セマンティック学習、計算効率、文脈内学習能力を高める拡張拡散モデルである。
本稿では,フィードバック信号を利用したフィードバック支援学習(FAL)フレームワークを提案する。
また,高雑音レベルの時間ステップで高密度サンプリングを行うためのプラグイン・アンド・プレイの効率的なサンプリング戦略(ESS)を提案する。
論文 参考訳(メタデータ) (2025-03-06T03:06:22Z) - Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate [118.37653302885607]
本稿では,LVLM(Large Vision Language Models)のマルチモーダル事前学習品質を示すために,MIR(Modality Integration Rate)を提案する。
MIRは、トレーニングデータ選択、トレーニング戦略スケジュール、モデルアーキテクチャ設計に重点を置いて、トレーニング前の結果を改善する。
論文 参考訳(メタデータ) (2024-10-09T17:59:04Z) - In-Domain Self-Supervised Learning Improves Remote Sensing Image Scene
Classification [5.323049242720532]
リモートセンシング画像分類のための有望なアプローチとして,自己教師付き学習が登場している。
そこで本研究では,14の下流データセットにまたがる自己教師型事前学習戦略について検討し,その効果を評価する。
論文 参考訳(メタデータ) (2023-07-04T10:57:52Z) - ALP: Action-Aware Embodied Learning for Perception [60.64801970249279]
認知のための行動認識型身体学習(ALP)について紹介する。
ALPは、強化学習ポリシーと逆ダイナミクス予測目標を最適化することにより、行動情報を表現学習に組み込む。
ALPは、複数の下流認識タスクにおいて、既存のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-06-16T21:51:04Z) - Cost-Sensitive Self-Training for Optimizing Non-Decomposable Metrics [9.741019160068388]
本稿では,非分解性メトリクスを最適化するための自己学習手法を一般化したCSSTフレームワークを紹介する。
以上の結果から,CSSTはデータセットや目的にまたがるほとんどのケースにおいて,最先端の改善を実現していることが示された。
論文 参考訳(メタデータ) (2023-04-28T10:31:12Z) - Where Should I Spend My FLOPS? Efficiency Evaluations of Visual
Pre-training Methods [29.141145775835106]
固定されたFLOP予算が与えられた場合、代表的な視覚的タスクに対して高い正確性を得るために最適なデータセット、モデル、そして(自己監督的な)トレーニング方法は何ですか?
5つの大規模データセット(JFT-300M, ALIGN, ImageNet-1K, ImageNet-21K, COCO)と6つの事前学習方法(CLIP, DINO, SimCLR, BYOL, Masked Autoencoding, and supervised)を検討した。
本稿の結果は,自己管理手法が本質的に大規模で未処理なデータにスケールする,という一般的な仮定に疑問を投げかけるものである。
論文 参考訳(メタデータ) (2022-09-30T17:04:55Z) - Towards Sequence-Level Training for Visual Tracking [60.95799261482857]
本研究は、強化学習に基づく視覚追跡のためのシーケンスレベルのトレーニング戦略を導入する。
4つの代表的な追跡モデル、SiamRPN++、SiamAttn、TransT、TrDiMPは、提案手法をトレーニングに取り入れることで一貫して改善されている。
論文 参考訳(メタデータ) (2022-08-11T13:15:36Z) - Self-Supervision Can Be a Good Few-Shot Learner [42.06243069679068]
本稿では,自己監督による学習表現を効果的に非教師なしの少数ショット学習法を提案する。
具体的には、低バイアスMI推定器を用いて、インスタンスとそれらの表現の相互情報(MI)を最大化する。
自己指導型事前訓練は,適切な条件下で指導型事前訓練より優れることを示す。
論文 参考訳(メタデータ) (2022-07-19T10:23:40Z) - UniVIP: A Unified Framework for Self-Supervised Visual Pre-training [50.87603616476038]
単一中心オブジェクトまたは非調和データセット上で,汎用的な視覚表現を学習するための,新しい自己教師型フレームワークを提案する。
大規模実験により、非高調波COCOで事前訓練されたUniVIPは、最先端の転送性能を実現することが示された。
また、ImageNetのような単一中心オブジェクトのデータセットを利用でき、線形探索において同じ事前学習エポックでBYOLを2.5%上回る。
論文 参考訳(メタデータ) (2022-03-14T10:04:04Z) - SLIP: Self-supervision meets Language-Image Pre-training [79.53764315471543]
自己指導型学習が視覚表現学習における言語指導の活用に役立つかどうかを考察する。
自己教師付き学習とCLIP事前学習を組み合わせたマルチタスク学習フレームワークSLIPを紹介する。
SLIPは、自己監督や言語監督よりも優れたパフォーマンスを享受しています。
論文 参考訳(メタデータ) (2021-12-23T18:07:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。