論文の概要: Label-efficient underwater species classification with semi-supervised learning on frozen foundation model embeddings
- arxiv url: http://arxiv.org/abs/2604.00313v1
- Date: Tue, 31 Mar 2026 23:27:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.763293
- Title: Label-efficient underwater species classification with semi-supervised learning on frozen foundation model embeddings
- Title(参考訳): 凍結基礎モデル埋め込みにおける半教師付き学習を用いたラベル効率の良い水中種分類
- Authors: Thomas Manuel Rost,
- Abstract要約: 凍結埋め込みの自己トレーニングは、ラベル付きデータセット全体に基づいてトレーニングされた完全に教師されたConvNeXtベースラインにギャップの大部分を埋める。
私たちのアプローチでは、トレーニングもドメイン固有のデータエンジニアリングも、水中適応モデルも必要ありません。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated species classification from underwater imagery is bottlenecked by the cost of expert annotation, and supervised models trained on one dataset rarely transfer to new conditions. We investigate whether semi-supervised methods operating on frozen foundation model embeddings can close this annotation gap with minimal labeling effort. Using DINOv3 ViT-B embeddings with no fine-tuning, we propagate a small set of labeled seeds through unlabeled data via nearest-neighbor-based self-training and evaluate on the AQUA20 benchmark (20 marine species). With fewer than 5% of the training labels, self-training on frozen embeddings closes much of the gap to a fully supervised ConvNeXt baseline trained on the entire labeled dataset; at full supervision, the gap narrows to a few percentage points, with several species exceeding the supervised baseline. Class separability in the embedding space, measured by ROC-AUC, is high even at extreme label scarcity, indicating that the frozen representations capture discriminative structure well before decision boundaries can be reliably estimated. Our approach requires no training, no domain-specific data engineering, and no underwater-adapted models, establishing a practical, immediately deployable baseline for label-efficient marine species recognition. All results are reported on the held-out test set over 100 random seed initializations.
- Abstract(参考訳): 水中画像からの自動種分類は専門家のアノテーションのコストでボトルネックとなり、訓練された教師付きモデルが新しい条件に移行することは滅多にない。
凍結基礎モデル埋め込みで動作する半教師あり手法が最小限のラベル付け作業でこのアノテーションギャップを埋めるかどうかを検討する。
DINOv3 ViT-B埋め込みを微調整なしで使用し、近辺の自己学習によるラベル付きデータを通じてラベル付き種子の小さなセットを伝播し、Aqua20ベンチマーク(20種)で評価する。
トレーニングラベルの5%未満では、凍結埋め込みによる自己学習は、完全に教師されたConvNeXtベースラインにギャップの大部分を閉じる。
ROC-AUCによって測定された埋め込み空間のクラス分離性は、極端にラベルが不足しても高いため、凍結表現は決定境界が確実に推定される前に識別構造を捉えることができる。
われわれのアプローチでは、訓練も、ドメイン固有のデータエンジニアリングも、水中適応モデルも必要とせず、ラベル効率の良い海洋生物認識のための実用的で即時デプロイ可能なベースラインを確立する。
すべての結果は、100以上のランダムシード初期化の保留テストセットで報告される。
関連論文リスト
- Combating Noisy Labels through Fostering Self- and Neighbor-Consistency [120.4394402099635]
ラベルノイズは様々な現実世界のシナリオで広まり、教師付きディープラーニングの課題を提起する。
我々は、Jo-SNC(textbfSelf- と textbfNeighbor-textbfConsistency に基づくサンプル選択とモデル正規化)というノイズロバスト手法を提案する。
我々は、クラスごとの選択閾値を調整するための自己適応型データ駆動しきい値設定方式を設計する。
論文 参考訳(メタデータ) (2026-01-19T07:55:29Z) - Downstream-Pretext Domain Knowledge Traceback for Active Learning [138.02530777915362]
本稿では、下流知識と事前学習指導のデータ相互作用をトレースするダウンストリーム・プレテキスト・ドメイン知識トレース(DOKT)手法を提案する。
DOKTは、トレースバックの多様性指標とドメインベースの不確実性推定器から構成される。
10のデータセットで行った実験は、我々のモデルが他の最先端の手法よりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-20T01:34:13Z) - Cross Modal Distillation for Flood Extent Mapping [0.41562334038629595]
本研究では,早期洪水警報システムの浸水検出モジュールの改良を目的としたML手法について検討する。
提案手法は,SAR(Synthetic Aperture Radar)画像とMulti-spectralとSAR(Synthetic Aperture Radar)画像のアンラベリングデータセットを利用する。
論文 参考訳(メタデータ) (2023-02-16T09:57:08Z) - Semi-supervised Contrastive Outlier removal for Pseudo Expectation
Maximization (SCOPE) [2.33877878310217]
Pseudo expectation Maximization (SCOPE) のための半教師付きコントラスト外乱除去法を用いて, 共起誤差を抑制する新しい手法を提案する。
その結果,SCOPEはベースライン上での半教師付き分類精度を大幅に向上し,さらに整合正則化と組み合わせた場合,250と4000のラベル付きサンプルを用いた半教師付きCIFAR-10分類タスクにおいて最も高い精度が得られた。
論文 参考訳(メタデータ) (2022-06-28T19:32:50Z) - Confident Sinkhorn Allocation for Pseudo-Labeling [40.883130133661304]
半教師付き学習は、ラベル付きデータへの機械学習の依存を減らす重要なツールである。
本稿では,疑似ラベル作成における不確実性の役割を理論的に研究し,CSA(Confident Sinkhorn Allocation)を提案する。
CSAは、信頼度の高いサンプルのみへの最適な輸送を通して、最高の擬似ラベル割り当てを特定する。
論文 参考訳(メタデータ) (2022-06-13T02:16:26Z) - Fuzzy Overclustering: Semi-Supervised Classification of Fuzzy Labels
with Overclustering and Inverse Cross-Entropy [1.6392706389599345]
ファジィラベルの半教師付き分類を扱うための新しいフレームワークを提案する。
これは、これらのファジィラベルのサブ構造を検出するために、オーバークラスタリング(overclustering)という考え方に基づいている。
本研究では,ファジィラベルを用いた実世界のプランクトンデータに適用した場合,従来の半教師付き手法よりも優れたフレームワークを示す。
論文 参考訳(メタデータ) (2021-10-13T10:50:50Z) - Self-Trained One-class Classification for Unsupervised Anomaly Detection [56.35424872736276]
異常検出(AD)は、製造から医療まで、さまざまな分野に応用されている。
本研究は、トレーニングデータ全体がラベル付けされておらず、正規サンプルと異常サンプルの両方を含む可能性のある、教師なしAD問題に焦点を当てる。
この問題に対処するため,データリファインメントによる堅牢な一級分類フレームワークを構築した。
本手法は6.3AUCと12.5AUCの平均精度で最先端の1クラス分類法より優れていることを示す。
論文 参考訳(メタデータ) (2021-06-11T01:36:08Z) - Minimax Active Learning [61.729667575374606]
アクティブラーニングは、人間のアノテーションによってラベル付けされる最も代表的なサンプルをクエリすることによって、ラベル効率の高いアルゴリズムを開発することを目指している。
現在のアクティブラーニング技術は、最も不確実なサンプルを選択するためにモデルの不確実性に頼るか、クラスタリングを使うか、最も多様なラベルのないサンプルを選択するために再構築する。
我々は,不確実性と多様性を両立させる半教師付きミニマックスエントロピーに基づく能動学習アルゴリズムを開発した。
論文 参考訳(メタデータ) (2020-12-18T19:03:40Z) - Uncertainty-aware Self-training for Text Classification with Few Labels [54.13279574908808]
本研究は,アノテーションのボトルネックを軽減するための半教師あり学習手法の1つとして,自己学習について研究する。
本稿では,基礎となるニューラルネットワークの不確実性推定を取り入れて,自己学習を改善する手法を提案する。
本手法では,クラス毎に20~30個のラベル付きサンプルをトレーニングに利用し,完全教師付き事前学習言語モデルの3%以内で検証を行う。
論文 参考訳(メタデータ) (2020-06-27T08:13:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。