論文の概要: Diversity-Based Active Learning: An Evaluation of Metric Spaces for Active Learning Selection
- arxiv url: http://arxiv.org/abs/2608.23461v1
- Date: Mon, 24 Aug 2026 16:30:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:44.197257
- Title: Diversity-Based Active Learning: An Evaluation of Metric Spaces for Active Learning Selection
- Title(参考訳): 多様性に基づくアクティブラーニング:アクティブラーニング選択のためのメトリクス空間の評価
- Abstract要約: プールベースのアクティブラーニングは、ラベルなしデータセットから最も有益なサンプルのみをクエリすることで、コストを最小化する。
一方、多様性に基づくアプローチでは、データの代表的なサブセットを選択しようとする。
我々は,様々な距離空間におけるGreedy K中心の性能評価に焦点をあてる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: With rapid advancement over the last few years, many different methods are now widely used for classification. However, training these models requires substantial labeled data. Active Learning is a potential solution to this problem. Pool-based active learning minimizes costs by querying only the most informative samples from an unlabeled dataset. Diversity-based approaches, on the other hand, attempt to select a representative subset of the data. There are many different objectives for determining the selection process, including exact K-center, exact K-median, and Greedy K-center. In this paper, we will focus on evaluating the performance of Greedy K-center across a variety of metric spaces: the raw feature space, a Linear Discriminant Analysis (LDA) space, and a model-derived probability space (with and without entropy-based weighting). Using Random Forest classifiers as a baseline evaluator, our empirical results on synthetic and real-world datasets demonstrate that mapping unlabeled instances into a predictive probability space and weighting the result by entropy often dominates the other options for active learning selection with Greedy K-center.
- Abstract(参考訳): 過去数年間の急速な進歩により、現在では多くの異なる方法が分類に広く使われている。
しかし、これらのモデルのトレーニングには、かなりのラベル付きデータが必要である。
アクティブラーニングは、この問題に対する潜在的な解決策です。
プールベースのアクティブラーニングは、ラベルのないデータセットから最も有益なサンプルのみをクエリすることで、コストを最小化する。
一方、多様性に基づくアプローチでは、データの代表的なサブセットを選択しようとする。
選択過程を決定するには、正確なK中心、正確なK中間子、グレディK中心など、多くの異なる目的がある。
本稿では,生の特徴空間,線形判別分析(LDA)空間,およびモデル由来の確率空間(エントロピーに基づく重み付けを伴わない)など,さまざまな距離空間におけるGreedy K中心の性能評価に焦点をあてる。
ランダムフォレスト分類器をベースライン評価器として使用し、合成および実世界のデータセットにおける実験結果から、ラベルなしのインスタンスを予測可能な確率空間にマッピングし、エントロピーによって結果を重み付けすることが、グレディKセンタによるアクティブな学習選択の他の選択肢を支配していることが示される。
関連論文リスト
- MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection [59.34281845159177]
我々は,自作ルーブリック発見に基づくソース認識フィルタリングフレームワークであるMIRAを提案する。
21のソースと5つのソースグループを持つコード指向のミッドトレーニングでは、MIRAは9つのコードベンチマークで選択ベースラインを上回っている。
論文 参考訳(メタデータ) (2026-05-28T17:40:40Z) - Active Transfer Bagging: A New Approach for Accelerated Active Learning Acquisition of Data by Combined Transfer Learning and Bagging Based Models [0.0]
アクティブラーニングのためのシードデータセット選択法であるアクティブトランスファー・バッグング(ATBagging)を導入する。
ATBaggingは、バッジアンサンブルモデルのベイズ解釈から、候補データポイントのインフォメーション性を推定する。
ATBagging on four real-world datasets cover both target-transfer and feature-shift scenarios。
論文 参考訳(メタデータ) (2026-02-02T18:15:50Z) - Class Balance Matters to Active Class-Incremental Learning [61.11786214164405]
まず、大規模な未ラベルデータのプールから始めて、インクリメンタルな学習のための最も情報に富んだサンプルを注釈付けします。
そこで我々は,クラスバランスと情報提供性を両立させるため,クラスバランス選択(CBS)戦略を提案する。
我々のCBSは、プリトレーニング済みモデルとプロンプトチューニング技術に基づいて、これらのCILメソッドに接続し、再生することができる。
論文 参考訳(メタデータ) (2024-12-09T16:37:27Z) - Categorical Data Clustering via Value Order Estimated Distance Metric Learning [53.28598689867732]
本稿では,分類属性を直感的に表現する新しい順序距離計量学習手法を提案する。
新しい共同学習パラダイムが開発され、クラスタリングとオーダー距離メートル法学習の代替となる。
提案手法は分類および混合データセットのクラスタリング精度に優れる。
論文 参考訳(メタデータ) (2024-11-19T08:23:25Z) - Downstream-Pretext Domain Knowledge Traceback for Active Learning [138.02530777915362]
本稿では、下流知識と事前学習指導のデータ相互作用をトレースするダウンストリーム・プレテキスト・ドメイン知識トレース(DOKT)手法を提案する。
DOKTは、トレースバックの多様性指標とドメインベースの不確実性推定器から構成される。
10のデータセットで行った実験は、我々のモデルが他の最先端の手法よりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-20T01:34:13Z) - Exploiting Diversity of Unlabeled Data for Label-Efficient
Semi-Supervised Active Learning [57.436224561482966]
アクティブラーニング(英: Active Learning)は、ラベリングのための最も重要なサンプルを選択することで、高価なラベリングの問題に対処する研究分野である。
アクティブな学習環境における初期ラベル付けのための最も情報性の高いサンプル群を選択するために,多様性に基づく新しい初期データセット選択アルゴリズムを提案する。
また、一貫性に基づく埋め込みの多様性に基づくサンプリングを用いた、新しいアクティブな学習クエリ戦略を提案する。
論文 参考訳(メタデータ) (2022-07-25T16:11:55Z) - Dominant Set-based Active Learning for Text Classification and its
Application to Online Social Media [0.0]
本稿では,最小限のアノテーションコストで大規模未ラベルコーパスのトレーニングを行うための,プールベースのアクティブラーニング手法を提案する。
提案手法には調整すべきパラメータが一切ないため,データセットに依存しない。
本手法は,最先端のアクティブラーニング戦略と比較して高い性能を実現する。
論文 参考訳(メタデータ) (2022-01-28T19:19:03Z) - Multiple-criteria Based Active Learning with Fixed-size Determinantal
Point Processes [43.71112693633952]
本稿では,情報性,代表性,多様性の3つの相補的基準を取り入れた,複数基準に基づく能動学習アルゴリズムを提案する。
提案手法は,他の複数基準のALアルゴリズムよりも性能が優れ,安定であることを示す。
論文 参考訳(メタデータ) (2021-07-04T13:22:54Z) - Minimax Active Learning [61.729667575374606]
アクティブラーニングは、人間のアノテーションによってラベル付けされる最も代表的なサンプルをクエリすることによって、ラベル効率の高いアルゴリズムを開発することを目指している。
現在のアクティブラーニング技術は、最も不確実なサンプルを選択するためにモデルの不確実性に頼るか、クラスタリングを使うか、最も多様なラベルのないサンプルを選択するために再構築する。
我々は,不確実性と多様性を両立させる半教師付きミニマックスエントロピーに基づく能動学習アルゴリズムを開発した。
論文 参考訳(メタデータ) (2020-12-18T19:03:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。