論文の概要: Focused PU learning from imbalanced data
- arxiv url: http://arxiv.org/abs/2605.14467v1
- Date: Thu, 14 May 2026 07:01:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.677853
- Title: Focused PU learning from imbalanced data
- Title(参考訳): 不均衡データからの焦点付きPU学習
- Authors: Elias Zavitsanos, Georgios Paliouras,
- Abstract要約: 病気の遺伝子識別、ターゲットマーケティング、不正検出、レコメンダシステムといった現実世界の多くの問題は、機械学習の手法では対処が難しい。
高い不均衡なデータセットにおいて、正およびラベルなし(PU)の例から学習する新しい方法を提案する。
- 参考スコア(独自算出の注目度): 4.306924266919574
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose a new method of learning from positive and unlabeled (PU) examples in highly imbalanced datasets. Many real-world problems, such as disease gene identification, targeted marketing, fraud detection, and recommender systems, are hard to address with machine learning methods, due to limited labeled data. Often, training data comprises positive and unlabeled instances, the latter typically being dominated by negative, but including also several positive instances. While PU learning is well-studied, few methods address imbalanced settings or hard-to-detect positive examples that resemble negative ones. Our approach uses a focused empirical risk estimator, incorporating both positive and unlabeled examples to train binary classifiers. Empirical evaluations demonstrate state-of-the-art performance on imbalanced datasets under two labeling mechanisms - selecting positives completely at random (SCAR) and selecting at random (SAR). Beyond these controlled experiments, we demonstrate the value of the proposed method in the real-world application of financial misstatement detection.
- Abstract(参考訳): 高い不均衡なデータセットにおいて、正およびラベルなし(PU)の例から学習する新しい方法を提案する。
病気の遺伝子識別、ターゲットマーケティング、不正検出、リコメンデータシステムといった現実世界の多くの問題は、ラベル付きデータに制限があるため、機械学習手法では対処が難しい。
トレーニングデータは、多くの場合、正および未ラベルのインスタンスを含み、後者は通常、負に支配されるが、いくつかの正のインスタンスも含む。
PU学習はよく研究されているが、不均衡な設定や、ネガティブに類似したポジティブな例に対処する手法はほとんどない。
提案手法では,実証的リスク推定器を用いて,正と未ラベルの両方の例を2値分類器の訓練に取り入れる。
実験的な評価は、ランダム(SCAR)における正の選択とランダム(SAR)における正の選択という、2つのラベリングメカニズムの下で、不均衡なデータセット上での最先端のパフォーマンスを示す。
これらの制御実験の他に、金融不備検出の現実的応用における提案手法の価値を実証する。
関連論文リスト
- Robust Positive-Unlabeled Learning via Noise Negative Sample
Self-correction [48.929877651182885]
正および未ラベルのデータから学ぶことは、文学における正の未ラベル(PU)学習として知られている。
本研究では,人間の学習の性質を動機とした学習戦略を取り入れた,新しい堅牢なPU学習手法を提案する。
論文 参考訳(メタデータ) (2023-08-01T04:34:52Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z) - Adaptive Negative Evidential Deep Learning for Open-set Semi-supervised Learning [69.81438976273866]
オープンセット半教師付き学習(Open-set SSL)は、ラベル付きデータ(inliers)で観測されない新しいカテゴリ(outliers)を含むラベル付きデータとテストデータを含む、より実践的なシナリオである。
本研究では,様々な不確かさを定量化するための外乱検出器として顕在的深層学習(EDL)を導入し,自己学習と推論のための異なる不確実性指標を設計する。
Inlierとoutlierの両方を含むラベルなしデータセットに適合するように、新しい適応的負の最適化戦略を提案する。
論文 参考訳(メタデータ) (2023-03-21T09:07:15Z) - Automatic Debiased Learning from Positive, Unlabeled, and Exposure Data [11.217084610985674]
本稿では,正・未ラベルデータ(PU分類)からの二項分類の問題に,正のデータの選択バイアスを伴って対処する。
このシナリオは、レコメンダシステムのような多くの実用的なアプリケーションのための概念的なフレームワークを表している。
本稿では,強い無知性仮定を用いて関心の関数を同定し,ADPUE(Automatic Debiased PUE)学習法を開発する手法を提案する。
論文 参考訳(メタデータ) (2023-03-08T18:45:22Z) - Uncertainty-aware Pseudo-label Selection for Positive-Unlabeled Learning [10.014356492742074]
本稿では,正の未ラベル学習環境における不均衡データセットとモデル校正の問題に取り組むことを提案する。
マイノリティクラスからのシグナルを増強することにより、擬似ラベル付けはラベル付きデータセットをラベル付きデータセットから新しいサンプルで拡張する。
PUUPLは一連の実験において、高度に不均衡な設定で大幅な性能向上をもたらす。
論文 参考訳(メタデータ) (2022-01-31T12:55:47Z) - Improving Positive Unlabeled Learning: Practical AUL Estimation and New
Training Method for Extremely Imbalanced Data Sets [10.870831090350402]
我々は2つの側面から、最先端技術に関するポジティブ・アンラベル(PU)学習を改善する。
まず,未ラベルサンプルの事前知識を必要とせずに生のPUデータを利用する,非バイアスの実用的なAUL推定法を提案する。
次に,極めて不均衡なデータセットに対する新しいトレーニング手法であるProbTaggingを提案する。
論文 参考訳(メタデータ) (2020-04-21T08:32:57Z) - Learning from Positive and Unlabeled Data with Arbitrary Positive Shift [11.663072799764542]
本稿では,未ラベルデータに対して任意の非表現陽性データであってもPU学習が可能であることを示す。
これを統計的に一貫した2つの手法に統合し、任意の正のバイアスに対処する。
実験により,多数の実世界のデータセットにまたがる手法の有効性が示された。
論文 参考訳(メタデータ) (2020-02-24T13:53:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。