論文の概要: When Label Noise Meets Class Imbalance: A Robust Framework for Android Malware Family Classification
- arxiv url: http://arxiv.org/abs/2609.22835v1
- Date: Sat, 19 Sep 2026 07:12:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:25:27.972563
- Title: When Label Noise Meets Class Imbalance: A Robust Framework for Android Malware Family Classification
- Title(参考訳): ラベルノイズとクラス不均衡:Androidのマルウェアファミリー分類のためのロバストフレームワーク
- Abstract要約: ラベルノイズとクラス不均衡に対処するため,Android マルウェアファミリー分類フレームワーク RoMaC を提案する。
既存の手法と比較して、RoMaCは様々な難読化シナリオとノイズレベルに対して6%から20%のパフォーマンス改善を示している。
- 参考スコア(独自算出の注目度): 9.847506146866545
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Machine learning methods for Android malware family classification have achieved high accuracy, but their application is hindered by two major challenges. First, the widely used code obfuscation severely disrupts the automated labeling process and introduces substantial label noise into training datasets. Second, training datasets often exhibit severe class imbalance, leading to poor performance of family classification models. Although existing studies have proposed various solutions to either label noise or class imbalance, they often overlook the interplay between these two factors. Under class imbalance, the presence of hard-to-learn minority-class samples can significantly impair the effectiveness of existing countermeasures for noisy samples. To jointly address label noise and class imbalance, we propose a robust Android malware family classification framework, RoMaC. It employs a self-training strategy to correct noisy labels and, more importantly, discriminately treats head-family and tail-family samples. This design effectively mitigates the adverse impact of class imbalance on noise-robust learning. Moreover, RoMaC integrates a class reweighting mechanism with multi-model ensemble learning, thereby enhancing both classification accuracy and noise robustness. We evaluate RoMaC on a combined dataset constructed from two public datasets. When 30% of the samples are obfuscated, RoMaC achieves an overall Macro-F1 score of 0.803 and an accuracy of 0.871, as well as a tail-class Macro-F1 score of 0.672 and an accuracy of 0.784. Compared with existing methods, RoMaC demonstrates performance improvements of 6%-20% across various obfuscation scenarios and noise levels.
- Abstract(参考訳): Androidマルウェアファミリー分類のための機械学習手法は精度が高いが、その応用には2つの大きな課題がある。
まず、広く使われているコードの難読化は、自動ラベリングプロセスを著しく破壊し、トレーニングデータセットにかなりのラベルノイズを導入します。
第2に、トレーニングデータセットは、しばしば深刻なクラス不均衡を示し、家族分類モデルの貧弱なパフォーマンスをもたらす。
既存の研究では、ラベルノイズやクラス不均衡に対する様々な解決策が提案されているが、これらの2つの要因間の相互作用を見落としていることが多い。
学級不均衡下では、学習困難なマイノリティクラスサンプルの存在は、ノイズのあるサンプルに対する既存の対策の有効性を著しく損なう可能性がある。
ラベルノイズとクラス不均衡に対処するため,Android マルウェアファミリー分類フレームワーク RoMaC を提案する。
ノイズのあるラベルを訂正するために自己学習戦略を採用しており、さらに重要なのは、ヘッドファミリーとテールファミリーのサンプルを差別的に扱うことである。
この設計は、クラス不均衡がノイズ・ロバスト学習に与える影響を効果的に軽減する。
さらに,クラス再重み付け機構とマルチモデルアンサンブル学習を統合し,分類精度と雑音頑健性を両立させる。
2つの公開データセットから構築した組み合わせデータセット上でRoMaCを評価する。
サンプルの30%が難燃すると、RoMaCは全体のマクロF1スコアが0.803、精度が0.871、テールクラスのマクロF1スコアが0.672、精度が0.784となる。
既存の手法と比較して、RoMaCは様々な難読化シナリオとノイズレベルに対して6%から20%のパフォーマンス改善を示している。
関連論文リスト
- Correcting Noisy Multilabel Predictions: Modeling Label Noise through Latent Space Shifts [6.0882756122009996]
ほとんどの現実世界の機械学習アプリケーションでは、データのノイズは避けられないように思える。
マルチラベル分類における雑音ラベル学習の分野について検討した。
我々のモデルは、雑音のラベル付けは潜伏変数の変化から生じると仮定し、より堅牢で有益な学習手段を提供する。
論文 参考訳(メタデータ) (2025-02-20T05:41:52Z) - Noisy Ostracods: A Fine-Grained, Imbalanced Real-World Dataset for Benchmarking Robust Machine Learning and Label Correction Methods [7.00297060532893]
ノイズ・オストラコズ・データセット(Noisy Ostracods dataset)は、甲殻類オストラコズの属と種分類のためのノイズの多いデータセットである。
ノイズはオープンセットで、オリジナルのアノテーションの一部ではないキュレーション中に発見された新しいクラスを含む。
Noisy Ostracodsデータセットは、不均衡係数$rho$ = 22429と非常に不均衡である。
論文 参考訳(メタデータ) (2024-12-03T09:30:57Z) - Multiclass Learning from Noisy Labels for Non-decomposable Performance Measures [15.358504449550013]
非分解性性能尺度の2つのクラスに対して雑音ラベルから学習するアルゴリズムを設計する。
どちらの場合も、広範に研究されているクラス条件雑音モデルの下で、アルゴリズムのノイズ補正バージョンを開発する。
実験では,ラベルノイズ処理におけるアルゴリズムの有効性を実証した。
論文 参考訳(メタデータ) (2024-02-01T23:03:53Z) - Class Prototype-based Cleaner for Label Noise Learning [73.007001454085]
半教師付き学習法は、雑音ラベル学習問題に対する現在のSOTAソリューションである。
textbfClass textbfPrototype-based label textbfCleaner。
論文 参考訳(メタデータ) (2022-12-21T04:56:41Z) - Prototypical Classifier for Robust Class-Imbalanced Learning [64.96088324684683]
埋め込みネットワークに付加的なパラメータを必要としないtextitPrototypealを提案する。
プロトタイプは、訓練セットがクラス不均衡であるにもかかわらず、すべてのクラスに対してバランスと同等の予測を生成する。
我々は, CIFAR-10LT, CIFAR-100LT, Webvision のデータセットを用いて, プロトタイプが芸術の状況と比較した場合, サブスタンスの改善が得られることを検証した。
論文 参考訳(メタデータ) (2021-10-22T01:55:01Z) - Training Classifiers that are Universally Robust to All Label Noise
Levels [91.13870793906968]
ディープニューラルネットワークは、ラベルノイズの存在下で過度に適合する傾向がある。
ポジティヴ・アンラベルラーニングの新たなサブカテゴリを取り入れた蒸留ベースのフレームワークを提案する。
我々の枠組みは概して中~高騒音レベルにおいて優れています。
論文 参考訳(メタデータ) (2021-05-27T13:49:31Z) - PLM: Partial Label Masking for Imbalanced Multi-label Classification [59.68444804243782]
長いラベルの分布を持つ実世界のデータセットで訓練されたニューラルネットワークは、頻繁なクラスに偏りがあり、頻繁なクラスでは不十分である。
本稿では,この比率を利用したPLM(Partial Label Masking)を提案する。
本手法は,マルチラベル (MultiMNIST と MSCOCO) とシングルラベル (CIFAR-10 と CIFAR-100) の2つの画像分類データセットにおいて,既存の手法と比較して高い性能を実現する。
論文 参考訳(メタデータ) (2021-05-22T18:07:56Z) - Noise-resistant Deep Metric Learning with Ranking-based Instance
Selection [59.286567680389766]
PRISM(Probabilistic Ranking-based Instance Selection with Memory)と呼ばれるDMLの耐騒音トレーニング技術を提案する。
PRISMは、ニューラルネットワークの以前のバージョンから抽出された画像特徴との平均的類似性を用いて、ミニバッチ内のノイズデータを識別する。
メモリバンクが生み出す高い計算コストを緩和するために,個々のデータポイントをクラスセンタに置き換える高速化手法を提案する。
論文 参考訳(メタデータ) (2021-03-30T03:22:17Z) - Provable tradeoffs in adversarially robust classification [96.48180210364893]
我々は、ロバストなイソペリメトリに関する確率論の最近のブレークスルーを含む、新しいツールを開発し、活用する。
この結果から,データの不均衡時に増加する標準精度とロバスト精度の基本的なトレードオフが明らかになった。
論文 参考訳(メタデータ) (2020-06-09T09:58:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。