論文の概要: MalDataGen: A Modular Framework for Synthetic Tabular Data Generation in Malware Detection
- arxiv url: http://arxiv.org/abs/2511.00361v1
- Date: Sat, 01 Nov 2025 02:08:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-05 16:37:26.739576
- Title: MalDataGen: A Modular Framework for Synthetic Tabular Data Generation in Malware Detection
- Title(参考訳): MalDataGen: マルウェア検出における合成語彙データ生成のためのモジュールフレームワーク
- Authors: Kayua Oleques Paim, Angelo Gaspar Diniz Nogueira, Diego Kreutz, Weverton Cordeiro, Rodrigo Brandao Mansilha,
- Abstract要約: MalDataGenは、モジュール型のディープラーニングモデルを使用して、高忠実な合成データを生成するためのオープンソースのフレームワークである。
そのフレキシブルな設計は、検出パイプラインへのシームレスな統合を可能にし、サイバーセキュリティアプリケーションのための実用的なソリューションを提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: High-quality data scarcity hinders malware detection, limiting ML performance. We introduce MalDataGen, an open-source modular framework for generating high-fidelity synthetic tabular data using modular deep learning models (e.g., WGAN-GP, VQ-VAE). Evaluated via dual validation (TR-TS/TS-TR), seven classifiers, and utility metrics, MalDataGen outperforms benchmarks like SDV while preserving data utility. Its flexible design enables seamless integration into detection pipelines, offering a practical solution for cybersecurity applications.
- Abstract(参考訳): 高品質なデータ不足により、マルウェアの検出が妨げられ、MLのパフォーマンスが制限される。
モジュール型ディープラーニングモデル(例えば、WGAN-GP、VQ-VAE)を用いて、高忠実な合成表データを生成するためのオープンソースのモジュラーフレームワークであるMalDataGenを紹介する。
二重検証(TR-TS/TS-TR)、7つの分類器、ユーティリティメトリクスを通じて評価され、MalDataGenはデータユーティリティを保ちながらSDVのようなベンチマークを上回っている。
そのフレキシブルな設計は、検出パイプラインへのシームレスな統合を可能にし、サイバーセキュリティアプリケーションのための実用的なソリューションを提供する。
関連論文リスト
- Memory-Based Malware Detection under Limited Data Conditions: A Comparative Evaluation of TabPFN and Ensemble Models [0.0]
低データレシエーション向けに設計された学習自由モデルであるTabPFNを提案する。
我々は、Random Forest、LightGBM、XGBoostなどの既存のベースラインに対して、その性能を評価する。
これらの発見は、TabPFNをサイバーセキュリティに組み込むという約束と実践上の制限の両方を強調している。
論文 参考訳(メタデータ) (2026-01-12T08:28:58Z) - Synthetic Data: AI's New Weapon Against Android Malware [0.0]
攻撃者は人工知能を使って、従来の検出技術を回避できる高度なマルウェアのバリエーションを作成している。
MalSynGenは、条件付き生成逆数ネットワーク(cGAN)を使用して合成データを生成する、Malware Synthetic Data Generation方法論である。
このデータは,実世界のデータの統計特性を保存し,Androidマルウェア分類器の性能を向上させる。
論文 参考訳(メタデータ) (2025-11-24T19:27:58Z) - GEM+: Scalable State-of-the-Art Private Synthetic Data with Generator Networks [9.432150710329607]
本稿では,AIMの適応計測フレームワークとGEMのスケーラブルなジェネレータネットワークを統合したGEM+を紹介する。
実験の結果,GEM+はAIMよりも実用性とスケーラビリティに優れ,最先端の成果が得られていることがわかった。
論文 参考訳(メタデータ) (2025-11-12T19:18:43Z) - Intellectual Property in Graph-Based Machine Learning as a Service: Attacks and Defenses [57.9371204326855]
この調査は、GMLモデルとグラフ構造化データの両方のレベルで、脅威と防御の最初の分類を体系的に導入する。
本稿では,IP保護手法の有効性を評価し,ベンチマークデータセットのキュレートしたセットを導入し,その適用範囲と今後の課題について論じるシステム評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-27T07:37:52Z) - LMAR: Language Model Augmented Retriever for Domain-specific Knowledge Indexing [42.51773265892766]
Retrieval Augmented Generation (RAG) システムは、事前訓練された埋め込みの性能劣化のためにドメイン固有の知識に苦しむことが多い。
LLM誘導データ合成と対比埋め込み適応と効率的なテキストクラスタリングを組み合わせることで、これらの課題に対処するモデルに依存しないフレームワークであるLMAR(Language Model Augmented Retriever)を提案する。
論文 参考訳(メタデータ) (2025-08-04T16:59:43Z) - LSM-2: Learning from Incomplete Wearable Sensor Data [65.58595667477505]
本稿では,Adaptive and Inherited Masking (AIM)を用いた第2世代Large Sensor Model (LSM-2)を紹介する。
AIMは明示的な計算を必要とせず、不完全なデータから直接堅牢な表現を学習する。
AIMを用いた LSM-2 は, 分類, 回帰, 生成モデルなど, 多様なタスクにまたがる最高の性能を実現する。
論文 参考訳(メタデータ) (2025-06-05T17:57:11Z) - Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation [69.62857948698436]
大規模言語モデル(LLM)の最近の進歩は、コーディングベンチマークのパフォーマンスを改善している。
しかし、手軽に利用できる高品質なデータの枯渇により、改善は停滞している。
本稿では,単一モデルのコードとテスト生成能力を共同で改善するセルフプレイ・ソルバ検証フレームワークであるSol-Verを提案する。
論文 参考訳(メタデータ) (2025-02-20T18:32:19Z) - DataGen: Unified Synthetic Dataset Generation via Large Language Models [88.16197692794707]
DataGenは、多様な、正確で、高度に制御可能なデータセットを生成するように設計された包括的なフレームワークである。
データ多様性を強化するため、DataGenは属性誘導生成モジュールとグループチェック機能を備えている。
大規模な実験は、DataGenによって生成されたデータの優れた品質を示す。
論文 参考訳(メタデータ) (2024-06-27T07:56:44Z) - M2CVD: Enhancing Vulnerability Semantic through Multi-Model Collaboration for Code Vulnerability Detection [52.4455893010468]
大規模言語モデル(LLM)は、コード理解において強力な能力を持つが、微調整コストとセマンティックアライメントの問題により、プロジェクト固有の最適化が制限される。
CodeBERTのようなコードモデルは微調整が容易であるが、複雑なコード言語から脆弱性のセマンティクスを学ぶことはしばしば困難である。
本稿では,M2CVD(Multi-Model Collaborative Vulnerability Detection)手法を提案する。
論文 参考訳(メタデータ) (2024-06-10T00:05:49Z) - GenQ: Quantization in Low Data Regimes with Generative Synthetic Data [28.773641633757283]
我々は、高度な生成AIモデルを用いて高分解能合成データを生成する新しいアプローチであるGenQを紹介する。
データの可用性が限られている場合、実際のデータは合成データ生成プロセスのガイドに使用される。
厳密な実験を通じて、GenQはデータフリーおよびデータスカース量子化の新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2023-12-07T23:31:42Z) - On the Effectiveness of Adversarial Samples against Ensemble
Learning-based Windows PE Malware Detectors [0.0]
本稿では,GANとRLモデルを組み合わせることで,アンサンブル学習に基づく検出器の動作に対処する突然変異システムを提案する。
FeaGANモデルでは、アンサンブル学習を用いて、生成された対向パターンを用いて、マルウェア検出器の回避能力を向上する。
論文 参考訳(メタデータ) (2023-09-25T02:57:27Z) - TSGM: A Flexible Framework for Generative Modeling of Synthetic Time Series [61.436361263605114]
時系列データは、研究者と産業組織間のデータの共有を妨げるため、しばしば不足または非常に敏感である。
本稿では,合成時系列の生成モデリングのためのオープンソースフレームワークである時系列生成モデリング(TSGM)を紹介する。
論文 参考訳(メタデータ) (2023-05-19T10:11:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。