論文の概要: When Entropy Is Not Enough: Multi-Modal Classification of Encrypted and Compressed Data Fragments
- arxiv url: http://arxiv.org/abs/2605.31337v1
- Date: Fri, 29 May 2026 14:18:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.656574
- Title: When Entropy Is Not Enough: Multi-Modal Classification of Encrypted and Compressed Data Fragments
- Title(参考訳): エントロピーが不十分な場合:暗号化および圧縮データフラグメントのマルチモーダル分類
- Abstract要約: Triumvirは、生のバイト断片の統計的、シーケンシャル、空間的表現を統合するマルチモーダルで不確実性を意識したアンサンブルアーキテクチャである。
トリウムヴィルは、二進法で最大4.5pp、マルチクラス分類で+6.4ppのゲインを持つ最先端の手法を一貫して上回ることを示す。
- 参考スコア(独自算出の注目度): 1.4419466020986265
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Reliable identification of encrypted data fragments is essential in cybersecurity, with applications to ransomware detection, digital forensics, and large-scale data analysis. Distinguishing encrypted from compressed fragments is particularly challenging, as short fragments lack structural data and exhibit low statistical redundancy. Traditional statistical methods based on byte-level distributions show limited effectiveness on this task. Recent machine learning approaches improve performance by learning subtle patterns from raw bytes, but predominantly rely on single-modal representations, implicitly assuming that a single view of the data is sufficient for accurate classification. This paper shows that this assumption becomes a fundamental limitation in low-information settings, when only small fragments of data are available (512--2048 Bytes). We propose Triumvir, a multi-modal, uncertainty-aware ensemble architecture that integrates statistical, sequential, and spatial representations of raw byte fragments. Extensive experimental analysis demonstrates that Triumvir consistently outperforms state-of-the-art methods with gains of up to +4.5pp in binary and +6.4pp in multiclass classification. Ablation studies confirm that combining modalities is critical, yielding improvements of up to +5pp over partial configurations.
- Abstract(参考訳): 暗号化されたデータ断片の信頼性の高い識別は、ランサムウェア検出、デジタル法医学、大規模データ分析など、サイバーセキュリティにおいて不可欠である。
圧縮された断片から暗号化された断片を識別することは特に困難であり、短い断片には構造データがなく、統計的冗長性が低い。
バイトレベルの分布に基づく従来の統計手法は、この課題に対して限定的な効果を示す。
最近の機械学習アプローチは、生のバイトから微妙なパターンを学習することでパフォーマンスを向上させるが、主に単一のモーダル表現に依存しており、データの単一のビューが正確な分類に十分であると暗黙的に仮定している。
本稿では,この仮定が,少ないデータ断片(512-2048バイト)しか利用できない場合に,低情報設定における基本的な制限となることを示す。
生のバイト断片の統計的,シーケンシャル,空間的表現を統合したマルチモーダル・不確実性を考慮したアンサンブルアーキテクチャであるTriumvirを提案する。
大規模な実験分析により、Triumvirは二進法で最大4.5pp、マルチクラス分類で+6.4ppのゲインを持つ最先端の手法を一貫して上回っていることが示されている。
アブレーション研究は、モダリティを組み合わせることが重要であり、部分的な構成よりも最大で5ppの改善をもたらすことを確認している。
関連論文リスト
- SAS: Semantic-aware Sampling for Generative Dataset Distillation [55.27114962330541]
本稿では,コントラスト言語-画像事前学習(CLIP)をポストサンプリングのセマンティクスとして活用することで,データセット蒸留のセマンティック・アウェア・パースペクティブを導入する。
我々のゴールは、コンパクトであるだけでなく、意味的にクラス差別的で多様である蒸留データセットを得ることです。
論文 参考訳(メタデータ) (2026-05-18T08:05:46Z) - DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning [64.33887406863899]
マルチモーダル偽装検出は、法医学とセキュリティのための聴覚的手がかりを解析することにより、偽装行動を特定することを目的としている。
既存のベンチマークでは、中間的な推論手段を使わずにバイナリラベルのみを提供する。
構造的キューレベルの記述と推論チェーンを用いた推論データセットを構築した。
1695年のサンプルでは、非実験的偽装検出データセットとしては最大である。
論文 参考訳(メタデータ) (2026-03-25T04:06:36Z) - ML-driven detection and reduction of ballast information in multi-modal datasets [0.0]
Ballastは冗長あるいは低ユーティリティな情報であり、次元性、ストレージ要件、計算コストを増大させる。
本研究では,構造化,半構造化,非構造化,スパースデータ型にまたがるバラスト検出と低減のための一般化されたマルチモーダルフレームワークを提案する。
バラストスコア(Ballast Score)は、これらの信号を統一されたクロスモーダルプルーニング戦略に統合するために提案されている。
論文 参考訳(メタデータ) (2026-02-18T21:01:05Z) - Localized Kernel Projection Outlyingness: A Two-Stage Approach for Multi-Modal Outlier Detection [0.0]
Two-Stage LKPLOは、新しいマルチステージアウトレイラ検出フレームワークである。
従来の射影的手法の制約を克服する。
挑戦的なデータセットで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-10-28T03:53:46Z) - Knowledge-Informed Neural Network for Complex-Valued SAR Image Recognition [51.03674130115878]
本稿では,新しい「圧縮集約圧縮」アーキテクチャ上に構築された軽量なフレームワークであるKnowledge-Informed Neural Network(KINN)を紹介する。
KINNはパラメータ効率の認識における最先端を確立し、データスカースとアウト・オブ・ディストリビューションのシナリオにおいて例外的な一般化を提供する。
論文 参考訳(メタデータ) (2025-10-23T07:12:26Z) - Compressive Meta-Learning [49.300635370079874]
圧縮学習(Compressive learning)は、ランダムで非線形な特徴を用いることで効率的な処理を可能にするフレームワークである。
圧縮学習手法の符号化段階と復号段階の両方をメタラーニングするフレームワークを提案する。
ニューラルネットワークベースの圧縮PCA、圧縮リッジ回帰、圧縮k平均、オートエンコーダなど、複数のアプリケーションについて検討する。
論文 参考訳(メタデータ) (2025-08-14T22:08:06Z) - Regularized Contrastive Partial Multi-view Outlier Detection [76.77036536484114]
RCPMOD(Regularized Contrastive partial Multi-view Outlier Detection)と呼ばれる新しい手法を提案する。
このフレームワークでは、コントラスト学習を利用して、ビュー一貫性のある情報を学び、一貫性の度合いでアウトレイラを識別する。
4つのベンチマークデータセットによる実験結果から,提案手法が最先端の競合より優れていることが示された。
論文 参考訳(メタデータ) (2024-08-02T14:34:27Z) - Hodge-Aware Contrastive Learning [101.56637264703058]
単純コンプレックスは、マルチウェイ依存によるデータのモデリングに有効である。
我々は、単純なデータを処理するための対照的な自己教師付き学習手法を開発した。
論文 参考訳(メタデータ) (2023-09-14T00:40:07Z) - Reliable Detection of Compressed and Encrypted Data [1.3439502310822147]
ランサムウェア検出、法医学、データ分析は、暗号化されたデータの断片を確実に識別する手法を必要とする。
現在のアプローチでは、エントロピー推定などのバイトレベルの分布から得られた統計を使用して、暗号化された断片を識別する。
現代のコンテンツタイプでは、データ分散を均一な分布に近づける圧縮技術を使用している。
本稿では、大規模で標準化されたデータセット上での既存の統計的テストを比較し、現在のアプローチが暗号化データと圧縮データを一貫して区別できないことを示す。
論文 参考訳(メタデータ) (2021-03-31T13:27:28Z) - EnCoD: Distinguishing Compressed and Encrypted File Fragments [0.9239657838690228]
現在の手法では,大規模な断片サイズであっても,暗号化と圧縮を確実に区別することはできない。
圧縮されたデータと暗号化されたデータを確実に区別できる学習ベースの分類器であるEnCoDを,フラグメントから512バイトまで小さく設計する。
異なるデータ型の大規模なデータセットに対する現在のアプローチに対するEnCoDの評価を行い、最も検討されたフラグメントサイズやデータタイプに対して、現在の最先端よりも優れていることを示す。
論文 参考訳(メタデータ) (2020-10-15T13:55:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。