論文の概要: Multi-Class vs. Multi-Label BERT for CVE-to-CWE Mapping: How Taxonomy Structure Shapes the Errors
- arxiv url: http://arxiv.org/abs/2607.07573v1
- Date: Wed, 08 Jul 2026 16:01:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.451819
- Title: Multi-Class vs. Multi-Label BERT for CVE-to-CWE Mapping: How Taxonomy Structure Shapes the Errors
- Title(参考訳): CVE-to-CWEマッピングのためのマルチクラス対マルチラベルBERT:分類構造がエラーをどう形作るか
- Abstract要約: 3つの入れ子ラベル空間で3つのトランスフォーマーエンコーダを評価する。
内部の混乱を許す階層的な評価は、マクロF1を$sim$81%から$sim$90%に上げる。
CySecは、統計学的に有意なゲインをマルチラベル設定に集中して、全体として最も強力な結果を得る。
- 参考スコア(独自算出の注目度): 0.1448851064537181
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Assigning Common Weakness Enumeration (CWE) categories to Common Vulnerabilities and Exposures (CVE) records remains an important but largely manual step in vulnerability analysis. We study this task as a text classification problem and compare two modelling choices: a \emph{multi-class} formulation that predicts a single CWE per CVE and a \emph{multi-label} formulation that allows multiple assignments. Three transformer encoders (BERT Base, SecureBERT, and CySecBERT) are evaluated on three nested label spaces (83, 47, and 25 classes). Multi-class training achieves higher macro-F1 across all settings, although the gap to multi-label narrows from 21 to 2 percentage points as the label space shrinks. Post-hoc threshold optimisation on the multi-label side closes this gap on the 25-class setting. Confusion analysis shows that the dominant misclassification patterns follow the CWE hierarchy and are shared across all three encoders (Pearson $r > 0.92$), which suggests that the error structure is driven more by taxonomy design than by encoder choice. A hierarchy-relaxed evaluation that forgives within-family confusions raises macro-F1 from ${\sim}$81\% to ${\sim}$90\%, indicating that strict metrics understate branch-level classifier quality. CySecBERT achieves the strongest results overall, with statistically significant gains concentrated in the multi-label setting.
- Abstract(参考訳): CWE(Common Weakness Enumeration)カテゴリをCommon Vulnerabilities and Exposures (CVE)レコードに割り当てることは、脆弱性分析において重要なステップだが、大部分は手作業で行う。
このタスクをテキスト分類問題として検討し、CVE毎に1つのCWEを予測する \emph{multi-class} と、複数の割り当てを可能にする \emph{multi-label} の2つのモデル選択を比較した。
3つの変圧器エンコーダ(BERT Base, SecureBERT, CySecBERT)をネストラベル空間(83, 47, 25クラス)で評価する。
マルチクラストレーニングは、ラベル空間が縮小するにつれて、マルチラベルの狭さを21から2ポイントに減らしながら、すべての設定で高いマクロF1を達成する。
マルチラベル側でのホット後のしきい値の最適化は、25クラスの設定でこのギャップを閉じる。
コンフュージョン解析は、主要な誤分類パターンがCWE階層に従っており、3つのエンコーダ(Pearson $r > 0.92$)で共有されていることを示している。
内部の混乱を許す階層付き評価では、マクロF1が${\sim}$81\%から${\sim}$90\%に上昇し、厳密なメトリクスが分岐レベル分類器の品質を下敷きにしていることを示している。
CySecBERTは、統計学的に有意な利得をマルチラベル設定に集中して、全体として最も強力な結果を得る。
関連論文リスト
- Label Granularity Skew in Federated Learning with Hierarchical Image Classification [1.1196974000738729]
フェデレーション学習は、ローカルデータを集中することなく、分散デバイス間でのプライバシ保護コラボレーションを可能にする。
クライアントはデータ分散だけでなく、ドメインの知識やアノテーションの能力も異なります。
本稿では, 階層分類における統計的不均一性の新たな形態であるラベル粒度スキューを紹介する。
論文 参考訳(メタデータ) (2026-08-10T08:01:50Z) - Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification [50.20892407648858]
マルチモーダルコントラスト学習は、画像とテキストカテゴリを整列させることで、ゼロショットの視覚的分類を可能にした。
既存の手法は、しばしば分類学レベルで矛盾する予測を生成する。
本稿では,各分類レベルが適切な最適化を受けることを保証するグループバランス設計を提案する。
我々は、BioCLIPに基づいてTreeOfLife-10Mでモデルをトレーニングし、複数の階層分類ベンチマークで評価する。
論文 参考訳(メタデータ) (2026-06-20T02:12:05Z) - Feature-Label Modal Alignment for Robust Partial Multi-Label Learning [66.1611192892514]
特徴ラベルアライメント(PML-MA)に基づく新しいPML手法を提案する。
PML-MAは特徴とラベルを2つの相補的なモダリティとして扱い、体系的なアライメントを通じて一貫性を回復する。
実世界のデータセットと合成データセットの両方の実験では、PML-MAが最先端の手法を大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2026-04-10T07:44:46Z) - Multi-Head Encoding for Extreme Label Classification [15.815842882043734]
eXtreme Classification Label (XLC) は、大量のラベルを識別するために確立されている。
カテゴリの数が増加するにつれて、分類器内のパラメータの数や非線形演算も増加する。
これにより計算過負荷問題(CCOP)が発生する。
論文 参考訳(メタデータ) (2024-12-13T14:53:47Z) - TagCLIP: A Local-to-Global Framework to Enhance Open-Vocabulary
Multi-Label Classification of CLIP Without Training [29.431698321195814]
Contrastive Language-Image Pre-Training (CLIP) はオープン語彙分類において顕著な能力を示した。
CLIPは、グローバル機能が最も顕著なクラスに支配される傾向があるため、マルチラベルデータセットのパフォーマンスが低い。
画像タグを得るための局所言語フレームワークを提案する。
論文 参考訳(メタデータ) (2023-12-20T08:15:40Z) - Generating Unbiased Pseudo-labels via a Theoretically Guaranteed
Chebyshev Constraint to Unify Semi-supervised Classification and Regression [57.17120203327993]
分類におけるしきい値と擬似ラベルプロセス(T2L)は、ラベルの品質を決定するために信頼性を使用する。
本質的には、レグレッションは高品質なラベルを生成するためにバイアスのない方法も必要である。
チェビシェフの不等式に基づく不偏ラベルを生成するための理論的に保証された制約を提案する。
論文 参考訳(メタデータ) (2023-11-03T08:39:35Z) - ProTeCt: Prompt Tuning for Taxonomic Open Set Classification [59.59442518849203]
分類学的オープンセット(TOS)設定では、ほとんどショット適応法はうまくいきません。
本稿では,モデル予測の階層的一貫性を校正する即時チューニング手法を提案する。
次に,階層整合性のための新しいPrompt Tuning(ProTeCt)手法を提案し,ラベル集合の粒度を分類する。
論文 参考訳(メタデータ) (2023-06-04T02:55:25Z) - CHiLS: Zero-Shot Image Classification with Hierarchical Label Sets [24.868024094095983]
オープン語彙モデル(例えばCLIP)はゼロショット分類において強い性能を示している。
暗黙的な意味的階層を持つデータセットに対する階層的ラベルセット(CHiLS)を用いた分類を提案する。
CHiLSは既存のゼロショットパイプラインで簡単に実装でき、追加のトレーニングコストを必要としない。
論文 参考訳(メタデータ) (2023-02-06T03:59:15Z) - All Mistakes Are Not Equal: Comprehensive Hierarchy Aware Multi-label
Predictions (CHAMP) [19.41500672342727]
本稿では,階層木のように重大度に依存して誤予測を罰する枠組みを提案する。
提案手法は,既存のマルチラベル分類アルゴリズムをより良い誤りで拡張するフレームワークを提供する。
論文 参考訳(メタデータ) (2022-06-17T09:32:48Z) - Rank-Consistency Deep Hashing for Scalable Multi-Label Image Search [90.30623718137244]
スケーラブルなマルチラベル画像検索のための新しいディープハッシュ法を提案する。
2つの空間の類似性順序を整列するために、新しい階数整合性目的を適用した。
強力な損失関数は、意味的類似性とハミング距離が一致しないサンプルをペナルティ化するように設計されている。
論文 参考訳(メタデータ) (2021-02-02T13:46:58Z) - Generative Multi-Label Zero-Shot Learning [136.17594611722285]
マルチラベルゼロショット学習は、トレーニング中にデータが入手できない複数の見えないカテゴリにイメージを分類する試みである。
我々の研究は、(一般化された)ゼロショット設定におけるマルチラベル機能の問題に最初に取り組みました。
私たちのクロスレベル核融合に基づく生成アプローチは、3つのデータセットすべてにおいて最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2021-01-27T18:56:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。