論文の概要: X-amine509: Predicting the Practical Risk Level of Enterprise X.509 Certificates
- arxiv url: http://arxiv.org/abs/2609.09402v1
- Date: Tue, 08 Sep 2026 19:58:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.802576
- Title: X-amine509: Predicting the Practical Risk Level of Enterprise X.509 Certificates
- Title(参考訳): X-amine509: 企業X.509証明書の実用的リスクレベルを予測する
- Abstract要約: X-amine509は、2段階のトリアージシステムである。
私たちはFortune 500,.gov,.eduドメインから1,027,714のX.509証明書を収集しました。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Enterprises managing large X.509 certificate inventories face a prioritization problem: deterministic analysis tools that precisely identify standards violations are indispensable for remediation, but applying them exhaustively across millions of certificates is operationally impractical. We present X-amine509, a two-stage triage system that uses machine learning to rapidly rank certificates by predicted risk and route only the highest-risk items to full deterministic analysis. Certificate risk is quantified as a composite score derived from 177 defect checks grounded in CA/Browser Forum Baseline Requirements, NIST IR 8547/SP 800-57, and cryptographic strength criteria, weighted by security severity across four tiers ranging from cryptographic breaks to minor compliance deviations. We collected 1,027,714 X.509 certificates from Fortune 500, .gov, and .edu domains and scored each using this rubric. On a held-out test set of 201,976 certificates, our best model (Extra Trees) achieves $R^2$ of 0.993 with MAE of 2.26, while Decision Tree scores $R^2$ of 0.986 at 3.7 million certificates per second on a single machine. Ranking quality confirms the triage value: aggregate NDCG exceeds 0.997, and severity-tier classification reports 99.76% accuracy with 98.90% recall on critical-tier defects. Thirteen months later, we retrieved another 571,374 certificates to test our models' durability over time, and the Extra Trees and Decision Tree models maintain MAE below 6.8, $R^2$ of at least 0.915, aggregate NDCG above 0.988, severity-tier accuracy of at least 99.52%, and critical-tier recall of at least 97.03%. Feature importance analysis identifies validity period, Extended Key Usage configuration, negative serial number encoding, and self-signed status as the strongest risk predictors, providing coarse interpretability at the triage stage.
- Abstract(参考訳): 大きなX.509証明書在庫を管理する企業は優先順位付けの問題に直面している: 基準違反を正確に識別する決定論的分析ツールは、修復には不可欠であるが、数百万の証明書に徹底的に適用することは、運用上不実用である。
機械学習を用いた2段階トリアージシステムであるX-amine509を提案する。
認証リスクは、CA/Browser Forum Baseline Requirements, NIST IR 8547/SP 800-57に根ざした177の欠陥チェックと、暗号ブレークからマイナーコンプライアンス逸脱までの4層にわたるセキュリティの重み付けによる暗号強度基準から導かれる複合スコアとして定量化される。
私たちはFortune 500から1,027,714 X.509の証明書を収集しました。
と...
江戸藩は それぞれ このルーリックを使って 得点しました。
201,976個の証明書のホールドアウトテストセットでは、最良のモデル(Extra Trees)が2.26のMAEで$R^2$ of 0.993を達成する一方、Decision Treeは1台のマシンで毎秒370万の証明書で$R^2$ of 0.986をスコアする。
集計NDCGは0.997を超え、重度レベルの分類では99.76%が正確であり、98.90%が臨界層の欠陥をリコールしている。
13ヶ月後、私たちはモデルの耐久性をテストするためにさらに571,374の証明書を取得し、Extra Trees and Decision TreeモデルではMAEが6.8以下、$R^2$が0.915以上、NDCGが0.988以上、Severity-tierが99.52%以上、Critical-tierが97.03%以上を維持しました。
特徴重要度分析は、有効期間、拡張キー使用構成、負のシリアル番号エンコーディング、自己署名ステータスを最強のリスク予測器として識別し、トリアージ段階で粗い解釈性を提供する。
関連論文リスト
- The Accuracy Paradox: Empirical Diagnostic of Default Decision Thresholds in Multi-Label Enzyme Commission Prediction [With Code] [0.7530103765625609]
本報告では,厳密なクラス不均衡の下で動作している未校正決定境界の系統的実証診断について述べる。
その結果, マルチラベルシステムAは77.16%, マクロF1スコア(0.3976), マクロリコール(0.3872)の精度が著しく向上した。
論文 参考訳(メタデータ) (2026-09-07T19:00:17Z) - Quality-Diversity Stress Tests for Process Reward Models:What Archive Coverage Can and Cannot Certify [1.0742675209112622]
MAP-Elites を用いた品質多様性探索問題として PRM ストレス試験を定式化する。
有限セル修復は、カバーセルのテールリスクと平均残酷さを境界とするが、カバーレートだけでは最悪の残酷なセルをバウンドすることはできない。
事前宣言されたペアのLoRA修復プロトコルは、攻撃率が0.148から0.037から0.074に減少し、最悪の攻撃は0.333から0.177から0.212に減少し、最高の4つの精度を低下させることなくAUROCのランキングを改善する。
論文 参考訳(メタデータ) (2026-08-08T08:41:06Z) - Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation [0.0]
エージェントAI評価パイプラインは、デプロイメント決定、安全認定、規制コンプライアンス要求を正当化するベンチマークスコアを生成する。
正式なフレームワークはまだ、これらのパイプラインのステージにおける妥当性の低下を特徴付けていない。
本稿では,タスク生成,人間シミュレーションキャリブレーション,自動判定の3層合成妥当性モデルを提案する。
論文 参考訳(メタデータ) (2026-08-01T17:50:12Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - Valid Per-Field Selective Risk Control for Document Extraction: Three Failure Modes, a Validity Ladder, and When Conditioning Pays [0.0]
フィールド単位の受け入れ/レビューは、ほとんどのアルファ版において選択的なリスクを持つが、信頼契約文書抽出システムを必要とする。
13,859 個の CORD レシート (49.0% ) からの真の Claude-sonnet-5 フィールドでは、3 つの障害モードを診断する。
シードピンでレグレッション付きプロシージャを備えたApache-2.0がリリースされた。
論文 参考訳(メタデータ) (2026-07-28T17:08:50Z) - GAUGE: Grading Agent-Built Financial Models Without a Golden Answer [38.72982631250115]
65社をカバーする108組のうち、中央値は0.33、92.6%は0.70以下であり、同じビンテージのペアは10%以内のインプリード価格に合意していない。
同じ企業の独立したアナリストモデルを用いて、65社をカバーする108組のうち、中央値のシングル参照スコアは0.33、92.6%が0.70未満であり、同じビンテージペアが10%以内のインリード価格で一致しないことが判明した。
本稿では,エージェント構築評価モデルを評価するベンチマークであるGAUGEを紹介する。
論文 参考訳(メタデータ) (2026-07-27T13:03:19Z) - False Sense of Safety in Selective Signal Classification: Auditing Bound Tightness and Exchangeability for Risk Control [6.3999417080764225]
分布自由リスク制御による選択的な予測では、キャリブレーションドローに対する信頼度1-deltaでは、受け入れられた入力のエラー率は、ユーザ予算のアルファ値以下である。
我々はこの約束を、機械異常音検出(ASD)とAI生成画像鑑定という信号領域検出器で監査する。
論文 参考訳(メタデータ) (2026-06-13T06:48:50Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Improving Model Safety by Targeted Error Correction [10.82789277277678]
二重分類器GBDTパイプラインを導入し,高リスクな非人間の誤分類から人間のような誤りを識別する。
動物データセットでは1.60%,ISICでは1.84%,SICAPv2では1.70%)。
ISICでは34.1%,SICAPv2では12.57%の危険な非人間的誤りを減らした。
論文 参考訳(メタデータ) (2026-05-04T12:47:41Z) - Towards Evading the Limits of Randomized Smoothing: A Theoretical
Analysis [74.85187027051879]
決定境界を複数の雑音分布で探索することにより,任意の精度で最適な証明を近似できることを示す。
この結果は、分類器固有の認証に関するさらなる研究を後押しし、ランダム化された平滑化が依然として調査に値することを示す。
論文 参考訳(メタデータ) (2022-06-03T17:48:54Z) - Unsupervised Anomaly Instance Segmentation for Baggage Threat
Recognition [39.40595024569702]
本稿では,X線スキャンにおける手荷物の脅威を,根拠となる真理ラベルを必要とせず,異常として認識する,新しい教師なしの異常なインスタンスセグメンテーションフレームワークを提案する。
そのスタイリング能力のおかげで、フレームワークは一度だけ訓練され、推論段階では、スキャナーの仕様にかかわらず、反バンドアイテムを検出して抽出する。
提案した4つの公共荷物X線データセットの徹底的な評価は、再学習なしに、競争性能を達成できることを実証している。
論文 参考訳(メタデータ) (2021-07-15T13:56:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。