論文の概要: Too Sure to Be Safe: Model Calibration for Reliable Log Anomaly Detection
- arxiv url: http://arxiv.org/abs/2608.17965v2
- Date: Wed, 19 Aug 2026 18:27:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 14:00:35.499088
- Title: Too Sure to Be Safe: Model Calibration for Reliable Log Anomaly Detection
- Title(参考訳): 安全すぎる:信頼性の高いログ異常検出のためのモデル校正
- Abstract要約: 本稿では,言語モデルに基づくログ異常検出器が過度な信頼度を誤った予測に割り当てていることを示す。
信頼性の高いログ異常検出のための軽量なポストホックキャリブレーションフレームワークであるLog Reconstruction and Distance (LoRD)を提案する。
LoRDは信頼性を継続的に向上し、異常検出性能を犠牲にすることなく、過信の異常関連エラーを大幅に低減する。
- 参考スコア(独自算出の注目度): 8.158546328898977
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Online log anomaly detection is critical for maintaining the reliability of large-scale computing systems. Although recent language model-based log anomaly detectors achieve strong detection performance, their confidence estimates remain poorly calibrated. We show that these detectors frequently assign excessive confidence to incorrect predictions, particularly for anomalous logs under severe class imbalance. Moreover, confidence on erroneous predictions remains persistently high even when conventional calibration metrics indicate good calibration, creating a critical reliability gap for operational monitoring systems. To address this issue, we propose Log Reconstruction and Distance (LoRD), a lightweight post-hoc calibration framework for reliable log anomaly detection. LoRD learns prediction-route-specific reliability models from latent representations of correctly classified validation samples and estimates prediction reliability through route-wise reconstruction distances. Based on the estimated reliability, LoRD selectively recalibrates high-risk predictions to suppress overconfident errors while preserving reliable predictions. Extensive experiments on four large-scale log benchmark datasets and multiple language model-based detectors demonstrate that LoRD consistently improves confidence reliability and substantially reduces overconfident anomaly-related errors without sacrificing anomaly detection performance.
- Abstract(参考訳): 大規模コンピューティングシステムの信頼性を維持するためには,オンラインログ異常検出が重要である。
近年の言語モデルに基づくログ異常検知器は強い検出性能を達成しているが、信頼性評価は依然として不十分である。
これらの検出器は過度な信頼度を誤った予測に割り当てることがしばしばあり、特に過度なクラス不均衡の下での異常なログに対してである。
さらに,従来のキャリブレーション指標が良好なキャリブレーションを示す場合であっても,誤予測の信頼性は引き続き高く保たれ,運用監視システムにとって重要な信頼性ギャップが生じる。
この問題に対処するために、信頼性の高いログ異常検出のための軽量なポストホックキャリブレーションフレームワークであるLog Reconstruction and Distance (LoRD)を提案する。
LoRDは、正しく分類された検証サンプルの潜在表現から予測経路固有の信頼性モデルを学び、経路ワイド再構成距離を通して予測信頼性を推定する。
推定された信頼性に基づいて、LoRDは高リスク予測を選択的に再検討し、信頼性のある予測を保持しながら過信エラーを抑制する。
4つの大規模ログベンチマークデータセットと複数の言語モデルベースの検出器による大規模な実験により、LoRDは信頼性を一貫して改善し、異常検出性能を犠牲にすることなく、過信の異常関連エラーを大幅に低減することを示した。
関連論文リスト
- Conformal Changepoint Localization and Root Cause Analysis with Corrupted Observations [55.76952683833966]
本稿では,データ破損時の信頼性設定サイズを低減するために,重み付きCONCH(W-CONCH)と重み付きCROC(W-CROC)を提案する。
画像ベースおよび実世界の変化点と根本原因ベンチマークの実験は、不確実性ベースの重み付けが信頼性セットのサイズを大幅に減少させることを示している。
論文 参考訳(メタデータ) (2026-07-29T05:16:59Z) - Anomaly-Informed Confidence Calibration for Vision-Based Safety Prediction [1.0981335059631014]
既存の異常信号における臨界知覚-力学ギャップを同定する。
本研究では,世界モデルから抽出した2つの異常スコアを融合する異常情報オンライン手法を提案する。
論文 参考訳(メタデータ) (2026-05-20T12:43:09Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - Latent Dynamics-Aware OOD Monitoring for Trajectory Prediction with Provable Guarantees [8.920589816043298]
安全クリティカルなサイバー物理システムでは、正確な軌道予測が下流の計画と制御に不可欠なガイダンスを提供する。
このようなOODイベントの検出は、トラフィック条件の進化とインタラクションパターンの変化によって困難である。
我々は,変化後分布の明示的な知識を必要とせずに,累積最大離散性アプローチを拡張して検出を可能にする。
3つの実世界の運転データセットの実験では、重み付きエラーや未知のポストチェンジ条件に対する検出遅延と堅牢性の低減が示されている。
論文 参考訳(メタデータ) (2026-03-15T20:56:57Z) - Decision-Aware Trust Signal Alignment for SOC Alert Triage [0.0]
本稿では,SOC警告トリアージの信頼信号対応方式を提案する。
このフレームワークは、調整済みの信頼性、軽量不確実性、そしてコストに敏感な決定しきい値をコヒーレントな決定支持層に組み合わせている。
信頼度が不一致な表示によって偽陰性が大幅に増幅されるのに対し、コスト重み付き損失は決定整合信頼信号を持つモデル間での桁違いに減少することを示す。
論文 参考訳(メタデータ) (2026-01-08T01:41:54Z) - Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - Calibrated Prediction Set in Fault Detection with Risk Guarantees via Significance Tests [3.500936878570599]
本稿では,形式的リスク保証を提供するために,コンフォメーション予測フレームワークと重要度テストを統合した新しい故障検出手法を提案する。
提案手法は,名目レベル以上の経験的カバレッジ率(1-alpha$)を一貫して達成する。
その結果、ユーザ定義のリスクレベル(alpha$)と効率の間のコントロール可能なトレードオフが明らかとなり、より高いリスク耐性が平均予測セットのサイズを小さくする。
論文 参考訳(メタデータ) (2025-08-02T05:49:02Z) - Revisiting Confidence Estimation: Towards Reliable Failure Prediction [53.79160907725975]
多くの信頼度推定法は誤分類誤りを検出するのに有害である。
本稿では, 最先端の故障予測性能を示す平坦な最小値を求めることにより, 信頼性ギャップを拡大することを提案する。
論文 参考訳(メタデータ) (2024-03-05T11:44:14Z) - PULL: Reactive Log Anomaly Detection Based On Iterative PU Learning [58.85063149619348]
本稿では,推定故障時間ウィンドウに基づくリアクティブ異常検出のための反復ログ解析手法PULLを提案する。
我々の評価では、PULLは3つの異なるデータセットで10のベンチマークベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2023-01-25T16:34:43Z) - Free Lunch for Generating Effective Outlier Supervision [46.37464572099351]
本稿では, ほぼ現実的な外乱監視を実現するための超効率的な手法を提案する。
提案したtextttBayesAug は,従来の方式に比べて偽陽性率を 12.50% 以上削減する。
論文 参考訳(メタデータ) (2023-01-17T01:46:45Z) - Evaluating probabilistic classifiers: Reliability diagrams and score
decompositions revisited [68.8204255655161]
確率的に統計的に一貫性があり、最適に結合し、再現可能な信頼性図を自動生成するCORP手法を導入する。
コーパスは非パラメトリックアイソトニック回帰に基づいており、プール・アジャセント・ヴァイオレータ(PAV)アルゴリズムによって実装されている。
論文 参考訳(メタデータ) (2020-08-07T08:22:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。