論文の概要: Did We Actually Fix It? An Independent Adversarial Stress-Test of Post-Point-Adjustment Evaluation Metrics for Time-Series Anomaly Detection
- arxiv url: http://arxiv.org/abs/2607.11969v2
- Date: Sun, 19 Jul 2026 06:38:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.304324
- Title: Did We Actually Fix It? An Independent Adversarial Stress-Test of Post-Point-Adjustment Evaluation Metrics for Time-Series Anomaly Detection
- Title(参考訳): 実際に修正したのか? 時系列異常検出のための点数調整後評価指標の独立的逆ストレステスト
- Abstract要約: 我々は,実際のベンチマークにおいて,代替指標が非熟練検出器に抵抗するか否かを,独立して,反対に問う。
N, 敵が最も多く報告するランダムな試行回数。
ほぼすべてのベンチマークにおいて、単一ランのスコアを報告したり、Nを開示したり、最もNのインフレに抵抗するPRベースの指標を好むことを推奨する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Point-adjustment (PA), for years the default scoring protocol in time-series anomaly detection (TSAD), was shown by Kim et al. (2022) to award near-perfect F1 to random anomaly scores. The field adopted a suite of replacement metrics (PA%K, range-based precision/recall, affiliation precision/recall, and Volume-Under-the-Surface, VUS, ROC/PR). We ask, independently and adversarially, whether these resist no-skill detectors on real benchmarks, and find the answer turns entirely on one overlooked variable: N, the number of random attempts an adversary reports the best of. Under a single honest run (N=1), not one replacement metric is gameable on any of six benchmarks (UCR, SMD, SMAP, MSL, NAB, PSM): a random detector reaches 90% of the best real detector's score on at most 11% of series for affiliation-F1, 5% for the ROC family, and 2% for the PR-based metrics and PA%K. But under best-of-N reporting, the seed-shopping endemic to ML, the metrics split sharply. affiliation-F1 and every ROC-based metric inflate steeply, affiliation crossing gameable (25% of series) by N=3 and reaching 0.98 at the full pool (N=41), the ROC family crossing by N=9-11; the PR-based metrics and PA%K stay near-flat at every N, floored near the anomaly prevalence (the lone exception is NAB at large N). A paired test finds VUS-ROC inflated on 131 series where its sibling VUS-PR is not, and never the reverse. The ROC-vs-PR split follows from the order-statistic behaviour of AUC under extreme class imbalance (a random PR-AUC is floored at prevalence); affiliation inflates by a second route, its extreme single-run leniency (already fragile at N=1). We release a pip-installable stress-test harness, and recommend reporting single-run scores or disclosing N and preferring PR-based metrics, which resist best-of-N inflation on nearly every benchmark.
- Abstract(参考訳): ポイント調整(PA)は、何年もの間、時系列異常検出(TSAD)におけるデフォルトスコアプロトコルであり、Kim et al (2022) により、ランダムな異常スコアにほぼ完璧なF1を付与することを示した。
この分野では、置換指標(PA%K、レンジベース精度/リコール、アフィリエレーション精度/リコール、ボリュームアンダーサーフェス、VUS、ROC/PR)が採用された。
我々は、独立して、そして反対に、これらが実際のベンチマーク上で非熟練検出器に抵抗するかどうかを問う。
1つの正直な実行(N=1)の下では、6つのベンチマーク(UCR, SMD, SMAP, MSL, NAB, PSM)のいずれかで1つの置換計量がゲーム可能であるわけではなく、ランダム検出器は、アフィリエレーションF1の少なくとも11%、ROCファミリーの5%、PRベースのメトリクスとPA%Kの2%で最高の実検出器のスコアの90%に達する。
しかし、Nのベスト・オブ・Nのレポートでは、MLへのシード・ショッピング・エンデミックが急激に分裂した。
Affiliation-F1 と全ての ROC 計量は急激に膨張し、N=3 でゲーム可能(系列の25%)、全プールで 0.98 に達する(N=41 で ROC 族が N=9-11 で交差する)。
ペアテストでは、VUS-ROCが131シリーズに膨らませられ、兄弟のVUS-PRが存在しないこと、逆でないことが分かる。
ROC-vs-PR は、極度のクラス不均衡下での AUC の順序統計的挙動(ランダムな PR-AUC は有病率で床になる)から成り、アフィリエレーションは第2経路によって膨らむ。
我々は、ピップインストール可能なストレステストハーネスをリリースし、ほぼ全てのベンチマークでNの最良のインフレーションに抵抗するPRベースの指標を優先して、シングルランスコアの報告やNの開示を推奨する。
関連論文リスト
- Not All Relations Are Equal: Relation-Balanced and Calibrated Graph Learning for Provenance-Based Intrusion Detection [66.44527094471619]
本稿では,関係バランスの取れたグラフ学習を用いた教師なしフレームワークRECALについて述べる。
3つのDARPA E3データセットにおいて、RECALはF1スコアの99.99%、99.93%、99.99%を達成し、各データセットでそれぞれ0.88、0.82、0.42で最高のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-15T00:31:01Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy [17.48959208263029]
我々は,クリーンな後進平均を予測し,正確なカーネル依存線形写像を用いてスコアに変換するEmphmean-to-score (M2S)を導入する。
均一な汚職のために、確率的単純度をブリッジポリトープにマッピングし、吸収マスクの破損のためにMD4を正確に回収する。
論文 参考訳(メタデータ) (2026-07-23T14:37:30Z) - Benchmark AUC Is Not Deployable Reliability: A Cross-Dataset Audit of Off-the-Shelf Features for Surveillance Video Anomaly Detection [0.0]
自動的な“suspicious behavior”フラグングは、AI監視の柱となる約束だ。
Fieldは標準ビデオ異常検出ベンチマークで高フレームレベルのROC-AUCを報告している。
その仮定が下がったときに何が起こるか監査します。
論文 参考訳(メタデータ) (2026-06-28T17:08:02Z) - Beyond ROC-AUC: Operating-Point Performance Reporting for Biometric Verification [0.0]
生体認証器は、しばしば厳密な偽一致予算で展開されるので、スコア範囲の狭く低い偽一致率(FMR)スライスのみを使用する。
実際には、受信機動作特性曲線(ROC-AUC)の下の1つの領域が分解能として報告されている。
完全なROC-AUCでは、FMR = 10-3では、より強く見えることが示されている。
論文 参考訳(メタデータ) (2026-06-13T15:28:54Z) - Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle [0.0]
基準自由忠実度測定は、モデルが基底真理に対して行う各原子的クレームを検証する。
彼らが盲点を共有していることを示す:彼らは精度だけを計測し、主張されている主張は支持されているか?
戦略的基底真理が決定論的に導出される領域であるF1テレメトリを用いて、この測定を可能にする。
論文 参考訳(メタデータ) (2026-06-08T11:56:25Z) - Tailoring Strictly Proper Scoring Rules for Downstream Tasks: An Application to Causal Inference [48.78219918881965]
本稿では,ダウンストリーム誤差メトリックの局所曲率をマッチングすることにより,タスク固有の厳密なスコアリングルールを導出するフレームワークを提案する。
これを平均処理効果 (ATE) 推定に適用し, 閉形式損失と対応する正準確率写像を導出する。
論文 参考訳(メタデータ) (2026-06-02T08:41:25Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Metric Unreliability in Multimodal Machine Unlearning: A Systematic Analysis and Principled Unified Score [14.579552536669217]
一般データ保護規制法に準拠するためには、ビジョンランゲージモデル(VLM)のアンラーニングが必要である。
マルチモーダル・アンラーニングにおける信頼性の最初の研究について述べる。
統一品質スコア(Unified Quality Score, UQS)は, 各計量のスピアマン相関と距離の関係から得られる重みを持つ計量である。
論文 参考訳(メタデータ) (2026-05-04T04:13:00Z) - One Sample is Enough to Make Conformal Prediction Robust [53.78604391939934]
共形予測は, 1つのランダムな摂動入力に対して前方通過しても, ある程度の堅牢性が得られることを示す。
提案手法は,入力毎に多数のパス(例えば100回程度)を使用するSOTA法と比較して,平均セットサイズが小さいロバストな集合を返す。
論文 参考訳(メタデータ) (2025-06-19T19:14:25Z) - Target before Shooting: Accurate Anomaly Detection and Localization
under One Millisecond via Cascade Patch Retrieval [49.45246833329707]
異常検出(AD)の「マッチング」性を再検討する
本稿では,ADの精度と実行速度を同時に向上する新しいADフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-13T11:49:05Z) - Detection Transformer with Stable Matching [48.963171068785435]
もっとも重要な設計は, 肯定的な事例の分類スコアを監督するために, 位置測定値のみを使用することである。
本原理では,DTRの分類損失とマッチングコストに位置測定値を統合することで,簡易かつ効果的な2つの修正を提案する。
12エポックおよび24エポックのトレーニング設定の下でResNet-50バックボーンを用いてCOCO検出ベンチマークで50.4および51.5APを達成する。
論文 参考訳(メタデータ) (2023-04-10T17:55:37Z) - Evaluating Large-Vocabulary Object Detectors: The Devil is in the
Details [107.2722027807328]
我々は、APのデフォルト実装はカテゴリー独立ではなく、適切に校正された検出器を直接報酬するものではないことを発見した。
既定の実装ではゲーム可能なメトリックが生成され、単純で非合理的な再ランクポリシーがAPを大きなマージンで改善できることが示される。
我々は,近年の大規模語彙検出の進歩をベンチマークし,新たなクラスごとの独立性評価において,多くの報告された利益が改善に結びついていないことを発見した。
論文 参考訳(メタデータ) (2021-02-01T18:56:02Z) - On the Practicality of Differential Privacy in Federated Learning by
Tuning Iteration Times [51.61278695776151]
フェデレートラーニング(FL)は、分散クライアント間で機械学習モデルを協調的にトレーニングする際のプライバシ保護でよく知られている。
最近の研究では、naive flは勾配リーク攻撃の影響を受けやすいことが指摘されている。
ディファレンシャルプライバシ(dp)は、勾配漏洩攻撃を防御するための有望な対策として現れる。
論文 参考訳(メタデータ) (2021-01-11T19:43:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。