論文の概要: Prevalence Determines Precision:Silent Contamination in Detector-Defined Datasets
- arxiv url: http://arxiv.org/abs/2609.11449v1
- Date: Thu, 10 Sep 2026 12:17:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.338728
- Title: Prevalence Determines Precision:Silent Contamination in Detector-Defined Datasets
- Title(参考訳): 精度決定:検出器決定データセットにおける強い汚染
- Abstract要約: 検出者定義のイベントデータセットに加えて,検出されたすべての項目を実あるいは幻としてラベル付けする独立した公式インデックスも保持しています。
1つの検出器、3つのプールはファントムレート81.7%、9.0%、0.0%をもたらす。
検出された応答曲線は、真事象473〜308よりも多くのファントムと真事象と幻成分(残留1.1e−16)の正確な凸結合である。
- 参考スコア(独自算出の注目度): 4.817733230615958
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many ML datasets are constructed by running a detector, heuristic, or model over candidate pools; accepted items become labels. Dataset precision is then governed by true-positive prevalence in each pool via Bayes, not solely by detector quality. Using one instrument and period, we hold a detector-defined event dataset plus an independent official index labeling every detected item as real or phantom. One detector, three pools yield phantom rates 81.7%, 9.0%, and 0.0%. Transferring precision from the two high-rate pools to the low-rate pool predicts 0.955 versus measured 0.183, a +422% error; the Bayes expression predicts all three within 3.3%. The detected response curve is an exact convex combination of a true-event and a phantom component (residual 1.1e-16), with phantoms outnumbering true events 473 to 308, so contamination is a second signal with detector-inherited shape, not additive noise. Contamination direction depends on the estimator: on identical windows one statistic is diluted and another inflated because its denominator is also contaminated. A common normalization turns the estimator into a mean of ratios whose expectation need not exist; on the same 335 events it returns 0.40 where the well-defined estimator returns 0.10.
- Abstract(参考訳): 多くのMLデータセットは、検知器、ヒューリスティック、あるいは候補プール上でモデルを実行することで構築される。
データセットの精度は、検出器の品質のみによって制御されるのではなく、ベイズを経由して各プールの真正の精度によって制御される。
1つの測定器と周期を用いて、検知器が定義したイベントデータセットと、検出されたすべてのアイテムを実または幻としてラベル付けする独立した公式インデックスを保持する。
1つの検出器、3つのプールはファントムレート81.7%、9.0%、0.0%をもたらす。
2つのハイレートプールからローレートプールへの正確な転送精度は 0.955 対 0.183 の誤差 +422% と予測される。
検出された応答曲線は、真事象と幻成分(残留1.1e−16)の正確な凸結合であり、真事象473〜308より数が多いファントムであるので、汚染は、加算雑音ではなく、検出器が継承した形状の2番目の信号である。
汚染方向は推定器に依存し、同じ窓上では1つの統計値が希釈され、別の統計値が膨張する。
一般的な正規化は、推定器を予測する必要がない比率の平均に変え、同じ335の事象では0.40を返すが、よく定義された推定器は0.10を返す。
関連論文リスト
- Not All Relations Are Equal: Relation-Balanced and Calibrated Graph Learning for Provenance-Based Intrusion Detection [66.44527094471619]
本稿では,関係バランスの取れたグラフ学習を用いた教師なしフレームワークRECALについて述べる。
3つのDARPA E3データセットにおいて、RECALはF1スコアの99.99%、99.93%、99.99%を達成し、各データセットでそれぞれ0.88、0.82、0.42で最高のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-15T00:31:01Z) - Improving the Sensitivity of Gravitational Wave Detection with Weighted Conformal Prediction [0.0]
我々は、確率的に厳密な信頼度推定を候補事象に対して提供するために、共形予測に基づくフレームワークを用いる。
重要な課題は、トレーニングに使用するシミュレートされたデータセットと、テストに使用される実際の、遅延のない、観察の間の分散シフトである。
論文 参考訳(メタデータ) (2026-09-10T11:33:49Z) - Distribution-free false-alarm calibration and chance-corrected spatial evaluation for industrial anomaly detection [2.5273986395975476]
我々は、分布自由な上限値とペア化された最小交差空間テストを組み合わせる。
我々は,3つのISP-ADモダリティと3つの固定データ分割から120個の点欠陥画像上の3つの検出器を評価する。
論文 参考訳(メタデータ) (2026-08-15T07:21:05Z) - Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models [0.0]
ClosurePairsは、繰り返し発生する障害を伴う互換性のあるマイクロステートを横断します。
ソースの属性は確実に回復する。
非線形相互作用ベンチマークにおける等予算分解誤差を低減する。
論文 参考訳(メタデータ) (2026-08-01T11:07:24Z) - Wolff-Parkinson-White Detection at 471:1 Class Imbalance: A Leakage-Controlled Study of the Data Bottleneck [0.0]
Wolff-Parkinson-White症候群 (WPW) は先天性心前駆症であり、臨床的には重要であり、12誘導心電図では欠落することが多い。
PTB-XL と Chapman-Shaoxing-Ningbo の2つの公開 12-lead corpora: 66,951 レコード,142 レコードの WPW は 0.21% (約471:1) である。
事前に規定された1つのリーク制御プロトコルの下では、ホールドアウトフォールドが正確に1回接触し、信号の7つの表現を比較し、分割と評価を固定する。
論文 参考訳(メタデータ) (2026-07-27T20:57:46Z) - K-ABENA: K-Adaptive Backpropagation with Error-based N-exclusion Algorithm : (Compensated Loss-Based Sample Exclusion with Unbiased Gradient Estimation) [0.0]
K-ABENAK-Adaptive Backpropagation with Error-based N-exclusionは選択的な計算フレームワークである。
これは、少量の低損失("ミニ")観測を除外することで、イット当たりの計算トレーニングコストを削減する。
ラベル制限下で0.386の精度(ベースライン:0.832)、極端な不均衡下で0.53のAUCに崩壊する。
論文 参考訳(メタデータ) (2026-07-07T06:58:51Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Spectral Signatures of Data Quality: Eigenvalue Tail Index as a Diagnostic for Label Noise in Neural Networks [0.0]
ニューラルネットワークの重み行列のスペクトル特性がテスト精度を予測できるかどうかを検討する。
制御されたラベルノイズの下では、ネットワークのボトルネック層における固有値分布のテール指数アルファは、残響R2 = 0.984(21ノイズレベル、3シードレベル)でテスト精度を予測する。
我々は,この署名の軌跡として情報処理ボトルネック層を同定し,ランダム行列モデルにおけるBBP相転移と観測を結びつける。
論文 参考訳(メタデータ) (2026-03-29T21:53:24Z) - Semiparametric conformal prediction [79.6147286161434]
ベクトル値の非整合性スコアの結合相関構造を考慮した共形予測セットを構築する。
スコアの累積分布関数(CDF)を柔軟に推定する。
提案手法は,現実の回帰問題に対して,所望のカバレッジと競争効率をもたらす。
論文 参考訳(メタデータ) (2024-11-04T14:29:02Z) - Provably Reliable Conformal Prediction Sets in the Presence of Data Poisoning [53.42244686183879]
コンフォーマル予測は、モデルに依存しない、分布のない不確実性定量化を提供する。
しかし、敵が訓練データと校正データを操作した場合の毒殺攻撃では、共形予測は信頼性が低い。
信頼性予測セット (RPS): 汚染下での信頼性保証を証明可能な共形予測セットを構築するための最初の効率的な方法を提案する。
論文 参考訳(メタデータ) (2024-10-13T15:37:11Z) - Calibrated Uncertainty Quantification for Operator Learning via
Conformal Prediction [95.75771195913046]
本稿では, リスク制御型量子ニューラル演算子, 分布のない有限サンプル機能キャリブレーション等式予測法を提案する。
関数領域上の点の期待値として定義されるカバレッジ率に関する理論的キャリブレーションを保証する。
2次元ダーシー流と3次元自動車表面圧力予測タスクに関する実験結果から,我々の理論的結果が検証された。
論文 参考訳(メタデータ) (2024-02-02T23:43:28Z) - Uncertainty-Aware AB3DMOT by Variational 3D Object Detection [74.8441634948334]
不確実性推定は統計的に正確な予測を提供する効果的なツールである。
本稿では,変分ニューラルネットワークを用いたTANet 3Dオブジェクト検出器を提案し,不確実性のある3Dオブジェクト検出を行う。
論文 参考訳(メタデータ) (2023-02-12T14:30:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。