論文の概要: Training-Free Model Selection and Domain-Aware Score Calibration for First-Shot Anomalous Sound Detection
- arxiv url: http://arxiv.org/abs/2607.04526v1
- Date: Sun, 05 Jul 2026 22:22:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.969997
- Title: Training-Free Model Selection and Domain-Aware Score Calibration for First-Shot Anomalous Sound Detection
- Title(参考訳): ファーストショット異常音検出のための訓練不要モデル選択とドメイン認識スコア校正
- Authors: Grach Mkrtchian,
- Abstract要約: DCASE Challenge Task 2における1発の異常音検出は、未確認の機械の異常を1つの閾値で警告しなければならない。
ソースドメインとターゲットドメインのAUCはシステム間で負の相関を持ち、開発セットの性能は評価セットのパフォーマンスを予測しない。
凍結したオーディオ埋め込みの上に、トレーニング不要のポストホック層で対処する。
- 参考スコア(独自算出の注目度): 0.12691047660244334
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: First-shot anomalous sound detection in DCASE Challenge Task 2 must flag anomalies of unseen machine types with a single threshold, without knowing whether a test clip comes from the data-rich source domain (990 normal training clips) or the data-scarce target domain (10). Two organizer-reported problems remain open: source- and target-domain AUC are negatively correlated across systems, and development-set performance does not predict evaluation-set performance. We address both with a training-free post-hoc layer over frozen audio embeddings: (i) per-domain quantile calibration shrunk toward a pooled map by a prior strength m, tracing a source/target balance frontier, and (ii) a label-free cross-validated domain-balance criterion that ranks candidate configurations from training normals only, paired with a coarse development-labeled viability veto. On DCASE 2025, the criterion rank-predicts the official evaluation score across a 45-configuration grid (Spearman rho = +0.91; family-block bootstrap 95% CI [+0.83, +0.95]) while development score is uninformative (+0.06). Criterion-based selection raises the evaluation score from 55.83 to 59.34 (jackknife CI [2.2, 4.8]) and, on an extended grid, to 61.05 -- retrospectively fourth of 35 teams. Replicating on DCASE 2023 and 2024 bounds the claim: development score is uninformative in all three years and degenerate configurations recur (vetoed every time), but under family-clustered uncertainty the criterion's predictive evidence survives only in 2025; in both replication years a fixed full-equalization default matches or beats criterion-based selection. A DCASE 2026 forward test is frozen before the 2026 evaluation ground truth is released; all headline numbers are reproduced by the official evaluator.
- Abstract(参考訳): DCASEチャレンジ2における第1ショット異常音検出は、テストクリップがデータリッチソースドメイン(990の通常のトレーニングクリップ)またはデータスカースターゲットドメイン(10)から来るかどうかを知らずに、単一のしきい値で未確認マシンタイプの異常をフラグ付けしなければならない。
ソースドメインとターゲットドメインのAUCはシステム間で負の相関を持ち、開発セットの性能は評価セットのパフォーマンスを予測しない。
凍結したオーディオ埋め込みの上に、トレーニング不要のポストホック層で対処する。
i) 領域ごとの量子的キャリブレーションは、事前強度mでプールマップに向かって縮小し、ソース/ターゲットバランスフロンティアをトレースし、
(II) ラベルフリーのクロスバリデーションドメインバランス基準で, トレーニング常用者のみから候補設定をランク付けし, 粗い開発ラベル付き生存率ベトと組み合わせた。
DCASE 2025では、基準は45構成グリッド(Spearman rho = +0.91; family-block bootstrap 95% CI [+0.83, +0.95])で公式評価スコアを予測し、開発スコアは非形式的(+0.06)である。
基準ベースの選択は評価スコアを55.83から59.34(jackknife CI [2.2, 4.8])に引き上げ、拡張グリッド上では61.05 – 35チームの振り返り4位に引き上げる。
DCASE 2023 と 2024 のリプリケートでは、開発スコアは3年ごとに不変であり、デジェネレーション構成は再帰する(毎回拒否される)が、家族集団の不確実性の下では、クレーターの予測証拠は2025 年にしか残っていない。
DCASE2026フォワードテストは、2026評価土台真実が解放される前に凍結され、全ての見出し番号は公式評価器によって再生される。
関連論文リスト
- Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - TASR: Training-Free Adaptive Stopping for Iterative Retrieval [12.177557521540082]
反復的検索拡張生成エージェントは、モデルが解答に収束した後も検索を続けることで、一般的にオーバースペンドされる。
TASR(Training-Free Adaptive Stopping Rule)は,モデルが前ラウンドの正規化を繰り返すと発火する一行述語である。
論文 参考訳(メタデータ) (2026-06-11T18:35:14Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - RISED: A Pre-Deployment Safety Evaluation Framework for Clinical AI Decision-Support Systems [0.0]
本稿では,信頼性,指数性,感度,等価性,展開性に関する5次元事前デプロイ評価を提案する。
RISEDはオープンソースのPythonパッケージとしてリリースされ、既存の臨床AIレポート標準の量的検証を提供する。
論文 参考訳(メタデータ) (2026-05-13T02:17:13Z) - The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation [1.8345614451086532]
RLHF 対応言語モデルは TruthfulQA 上で応答均質化を示す。
40-79%の質問は、10のi.i.d.サンプルに対して単一のセマンティッククラスタを生成する。
論文 参考訳(メタデータ) (2026-03-25T09:35:15Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - Generalized Focal Loss: Learning Qualified and Distributed Bounding
Boxes for Dense Object Detection [85.53263670166304]
一段検出器は基本的に、物体検出を密度の高い分類と位置化として定式化する。
1段検出器の最近の傾向は、局所化の質を推定するために個別の予測分岐を導入することである。
本稿では, 上記の3つの基本要素, 品質推定, 分類, ローカライゼーションについて述べる。
論文 参考訳(メタデータ) (2020-06-08T07:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。