論文の概要: Cover First, Disagree Softly: Rethinking Mismatch-First Active Learning for Frame-Level Audio Classification
- arxiv url: http://arxiv.org/abs/2607.13571v1
- Date: Wed, 15 Jul 2026 08:09:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.699529
- Title: Cover First, Disagree Softly: Rethinking Mismatch-First Active Learning for Frame-Level Audio Classification
- Title(参考訳): フレームレベル音声分類のためのMismatchファーストアクティブラーニングの再考
- Authors: Shiqi Zhang, Tuomas Virtanen,
- Abstract要約: その結果,MFFTは選択したセグメント間の類似性に盲目であり,低予算下では失敗することがわかった。
本稿では,不一致重み付き対象範囲を通じて全予算を消費するミスマッチ重み付き施設配置(MW-FL)を提案する。
- 参考スコア(独自算出の注目度): 9.755734517503319
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sound event detection relies on frame-level strong labels whose annotation is expensive. Active learning addresses this problem by selecting the audio segments whose labels help the classifier most. One of the prevailing acquisition strategies for this task, mismatch-first farthest-traversal (MFFT), combines the disagreement between two classifiers and the diversity of the selected segments through hard sequential decisions. It selects whole groups of high-disagreement segments first and spreads only the remaining budget by farthest traversal. On two multi-label datasets we show that this design is blind to the similarity among the selected segments and fails under low budgets, with every mismatch-first variant ending below the plain geometric strategy it builds on. We propose mismatch-weighted facility location (MW-FL), which spends the entire budget through a disagreement-weighted coverage objective that penalizes similarity among the selected segments. The disagreement signal from MFFT is used to obtain the nonnegative weights of this facility-location objective, without introducing hyperparameters. Experiments across two geometric mechanisms with three ways of using disagreement show that coverage of the selected segments is the dominant factor, hard disagreement gating of selection is harmful on both mechanisms, and soft disagreement weighting helps on top of coverage. MW-FL attains the best area under the learning curve on both datasets.
- Abstract(参考訳): 音のイベント検出は、アノテーションが高価であるフレームレベルの強いラベルに依存する。
アクティブラーニングは、ラベルが分類器を最も助けるオーディオセグメントを選択することでこの問題に対処する。
このタスクの一般的な獲得戦略の1つであるMFFTは、2つの分類器と選択されたセグメントの多様性の相違をハードシーケンシャルな決定によって組み合わせている。
最初は高分化セグメントの全グループを選択し、残りの予算だけを最遠のトラバースで広げる。
2つのマルチラベルデータセットにおいて、この設計は選択されたセグメント間の類似性に盲目であり、低予算下で失敗することを示し、すべてのミスマッチファースト変種は、それが構築する平易な幾何学的戦略の下にある。
提案するミスマッチ重み付き施設位置(MW-FL)は,選択したセグメント間の類似性を罰する不一致重み付きカバー目標を通じて,予算全体を消費する。
MFFTの不一致信号は、過パラメータを導入することなく、この施設位置目標の非負の重みを得るために用いられる。
2つの幾何学的メカニズムを3つの方法で比較したところ、選択されたセグメントのカバレッジが支配的な要因であること、選択のハードな不一致ゲーティングが両方のメカニズムに有害であること、およびソフト不一致重み付けがカバレッジの上位に寄与していることが示されている。
MW-FLは、両方のデータセットで学習曲線の下で最高の領域を得る。
関連論文リスト
- Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement [66.67463557274358]
バイアス付きデータセットに基づいてトレーニングされた基礎モデルは、しばしばターゲットラベルと非因果属性の間の急激な相関に依存する。
信頼誘導概念マイニング(CBCM:Confidence-guided Concept Mining)を導入し,属性アノテーションを使わずに信頼性の高いスプリアス属性を同定する。
本稿では,目標と突発的な表現を2つのブランチに分離するプロンプトチューニングフレームワークであるDual-branch Cross-projection Debiasing (DCD)を提案する。
論文 参考訳(メタデータ) (2026-06-23T05:28:47Z) - LUCoS: Latent Unsupervised Context Selection for Tabular Foundation Models [1.1922891806996732]
LUCoSは、教師なし事前フィルタネットワーク(PFN)からの埋め込みによって誘導される潜時幾何学に置き換える。
LUCoSは6つの低ラベル予算のデータセットで第1位であり、結論はメトリクスとデータセットレベルのチェックで安定している。
論文 参考訳(メタデータ) (2026-05-26T16:31:39Z) - Soft Tuy-Completeness for Robust Projection Selection in Cone-Beam CT [4.213649496201482]
本研究は、関心領域集束コーンビームCTにおける投射選択のための、連続したソフトなほぼ直交性スコアと、分解能を考慮した飽和被曝目標を導入する。
論文 参考訳(メタデータ) (2026-05-20T12:37:15Z) - Budget-Aware Routing for Long Clinical Text [8.474809035213118]
大きな言語モデルの大きな課題は、クエリ毎のトークンコストとデプロイメント全体のコストです。
文書単位のサブセットが厳格なトークン予算の下で選択される、予算付きコンテキスト選択について検討する。
関連性,カバレッジ,多様性のバランスをとるモノトンサブモジュラー目的のtextbfRCD を提案する。
論文 参考訳(メタデータ) (2026-05-01T01:34:53Z) - Segment-Level Attribution for Selective Learning of Long Reasoning Traces [39.93489058702076]
本稿では,高い帰属力を持つが適度な一貫性を持つ重要なセグメントを特定するためのセグメントレベル選択学習フレームワークを提案する。
提案手法は精度と出力効率を向上し、長い推論トレースからより効果的な学習を可能にする。
論文 参考訳(メタデータ) (2026-01-31T00:29:24Z) - Mitigating Boundary Ambiguity and Inherent Bias for Text Classification in the Era of Large Language Models [24.085614720512744]
本研究では,大規模言語モデル (LLM) がテキスト分類における選択肢の数や配置の変化に対して脆弱であることを示す。
重要なボトルネックは、曖昧な決定境界と、特定のトークンや位置に対する固有のバイアスから生じます。
我々のアプローチは、ペア比較が境界のあいまいさと固有のバイアスを効果的に緩和できるという経験的観察に基づいている。
論文 参考訳(メタデータ) (2024-06-11T06:53:19Z) - Efficient Bilateral Cross-Modality Cluster Matching for Unsupervised Visible-Infrared Person ReID [56.573905143954015]
本稿では, クラスタ間マッチングによるモダリティギャップを低減するための, クラスタマッチングに基づく新たな学習フレームワークを提案する。
このような監視信号の下では、クラスタレベルで特徴を協調的に整列させるために、モダリティ・特定・モダリティ・非依存(MSMA)コントラスト学習フレームワークが提案されている。
公開SYSU-MM01とRegDBデータセットの実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2023-05-22T03:27:46Z) - Ambiguity-Resistant Semi-Supervised Learning for Dense Object Detection [98.66771688028426]
本研究では,一段階検出器のためのAmbiguity-Resistant Semi-supervised Learning (ARSL)を提案する。
擬似ラベルの分類とローカライズ品質を定量化するために,JCE(Joint-Confidence Estimation)を提案する。
ARSLは、曖昧さを効果的に軽減し、MS COCOおよびPASCALVOC上で最先端のSSOD性能を達成する。
論文 参考訳(メタデータ) (2023-03-27T07:46:58Z) - SPL-MLL: Selecting Predictable Landmarks for Multi-Label Learning [87.27700889147144]
我々は、入力(予測可能)に応じて予測しやすく、他の可能なラベル(表現可能)をうまく回復できるランドマークとして、ラベルの小さなサブセットを選択することを提案する。
我々は,ADM(Alternating Direction Method)を用いてこの問題を解決する。実世界のデータセットに関する実証研究により,本手法が他の最先端手法よりも優れた分類性能を実現することを示す。
論文 参考訳(メタデータ) (2020-08-16T11:07:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。