論文の概要: From General-Purpose Audio Tagging to Spatially Grounded Sound Event Localization and Detection
- arxiv url: http://arxiv.org/abs/2606.27751v1
- Date: Fri, 26 Jun 2026 06:12:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.392985
- Title: From General-Purpose Audio Tagging to Spatially Grounded Sound Event Localization and Detection
- Title(参考訳): 汎用音響タグから空間的音場定位・検出へ
- Authors: Stefano Giacomelli, Stefano Damiano, Claudia Rinaldi, Fabio Graziosi, Toon van Waterschoot,
- Abstract要約: 提案したAT2SELDフレームワークは、事前訓練されたATバックボーンと、コンパクトな第1次アンビニクス(FOA)空間処理を結合する。
データ、計算、デプロイメントの制約の下で、セマンティックオーディオがローカライズ対応のシーン分析をどのようにサポートしているかを特徴付ける。
- 参考スコア(独自算出の注目度): 6.515657411366296
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: This report investigates the extension of pretrained General-Purpose Audio Tagging (GP-AT) models toward spatially grounded Sound Event Localization and Detection (SELD). The proposed AT2SELD framework couples a pretrained AT backbone with compact First-Order Ambisonics (FOA) spatial processing, track-wise SED and Cartesian DOA estimation, permutation aware supervision, and calibration. It characterizes how semantic audio priors support localization-aware scene analysis under data, computation, and deployment constraints. The framework is developed through informed multi-stage Neural Architecture Search (NAS). Stage 1 shows that spectral FOA descriptors, based on magnitude, phase, and Intensity Vectors (IVs), provide the most reliable interface for semantic-to-spatial transfer. Stage 2 identifies early residual spatial encoding as the main capacity-sensitive component, while late track-wise abstraction and recurrent smoothing act mainly as refinement stages. Stage 3 shows that late cross-stitch coupling improves semantic-spatial interaction, whereas early fusion is costlier and less effective. Diagnostic evaluation analyzes the selected architecture under class balancing, focal loss, activity-conditioned DOA supervision, threshold calibration, and transfer across STARSS23, TAU2019, TAU-NIGENS2020, and TAU-NIGENS2021. Focal loss improves the activity point, active-only DOA supervision mitigates inactive target dominance, and validation-selected thresholds recover calibration without replacing spatial learning. Cross-dataset and oracle-activity analyses indicate strong fixed source localization on TAU2019, transferable representations from TAU NIGENS2021, and meaningful but uncertain behavior on STARSS23. Overall, GP-AT priors appear promising for SELD design when embedded in spatial-aware architectures and optimized through integrated calibration and deployment oriented strategies.
- Abstract(参考訳): 本報告では,音場定位・検出(SELD)に対するGP-ATモデルの拡張について検討する。
提案したAT2SELDフレームワークは,コンパクトな第1次アンビニクス(FOA)空間処理,トラックワイズSEDとCartesian DOA推定,置換を考慮した監視,キャリブレーションと,事前訓練されたATバックボーンを結合する。
データ、計算、デプロイメントの制約の下で、セマンティックオーディオがローカライズ対応のシーン分析をどのようにサポートしているかを特徴付ける。
このフレームワークは、インフォームド・マルチステージ・ニューラル・アーキテクチャ・サーチ(NAS)によって開発されている。
ステージ1では、スペクトルFOA記述子は、大きさ、位相、強度ベクトル(IV)に基づいて、セマンティック・ツー・スパニアル・トランスファーの最も信頼性の高いインターフェースを提供する。
ステージ2は、初期残留空間符号化を主容量感応成分とし、遅くて軌道の抽象化と繰り返しの平滑化は、主に精細化の段階として機能する。
ステージ3では、後期のクロススティッチ結合は意味と空間の相互作用を改善する一方、初期の融合はコストが高く、効果が低いことが示される。
診断評価では,STARSS23,TAU2019,TAU-NIGENS2020,TAU-NIGENS2021のクラスバランス,焦点損失,活動条件DOAの監督,しきい値の校正,STARSS23,TAU2019,TAU-NIGENS2021,TAU-NIGENS2021を介して選択されたアーキテクチャを解析した。
焦点喪失は活動点を改善し、アクティブのみのDOA監督は非アクティブな目標支配を緩和し、検証選択された閾値は空間学習を置き換えることなく校正を回復する。
TAU2019、TAU NIGENS2021からの転写可能な表現、STARSS23における有意義だが不確実な振る舞いなどである。
全体として、GP-ATは空間認識アーキテクチャに組み込み、キャリブレーションとデプロイメント指向の戦略によって最適化されたSELD設計に期待できる。
関連論文リスト
- FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales [65.4821703903285]
FLOROは、小さなが高度に多様なリモートセンシングコーパスから転送可能な表現を学習するために設計されたマルチモーダル基礎モデルである。
FLOROは、Sentinel-1、Sentinel-2、SkySAT画像、標高、UAV由来のデータとの不均一な組み合わせによるマスク付きオートエンコーディングを用いて事前訓練される。
我々は、シーン分類、セグメンテーション、回帰タスクにまたがる凍結エンコーダプロトコルを用いて、PANGAEAベンチマーク上でFLOROを評価した。
論文 参考訳(メタデータ) (2026-05-27T08:55:54Z) - RELO: Reinforcement Learning to Localize for Visual Object Tracking [70.27265738642956]
視覚的物体追跡のためのReinforcement-learning-to-LOcalize法であるRELOを紹介する。
RELOは、手作りの空間先行を空間的位置から学習した局所化ポリシーに置き換える。
我々は、RELOがテンプレート更新なしでLaSOText上で57.5%のAUCを達成することを示す。
論文 参考訳(メタデータ) (2026-05-08T07:34:29Z) - Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detection [38.14795337940857]
ドメインシフトは、検出器が強力なオブジェクト中心の表現を維持する能力を低下させる。
FALCON-SFODはドメインシフト下でのオブジェクト指向適応を強化するために設計されたフレームワークである。
論文 参考訳(メタデータ) (2025-12-19T12:30:29Z) - FoBa: A Foreground-Background co-Guided Method and New Benchmark for Remote Sensing Semantic Change Detection [48.06921153684768]
本稿では,LevirSCDと呼ばれるリモートセマンティックチェンジ検出(SCD)のための新しいベンチマークを提案する。
データセットには16の変更カテゴリと210の特定の変更タイプが含まれており、よりきめ細かいクラス定義がある。
本研究では,フォアグラウンド・バックグラウンド・コグラウンドSCD(FoBa)手法を提案する。
FoBaは、現在のSOTA法と比較して、それぞれ1.48%、3.61%、および2.81%の改善を達成している。
論文 参考訳(メタデータ) (2025-09-19T09:19:57Z) - An ocean front detection and tracking algorithm [4.0604303269549185]
本稿では,距離空間解析を用いたベイズフロント検出・追跡フレームワークを提案する。
BFDTMSAはヒストグラム法と比較して過検出を73%削減する。
オープンソースリリースは、再現可能な海洋研究において重要なギャップを埋めるものだ。
論文 参考訳(メタデータ) (2025-02-21T07:00:09Z) - Spatial-Aware Token for Weakly Supervised Object Localization [137.0570026552845]
タスク固有の空間認識トークンを,弱教師付き方式で条件定位に提案する。
実験の結果、SATはCUB-200とImageNetの両方で、98.45%と73.13%のGT-known Locで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2023-03-18T15:38:17Z) - Relation Matters: Foreground-aware Graph-based Relational Reasoning for
Domain Adaptive Object Detection [81.07378219410182]
我々は、FGRR(Fearground-aware Graph-based Reasoning)というドメインDのための新しい汎用フレームワークを提案する。
FGRRはグラフ構造を検出パイプラインに組み込んで、ドメイン内およびドメイン間フォアグラウンドオブジェクト関係を明示的にモデル化する。
実験の結果、提案したFGRRは4つのDomainDベンチマークの最先端よりも優れていることが示された。
論文 参考訳(メタデータ) (2022-06-06T05:12:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。