論文の概要: Acoustically Grounded Cost Learning for Open-Vocabulary Audio-Visual Semantic Segmentation
- arxiv url: http://arxiv.org/abs/2608.29121v1
- Date: Sat, 29 Aug 2026 08:02:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.844252
- Title: Acoustically Grounded Cost Learning for Open-Vocabulary Audio-Visual Semantic Segmentation
- Title(参考訳): オープンボキャブラリ・オーディオ・ビジュアル・セマンティック・セマンティック・セグメンテーションのための音場学習
- Authors: Tianrui Hui, Shaofei Huang, Qisong Han, Yaxiong Wang, Lechao Cheng, Zhedong Zheng, Zhun Zhong, Richang Hong, Meng Wang,
- Abstract要約: Open-Vocabulary Audio-Visual Semantic (OV-AVSS) は、オープンなカテゴリの集合から、音を放出するオブジェクトのピクセルレベルのセグメンテーションを実行することを目的としている。
カテゴリー特化の目的を整理し,新しい音響的基盤型コスト学習フレームワークを提案する。
AVSBench-OVデータセットの実験により,本手法が従来の最先端手法よりも大幅に優れていることが示された。
- 参考スコア(独自算出の注目度): 95.88527433039519
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-Vocabulary Audio-Visual Semantic Segmentation (OV-AVSS) aims to perform pixel-level segmentation of sound-emitting objects from an open set of categories. The previous method relies on a class-agnostic foreground definition, which groups semantically diverse objects into a heterogeneous positive set, causing the model to learn unstable sounding patterns and produce unreliable proposals. To address this, we reformulate the objective to be category-specific and propose a novel Acoustically Grounded Cost Learning (AGCL) framework to transform the static, audio-agnostic visual-text priors into dynamic, audio-grounded cost representations. For intra-category soundingness discovery, we devise Audio-Modulated Cost Generation (AMCG) and Audio-Guided Temporal Aggregation (AGTA) modules to enable both frame-level sounding region highlighting and video-level temporal refinement with a low-intrusive audio injection mechanism. For inter-category distractor discrimination, we introduce a Synergistic Distractor Mining (SDM) strategy, which selectively penalizes acoustically and semantically confusing negative categories to learn more discriminative decision boundaries. Extensive experiments on the AVSBench-OV dataset demonstrate that our method significantly outperforms previous state-of-the-art approaches, particularly on unseen categories. Code is available at https://github.com/spyflying/AGCL.
- Abstract(参考訳): Open-Vocabulary Audio-Visual Semantic Segmentation (OV-AVSS) は、オープンなカテゴリの集合から音の放出対象のピクセルレベルのセグメンテーションを実行することを目的としている。
従来の手法は、意味論的に多様なオブジェクトを異種正の集合にグループ化するクラス非依存のフォアグラウンド定義に依存しており、不安定な音のパターンを学習し、信頼できない提案を生成する。
そこで本研究では,静的・オーディオに依存しない視覚テキストを動的・オーディオ・グラウンド・コスト表現に変換するために,カテゴリ固有の目的を整理し,新しい音響的グラウンド・コスト・ラーニング(AGCL)フレームワークを提案する。
カテゴリー内音質発見のために,低侵襲音声注入機構によるフレームレベルの音質強調とビデオレベルの時間的改善を可能にするために,AMCG(Audio-Modulated Cost Generation)とAGTA(Audio-Guided Temporal Aggregation)モジュールを考案した。
カテゴリー間トラクタ識別には、音響的および意味論的に混乱した負のカテゴリを選択的に罰し、より差別的な決定境界を学習するSDM(Synergistic Distractor Mining)戦略を導入する。
AVSBench-OVデータセットの大規模な実験により、我々の手法は従来の最先端アプローチ、特に目に見えないカテゴリよりも大幅に優れていることが示された。
コードはhttps://github.com/spyflying/AGCLで入手できる。
関連論文リスト
- Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization [69.67186845167568]
Open-vocabulary Audio-visual Event Localization (OV-AVEL) は、音声と視覚のキューを共同でモデル化し、イベントを認識および時間的にローカライズする。
既存の手法は主にユークリッド空間における共同視覚表現を学習する。
音声・視覚イベントの局所化のための階層的セマンティック制約ヘテロジニアスグラフ(HSCHG)を提案する。
論文 参考訳(メタデータ) (2026-06-05T08:23:58Z) - Implicit Counterfactual Learning for Audio-Visual Segmentation [50.69377287012591]
我々は,非バイアスの相互理解を実現するために,暗黙の対実的枠組み(ICF)を提案する。
意味論の欠如により、異種表現は誤った一致につながる可能性がある。
モダリティ共有空間を確立するために,ビデオ,セグメント,フレームレベルを含む多粒性暗黙テキスト(MIT)をブリッジとして導入する。
論文 参考訳(メタデータ) (2025-07-28T11:46:35Z) - $C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction [80.57232374640911]
我々はMask-And-Recover (MAR)と呼ばれるモデルに依存しない戦略を提案する。
MARは、モダリティ間およびモダリティ間コンテキスト相関を統合し、抽出モジュール内の大域的推論を可能にする。
各サンプルの難易度を向上するために, 精細信頼スコア(FCS)モデルを導入する。
論文 参考訳(メタデータ) (2025-04-01T13:01:30Z) - Do Audio-Visual Segmentation Models Truly Segment Sounding Objects? [38.98706069359109]
AVSBench-Robustは、サイレント、環境騒音、オフスクリーン音を含む様々なネガティブなオーディオシナリオを取り入れたベンチマークである。
提案手法は, ほぼ完全な偽陽性率を維持しながら, 標準測定値とロバストネス測定値の両方において顕著な改善を実現している。
論文 参考訳(メタデータ) (2025-02-01T07:40:29Z) - Open-Vocabulary Audio-Visual Semantic Segmentation [12.330521982730836]
AVSSタスクをアノテートされたラベル空間を超えたオープンワールドシナリオに拡張する。
1)音声と視覚の融合を行い、全ての潜在的な聴覚オブジェクトを見つけるための普遍的な音源定位モジュールと,2)大規模事前学習型視覚言語モデルからの事前知識の助けを借りてカテゴリを予測するオープン語彙分類モジュールと,からなる,最初のオープン語彙型AVSSフレームワークであるOV-AVSSを提案する。
論文 参考訳(メタデータ) (2024-07-31T16:14:09Z) - DiffSED: Sound Event Detection with Denoising Diffusion [70.18051526555512]
生成学習の観点からSED問題を再構築する。
具体的には,騒音拡散過程において,雑音のある提案から音の時間境界を生成することを目的としている。
トレーニング中は,ノイズの多い遅延クエリを基本バージョンに変換することで,ノイズ発生過程の逆転を学習する。
論文 参考訳(メタデータ) (2023-08-14T17:29:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。