論文の概要: Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation
- arxiv url: http://arxiv.org/abs/2608.03264v1
- Date: Tue, 04 Aug 2026 07:35:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.083843
- Title: Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation
- Title(参考訳): 耳に耳を傾ける:オーディオ・ビジュアル・インスタンス・セグメンテーションのためのステートフル・リスニング
- Authors: Leiye Liu, Miao Zhang, Jiahong Jiang, Jingjing Li, Jialong Zhong, Kai Peng, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu,
- Abstract要約: 既存の手法では、重なり合う音響イベントと視覚的インスタンスをマッチングし、音声視覚力学を扱うのに苦労している。
本稿では,2つのメカニズムを用いて,これらの課題に対処するH2Sを提案する。
論文が受け入れられたら、コードはオープンソースになる。
- 参考スコア(独自算出の注目度): 58.79612575170589
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Audio-visual instance segmentation (AVIS) requires accurately identifying and tracking individual sounding objects with pixel-level masks. Existing methods struggle to match overlapping acoustic events with visual instances and handle asynchronous audio-visual dynamics. Therefore, two critical questions arise: how can a model establish precise correspondence between overlapping sound sources and visual instances, and how can a model maintain robust tracking when audio and visual signals are temporally misaligned?This paper proposes Hear to See (H2S), addressing these challenges through two mechanisms. The Acoustic-Semantic Projector (ASP) disentangles mixed audio and establishes hierarchical correspondence from semantic to spatial domains. The Asynchronous Dynamics Modulator (ADM) adaptively adjusts state transitions via audio-modulated Mamba, prioritizing current information during dynamic variations and maintaining continuity in stable periods.Experiments on AVISeg show H2S achieves SOTA performance, attaining 48.54 mAP with a COCO pretrained ResNet50 and surpassing the previous by 7.8\%. The code will be open-sourced once the paper is accepted. The source code will be publicly available at https://github.com/leiyeliu/H2S.
- Abstract(参考訳): オーディオ・ビジュアル・インスタンス・セグメンテーション(AVIS)は、個々の音の物体をピクセルレベルのマスクで正確に識別し、追跡する必要がある。
既存の手法では、重複する音響イベントを視覚的インスタンスとマッチングし、非同期オーディオ視覚力学を扱うのに苦労している。
したがって、2つの重要な疑問が生じる: 重なり合う音源と視覚的インスタンスの正確な対応をモデルがどうやって確立できるか、そして、音声信号と視覚信号が時間的に不一致であるときに、モデルが頑健な追跡を維持するにはどうすればよいか。
本稿では,2つのメカニズムを用いて,これらの課題に対処するH2Sを提案する。
アコースティック・セマンティック・プロジェクタ(ASP)は、混合音声をアンタングルし、意味から空間領域への階層的対応を確立する。
ADM(Asynchronous Dynamics Modulator)は、オーディオ変調マンバによる状態遷移を適応的に調整し、動的変動時の電流情報を優先順位付けし、安定した期間における連続性を維持する。
論文が受け入れられたら、コードはオープンソースになる。
ソースコードはhttps://github.com/leiyeliu/H2S.comで公開されている。
関連論文リスト
- Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources [57.68713138159972]
本稿では,ソーストラジェクトリとともにイベントセマンティクスを学習する時間分解型オーディオエンコーダを提案する。
実験により、この表現は意味的局所化を改善し、空間的および局所化指向のトレードオフよりも強い推論をもたらすことが示された。
論文 参考訳(メタデータ) (2026-06-12T05:58:31Z) - Selective Noise Suppression and Discriminative Mutual Interaction for Robust Audio-Visual Segmentation [59.11043512784162]
本稿では,SNRPモジュールとDAMF戦略を備えたSDAVSを提案する。
実験により,提案手法はベンチマークAVSデータセットの最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2026-03-15T03:22:24Z) - ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation [55.76423101183408]
ViSAudioは、条件付きフローマッチングとデュアルブランチオーディオ生成アーキテクチャを利用するエンドツーエンドフレームワークである。
空間浸漬による高品質なオーディオを生成し、視点の変化、音源の動き、様々な音響環境に適応する。
論文 参考訳(メタデータ) (2025-12-02T18:56:12Z) - Learning What To Hear: Boosting Sound-Source Association For Robust Audiovisual Instance Segmentation [37.91678426119673]
既存の手法は2つの根本的な問題から生じる視覚バイアスに悩まされている。一様加法融合は、クエリが異なる音源に特化することを防ぎ、視覚のみの訓練目的は、クエリが任意の有意なオブジェクトに収束することを許している。
クロスアテンションを用いた音声中心クエリ生成を提案し、各クエリは異なる音源に選択的に参加し、音声固有の先行情報を視覚的復号化することができる。
論文 参考訳(メタデータ) (2025-09-26T02:31:17Z) - Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation [39.38821481268827]
AVVS (Audio-visual Video segmentation) は、対応するオーディオと正確に一致した音声生成オブジェクトのピクセルレベルのマップを生成することを目的としている。
現在の手法は、オブジェクトレベルの情報に重点を置いているが、音声の意味的変化の境界を無視しているため、時間的ミスアライメントが生じる。
本稿では,協調型ハイブリッドプロパゲータフレームワーク(Co-Prop)を提案する。
論文 参考訳(メタデータ) (2024-12-11T07:33:18Z) - Progressive Confident Masking Attention Network for Audio-Visual Segmentation [7.864898315909104]
オーディオ・ビジュアル (AVS) と呼ばれる難題が出現し、シーン内のオブジェクトを音声化するためのセグメンテーションマップを作成することを目的としている。
PMCANet(Progressive Confident Masking Attention Network)を紹介する。
注意機構を利用して、音声信号と視覚フレームの本質的な相関を明らかにする。
論文 参考訳(メタデータ) (2024-06-04T14:21:41Z) - QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic Decomposition [47.103732403296654]
マルチソース意味空間は、単一ソース部分空間のカルテシアン積として表すことができる。
安定なグローバルな(クリップレベルの)特徴から,局所的な(フレームレベルの)特徴に知識を蒸留する,グローバルから局所的な量子化機構を導入する。
意味的に分解された音声表現がAVSの性能を大幅に向上させることを示す実験を行った。
論文 参考訳(メタデータ) (2023-09-29T20:48:44Z) - Leveraging Language Model Capabilities for Sound Event Detection [10.792576135806623]
本稿では,音声イベントとその時間的位置を同時に生成しながら,音声特徴を理解するためのエンドツーエンドフレームワークを提案する。
具体的には、事前学習された音響モデルを用いて、異なるカテゴリーにわたる識別的特徴を捉え、自動回帰テキスト生成のための言語モデルを用いる。
論文 参考訳(メタデータ) (2023-08-22T15:59:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。