論文の概要: Less is More: Encoder-only Audio-Visual Segmentation
- arxiv url: http://arxiv.org/abs/2609.29121v1
- Date: Thu, 24 Sep 2026 06:56:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.760108
- Title: Less is More: Encoder-only Audio-Visual Segmentation
- Title(参考訳): Encoderのみのオーディオ・ビジュアル・セグメンテーション
- Abstract要約: AVSS(Audio-Visual Semantic)は、ビデオフレーム内の音源を識別、セグメント化、分類することを目的としている。
近年,画像セグメンテーションモデルには,画像セグメンテーション性能にはほとんど寄与しない冗長成分が含まれていることが示されている。
AVSSに対するGPUのみのオーディオ・ビジュアル(EASE)アプローチを提案する。
EASEは365 FPSで、以前のState-of-the-Art (SotA) AVSモデルよりも3倍高速で、11時間以内で走行する。
- 参考スコア(独自算出の注目度): 12.362708853106106
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Audio-Visual Semantic Segmentation (AVSS) aims to identify, segment, and classify sound-emitting objects in video frames. Previous Transformer-based AVSS approaches largely inherit design principles from image segmentation models. Recent studies show that these image segmentation models contain redundant components that contribute little to the segmentation performance. Following this insight, we propose Encoder-only Audio-Visual Segmentation (EASE). EASE runs at up to 365 FPS, 3x faster than prior State-of-the-Art (SotA) AVS models at comparable accuracy, and trains in under 11 GPU-hours. Furthermore, we achieve SotA AVSS performance across different backbones and input resolutions. Our results demonstrate that AVSS can be both simpler and faster, providing a scalable foundation for future research and real-time applications. Code, model weights, and samples are available at https://ease-avs.notion.site
- Abstract(参考訳): AVSS(Audio-Visual Semantic Segmentation)は、ビデオフレーム内の音源を識別、セグメント化、分類することを目的としている。
以前のTransformerベースのAVSSアプローチは、画像セグメンテーションモデルから設計原則をほとんど継承している。
近年の研究では,これらの画像分割モデルには,セグメント化性能にはほとんど寄与しない冗長成分が含まれていることが示されている。
そこで本研究では,Encoder-only Audio-Visual Segmentation (EASE)を提案する。
EASEは最大365 FPSで動作し、以前のState-of-the-Art (SotA) AVSモデルと同等の精度で3倍高速で、GPU時間は11時間以内である。
さらに、異なるバックボーンと入力解像度でSotA AVSS性能を実現する。
我々の結果は、AVSSはシンプルかつ高速であり、将来の研究とリアルタイムアプリケーションのためのスケーラブルな基盤を提供することを示した。
コード、モデルウェイト、サンプルはhttps://ease-avs.notion.siteで入手できる。
関連論文リスト
- Revisiting Audio-Visual Segmentation with Vision-Centric Transformer [60.83798235788669]
AVS (Audio-Visual) は、オーディオ信号に基づいて、映像フレームに音声を生成するオブジェクトを分割することを目的としている。
本稿では,視覚由来の問合せを利用して,対応する音声や視覚情報を反復的に取得する視覚中心変換フレームワークを提案する。
我々のフレームワークは,AVSBenchデータセットの3つのサブセット上で,最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-06-30T08:40:36Z) - Separating the "Chirp" from the "Chat": Self-supervised Visual Grounding of Sound and Language [77.33458847943528]
DenseAVは、ビデオ視聴のみで高解像度、意味論的、音声視覚的に整合した特徴を学習する、新しいデュアルエンコーダ基盤アーキテクチャである。
そこで本研究では,DenseAVによる単語の「意味」と音の「位置」の特定が可能であることを明らかにした。
論文 参考訳(メタデータ) (2024-06-09T03:38:21Z) - Leveraging Foundation models for Unsupervised Audio-Visual Segmentation [49.94366155560371]
AVS (Audio-Visual) は、可聴物体をピクセルレベルの視覚シーンで正確に概説することを目的としている。
既存のAVS手法では、教師付き学習方式でオーディオマスク対の細かいアノテーションを必要とする。
タスク固有のデータアノテーションやモデルトレーニングを必要とせず、教師なしの音声-視覚的セグメンテーションを導入する。
論文 参考訳(メタデータ) (2023-09-13T05:05:47Z) - AVSegFormer: Audio-Visual Segmentation with Transformer [42.24135756439358]
ビデオ中の音声オブジェクトの特定とセグメント化を目的とした,AVS(Audio-visual segmentation)タスクが導入された。
このタスクは、初めてオーディオ駆動のピクセルレベルのシーン理解を必要とし、重大な課題を提起する。
本稿では,トランスフォーマーアーキテクチャを活用するAVSegFormerを提案する。
論文 参考訳(メタデータ) (2023-07-03T16:37:10Z) - Visually-Guided Sound Source Separation with Audio-Visual Predictive
Coding [57.08832099075793]
視覚誘導音源分離は、視覚特徴抽出、マルチモーダル特徴融合、音響信号処理の3つの部分からなる。
本稿では,この課題をパラメータ調和とより効果的な方法で解決するために,AVPC(Audio-visual predictive coding)を提案する。
さらに、同一音源の2つの音声視覚表現を共予測することにより、AVPCのための効果的な自己教師型学習戦略を開発する。
論文 参考訳(メタデータ) (2023-06-19T03:10:57Z) - Annotation-free Audio-Visual Segmentation [46.42570058385209]
追加の手動アノテーションを使わずにオーディオ・ビジュアル・タスクのための人工データを生成する新しいパイプラインを提案する。
既存の画像セグメンテーションとオーディオデータセットを活用し、画像とマスクのペアをカテゴリラベルを用いて対応するオーディオサンプルとマッチングする。
また,SAMA-AVSの軽量モデルを導入し,AVSタスクに事前訓練されたセグメントの任意のモデル(SAM)を適応させる。
論文 参考訳(メタデータ) (2023-05-18T14:52:45Z) - Audio-Visual Segmentation [47.10873917119006]
本稿では,AVS(Audio-visual segmentation)と呼ばれる新しい課題について検討する。
ゴールは、画像フレームの時点で音を生成するオブジェクトのピクセルレベルのマップを出力することである。
本研究では,可聴ビデオにおける音声オブジェクトに対する画素単位のアノテーションを提供するAVSBench(Audio-visual segmentation benchmark)を構築した。
論文 参考訳(メタデータ) (2022-07-11T17:50:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。