論文の概要: AVIO: Learning to Add and Remove Sounding Objects in Audiovisual Scenes
- arxiv url: http://arxiv.org/abs/2609.36503v1
- Date: Tue, 29 Sep 2026 01:56:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.110252
- Title: AVIO: Learning to Add and Remove Sounding Objects in Audiovisual Scenes
- Title(参考訳): AVIO:聴覚シーンにおける音質オブジェクトの追加と削除を学習する
- Abstract要約: 我々は1,878個のターゲットオブジェクト名にまたがるペアオーディオヴィジュアル例のデータセットであるtextitAVIOBenchを紹介した。
AVIOBenchは、各対象物体の視覚的存在と音響的寄与を共有IDと視覚マスクを通してリンクする。
我々は、ソース条件付き特徴変調により事前訓練されたテキストからオーディオ視覚生成モデルに適応し、オブジェクトの追加と削除を共同で学習するtextitAVIOを提案する。
- 参考スコア(独自算出の注目度): 39.60415556028227
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adding or removing a sounding object requires coordinated changes to visual content and sound while preserving the surrounding scene. Yet paired supervision for localized non-speech audiovisual editing remains limited, as visual and acoustic edits must target the same object and isolate its sound from overlapping sources. To address this gap, we introduce \textit{AVIOBench}, a dataset comprising 37.9 hours of paired audiovisual examples spanning 1{,}878 target-object names. AVIOBench links the visual presence and acoustic contribution of each target object through a shared identity and visual mask. Our automated pipeline uses visual grounding and cross-modal consistency to select target-sound removal candidates, then jointly refines the audiovisual pairs to improve perceptual quality and cross-modal consistency. Building on this dataset, we propose \textit{AVIO}, which adapts a pretrained text-to audiovisual generation model through source-conditioned feature modulation to jointly learn object addition and removal. A reference-frame curriculum gradually reduces reference conditioning during training, enabling one model to perform instruction-only editing with optional visual guidance. Quantitative and qualitative evaluations demonstrate effective audiovisual object removal and addition, with optional reference guidance providing appearance and placement control for addition.
- Abstract(参考訳): 音質オブジェクトの追加や削除には、周囲のシーンを保存しながら、視覚内容と音の協調的な変化が必要となる。
しかし、局所的な非音声音声視覚編集のためのペアによる監督は、視覚的および音響的編集が同じ対象を標的にし、重なり合う音源から音を分離する必要があるため、依然として限られている。
このギャップに対処するために、ターゲットオブジェクト名1{,}878にまたがるペアオーディオヴィジュアル例の37.9時間からなるデータセットである \textit{AVIOBench} を紹介する。
AVIOBenchは、各対象物体の視覚的存在と音響的寄与を共有IDと視覚マスクを通してリンクする。
我々の自動パイプラインは、視覚的グラウンドとクロスモーダルの整合性を利用して、ターゲット音の除去候補を選択し、その後、聴覚的ペアを改良し、知覚的品質とクロスモーダルの整合性を改善する。
このデータセットに基づいて、ソース条件付き特徴変調による事前訓練されたテキストからオーディオ視覚生成モデルを適用し、オブジェクトの追加と削除を共同で学習する。
参照フレームのカリキュラムは、トレーニング中の参照条件付けを徐々に減らし、任意のビジュアルガイダンスで命令のみの編集を可能にする。
定量的および定性的な評価は、視覚的オブジェクトの効果的な除去と追加を実証し、追加のための外観と配置制御を提供するオプション参照ガイダンスを提示する。
関連論文リスト
- TV-AudioRemover: Joint Text-Visual Guided Sound Removal with Multi-Task Hard-Mixture Curriculum [18.94812111124291]
テキスト・ビジュアル・ガイド音除去(TV-Audio Remover)について紹介する。
TV-AudioRemoverは、視覚的に編集されたビデオと自然言語による指示を利用する、ターゲット音除去フレームワークである。
実験により,本手法は主観的指標と客観的指標の両面において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2026-09-22T08:29:41Z) - Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal [90.14887235360611]
SAVEBenchは、テキストとマスク条件を備えたペアオーディオヴィジュアルデータセットで、オブジェクト指向のソース・ツー・ターゲット学習を可能にする。
SAVEにはSchrodinger Bridgeが組み込まれており、ソースからターゲットのオーディオヴィジュアルミックスへのダイレクトトランスポートを学習する。
評価の結果,提案したSAVEモデルは,残したコンテンツを保存しながら,音声・視覚コンテンツ中の対象オブジェクトを除去できることがわかった。
論文 参考訳(メタデータ) (2025-12-14T23:19:15Z) - Language-Guided Joint Audio-Visual Editing via One-Shot Adaptation [56.92841782969847]
言語誘導型共同視覚編集という新しいタスクを導入する。
この課題は、音声と映像のペアが与えられたとき、言語指導に基づいて与えられた音質イベントを編集することにより、新たな音声・視覚コンテンツを生成することである。
共同音声・視覚編集のための拡散型フレームワークを提案し,2つの重要なアイデアを紹介した。
論文 参考訳(メタデータ) (2024-10-09T22:02:30Z) - Language-Guided Audio-Visual Source Separation via Trimodal Consistency [64.0580750128049]
この課題の鍵となる課題は、発音対象の言語的記述と、その視覚的特徴と、音声波形の対応する成分とを関連付けることである。
2つの新たな損失関数を通して擬似目標管理を行うために、既成の視覚言語基盤モデルを適用する。
3つの音声・視覚的分離データセットに対する自己教師型アプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-03-28T22:45:40Z) - Class-aware Sounding Objects Localization via Audiovisual Correspondence [51.39872698365446]
複雑な視覚的シナリオにおける音像の局所化と認識を行うための2段階の学習フレームワークを提案する。
我々は、カクテルパーティーのシナリオでクラス認識オブジェクトのローカライズマップを生成し、サイレントエリアの抑制にオーディオ視覚対応を使用する。
実写ビデオと合成ビデオの両方の実験では、オブジェクトのローカライズと認識だけでなく、サイレントビデオのフィルタリングにも優れていることが示されている。
論文 参考訳(メタデータ) (2021-12-22T09:34:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。