論文の概要: TV-AudioRemover: Joint Text-Visual Guided Sound Removal with Multi-Task Hard-Mixture Curriculum
- arxiv url: http://arxiv.org/abs/2609.25864v1
- Date: Tue, 22 Sep 2026 08:29:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.300315
- Title: TV-AudioRemover: Joint Text-Visual Guided Sound Removal with Multi-Task Hard-Mixture Curriculum
- Title(参考訳): TV-AudioRemover:マルチタスクハード・ミクチャー・カリキュラムによる共同テキスト・ビジュアル・ガイド音除去
- Abstract要約: テキスト・ビジュアル・ガイド音除去(TV-Audio Remover)について紹介する。
TV-AudioRemoverは、視覚的に編集されたビデオと自然言語による指示を利用する、ターゲット音除去フレームワークである。
実験により,本手法は主観的指標と客観的指標の両面において最先端の性能を達成することが示された。
- 参考スコア(独自算出の注目度): 18.94812111124291
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual object removal can eliminate a target from video frames, yet its acoustic trace persists in the soundtrack, causing obvious audio-visual inconsistency. Existing video inpainting models operate solely on pixels, while audio editing models, especially for the sound removal task, are typically driven by text and therefore rely on limited single-modal control, which is less effective than multimodal guidance that provides stronger semantic grounding and temporal synchronization cues. In this paper, we present Text-Visual Guided Sound Removal (TV-AudioRemover), a target sound removal framework that leverages the visually edited video together with a natural-language instruction to suppress the sound associated with the removed visual object from the original audio mixture. To acquire high-quality training data, we devise a pipeline to construct a million-scale dataset of single-object audio-visual aligned samples, from which we synthesize mixture-target pairs customized for model training. To effectively leverage visual context and follow instruction intent, we augment the model architecture with task tokens, generalizable instruction modeling, and modality-specific global guidance. We further adopt multi-task training to strengthen task-role comprehension, and employ a hard-mixture curriculum that leverages semantically similar acoustic mixtures during fine-tuning to enhance fine-grained source discrimination. To support evaluation, we present AV-Remove-Bench, a comprehensive audio-visual object removal benchmark, along with dedicated objective metrics and an MLLM-based evaluation protocol. Experiments demonstrate that our method achieves state-of-the-art performance on both subjective and objective metrics. Project page: https://yjx-research.github.io/TV-AudioRemover/.
- Abstract(参考訳): ビジュアルオブジェクトの除去は、ビデオフレームからターゲットを排除できるが、その音響的痕跡はサウンドトラックに留まり、明らかにオーディオと視覚の矛盾を引き起こす。
既存のビデオ塗装モデルはピクセルのみで動作するが、音声編集モデル(特に音声除去タスク)はテキストによって駆動されるため、より強力なセマンティックグラウンドと時間的同期手段を提供するマルチモーダルガイダンスよりも効果の低い、限定的な単一モーダル制御に依存している。
本稿では,テキスト・ビジュアル・ガイドド・サウンド・リジェクション(TV-AudioRemover)という,視覚的に編集された映像を自然言語の指示とともに活用し,元のオーディオ・ミックスから除去された視覚オブジェクトに関連付けられた音を抑圧するターゲット・サウンド・リジェクション・フレームワークを提案する。
高品質なトレーニングデータを取得するために,単一対象のオーディオ-視覚協調サンプルの100万規模のデータセットを構築するパイプラインを考案し,モデルトレーニング用にカスタマイズされた混合ターゲットペアを合成する。
視覚的コンテキストを効果的に活用し,指示意図に従うために,タスクトークン,一般化可能な命令モデリング,モダリティ固有のグローバルガイダンスをモデルアーキテクチャに追加する。
さらに,タスクロール理解を強化するためにマルチタスクトレーニングを採用し,微調整中に意味論的に類似した音響混合物を活用し,きめ細かい音源識別を強化するハードミックスカリキュラムを採用している。
評価を支援するため,AV-Remove-Bench,包括的オーディオ視覚オブジェクト除去ベンチマーク,専用の客観的指標,MLLMに基づく評価プロトコルを提案する。
実験により,本手法は主観的指標と客観的指標の両面において最先端の性能を達成することが示された。
プロジェクトページ: https://yjx-research.github.io/TV-AudioRemover/
関連論文リスト
- VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module [46.29588402955497]
VAInpaintは、新しいパイプラインで、マスクを生成し、オブジェクトを削除する際のビデオインペイントモデルをガイドする。
LLMは世界規模でシーンを解析し、リージョン固有のモデルは局所的な記述を提供する。
提案手法は,オーディオおよびビデオのインパインティングにおける現在のベンチマークに匹敵する性能を実現する。
論文 参考訳(メタデータ) (2025-09-21T10:31:56Z) - Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes [16.530816405275715]
本稿では,音声と非音声の両方を同時に視覚的シーン内でグラウンド化できる統一モデルを提案する。
既存のアプローチは、通常、音声または非音声のどちらかを独立に、あるいはせいぜい一緒に扱うことに限定されるが、連続的に混合しない。
論文 参考訳(メタデータ) (2025-03-24T16:56:04Z) - Language-Guided Audio-Visual Source Separation via Trimodal Consistency [64.0580750128049]
この課題の鍵となる課題は、発音対象の言語的記述と、その視覚的特徴と、音声波形の対応する成分とを関連付けることである。
2つの新たな損失関数を通して擬似目標管理を行うために、既成の視覚言語基盤モデルを適用する。
3つの音声・視覚的分離データセットに対する自己教師型アプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-03-28T22:45:40Z) - VATLM: Visual-Audio-Text Pre-Training with Unified Masked Prediction for
Speech Representation Learning [119.49605266839053]
VATLM (Visual-Audio-Text Language Model) を用いたクロスモーダル表現学習フレームワークを提案する。
提案したVATLMは、モダリティに依存しない情報をモデル化するために、統一されたバックボーンネットワークを使用する。
これら3つのモダリティを1つの共有セマンティック空間に統合するために、VATLMは統一トークンのマスク付き予測タスクで最適化される。
論文 参考訳(メタデータ) (2022-11-21T09:10:10Z) - Contrastive Audio-Visual Masked Autoencoder [85.53776628515561]
CAV-MAE(Contrastive Audio-Visual Masked Auto-Encoder)
我々の完全自己指導型CAV-MAEは、VGGSoundで65.9%の新しいSOTA精度を実現する。
論文 参考訳(メタデータ) (2022-10-02T07:29:57Z) - Dual Normalization Multitasking for Audio-Visual Sounding Object
Localization [0.0]
本研究では,音の視覚的位置のあいまいさを軽減するため,新しい概念である音場オブジェクトを提案する。
この新たなAVSOL問題に対処するために、デュアル正規化マルチタスクと呼ばれる新しいマルチタスクトレーニング戦略とアーキテクチャを提案する。
論文 参考訳(メタデータ) (2021-06-01T02:02:52Z) - Weakly-supervised Audio-visual Sound Source Detection and Separation [38.52168086518221]
本稿では,個々の物体の見た目と音の双方をネットワークが学習する,音声と視覚の協調手法を提案する。
音分離の文脈で弱教師付きオブジェクトセグメンテーションを導入する。
私たちのアーキテクチャはエンドツーエンドで学ぶことができ、追加の監視やバウンディングボックスの提案は必要ありません。
論文 参考訳(メタデータ) (2021-03-25T10:17:55Z) - Self-Supervised Learning of Audio-Visual Objects from Video [108.77341357556668]
本稿では,音源の局所化とグループ化,時間とともに情報収集を行うための光フローに着目したモデルを提案する。
本稿では,4つの下流音声指向タスクにおいて,モデルが学習する音声-視覚オブジェクトの埋め込みの有効性を実証する。
論文 参考訳(メタデータ) (2020-08-10T16:18:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。