論文の概要: Soundwich: Video Generation with Layered and Controllable Audio
- arxiv url: http://arxiv.org/abs/2610.00691v2
- Date: Fri, 02 Oct 2026 04:37:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.982069
- Title: Soundwich: Video Generation with Layered and Controllable Audio
- Title(参考訳): Soundwich:層状でコントロール可能なオーディオによるビデオ生成
- Abstract要約: Soundwichは、凍結したジョイントオーディオビデオフローマッチングモデルを複数のオーディオステムのジェネレータに変換する、トレーニング不要のフレームワークである。
サウンドウィッチは、その時間的活動を明確に制御して、別々のオーディオステムを生成する。
実験と人的評価は、柔軟なソースレベルの編集を可能にしながら、時間的制御、ソース分離、自然性を改善したことを示している。
- 参考スコア(独自算出の注目度): 51.034017422638776
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent joint audio-video generative models can synthesize realistic videos with synchronized sound, but typically generate audio as a single mixed track. This limits source-level control and differs from practical audiovisual workflows, where speech, music, sound effects, and ambient sounds are represented as separate editable tracks. We introduce Soundwich, a training-free framework that transforms a frozen joint audio-video flow-matching model into a generator of multiple synchronized, independently editable audio stems coupled to a shared video. Soundwich generates separate audio stems with explicit control over their temporal activity. To keep separately generated sounds coherent, we introduce a shared scene representation that communicates global audiovisual context across stems while preserving their source-level separation. We further route cross-modal interactions between each audio stem and its corresponding visual source, improving audiovisual consistency. The resulting stems remain synchronized with the video and can be independently retimed, muted, replaced, or remixed. Experiments and human evaluations show improved temporal control, source separation, and naturalness, while enabling flexible source-level editing within coherent audiovisual generation. Code is available at https://github.com/CodyNing/Soundwich.
- Abstract(参考訳): 最近のジョイントオーディオ・ビデオ生成モデルは、同期された音でリアルなビデオを合成することができるが、通常、単一の混合トラックとしてオーディオを生成する。
これはソースレベルの制御を制限し、音声、音楽、サウンドエフェクト、周囲の音を別々に編集可能なトラックとして表現する、実用的なオーディオヴィジュアルワークフローとは異なる。
本研究では,凍結したジョイントビデオフローマッチングモデルを,共有ビデオに結合した複数同期編集可能なオーディオステムのジェネレータに変換する,トレーニングフリーフレームワークSoundwichを紹介する。
サウンドウィッチは、その時間的活動を明確に制御して、別々のオーディオステムを生成する。
そこで本研究では,ソースレベルの分離を保ちながら,幹間のグローバルな音声視覚コンテキストを伝達する共有シーン表現を提案する。
さらに、各音声幹とその対応する視覚源間の相互モーダルな相互作用をルートし、聴覚的整合性を改善する。
生成されたステムはビデオと同期し続け、独立してリタイム、ミュート、置換、リミックスできる。
実験と人的評価は、時間的制御、ソース分離、自然性の向上を示し、コヒーレントなオーディオ視覚生成において柔軟なソースレベルの編集を可能にする。
コードはhttps://github.com/CodyNing/Soundwich.comで入手できる。
関連論文リスト
- Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal [90.14887235360611]
SAVEBenchは、テキストとマスク条件を備えたペアオーディオヴィジュアルデータセットで、オブジェクト指向のソース・ツー・ターゲット学習を可能にする。
SAVEにはSchrodinger Bridgeが組み込まれており、ソースからターゲットのオーディオヴィジュアルミックスへのダイレクトトランスポートを学習する。
評価の結果,提案したSAVEモデルは,残したコンテンツを保存しながら,音声・視覚コンテンツ中の対象オブジェクトを除去できることがわかった。
論文 参考訳(メタデータ) (2025-12-14T23:19:15Z) - ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing [47.14083940177122]
ThinkSoundは、ビデオの段階的にインタラクティブなオーディオ生成と編集を可能にする新しいフレームワークである。
提案手法は,3つの相補的な段階 – セマンティック・コヒーレント,インタラクティブなオブジェクト中心の改良,ターゲット編集 – に分解する。
実験により、ThinkSoundはオーディオメトリクスとCoTメトリクスの両方で、ビデオからオーディオ生成における最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-06-26T16:32:06Z) - Audio-Sync Video Generation with Multi-Stream Temporal Control [64.00019697525322]
我々は,正確な音声-視覚同期を備えたビデオ生成のための多目的フレームワークであるMTVを紹介する。
MTVは音声を音声、エフェクト、トラックに分離し、唇の動き、イベントタイミング、視覚的気分を制御できる。
このフレームワークをサポートするために、高品質な撮影ビデオとデミックスされたオーディオトラックのデータセットであるDremixを提示する。
論文 参考訳(メタデータ) (2025-06-09T17:59:42Z) - ReelWave: Multi-Agentic Movie Sound Generation through Multimodal LLM Conversation [72.22243595269389]
本稿では,自律型サウンドディレクタによって教師される音声生成のためのマルチエージェントフレームワークを提案する。
Foley ArtistはComposerとVoice Actorのエージェントと共同で働き、共同でオフスクリーンサウンドを自動生成して全体の生産を補完する。
本フレームワークは,映画から抽出した映像クリップに調和した,リッチで関連性の高い音声コンテンツを生成できる。
論文 参考訳(メタデータ) (2025-03-10T11:57:55Z) - SyncFusion: Multimodal Onset-synchronized Video-to-Audio Foley Synthesis [9.118448725265669]
音を設計する際に最も時間がかかるステップの1つは、音声とビデオの同期です。
ビデオゲームやアニメーションでは、参照音声は存在せず、ビデオからのイベントタイミングのマニュアルアノテーションを必要とする。
そこで本研究では,ビデオから繰り返し動作のオンセットを抽出し,新たな音効果音響トラックを生成するために訓練された拡散モデルの条件付けに用いるシステムを提案する。
論文 参考訳(メタデータ) (2023-10-23T18:01:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。