論文の概要: BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation
- arxiv url: http://arxiv.org/abs/2607.11364v1
- Date: Mon, 13 Jul 2026 10:28:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.435783
- Title: BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation
- Title(参考訳): backgroundMellow: 物語駆動リッチシネマティックサウンドスケープ生成のための多モード結合フレームワーク
- Abstract要約: 我々は、ストーリー・ツー・オーディオ生成を精密なオーケストレーションと信号処理の問題として扱うフレームワーク、BacksideMellowを提案する。
このフレームワークは、テキストを精密で多層的なオーディオキューに分解するマスター・スペシャリストのエージェント・アーキテクチャによって、根本から実現されている。
我々のパイプラインは、環境合成のためのTango2潜伏拡散モデルと、プロのサウンドトラックからマイニングされた新しいシネマティックBGMレトリバーの上に構築されている。
- 参考スコア(独自算出の注目度): 1.8763872698583384
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generating immersive, synchronized and cinematic audio for long-form textual narratives remains a significant challenge in multi-modal AI. While current Text-to-Audio (TTA) frameworks successfully synthesize isolated sound effects, they struggle with narrative cohesion, temporal alignment, and cinematic emotional depth. We present BackgroundMellow, a framework that treats story-to-audio generation as a precise orchestration and signal processing problem. This framework is enabled without ground-truth through a master-specialist agent architecture that decomposes text into precise and multi-layered audio cues, generates each category of sounds with suitable specialist model, and superimposes the soundscapes to create a unified and aligned audio segment. Our pipeline is built over Tango2 latent diffusion model for environmental synthesis alongside a novel Cinematic BGM Retriever mined from professional soundtracks. To automate the sound mixing process, we use an NLP based module that predicts precise audio parameters, like start time, duration, and relative loudness, based on the narrative timeline. We further empirically evaluate and show the efficacy of the proposed framework leveraging nearest-neighbor retrieval against a curated dataset of YouTube cinematic trailers to measure temporal synchronization, coverage, and spectral richness.
- Abstract(参考訳): 長い形式のテキスト物語のための没入型、同期型、シネマティックオーディオを生成することは、マルチモーダルAIにおいて重要な課題である。
現在のテクスト・トゥ・オーディオ(TTA)フレームワークは、孤立した音響効果をうまく合成するが、物語の結束、時間的アライメント、映画的感情深度に苦しむ。
我々は、ストーリー・ツー・オーディオ生成を精密なオーケストレーションと信号処理の問題として扱うフレームワーク、BacksideMellowを提案する。
このフレームワークは、テキストを精密で多層的なオーディオキューに分解し、適切なスペシャリストモデルでそれぞれの音のカテゴリを生成し、サウンドスケープを重畳して、統一されたアライメントされたオーディオセグメントを作成するマスター・スペシャリスト・エージェント・アーキテクチャによって、根底から実現されている。
我々のパイプラインは、プロのサウンドトラックから抽出した新しいシネマティックBGMレトリバーとともに、環境合成のためのTango2潜伏拡散モデル上に構築されている。
音の混合プロセスを自動化するために,物語の時系列に基づいて,開始時間,持続時間,相対音量などの正確な音響パラメータを予測するNLPベースのモジュールを用いる。
さらに, 映像トレーラーのキュレートされたデータセットに対して, 近接検索を利用して時間同期, カバレッジ, スペクトル富度を測定する手法の有効性を実証的に評価し, 提案手法の有効性を示した。
関連論文リスト
- ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation [55.76423101183408]
ViSAudioは、条件付きフローマッチングとデュアルブランチオーディオ生成アーキテクチャを利用するエンドツーエンドフレームワークである。
空間浸漬による高品質なオーディオを生成し、視点の変化、音源の動き、様々な音響環境に適応する。
論文 参考訳(メタデータ) (2025-12-02T18:56:12Z) - AudioStory: Generating Long-Form Narrative Audio with Large Language Models [87.23256929520743]
AudioStoryは、大きな言語モデルとテキストからオーディオシステムを統合して、構造化された長文の音声物語を生成するフレームワークである。
LLMを用いて複雑な物語クエリを時間順に並べたサブタスクに分解する。
広汎な実験により,単一音声生成と物語音声生成の両方においてAudioStoryの優位性が,指示追従能力と音声忠実性の両方において,TTAベースラインを上回った。
論文 参考訳(メタデータ) (2025-08-27T17:55:38Z) - ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing [47.14083940177122]
ThinkSoundは、ビデオの段階的にインタラクティブなオーディオ生成と編集を可能にする新しいフレームワークである。
提案手法は,3つの相補的な段階 – セマンティック・コヒーレント,インタラクティブなオブジェクト中心の改良,ターゲット編集 – に分解する。
実験により、ThinkSoundはオーディオメトリクスとCoTメトリクスの両方で、ビデオからオーディオ生成における最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-06-26T16:32:06Z) - OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking [22.337906095079198]
我々はOmniTalkerについて述べる。OmniTalkerは、入力テキストから同期音声ビデオコンテンツを共同で生成する統合フレームワークである。
本フレームワークは,2分岐拡散変換器(DiT)アーキテクチャを採用し,一方は音声生成に,もう一方はビデオ合成に用いている。
論文 参考訳(メタデータ) (2025-04-03T09:48:13Z) - Long-Video Audio Synthesis with Multi-Agent Collaboration [20.332328741375363]
LVAS-Agentは、協調的な役割を通じてプロのダビングをエミュレートする新しいフレームワークである。
提案手法は,シーンセグメンテーション,スクリプト生成,音響設計,音声合成の4段階に分割する。
中心的なイノベーションには、シーン/スクリプトの洗練のための議論の補正機構や、時間-意味的アライメントのための世代-検索ループが含まれる。
論文 参考訳(メタデータ) (2025-03-13T07:58:23Z) - ReelWave: Multi-Agentic Movie Sound Generation through Multimodal LLM Conversation [72.22243595269389]
本稿では,自律型サウンドディレクタによって教師される音声生成のためのマルチエージェントフレームワークを提案する。
Foley ArtistはComposerとVoice Actorのエージェントと共同で働き、共同でオフスクリーンサウンドを自動生成して全体の生産を補完する。
本フレームワークは,映画から抽出した映像クリップに調和した,リッチで関連性の高い音声コンテンツを生成できる。
論文 参考訳(メタデータ) (2025-03-10T11:57:55Z) - Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition [72.22243595269389]
本稿では,テキストやビデオの入力に基づく音声生成,編集,合成のためのフレームワークであるAudio-Agentを紹介する。
提案手法では,事前学習したTTA拡散ネットワークを音声生成エージェントとして利用し,GPT-4でタンデムで動作させる。
VTA(Video-to-audio)タスクでは、既存のほとんどのメソッドは、生成されたオーディオとビデオイベントを同期させるタイムスタンプ検出器のトレーニングを必要とする。
論文 参考訳(メタデータ) (2024-10-04T11:40:53Z) - AudioLM: a Language Modeling Approach to Audio Generation [59.19364975706805]
本稿では,長期的整合性を有する高品質オーディオ生成フレームワークであるAudioLMを紹介する。
本稿では,既存の音声トークンが,再建品質と長期構造との間に異なるトレードオフをもたらすことを示す。
我々は,コヒーレントピアノ音楽の継続を生成することによって,我々のアプローチが音声を超えてどのように拡張されるかを実証する。
論文 参考訳(メタデータ) (2022-09-07T13:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。