論文の概要: FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips
- arxiv url: http://arxiv.org/abs/2604.05731v1
- Date: Tue, 07 Apr 2026 11:34:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.787088
- Title: FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips
- Title(参考訳): FoleyDesigner: フィルムクリップのための精密な時空間アライメントを備えた没入型ステレオフォリージェネレーション
- Authors: Mengtian Li, Kunyan Dai, Yi Ding, Ruobing Ni, Ying Zhang, Wenwu Wang, Zhifeng Xie,
- Abstract要約: フォリー・アート・プレイは、映画制作における聴覚経験を高める上で重要な役割を演ずる。
FoleyDesignerは正確な多時間解析にBS-agentアーキテクチャを使用している。
フレームワークは、プロのパイプラインとのシームレスな統合を維持するインタラクティブなユーザコントロールをサポートする。
- 参考スコア(独自算出の注目度): 23.991747947268212
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Foley art plays a pivotal role in enhancing immersive auditory experiences in film, yet manual creation of spatio-temporally aligned audio remains labor-intensive. We propose FoleyDesigner, a novel framework inspired by professional Foley workflows, integrating film clip analysis, spatio-temporally controllable Foley generation, and professional audio mixing capabilities. FoleyDesigner employs a multi-agent architecture for precise spatio-temporal analysis. It achieves spatio-temporal alignment through latent diffusion models trained on spatio-temporal cues extracted from video frames, combined with large language model (LLM)-driven hybrid mechanisms that emulate post-production practices in film industry. To address the lack of high-quality stereo audio datasets in film, we introduce FilmStereo, the first professional stereo audio dataset containing spatial metadata, precise timestamps, and semantic annotations for eight common Foley categories. For applications, the framework supports interactive user control while maintaining seamless integration with professional pipelines, including 5.1-channel Dolby Atmos systems compliant with ITU-R BS.775 standards, thereby offering extensive creative flexibility. Extensive experiments demonstrate that our method achieves superior spatio-temporal alignment compared to existing baselines, with seamless compatibility with professional film production standards. The project page is available at https://gekiii996.github.io/FoleyDesigner/ .
- Abstract(参考訳): フォリーアートは映画における没入的な聴覚経験を高める上で重要な役割を担っているが、時空間に整合した音声のマニュアル作成は労働集約的である。
プロのFoleyワークフローにインスパイアされた新しいフレームワークであるFoleyDesignerを提案し、フィルムクリップ解析、時空間制御可能なFoley生成、プロのオーディオミキシング機能を統合する。
FoleyDesignerは、正確な時空間分析にマルチエージェントアーキテクチャを使用している。
ビデオフレームから抽出した時空間的手がかりに基づいて訓練された潜時拡散モデルと,映画産業におけるポストプロダクションの実践をエミュレートする大規模言語モデル(LLM)によるハイブリッドメカニズムを組み合わせることで,時空間アライメントを実現する。
フィルムにおける高品質なステレオオーディオデータセットの欠如を解決するために,空間メタデータ,正確なタイムスタンプ,セマンティックアノテーションを含む最初のプロ用ステレオオーディオデータセットであるFilmStereoを紹介した。
アプリケーションでは、ITU-R BS.775標準に準拠した5.1チャンネルのDolby Atmosシステムを含む、プロのパイプラインとのシームレスな統合を維持しながら、インタラクティブなユーザコントロールをサポートする。
広汎な実験により,本手法は,プロのフィルム製作基準とのシームレスな互換性を保ちながら,既存のベースラインに比べて時空間アライメントが優れていることが示された。
プロジェクトページはhttps://gekiii996.github.io/FoleyDesigner/ で公開されている。
関連論文リスト
- FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts [33.4228845956243]
FoleyDirectorは、DiTベースのV2A生成において正確な時間的ガイダンスを可能にするフレームワークである。
ベースモデルのオーディオ品質を保ち、V2A生成と時間的に制御された合成をシームレスに切り替えることができる。
論文 参考訳(メタデータ) (2026-03-20T11:19:29Z) - ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation [55.76423101183408]
ViSAudioは、条件付きフローマッチングとデュアルブランチオーディオ生成アーキテクチャを利用するエンドツーエンドフレームワークである。
空間浸漬による高品質なオーディオを生成し、視点の変化、音源の動き、様々な音響環境に適応する。
論文 参考訳(メタデータ) (2025-12-02T18:56:12Z) - SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos [38.40457780873775]
SALSA-Vは,サイレントビデオコンテンツから高同期・高忠実長音声を合成できるマルチモーダルビデオ・オーディオ生成モデルである。
提案手法では,非拘束長音声系列の音声条件生成とシームレスな合成を可能にする。
SALSA-Vは,映像コンテンツと音声の協調・同期の両面で,定量的評価と人間の聴取研究において,既存の最先端手法を著しく上回っていることを示す。
論文 参考訳(メタデータ) (2025-10-03T11:37:50Z) - ReelWave: Multi-Agentic Movie Sound Generation through Multimodal LLM Conversation [72.22243595269389]
本稿では,自律型サウンドディレクタによって教師される音声生成のためのマルチエージェントフレームワークを提案する。
Foley ArtistはComposerとVoice Actorのエージェントと共同で働き、共同でオフスクリーンサウンドを自動生成して全体の生産を補完する。
本フレームワークは,映画から抽出した映像クリップに調和した,リッチで関連性の高い音声コンテンツを生成できる。
論文 参考訳(メタデータ) (2025-03-10T11:57:55Z) - AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation [49.6922496382879]
本稿では,A2V(Video-to-Audio)生成とA2V(Audio-to-Video)生成のための統合フレームワークを提案する。
我々のフレームワークの鍵は、ビデオとオーディオの拡散モデル間の双方向情報交換を容易にするFusion Blockである。
論文 参考訳(メタデータ) (2024-12-19T18:57:21Z) - FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment [11.796771978828403]
ビデオから時間的コヒーレントかつ意味論的に制御可能な音響効果を生成する2段階生成フレームワークであるFolAIを紹介する。
その結果、我々のモデルは、時間的に視覚運動に整合し、意味的にユーザ意図と整合し、知覚的にリアルな音声を確実に生成することがわかった。
これらの知見は、FolAIがプロと対話的な環境でスケーラブルで高品質なフォーリー音声合成のための、制御可能でモジュラーなソリューションとしての可能性を強調している。
論文 参考訳(メタデータ) (2024-12-19T16:37:19Z) - FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds [14.636030346325578]
我々は,ビデオと同期する高品質な音響効果の自動生成であるNeural Foleyについて検討し,没入型音声視覚体験を実現する。
本稿では,高品質な音声生成を実現するために,事前学習されたテキスト・音声モデルを活用する新しいフレームワークであるFoleyCrafterを提案する。
FoleyCrafterの特筆すべき利点は、テキストプロンプトとの互換性である。
論文 参考訳(メタデータ) (2024-07-01T17:35:56Z) - Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion
Latent Aligners [69.70590867769408]
ビデオとオーディオのコンテンツ制作は、映画産業とプロのユーザーにとって重要な技術である。
既存の拡散に基づく手法は、ビデオと音声を別々に生成する。
本研究では,このギャップを埋めることを目的として,クロス・ビジュアル・オーディオとジョイント・ヴィジュアル・オーディオ生成のためのフレームワークを慎重に設計した。
論文 参考訳(メタデータ) (2024-02-27T17:57:04Z) - T-FOLEY: A Controllable Waveform-Domain Diffusion Model for
Temporal-Event-Guided Foley Sound Synthesis [7.529080653700932]
フォリー音声合成のための時間イベント誘導波形生成モデルであるT-Foleyについて述べる。
T-Foleyは音のクラスと時間イベントという2つの条件を用いて高品質な音声を生成する。
T-Foleyは客観的評価指標と主観評価指標の両方において優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-01-17T15:54:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。