論文の概要: Relational Synthesis: Structure-Mediated Concatenative Synthesis for Foley and Retrieval-Augmented Audio Generation
- arxiv url: http://arxiv.org/abs/2610.05768v1
- Date: Mon, 05 Oct 2026 04:14:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 04:32:29.578336
- Title: Relational Synthesis: Structure-Mediated Concatenative Synthesis for Foley and Retrieval-Augmented Audio Generation
- Title(参考訳): リレーショナルシンセサイザー: フォリーと検索音声生成のための構造媒介型コンカニカルシンセサイザー
- Abstract要約: 検索したソースオーディオ$S$と別のリファレンスオーディオ$R$が与えられたら、このペアの$(S,R)$から新しいオーディオ$Y$を合成できますか?
両節は, コインライクな関係合成法を用いて同時に処理可能であることを示す。
実験の結果,リレーショナル合成はニューラルRAGと自然に統合され,時間的一致,音響的忠実度,漏れ持続性を測定するFoleyオーディオが良好に動作することがわかった。
- 参考スコア(独自算出の注目度): 10.338357262730863
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We ask: given a retrieved source audio $S$ and a separate reference audio $R$, can we synthesize novel audio $Y$ out of this pair $(S,R)$ such that $Y$ remains acoustically consistent with $S$, while not persistently copying segments of $S$ or $R$? The first clause is a well-known goal in Foley audio production, and the second is a well-known issue in neural RAG when $S$ and $R$ are naively injected into neural generators. We show that both clauses can be addressed simultaneously using a method we coin relational synthesis, a variation of concatenative synthesis where target cost is replaced by a relational Gromov-like structural cost. Rather than imitating the content of $R$, relational synthesis exploits it from the "other side of the hill": it transfers the temporal structure and directed amplitude motion of $R$ to reorganize and concatenate the grains of $S$ in a novel manner that protects $S$'s acoustic information. Our experiments show that relational synthesis integrates naturally with neural RAG and produces Foley audio that performs well on metrics measuring temporal agreement, acoustic fidelity, and leakage persistence, while maintaining distribution-level quality and text alignment.
- Abstract(参考訳): 検索したソースオーディオ$S$と別のリファレンスオーディオ$R$が与えられたら、新しいオーディオ$Y$をこのペアの$(S,R)$から合成して、$Y$が$S$と音響的に整合性を維持しながら、$S$または$R$のセグメントを永続的にコピーしないようにできますか?
最初の節はフォーリーオーディオ生産においてよく知られた目標であり、第二節はニューラルなRAGにおいて、$S$と$R$がニューラルなジェネレータに鼻で注入されるときのよく知られた問題である。
両節は, 対象コストをGromovのような構造コストに置き換える, 結合型合成の変種であるリレーショナル合成法を用いて, 同時に対応可能であることを示す。
リレーショナル合成は、$R$の内容を模倣するのではなく、「丘の向こう側」から利用し、時間構造と$R$の振幅運動を変換して、$S$の穀物を再編成し、新しい方法で$S$の音響情報を保護する。
実験の結果,リレーショナル合成はニューラルRAGと自然に統合され,時間的整合性,音響的忠実度,漏れ持続性を測定しつつ,分布レベルの品質とテキストアライメントを維持できるFoleyオーディオを生成することがわかった。
関連論文リスト
- Temporal Memory for Resource-Constrained Agents: Continual Learning via Stochastic Compress-Add-Smooth [0.0]
シーケンシャルに動作するエージェントは、固定メモリ予算の下で、古い経験を忘れずに新しい経験を取り入れなければならない。
本稿では,メモリをパラメータベクトルではなくプロセスとするフレームワークを提案する。
このフレームワークは連続学習の完全な分析的イジングモデル’を提供し、数学的精度でそのメカニズム、速度、形態を研究できる。
論文 参考訳(メタデータ) (2026-03-31T12:04:11Z) - How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection [60.88800374832363]
最近のスプーフ検出研究では、ボコーダとニューラルオーディオコーデックの合成波形を用いて攻撃者をシミュレートしている。
ラベル付け選択の違いが検出性能にどのように影響するかを調べ,ラベル付け戦略に対する洞察を提供する。
論文 参考訳(メタデータ) (2026-02-18T10:29:07Z) - DiffSyn: A Generative Diffusion Approach to Materials Synthesis Planning [31.640096031422896]
DiffSynは、50年間にわたる23,000以上の合成レシピに基づいて訓練された生成拡散モデルである。
DiffSynは、所望のゼオライト構造と有機テンプレートに条件付き可能な合成経路を生成する。
概念実証として,DiffSyn合成経路を用いてUFI材料を合成する。
論文 参考訳(メタデータ) (2025-09-21T14:19:47Z) - Latent Granular Resynthesis using Neural Audio Codecs [0.0]
本稿では,潜在ベクトルレベルでの粒状合成の概念を再構築することで,創造的な音声再生を実現する新しい手法を提案する。
提案手法は,ソース音声コーパスを潜在ベクトルセグメントに符号化し,ターゲット音声信号の各潜在粒度をコードブックに最も近いものとマッチングすることにより,"粒状コードブック"を作成する。
得られたハイブリッドシーケンスをデコードして、ソースの音節特性を採用しながら、ターゲットの時間構造を保存するオーディオを生成する。
論文 参考訳(メタデータ) (2025-07-25T12:14:12Z) - VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment [101.2489492032816]
VALL-E Rは、堅牢で効率的なゼロショットテキスト音声合成システムである。
この研究は、失語症に罹患した人々のためのスピーチの作成を含む有意義なプロジェクトに適用される可能性がある。
論文 参考訳(メタデータ) (2024-06-12T04:09:44Z) - SynthesizRR: Generating Diverse Datasets with Retrieval Augmentation [55.2480439325792]
トピック分類,感情分析,トーン検出,ユーモアの6つのデータセットの合成について検討した。
その結果,SynthesizRRは語彙や意味の多様性,人文との類似性,蒸留性能を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2024-05-16T12:22:41Z) - PhaseAug: A Differentiable Augmentation for Speech Synthesis to Simulate
One-to-Many Mapping [0.3277163122167433]
本稿では、各周波数ビンの位相を回転させて1対1のマッピングをシミュレートする、音声合成のための最初の微分可能拡張であるPhaseAugを提案する。
論文 参考訳(メタデータ) (2022-11-08T23:37:05Z) - End to End Lip Synchronization with a Temporal AutoEncoder [95.94432031144716]
ビデオ中の唇の動きをオーディオストリームと同期させる問題について検討する。
両領域再帰型ニューラルネットワークを用いて最適アライメントを求める。
アプリケーションとして、既存のビデオストリームとテキストから音声までの音声を強力にアライメントする能力を実証する。
論文 参考訳(メタデータ) (2022-03-30T12:00:18Z) - Neural Granular Sound Synthesis [53.828476137089325]
グラニュラー音声合成は、小さな波形ウィンドウの並べ替え配列に基づく一般的な音声生成技術である。
生成ニューラルネットワークは、その欠点の大部分を緩和しつつ、粒状合成を実現することができることを示す。
論文 参考訳(メタデータ) (2020-08-04T08:08:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。