論文の概要: A Text-Steerable Instrument for Sketching Procedural Soundscapes via Language Models
- arxiv url: http://arxiv.org/abs/2607.00309v1
- Date: Wed, 01 Jul 2026 01:21:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.677492
- Title: A Text-Steerable Instrument for Sketching Procedural Soundscapes via Language Models
- Title(参考訳): 言語モデルによる手続き的音環境のスケッチのためのテキスト・ステアブル・インスツルメンテーション
- Abstract要約: 本稿では,自然言語のシーン記述をプロシージャ・サウンドスケープに変換するリアルタイム音楽インタフェースを提案する。
パフォーマーは「深夜にウォームジャズカフェ」のようなプロンプトを入力し、直接パラメータ調整によってそれを操縦する。
技術的プロキシとしてホールドアウトプロンプト上でのLAION-CLAPを用いて,テキスト音声のセマンティックアライメントを評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present a real-time musical interface that converts natural-language scene descriptions into evolving procedural soundscapes. A performer types a prompt such as "warm jazz cafe at midnight" and steers it through direct parameter adjustments - stepping brightness down, switching a rhythm style - each producing a predictable, audible shift without re-prompting. Where GPU-bound text-to-audio systems synthesize monolithic waveforms, our instrument generates human-readable configurations over a categorical schema, enabling fine-grained performer control; most valid combinations are designed to sound musically coherent. Three interchangeable backends - embedding retrieval for sub-second CPU-only use, hosted LLMs via API, and a fine-tuned 270M local model - all emit the same schema. A live generator architecture continuously emits audio while resolving new instructions in the background, crossfading seamlessly when ready; even when an LLM takes 5-12 seconds to respond, the audience hears uninterrupted sound - reframing text-to-music as an ongoing performable stream rather than a one-shot generation. We evaluate text-audio semantic alignment using LAION-CLAP on held-out prompts as a technical proxy, finding that retrieval-based configuration outperforms random valid configurations on this metric, while noting that LAION-CLAP also informed retrieval-map construction. We report performance observations, informal listener feedback, and release materials for the SDK, dataset artifacts, model, and audiovisual performance interface.
- Abstract(参考訳): 本稿では,自然言語のシーン記述をプロシージャ・サウンドスケープに変換するリアルタイム音楽インタフェースを提案する。
演奏者は「真夜中のウォーム・ジャズ・カフェ」などのプロンプトを入力し、直接パラメータ調整(明るさを下げ、リズムスタイルを切り替える)により、それぞれが再ジャンプすることなく予測可能な、聴取可能なシフトを発生させる。
GPUによるモノリシックな波形の合成において,我々の装置は分類スキーマ上で人間の可読な構成を生成し,演奏者の微妙な制御を可能にし,最も有効な組み合わせは音楽的に整合性を持つよう設計されている。
3つの交換可能なバックエンド – サブ秒のCPU専用使用のための組み込み検索,API経由でホストされたLLM,2億7000万のローカルモデル – がすべて同じスキーマを出力する。
ライブジェネレータアーキテクチャは、バックグラウンドで新しい命令を解決しながら音声を連続的に出力し、準備が整ったときにシームレスにクロスフェイズする。
また, LAION-CLAPが検索マップ構築を通知する一方で, 検索に基づく構成が, この指標のランダムな有効構成よりも優れていることを確認し, 保持プロンプト上でのLAION-CLAPによるテキスト音声意味アライメントの評価を行った。
パフォーマンス観察,非公式なリスナフィードバック,SDK,データセットアーティファクト,モデル,オーディオ視覚的パフォーマンスインターフェース用のリリース資料について報告する。
関連論文リスト
- BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation [1.8763872698583384]
我々は、ストーリー・ツー・オーディオ生成を精密なオーケストレーションと信号処理の問題として扱うフレームワーク、BacksideMellowを提案する。
このフレームワークは、テキストを精密で多層的なオーディオキューに分解するマスター・スペシャリストのエージェント・アーキテクチャによって、根本から実現されている。
我々のパイプラインは、環境合成のためのTango2潜伏拡散モデルと、プロのサウンドトラックからマイニングされた新しいシネマティックBGMレトリバーの上に構築されている。
論文 参考訳(メタデータ) (2026-07-13T10:28:15Z) - Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors [10.603967327834214]
既存のマルチスピーカ対話システムは、構造化された監視を通して話者と発話を結合する。
提案手法であるScenAは,大規模インザミルドデータに基づいて事前学習したテキスト・オーディオ・フローマッチング基盤モデルである。
我々は、CoVoMix2-DialogueベンチマークでScenAを評価し、話者結合測定において、既存のマルチスピーカシステムよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-06-17T17:51:50Z) - Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models [57.635707525420884]
本稿では,タスク固有の音響特徴をキャプチャするために,トレーニング可能なプロンプトをオーディオエンコーダに導入するフレームワークを提案する。
既存のテキスト側アプローチとオーディオ側プロンプト学習を統合することで、少数ショット適応が促進されることを実証する。
論文 参考訳(メタデータ) (2026-06-14T11:23:09Z) - Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources [57.68713138159972]
本稿では,ソーストラジェクトリとともにイベントセマンティクスを学習する時間分解型オーディオエンコーダを提案する。
実験により、この表現は意味的局所化を改善し、空間的および局所化指向のトレードオフよりも強い推論をもたらすことが示された。
論文 参考訳(メタデータ) (2026-06-12T05:58:31Z) - FIGMA: Towards FIne-Grained Music retrievAl [65.98380295254817]
自然言語記述による音楽の検索はCLAPのような対照的な音声テキストモデルで改善されているが、現在のシステムはいまだに大まかなセマンティッククエリに限られている。
この制限は、長いキャプションで訓練されているにもかかわらず、CLAPベースのモデルは、最初の数個のトークンのみを効果的に活用する。
本研究では,グローバルな音声テキストアライメントとフレームレベルのトークンアライメントを共同で最適化することで,この制限に対処するマルチビューコントラストアーキテクチャであるFIGMAを提案する。
論文 参考訳(メタデータ) (2026-06-04T18:05:39Z) - Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts [20.986457042343684]
フリーフォームテキスト・プロンプト・トゥ・ユニファイド・オーディオ・ジェネレーションという新しいタスクを導入する。
PlanAudioは統合された自己回帰型LLMベースのフレームワークである。
音声・音響・合成のシナリオで評価を行う。
論文 参考訳(メタデータ) (2026-05-27T07:15:35Z) - InstructAudio: Unified speech and music generation with natural language instruction [52.76518112649456]
InstructAudioは、音響属性の命令ベースの制御を可能にする統一的なフレームワークである。
英語と中国語で表現力のある音声、音楽、対話生成をサポートする。
論文 参考訳(メタデータ) (2025-11-23T15:15:21Z) - SeeingSounds: Learning Audio-to-Visual Alignment via Text [15.011814561603964]
本稿では,音声,言語,視覚の相互作用を利用した画像生成のためのフレームワークであるSeeingSoundsを紹介する。
音声は凍結言語エンコーダを介して意味言語空間に投影され、視覚言語モデルを用いて文脈的に視覚領域に基底される。
このアプローチは認知神経科学にインスパイアされ、人間の知覚で観察される自然な相互関連を反映している。
論文 参考訳(メタデータ) (2025-10-10T18:42:50Z) - From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data [55.2480439325792]
音声対応の大規模言語モデル(ALLM)は近年,音声入力の理解と処理において大きな進歩を遂げている。
これらのモデルは典型的にはテキストベースの大規模言語モデル(LLM)に適応し、音声関連タスクのさらなるトレーニングを行う。
本研究では、現在と欠落した音を区別するALLMの能力を高めるために、コントラッシブな訓練データを生成するデータ生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-26T16:08:41Z) - CoLLAP: Contrastive Long-form Language-Audio Pretraining with Musical Temporal Structure Augmentation [17.41880273107978]
Contrastive Long-form Language-Audio Pretraining (textbfCoLLAP)
入力音声(最大5分)と言語記述(250語)の認識窓を著しく拡張するコントラストロングフォーム言語事前学習(textbfCoLLAP)を提案する。
大規模なAudioSetトレーニングデータセットから51.3Kのオーディオテキストペアを収集し,平均オーディオ長が288秒に達する。
論文 参考訳(メタデータ) (2024-10-03T07:46:51Z) - C3LLM: Conditional Multimodal Content Generation Using Large Language Models [66.11184017840688]
C3LLMは,ビデオ・トゥ・オーディオ,音声・テキスト,テキスト・トゥ・オーディオの3つのタスクを組み合わせた新しいフレームワークである。
C3LLMはLarge Language Model (LLM) 構造を異なるモダリティを整列するためのブリッジとして適合させる。
本手法は,従来の音声理解,ビデオ音声生成,テキスト音声生成のタスクを1つの統一モデルに統合する。
論文 参考訳(メタデータ) (2024-05-25T09:10:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。