論文の概要: MazzikaAI: A knowledge-based performance-to-prompt compiler for real-time Arabic maqam accompaniment with a streaming text-to-music model
- arxiv url: http://arxiv.org/abs/2608.10360v1
- Date: Tue, 11 Aug 2026 01:37:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.859225
- Title: MazzikaAI: A knowledge-based performance-to-prompt compiler for real-time Arabic maqam accompaniment with a streaming text-to-music model
- Title(参考訳): MazzikaAI: リアルタイムアラビア・マカム伴奏のための知識に基づくパフォーマンス・ツー・プロンプトコンパイラ
- Abstract要約: アラビア語のマカーム音楽のマイクロトナール、モーダル、装飾された呼び出しと応答に基づいて構築されたものは、生成音楽モデルによって最も守られている伝統の1つである。
本稿では,自然言語をリアルタイム制御ループのアクチュエータとして利用する知識ベースシステムであるMazzikaAIを提案する。
- 参考スコア(独自算出の注目度): 15.423928823904482
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Arabic maqam music microtonal, modal, and built on ornamented call and response is among the traditions most underserved by generative music models, whose training frameworks remain predominantly Western and equaltempered. Real time accompaniment sharpens this gap: an AI partner must listen, adapt dynamically, and respect idiomatic microtonal structures. Streaming text to music models provide strong generative capabilities but lack precise control interfaces. We present MazzikaAI, a knowledge based system that uses natural language as the actuator of a realtime control loop. By compiling live MIDI, gesture, and inferred harmony into continuously updated text prompts, MazzikaAI steers an unmodified streaming generator, Google Lyria RealTime, without requiring model finetuning. The system embeds expert knowledge of six core maqamat, characteristic ornaments, and ensemble dynamics, maintaining realtime responsiveness with subsecond keytoaudibleupdate latency. Empirical evaluations demonstrate that dynamic prompt compilation reliably grounds generation in microtonal scales, significantly increasing offgrid quartertone content over baseline generation. Beyond its core implementation, MazzikaAI illustrates how deterministic knowledgebased rules can effectively bridge expert, nonWestern musical traditions and unfinetuned foundation models. This architecture establishes a scalable paradigm for realtime humanAI cocreation, offering a generalizable blueprint for interactive accompaniment, adaptive music education, and culturally inclusive generative audio across diverse global idioms.
- Abstract(参考訳): アラビアのマカーム音楽のマイクロトナール、モーダル、そして装飾された呼び出しと応答に基づいて構築されたマカーム音楽は、その訓練の枠組みは、主に西洋的で平等なままである、生成音楽のモデルによって最も守られている伝統の1つである。
AIパートナーは耳を傾け、動的に適応し、慣用的なマイクロトン構造を尊重しなければならない。
テキストを音楽モデルにストリーミングすることは、強力な生成機能を提供するが、正確な制御インターフェイスがない。
本稿では,自然言語をリアルタイム制御ループのアクチュエータとして利用する知識ベースシステムであるMazzikaAIを提案する。
ライブMIDI、ジェスチャー、推論された調和を継続的に更新されたテキストプロンプトにコンパイルすることで、MazzikaAIはモデル微調整を必要とせずに、修正されていないストリーミングジェネレータであるGoogle Lyria RealTimeを操縦する。
このシステムは、6つのコアマカマト、特徴的な装飾、アンサンブルダイナミクスに関する専門家の知識を組み込んでおり、サブ秒のキートーザブル更新レイテンシによるリアルタイム応答性を維持している。
実験的な評価により, 動的プロンプトコンパイルはマイクロトンスケールで確実に生成し, ベースライン生成よりもオフグリッドクォートーンの含有量が有意に増加した。
MazzikaAIは、その中核的な実装を超えて、決定論的知識に基づくルールが、専門家、非西洋音楽の伝統、そして未定義の基礎モデルを効果的に橋渡しする方法について説明している。
このアーキテクチャは、インタラクティブな伴奏、適応音楽教育、そして多様なグローバルイディオムにまたがる文化的包括的生成オーディオのための一般化可能な青写真を提供する、リアルタイムヒューマンAIコクリエーションのためのスケーラブルなパラダイムを確立する。
関連論文リスト
- Real-Time Interactive Music Generation via Data-Free Streaming Consistency Distillation [1.3115273020229667]
インタラクティブ音楽は人間のリアルタイム表現に依存している。
現代の生成音楽AIは、この領域にはほとんど欠落している。
このギャップを埋めるフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-23T08:37:15Z) - Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation [11.963078031832088]
STREAMは、振動生成のためのモード分離拡散変換器である。
ドメイン固有のダンス語彙とフレームレベルのセマンティックアノテーションに富んだデータセットであるMotorica++を紹介する。
STREAMは、コレオグラフィーのセマンティクスを完全に保存しながら、動きと音楽の間の最先端のアライメントを実現する。
論文 参考訳(メタデータ) (2026-06-22T00:01:05Z) - FIGMA: Towards FIne-Grained Music retrievAl [65.98380295254817]
自然言語記述による音楽の検索はCLAPのような対照的な音声テキストモデルで改善されているが、現在のシステムはいまだに大まかなセマンティッククエリに限られている。
この制限は、長いキャプションで訓練されているにもかかわらず、CLAPベースのモデルは、最初の数個のトークンのみを効果的に活用する。
本研究では,グローバルな音声テキストアライメントとフレームレベルのトークンアライメントを共同で最適化することで,この制限に対処するマルチビューコントラストアーキテクチャであるFIGMAを提案する。
論文 参考訳(メタデータ) (2026-06-04T18:05:39Z) - EchoAvatar: Real-time Generative Avatar Animation from Audio Streams [31.328378976492775]
本稿では,低レイテンシでストリーミング音声と音楽から連続的でコヒーレントなフルボディモーションを生成するための新しいフレームワークを提案する。
この制御性とストリーム音声駆動合成を組み合わせることで,音声エージェントを対話型ヒューマノイドアバターに変換するためのプラグアンドプレイソリューションとして機能する。
論文 参考訳(メタデータ) (2026-05-27T10:18:16Z) - Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control [66.46754271097555]
我々は, きめ細かなスタイル条件付き長大な楽曲生成のための, 完全オープンソースシステムをリリースする。
データセットは116kの完全ライセンスの合成曲で構成され、自動生成の歌詞とスタイル記述がある。
我々は、個別の音声トークンで拡張されたQwenベースの言語モデルの単一ステージ教師付き微調整によりMuseを訓練する。
論文 参考訳(メタデータ) (2026-01-07T14:40:48Z) - InstructAudio: Unified speech and music generation with natural language instruction [52.76518112649456]
InstructAudioは、音響属性の命令ベースの制御を可能にする統一的なフレームワークである。
英語と中国語で表現力のある音声、音楽、対話生成をサポートする。
論文 参考訳(メタデータ) (2025-11-23T15:15:21Z) - Music Flamingo: Scaling Music Understanding in Audio Language Models [98.94537017112704]
Music Flamingoは、基礎的なオーディオモデルにおける音楽理解を促進するために設計された、新しい大きなオーディオ言語モデルである。
MF-Skillsはマルチステージパイプラインを通じてラベル付けされたデータセットで、調和、構造、音色、歌詞、文化的な文脈をカバーする豊富なキャプションと質問応答ペアを生成する。
MF-Thinkは音楽理論に基づく新しいチェーン・オブ・シンク・データセットで、続いてGRPOベースの強化学習とカスタム報酬を取り入れた。
論文 参考訳(メタデータ) (2025-11-13T13:21:09Z) - The Ghost in the Keys: A Disklavier Demo for Human-AI Musical Co-Creativity [59.78509280246215]
Aria-Duetは、人間のピアニストと最先端のジェネレーティブモデルであるAriaのリアルタイム音楽デュエットを容易にするインタラクティブシステムである。
音楽学的な観点からシステムのアウトプットを分析し,そのモデルがスタイリスティックなセマンティクスを維持でき,コヒーレントなフレーズのアイデアを発達させることができることを発見した。
論文 参考訳(メタデータ) (2025-11-03T15:26:01Z) - MusiConGen: Rhythm and Chord Control for Transformer-Based Text-to-Music Generation [19.878013881045817]
MusiConGenは、一時条件付きトランスフォーマーベースのテキスト-音楽モデルである。
条件信号として自動的に抽出されたリズムとコードを統合する。
MusiConGenは,特定の条件に整合したリアルなバックトラック音楽を生成することができることを示す。
論文 参考訳(メタデータ) (2024-07-21T05:27:53Z) - MuDiT & MuSiT: Alignment with Colloquial Expression in Description-to-Song Generation [18.181382408551574]
本稿では,口語記述から歌声生成への新たな課題を提案する。
生成されたコンテンツと口語的人間の表現の整合性に焦点を当てている。
この課題は、AIモデル内の言語理解と聴覚表現のギャップを埋めることを目的としている。
論文 参考訳(メタデータ) (2024-07-03T15:12:36Z) - RL-Duet: Online Music Accompaniment Generation Using Deep Reinforcement
Learning [69.20460466735852]
本稿では,オンライン伴奏生成のための深層強化学習アルゴリズムを提案する。
提案アルゴリズムは人体に応答し,メロディック,ハーモニック,多種多様な機械部品を生成する。
論文 参考訳(メタデータ) (2020-02-08T03:53:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。