論文の概要: MusiChat: Vibe Composing for Music Creation
- arxiv url: http://arxiv.org/abs/2607.24873v1
- Date: Mon, 27 Jul 2026 03:51:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.56377
- Title: MusiChat: Vibe Composing for Music Creation
- Title(参考訳): MusiChat: 音楽制作のためのバイブ・コンポジション
- Authors: Callie C. Liao, Duoduo Liao, Ellie L. Zhang,
- Abstract要約: MusiChatは人間とAIの協調的な音楽制作を可能にする対話型ビブ合成システムである。
MusiChatは、メモリ拡張アーキテクチャを通じて、大きな言語モデルとハイブリッドなシンボリックミュージックエンジンを統合する。
目的分析と人的研究を通じてMusiChatを評価し, 単ターン・多ターンインタラクションにおける95.31%, 100%の精度を実現した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in AI music generation have enabled users to create complete musical pieces from natural-language prompts. However, most existing systems follow a prompt-and-regenerate paradigm, making iterative refinement difficult because users must repeatedly recreate compositions instead of directly evolving existing musical ideas. We present MusiChat, a conversational vibe composing system that enables collaborative human-AI music creation through natural-language interaction and iterative refinement. At the core of MusiChat is a hierarchical controllable music generation framework that separates lyric-aligned musical structure generation from expressive surface realization, allowing flexible stylistic transformations and structure-preserving edits. The system integrates a large language model with a hybrid symbolic music engine through a memory-augmented architecture that maintains the active composition state and user history across interactions. A hybrid intent-routing mechanism further enables efficient interpretation of both precise musical edits and open-ended creative requests. Rather than regenerating compositions from scratch, MusiChat incrementally transforms an evolving musical artifact while preserving relevant musical structure and user intent. We evaluate MusiChat through objective analysis and human studies, achieving 95.31% and 100% accuracy for single- and multi-turn interactions, respectively, and obtaining like-to-dislike ratios of 2:1 for melody naturalness and 3:1 for musical quality. Our results demonstrate that MusiChat supports coherent multi-turn music authoring and interactive human-AI co-creation through a conversational interface.
- Abstract(参考訳): 近年のAI音楽生成の進歩により、ユーザーは自然言語のプロンプトから完全な楽曲を作成できるようになった。
しかし、既存のシステムの多くは即時再生のパラダイムを踏襲しており、既存の音楽のアイデアを直接進化させるのではなく、繰り返し作曲を再現する必要があるため、反復的な洗練が困難である。
本研究では,対話型ビブ合成システムであるMusiChatについて紹介する。
MusiChatの中核は階層的な制御可能な音楽生成フレームワークで、歌詞に整列した音楽構造を表現的表面実現から切り離し、柔軟なスタイリスティックな変換と構造保存の編集を可能にする。
このシステムは大きな言語モデルとハイブリッドなシンボリック・ミュージックエンジンを統合し、メモリ拡張アーキテクチャにより、インタラクション間のアクティブなコンポジション状態とユーザ履歴を維持する。
ハイブリッドインテントルーティング機構により、正確な音楽編集とオープンエンドのクリエイティブリクエストの両方の効率的な解釈が可能になる。
MusiChatは、スクラッチから作曲を再生するのではなく、音楽構造とユーザ意図を保存しながら、進化する音楽アーティファクトを段階的に変換する。
メロディの自然度は2:1、音楽の質は3:1である。
以上の結果から,MusiChatは対話型インタフェースにより,マルチターン音楽のコヒーレントなオーサリングと対話型人間とAIの共創を支援することがわかった。
関連論文リスト
- Co-policy: Responsive Human-Robot Co-Creation for Musical Performances [58.92814200971293]
Co-policyは、人間とロボットの共創のためのフレームワークである。
意味的意図の接地、制約のある音楽的変化、そしてビズーモータ実行を分離する。
拡散ポリティクスおよびアブレーションベースラインよりも,意図整合性,実行精度,応答周波数が向上した。
論文 参考訳(メタデータ) (2026-06-18T08:08:16Z) - Music of Changing Lines: Toward a Culturally Situated Approach to the I-Ching [78.66052394412223]
チェンジラインの音楽は、中立的なランダム化ではなく、意味を持つフレームワークとして、I-Chingを再中心としている。
ユーザーはウェン・ワンファのコイン鋳造を行い、確率的音楽プロセスを通じてリアルタイムで同行する。
結果として得られるヘキサグラムと行の変化は、ユーザの問い合わせに関連して、大きな言語モデルであるGeminiによって解釈される。
論文 参考訳(メタデータ) (2026-05-19T18:35:47Z) - Music Flamingo: Scaling Music Understanding in Audio Language Models [98.94537017112704]
Music Flamingoは、基礎的なオーディオモデルにおける音楽理解を促進するために設計された、新しい大きなオーディオ言語モデルである。
MF-Skillsはマルチステージパイプラインを通じてラベル付けされたデータセットで、調和、構造、音色、歌詞、文化的な文脈をカバーする豊富なキャプションと質問応答ペアを生成する。
MF-Thinkは音楽理論に基づく新しいチェーン・オブ・シンク・データセットで、続いてGRPOベースの強化学習とカスタム報酬を取り入れた。
論文 参考訳(メタデータ) (2025-11-13T13:21:09Z) - The Ghost in the Keys: A Disklavier Demo for Human-AI Musical Co-Creativity [59.78509280246215]
Aria-Duetは、人間のピアニストと最先端のジェネレーティブモデルであるAriaのリアルタイム音楽デュエットを容易にするインタラクティブシステムである。
音楽学的な観点からシステムのアウトプットを分析し,そのモデルがスタイリスティックなセマンティクスを維持でき,コヒーレントなフレーズのアイデアを発達させることができることを発見した。
論文 参考訳(メタデータ) (2025-11-03T15:26:01Z) - ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing [47.14083940177122]
ThinkSoundは、ビデオの段階的にインタラクティブなオーディオ生成と編集を可能にする新しいフレームワークである。
提案手法は,3つの相補的な段階 – セマンティック・コヒーレント,インタラクティブなオブジェクト中心の改良,ターゲット編集 – に分解する。
実験により、ThinkSoundはオーディオメトリクスとCoTメトリクスの両方で、ビデオからオーディオ生成における最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-06-26T16:32:06Z) - ImprovNet -- Generating Controllable Musical Improvisations with Iterative Corruption Refinement [6.873190001575463]
ImprovNetは、表現力と制御性のある即興演奏を生成するトランスフォーマーベースのアーキテクチャである。
ジャンル固有のスタイルでメロディーを調和させ、短期間の即時継続および補充タスクを実行することができる。
論文 参考訳(メタデータ) (2025-02-06T21:45:38Z) - MuDiT & MuSiT: Alignment with Colloquial Expression in Description-to-Song Generation [18.181382408551574]
本稿では,口語記述から歌声生成への新たな課題を提案する。
生成されたコンテンツと口語的人間の表現の整合性に焦点を当てている。
この課題は、AIモデル内の言語理解と聴覚表現のギャップを埋めることを目的としている。
論文 参考訳(メタデータ) (2024-07-03T15:12:36Z) - MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models [57.47799823804519]
私たちは、ミュージシャンが映画の脚本だけでなく、視覚化を通して音楽を作る方法にインスピレーションを受けています。
本稿では,テキスト記述と対応する画像からの手がかりを効果的に利用して音楽を合成するモデルであるMeLFusionを提案する。
音楽合成パイプラインに視覚情報を加えることで、生成した音楽の質が大幅に向上することを示す。
論文 参考訳(メタデータ) (2024-06-07T06:38:59Z) - Controllable Lyrics-to-Melody Generation [14.15838552524433]
ユーザは好みの音楽スタイルで歌詞からリアルなメロディを生成できる、制御可能な歌詞・メロディ生成ネットワークであるConL2Mを提案する。
本研究は,音楽属性の依存関係を複数のシーケンスをまたいでモデル化するため,マルチブランチスタック型LSTMアーキテクチャ間の情報フローを実現するためにメモリ間融合(Memofu)を提案し,参照スタイル埋め込み(RSE)を提案し,生成したメロディの音楽スタイルを制御し,シーケンスレベルの統計的損失(SeqLoss)をモデルがシーケンスレベルを学習するのに役立つように提案した。
論文 参考訳(メタデータ) (2023-06-05T06:14:08Z) - Music Harmony Generation, through Deep Learning and Using a
Multi-Objective Evolutionary Algorithm [0.0]
本稿では,ポリフォニック音楽生成のための遺伝的多目的進化最適化アルゴリズムを提案する。
ゴールの1つは音楽の規則と規則であり、他の2つのゴール、例えば音楽の専門家や普通のリスナーのスコアとともに、最も最適な反応を得るために進化のサイクルに適合する。
その結果,提案手法は,聞き手を引き寄せながら文法に従う調和音とともに,所望のスタイルや長さの難易度と快適さを生み出すことができることがわかった。
論文 参考訳(メタデータ) (2021-02-16T05:05:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。