論文の概要: Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation
- arxiv url: http://arxiv.org/abs/2608.04378v1
- Date: Wed, 05 Aug 2026 02:38:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.692784
- Title: Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation
- Title(参考訳): 音楽再生エージェントの「リスナー」支援:階層的自己監督型世界モデルによる理解と生成
- Authors: Scott H. Hawley,
- Abstract要約: 本稿では,JEPAスタイルの目的を持つシンボリック音楽の「階層的自己監督世界モデル」を提案する。
条件付きフローマッチングモデルは、PCA還元条件から画素空間に流れる訓練されたデコーダのモデルである。
パイプラインはCPU上で動作し、Apple MPSで2.8ドル、または0.6ドルで提案される。
- 参考スコア(独自算出の注目度): 1.218340575383456
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Collaborative music agents need internal representations rich enough to support both understanding and generation, yet flexible enough for a workflow where the human retains agency. We present a hierarchical self-supervised ``world model'' for symbolic music: a 2.55M-parameter Swin V2 encoder trained on MIDI piano-roll images with JEPA-style objectives (pitch- and time-shift equivariance, masked embedding prediction, and a distributional regularizer), using no labels and no music-theory vocabulary. Probing the frozen embeddings shows that the level at which a musical property becomes decodable tracks its musical time scale: phrase boundaries are read off the coarsest levels, note density and harmonic detail off the finest. Temporal and phrase structure emerge from the self-supervised objectives alone, while harmonic content must be asked for; a small chord-supervision head raises joint chord recovery from .18 to .54, and key detection, which is never supervised, from .16 to .70. Following the Representation AutoEncoder paradigm, a conditional flow-matching model stands in for a trained decoder, flowing in pixel space from PCA-reduced conditioning: it reproduces a target window at pixel F1 $0.996$, and the same per-level conditioning dropout that controls how far variations stray also enables graphical prompting for masked inpainting with no inpainting-specific sampler. The pipeline runs on CPU producing a suggestion in $2.8$ s, or $0.6$ s on Apple MPS, which we demonstrate in a live interactive demo. In concert with an LLM-based brain, these capabilities supply the core of a collaborative music creation agent in service of, rather than in place of, human agency.
- Abstract(参考訳): 協調的な音楽エージェントは、理解と生成の両方をサポートするのに十分な内部表現を必要とするが、人間がエージェンシーを保持するワークフローには十分柔軟である。
2.55MパラメータのSwin V2エンコーダは、JEPAスタイルの目標(ピッチと時間シフトの同値、マスク埋め込み予測、分布正規化器)でMIDIピアノロールイメージに基づいて訓練され、ラベルや音楽理論の語彙は使用しない。
凍結した埋め込みは、音楽的特性がデオード可能になったレベルが、その音楽的時間スケールをトラックしていることを示している:フレーズ境界は、粗いレベルから読み取られ、ノート密度と、最も細かい音高のディテールが読み取られる。
小さなコード・スーパービジョンヘッドは、.18から.54へのジョイントコード回復を上昇させ、.16から.70へのキー検出は、制御されない。
Representation AutoEncoder のパラダイムに従って、条件付きフローマッチングモデルがトレーニングされたデコーダ(PCA-Reduced Conditioning:PCA-Reduced Conditioning:PCA-Reduced Conditioning:PCA-Reduced Conditioning): ピクセルF1$0.996$でターゲットウィンドウを再現する。
パイプラインはCPU上で実行され、Apple MPSで2.8ドル、または0.6ドルで提案される。
LLMベースの脳と協調して、これらの能力は人間の代理ではなく、協調的な音楽創造エージェントのコアを提供する。
関連論文リスト
- MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music [1.218340575383456]
我々は,LJEPAとSwin Transformer V2エンコーダを組み合わせたMIDI-RAE-JEPAを提案する。
ピアノロール画像として符号化された記号音楽のこのような階層的表現を学習する。
その結果, 等価性に基づくSSL目標と十分な微細エンコーダ容量が組み合わさって, 意味的に豊かで, 生成的に有用な記号音楽表現への実現可能な道筋が示唆された。
論文 参考訳(メタデータ) (2026-07-16T03:42:35Z) - Steering Autoregressive Music Generation with Recursive Feature Machines [43.475981527010276]
MusicRFMはRecursive Feature Machines (RFM) に適応し、凍結した、事前訓練された音楽モデルに対してきめ細かな、解釈可能な制御を可能にするフレームワークである。
RFMはモデルの内部勾配を分析して解釈可能な「概念方向」を生成する
動的・時間変化のスケジュールと複数の音楽特性の同時実施方法を含む,この制御の高度な機構について述べる。
論文 参考訳(メタデータ) (2025-10-21T23:23:14Z) - SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation [75.86473375730392]
SongGenは、コントロール可能な曲を生成するための、完全なオープンソースでシングルステージの自動回帰トランスフォーマーである。
音声と伴奏の混合を生成する混合モードと、それらを別々に合成するデュアルトラックモードの2つの出力モードをサポートする。
コミュニティの関与と今後の研究を促進するため、私たちは、モデルの重み付け、トレーニングコード、注釈付きデータ、前処理パイプラインをリリースします。
論文 参考訳(メタデータ) (2025-02-18T18:52:21Z) - MusicFlow: Cascaded Flow Matching for Text Guided Music Generation [53.63948108922333]
MusicFlowは、フローマッチングに基づくケースドテキストから音楽への生成モデルである。
学習目的としてマスク予測を活用することで,音楽の充実や継続といった他のタスクにモデルを一般化することができる。
論文 参考訳(メタデータ) (2024-10-27T15:35:41Z) - PerTok: Expressive Encoding and Modeling of Symbolic Musical Ideas and Variations [0.3683202928838613]
Cadenzaは、シンボリック・ミュージック・アイデアの表現的バリエーションを予測するための、新しい多段階生成フレームワークである。
提案するフレームワークは,1)コンストラクタと2)パフォーマの2段階からなる。
我々のフレームワークはミュージシャンにインスピレーションを与える目的で設計、研究、実装されている。
論文 参考訳(メタデータ) (2024-10-02T22:11:31Z) - Simple and Controllable Music Generation [94.61958781346176]
MusicGenは単一の言語モデル(LM)であり、圧縮された離散的な音楽表現、すなわちトークンの複数のストリームで動作する。
以前の作業とは異なり、MusicGenはシングルステージのトランスフォーマーLMと効率的なトークンインターリービングパターンで構成されている。
論文 参考訳(メタデータ) (2023-06-08T15:31:05Z) - The Piano Inpainting Application [0.0]
生成アルゴリズムは、提供された制御の制限、推論の禁止、ミュージシャンの生成への統合の欠如のために、依然としてアーティストによって広く使われていない。
本稿では,ピアノ演奏のインペインティングに着目した生成モデルであるピアノ・インペインティング・アプリケーション(PIA)について述べる。
論文 参考訳(メタデータ) (2021-07-13T09:33:11Z) - MuseMorphose: Full-Song and Fine-Grained Music Style Transfer with Just
One Transformer VAE [36.9033909878202]
トランスフォーマーと可変オートエンコーダ(VAE)は、シンボリック(例えばMIDI)ドメイン音楽生成に広く採用されている。
本稿では,両強みを示す単一のモデルを構築するために,この2つをまとめることに興味がある。
実験により、musemorphoseはrecurrent neural network(rnn)よりも多くのスタイル転送タスクで広く使われているメトリクスを先行技術で上回っていることが示されている。
論文 参考訳(メタデータ) (2021-05-10T03:44:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。