論文の概要: MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music
- arxiv url: http://arxiv.org/abs/2607.14537v1
- Date: Thu, 16 Jul 2026 03:42:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.977147
- Title: MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music
- Title(参考訳): MIDI-RAE-JEPA:記号音楽のための階層的表現学習と生成
- Authors: Scott H. Hawley,
- Abstract要約: 我々は,LJEPAとSwin Transformer V2エンコーダを組み合わせたMIDI-RAE-JEPAを提案する。
ピアノロール画像として符号化された記号音楽のこのような階層的表現を学習する。
その結果, 等価性に基づくSSL目標と十分な微細エンコーダ容量が組み合わさって, 意味的に豊かで, 生成的に有用な記号音楽表現への実現可能な道筋が示唆された。
- 参考スコア(独自算出の注目度): 1.218340575383456
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Rich internal representations of musical structure are essential for music understanding tasks such as machine-assisted music co-writing, yet self-supervised approaches for symbolic music representation remain underexplored, particularly those that encode the hierarchical multiscale nature of musical structures. We present MIDI-RAE-JEPA, combining a pitch- and time-shift equivariance objective with LeJEPA and a Swin Transformer V2 encoder to learn such hierarchical representations of symbolic music encoded as piano roll images. The time-shift equivariance objective encourages the model to internalize temporal musical relationships. The encoder is trained purely on self-supervised objectives -- including a masked embedding predictor (MEP) -- with collapse prevented via SIGReg. A separate decoder trained on the frozen encoder embeddings achieves reconstruction F1 of 0.995, and a flow matching generative model conditioned on those embeddings produces generations that closely match the pitch register and rhythmic density of the conditioning excerpt, while mismatched conditioning yields unrelated but musically plausible output. Learned representations outperform a Haar scattering transform baseline on a downstream emotion classification task, and embedding distances increase monotonically with pitch and time shift magnitude, confirming measurable equivariance. These results suggest that equivariance-based SSL objectives, combined with sufficient fine-level encoder capacity, provide a viable path toward semantically rich, generatively useful representations of symbolic music.
- Abstract(参考訳): 豊かな音楽構造の内部表現は、機械支援音楽の共筆のような音楽理解のタスクには不可欠であるが、象徴的な音楽表現に対する自己指導的なアプローチは、特に音楽構造の階層的なマルチスケールな性質を符号化するものとしては、未発見のままである。
本稿では,LJEPAとSwin Transformer V2エンコーダを組み合わせたMIDI-RAE-JEPAを用いて,ピアノロール画像として符号化されたシンボリック音楽の階層的表現を学習する。
時間-シフト同値の目的は、時間的音楽的関係を内在化することをモデルに促す。
エンコーダは、マスク付き埋め込み予測器(MEP)を含む、自己管理された目的に基づいて純粋に訓練されており、SIGRegを介して崩壊を防いでいる。
凍結エンコーダ埋め込みで訓練された別個のデコーダは0.995の再構成F1を達成し、それらの埋め込みに条件付けされたフローマッチング生成モデルは、条件付けのピッチレジスタとリズム密度とを密に一致させる世代を生成し、不一致条件付けは、無関係で音楽的に可聴な出力を得る。
学習された表現は、下流感情分類タスクにおいてハール散乱変換ベースラインを上回り、埋め込み距離はピッチや時間シフトの程度で単調に増加し、測定可能な同値性を確認する。
これらの結果から,同値性に基づくSSL目標と十分な精細エンコーダ容量が組み合わさって,意味的にリッチで生成的に有用な記号音楽表現への実現可能な道筋が示唆された。
関連論文リスト
- FIGMA: Towards FIne-Grained Music retrievAl [65.98380295254817]
自然言語記述による音楽の検索はCLAPのような対照的な音声テキストモデルで改善されているが、現在のシステムはいまだに大まかなセマンティッククエリに限られている。
この制限は、長いキャプションで訓練されているにもかかわらず、CLAPベースのモデルは、最初の数個のトークンのみを効果的に活用する。
本研究では,グローバルな音声テキストアライメントとフレームレベルのトークンアライメントを共同で最適化することで,この制限に対処するマルチビューコントラストアーキテクチャであるFIGMAを提案する。
論文 参考訳(メタデータ) (2026-06-04T18:05:39Z) - SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton [26.272034375469943]
SymphonyGenは、撮影オーケストレーションのための3D階層的なフレームワークである。
ビート量子化マルチボイスハーモニースケルトンを用いた「ショートスコア」コンディショニングを導入する。
我々は、意図しない音節衝突を抑制するために、不協和逆サンプリングアルゴリズムを実装した。
論文 参考訳(メタデータ) (2026-04-28T11:01:21Z) - Scaling Self-Supervised Representation Learning for Symbolic Piano Performance [52.661197827466886]
本研究では,多量のシンボリック・ピアノ転写を訓練した自己回帰型トランスフォーマモデルの能力について検討した。
比較的小型で高品質なサブセットをファインチューンモデルに使い、音楽の継続を生成、シンボリックな分類タスクを実行し、汎用的なコントラストMIDI埋め込みを生成する。
論文 参考訳(メタデータ) (2025-06-30T14:00:14Z) - PerTok: Expressive Encoding and Modeling of Symbolic Musical Ideas and Variations [0.3683202928838613]
Cadenzaは、シンボリック・ミュージック・アイデアの表現的バリエーションを予測するための、新しい多段階生成フレームワークである。
提案するフレームワークは,1)コンストラクタと2)パフォーマの2段階からなる。
我々のフレームワークはミュージシャンにインスピレーションを与える目的で設計、研究、実装されている。
論文 参考訳(メタデータ) (2024-10-02T22:11:31Z) - Unifying Symbolic Music Arrangement: Track-Aware Reconstruction and Structured Tokenization [19.27890803128116]
自動マルチトラック音楽アレンジメントのための統合フレームワークを提案する。
中心となるのは、トークンレベルのアンタングルされたコンテンツとスタイルで動作するセグメントレベルの再構築目標である。
トラックワイズ・モデリングを支援するため,マルチトラック・シンボリック・ミュージックのための構造化トークン化手法であるREMI-zを導入する。
論文 参考訳(メタデータ) (2024-08-27T16:18:51Z) - Multi-view MidiVAE: Fusing Track- and Bar-view Representations for Long
Multi-track Symbolic Music Generation [50.365392018302416]
長い多トラックのシンボリック・ミュージックを効果的にモデル化・生成するVAE手法の先駆者の一つであるMulti-view MidiVAEを提案する。
我々は,ハイブリッドな変分符号化・復号化戦略を用いて,楽器の特徴と調和,および楽曲のグローバルおよびローカルな情報に焦点をあてる。
論文 参考訳(メタデータ) (2024-01-15T08:41:01Z) - Multi-instrument Music Synthesis with Spectrogram Diffusion [19.81982315173444]
我々は、MIDIシーケンスから任意の組み合わせの楽器をリアルタイムで生成できるニューラルシンセサイザーの中盤に焦点を当てる。
MIDIはエンコーダ・デコーダ変換器でスペクトログラム、次いでGAN(Generative Adversarial Network)スペクトルインバータでスペクトログラムからオーディオへ分光する。
これは、楽器と音符の任意の組み合わせのための対話的で表現力のあるニューラルシンセシスに向けた、有望な第一歩である。
論文 参考訳(メタデータ) (2022-06-11T03:26:15Z) - Symphony Generation with Permutation Invariant Language Model [57.75739773758614]
変分不変言語モデルに基づくシンフォニーネットという記号的シンフォニー音楽生成ソリューションを提案する。
シンフォニートークンの超長いシーケンスをモデル化するためのバックボーンとして、新しいトランスフォーマーデコーダアーキテクチャが導入された。
実験結果から,提案手法は人間の構成と比べ,コヒーレント,新規,複雑,調和的な交響曲を生成できることが示唆された。
論文 参考訳(メタデータ) (2022-05-10T13:08:49Z) - Conditioning Trick for Training Stable GANs [70.15099665710336]
本稿では,GANトレーニング中の不安定性問題に対応するため,ジェネレータネットワークに正規性から逸脱する条件付け手法を提案する。
我々は、生成元をシュア分解のスペクトル領域で計算された実サンプルの正規化関数から逸脱するように強制する。
論文 参考訳(メタデータ) (2020-10-12T16:50:22Z) - Hierarchical Timbre-Painting and Articulation Generation [92.59388372914265]
本稿では,f0と大音量に基づく高速かつ高忠実な楽曲生成手法を提案する。
合成音声は、対象楽器の音色及び調音を模倣する。
論文 参考訳(メタデータ) (2020-08-30T05:27:39Z) - Learning Style-Aware Symbolic Music Representations by Adversarial
Autoencoders [9.923470453197657]
我々は,文脈情報を用いた変動型オートエンコーダを組み込むための,フレキシブルで自然な手段として,逆正則化を活用することに注力する。
第1回音楽Adversarial Autoencoder(MusAE)について紹介する。
我々のモデルは、標準変分オートエンコーダに基づく最先端モデルよりも高い再構成精度を有する。
論文 参考訳(メタデータ) (2020-01-15T18:07:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。