論文の概要: CPR: Combining global composing, local performing and full-sequence refining in piano rendering with continuous autoregressive modelling
- arxiv url: http://arxiv.org/abs/2609.18216v2
- Date: Fri, 18 Sep 2026 09:00:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.699783
- Title: CPR: Combining global composing, local performing and full-sequence refining in piano rendering with continuous autoregressive modelling
- Title(参考訳): CPR: 連続自己回帰モデルによるピアノレンダリングにおけるグローバルコンポジショニング, 局所演奏, フルシーケンス精錬の併用
- Abstract要約: プロンプト条件のピアノMIDI-to-Musicレンダリングは、基準録音の音色を再現しながら、ターゲット音符を忠実にレンダリングすることを目的としている。
既存のアプローチは主に、自己回帰(AR)モデリングとフローマッチング(または拡散)の2つのパラダイムに従っている。
- 参考スコア(独自算出の注目度): 4.601112545537169
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prompt-conditioned piano MIDI-to-Music rendering aims to faithfully render target notes while reproducing the timbre of a reference recording. Existing approaches primarily follow two paradigms: autoregressive (AR) modeling and flow matching (or diffusion). Discrete-codec AR models provide causal temporal modeling, but quantization can discard acoustic detail. Flow matching better preserves acoustic structure in the cost of full-sequence attention costs and worse semantic structure. Continuous autoregressive models operate directly on continuous representations. It not only combines the condition-following ability of AR models and distribution-modeling capacity of flow matching but also bypasses the quantization bottleneck with lower computational costs. Building on this principle, we present Composer--Performer--Refiner (CPR) framework. Composer autoregressively predicts continuous hidden states, Performer generates 24kHz acoustic latents through local flow matching and Refiner then upsamples the waveform to 48 kHz. We further introduce Bottlenecked Representation Alignment (BREPA) and Modality--Time RoPE (MT-RoPE) to strengthen musical semantic structure in Composer hidden states and temporal alignments across modalities. Codes are available at https://github.com/FEAfeatherTHER/CPR_official
- Abstract(参考訳): プロンプト条件のピアノMIDI-to-Musicレンダリングは、基準録音の音色を再現しながら、ターゲット音符を忠実にレンダリングすることを目的としている。
既存のアプローチは主に、自己回帰(AR)モデリングとフローマッチング(あるいは拡散)の2つのパラダイムに従っている。
離散符号化ARモデルは因果時間モデリングを提供するが、量子化は音響的詳細を破棄することができる。
フローマッチングは、フルシーケンスアテンションコストとより悪いセマンティック構造を犠牲にして、音響構造をよりよく保存する。
連続自己回帰モデルは、連続表現を直接操作する。
これは、ARモデルの条件追従能力とフローマッチングの分散モデリング能力を組み合わせるだけでなく、量子化ボトルネックを低い計算コストで回避する。
この原理に基づいて、我々はComposer--Performer--Refiner (CPR)フレームワークを提案する。
コンストラクタは連続した隠れ状態を自動回帰予測し、Performerは局所的な流れマッチングを通じて24kHzの音響潜伏音を生成し、Refinerは波形を48kHzにアップサンプリングする。
さらに,Bottlenecked Representation Alignment (BREPA) とModality-Time RoPE (MT-RoPE) を導入し,コンストラクタ隠蔽状態における音楽的意味構造とモーダル性間の時間的アライメントを強化する。
コードはhttps://github.com/FEAfeatherTHER/CPR_officialで公開されている。
関連論文リスト
- Perceive, Route and Modulate: Dynamic Pattern Recalibration for Time Series Forecasting [68.53528085362642]
現在の深い予測モデルは、すべての時間トークンに一様に適用される固定重み行列に依存している。
トークンレベルの再校正によってこれを解決するバックボーンに依存しないメカニズムであるDynamic Pattern Recalibrationを導入する。
DPRNetは12ベンチマークで競合性能を達成し、マクロパラメータスケーリングに対する動的リカバリを検証する。
論文 参考訳(メタデータ) (2026-05-07T14:12:47Z) - Towards Real-Time Human-AI Musical Co-Performance: Accompaniment Generation with Latent Diffusion Models and MAX/MSP [10.7598634894472]
本稿では,リアルタイムな人間-AI音楽の協調演奏のための枠組みについて述べる。
このシステムは、MAX/MSPのフロントエンド処理によるリアルタイムオーディオ入力、バッファリング、再生を、OSC/UDPメッセージを介して通信する生成モデルを実行するPython推論サーバと組み合わせる。
論文 参考訳(メタデータ) (2026-04-08T21:30:05Z) - CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling [46.16066322190728]
完全連続配列混合アーキテクチャであるCAWN(Continuous Acoustic Wave Network)を導入する。
CAWNは離散行列ベースの注意を代わりに、多面体複素ドメインファサーに隠された状態を計画している。
超長コンテキスト上での信号劣化を防止するため,デュアルゲート選択位相共振機構を導入する。
論文 参考訳(メタデータ) (2026-04-05T20:13:22Z) - Next Tokens Denoising for Speech Synthesis [51.320443764269726]
Dragon-FMは、ARとフローマッチングを統合する新しいテキスト音声(TTS)設計である。
毎秒12.5トークンのコンパクトレートで48kHzのオーディオトークンをチャンクで処理する。
ポッドキャストデータセットの実験では、高品質なゼロショットポッドキャストを効率的に生成できることが示されている。
論文 参考訳(メタデータ) (2025-07-30T15:03:36Z) - Scaling Self-Supervised Representation Learning for Symbolic Piano Performance [52.661197827466886]
本研究では,多量のシンボリック・ピアノ転写を訓練した自己回帰型トランスフォーマモデルの能力について検討した。
比較的小型で高品質なサブセットをファインチューンモデルに使い、音楽の継続を生成、シンボリックな分類タスクを実行し、汎用的なコントラストMIDI埋め込みを生成する。
論文 参考訳(メタデータ) (2025-06-30T14:00:14Z) - From Discrete Tokens to High-Fidelity Audio Using Multi-Band Diffusion [84.138804145918]
深層生成モデルは、様々な種類の表現で条件付けられた高忠実度オーディオを生成することができる。
これらのモデルは、条件付けに欠陥がある場合や不完全な場合、可聴アーチファクトを生成する傾向がある。
低ビットレート離散表現から任意の種類のオーディオモダリティを生成する高忠実度マルチバンド拡散ベースフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-02T22:14:29Z) - Continuous Melody Generation via Disentangled Short-Term Representations
and Structural Conditions [14.786601824794369]
ユーザが指定したシンボリックシナリオと過去の音楽コンテキストを組み合わせることで,メロディーを構成するモデルを提案する。
本モデルでは,8拍子の音符列を基本単位として長い旋律を生成でき,一貫したリズムパターン構造を他の特定の歌と共有することができる。
その結果,本モデルが生成する音楽は,顕著な繰り返し構造,豊かな動機,安定したリズムパターンを有する傾向が示唆された。
論文 参考訳(メタデータ) (2020-02-05T06:23:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。