論文の概要: BeatEdit: Symbolic Music Generation as Explicit Editing
- arxiv url: http://arxiv.org/abs/2607.11124v1
- Date: Mon, 13 Jul 2026 06:00:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.344349
- Title: BeatEdit: Symbolic Music Generation as Explicit Editing
- Title(参考訳): BeatEdit: シンボリック・ミュージック・ジェネレーションの抜本的な編集
- Abstract要約: 編集ベースの手法は、テキスト変換作業には有効であることが証明されているが、象徴的な音楽では探索されていない。
本研究では,明示的な編集操作に基づくシンボリック音楽生成のための最初のフレームワークであるBeatEditを提案する。
BeatEditは、スクラッチから合成するのではなく、ドラフトを編集することで、生成を新しいコンテンツとして再キャストする。
- 参考スコア(独自算出の注目度): 8.63659638468049
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Music creation is fundamentally a process of revision. Yet symbolic music generation remains dominated by paradigms that produce complete sequences from scratch, with limited support for selective modification. Edit-based methods have proven effective for text transformation tasks, but remain largely unexplored for symbolic music. We trace this absence to the representational level: conventional event-based music encodings lack the structural properties required by explicit music editing. In contrast, the BEAT encoding, a beat-grid-anchored representation originally designed for autoregressive generation, possesses structural properties amenable to editing. We propose BeatEdit, the first framework for symbolic music generation based on explicit edit operations, recasting generation as producing new content by editing a draft rather than synthesizing from scratch. BeatEdit comprises three complementary mechanisms along an axis of increasing edit density: per-token sequence tagging for error correction, iterative refinement for accompaniment editing, and tag-then-fill for segment completion. All these mechanisms share a single encoding and pre-trained backbone, achieving higher precision and perceptual quality than autoregressive and diffusion methods across all three tasks, while remaining efficient, with single-pass inference completing in under 100 ms. Cross-encoding evaluation further reveals that encoding design substantially influences editing effectiveness, with notable encoding-method interaction effects. Code is available at https://github.com/Haoyu-Gu/BeatEdit-code
- Abstract(参考訳): 音楽の創造は基本的に改訂の過程である。
しかし、シンボリック・ミュージック・ジェネレーションは、スクラッチから完全なシーケンスを生成するパラダイムに支配されており、選択的な修正を限定的にサポートしている。
編集ベースの手法は、テキスト変換作業には有効であることが証明されているが、象徴的な音楽では探索されていない。
従来のイベントベースの音楽符号化では、明示的な音楽編集に必要な構造的特性が欠如している。
これとは対照的に、BEATエンコーディングは、もともと自己回帰生成用に設計されたビートグリッドアンコール表現であり、編集可能な構造特性を持っている。
本研究では,明示的な編集操作に基づく記号的音楽生成のための最初のフレームワークであるBeatEditを提案する。
BeatEditは、編集密度を増大させる軸に沿って、3つの補完的なメカニズムで構成されている。
これらすべてのメカニズムは、単一のエンコーディングと事前訓練されたバックボーンを共有し、自己回帰的および拡散的手法よりも高い精度と知覚的品質を達成すると同時に、100ms以下で単一パスの推論が完了しても効率を保っている。
コードはhttps://github.com/Haoyu-Gu/BeatEdit-codeで入手できる。
関連論文リスト
- Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing [10.49533454106105]
音声の塗装は欠落したセグメントを復元する一方、音声編集は編集されたテキストに従って音声コンテンツを置換する。
SIEDDは、階層的トークン上でのテキスト誘導音声の描画と編集のための離散拡散フレームワークである。
RealEdit のベンチマークでは,SIEDD が評価手法の中で最高の音声編集性能を達成している。
論文 参考訳(メタデータ) (2026-08-05T18:57:34Z) - Rethinking One-Step Image Editing through ChordEdit: Reproduction, Simplification, and New Insights [3.9337184784112917]
1ステップの画像編集は、テキストガイドによる編集を速く、実用的で、デプロイしやすいものにするために重要である。
再生,アブレーション,単純化を通じて,コード編集を再考する。
論文 参考訳(メタデータ) (2026-06-12T02:35:45Z) - SpotEdit: Selective Region Editing in Diffusion Transformers [66.44912649206553]
SpotEditは、修正されたリージョンのみを選択的に更新する、トレーニング不要な拡散編集フレームワークである。
不要な計算を削減し、未修正領域で高い忠実性を維持することにより、SpotEditは効率よく正確な画像編集を実現する。
論文 参考訳(メタデータ) (2025-12-26T14:59:41Z) - FlowDC: Flow-Based Decoupling-Decay for Complex Image Editing [52.54102743380658]
本稿では,複雑な編集を複数のサブ編集エフェクトに分離し,編集プロセス中に並列に重畳するFlowDCを提案する。
FlowDCは既存の方法に比べて優れた結果を示した。
論文 参考訳(メタデータ) (2025-12-12T09:08:39Z) - FlashEdit: Decoupling Speed, Structure, and Semantics for Precise Image Editing [75.29825659756351]
FlashEditは、高忠実でリアルタイムな画像編集を可能にするように設計された新しいフレームワークである。
その効率性は,(1)コストのかかる反復プロセスをバイパスするワンステップ・インバージョン・アンド・編集(OSIE)パイプライン,(2)編集領域内でのみ特徴を選択的に修正することで背景保存を保証するバックグラウンドシールド(BG-Shield)技術,(3)背景への意味的漏洩を抑えることで正確な局所的編集を保証するスカラー化空間横断認識(SSCA)機構の3つの重要なイノベーションに由来する。
論文 参考訳(メタデータ) (2025-09-26T11:59:30Z) - EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing [54.10773655199149]
自動回帰モデルにおける効率的な音声編集のためのクロスアテンション制御の活用について検討する。
画像編集手法に触発されて,横断的・自己認識的メカニズムを通じて編集をガイドするPrompt-to-Promptライクなアプローチを開発した。
論文 参考訳(メタデータ) (2025-07-15T08:44:11Z) - Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning [24.6866990804501]
Instruct-MusicGenは、事前訓練されたMusicGenモデルを微調整して、効率的に編集命令に従う新しいアプローチである。
注目すべきは、Instruct-MusicGenはオリジナルのMusicGenモデルに8%新しいパラメータを導入し、5Kステップでのみ列車を走らせることだ。
論文 参考訳(メタデータ) (2024-05-28T17:27:20Z) - MotionEditor: Editing Video Motion via Content-Aware Diffusion [96.825431998349]
MotionEditorはビデオモーション編集のための拡散モデルである。
新たなコンテンツ対応モーションアダプタをControlNetに組み込んで、時間的モーション対応をキャプチャする。
論文 参考訳(メタデータ) (2023-11-30T18:59:33Z) - InstructME: An Instruction Guided Music Edit And Remix Framework with
Latent Diffusion Models [42.2977676825086]
本稿では,遅延拡散モデルに基づくインストラクションガイド付き音楽編集・リミックスフレームワークであるInstructMEを開発する。
本フレームワークは,編集前後の一貫性を維持するため,U-Netをマルチスケールアグリゲーションで強化する。
提案手法は, 音質, テキスト関連性, 調和性において, 先行するシステムを大幅に上回っている。
論文 参考訳(メタデータ) (2023-08-28T07:11:42Z) - Learning Structural Edits via Incremental Tree Transformations [102.64394890816178]
構造化データのインクリメンタルな編集(すなわち「構造的編集」)のための汎用モデルを提案する。
我々の編集者は、反復的にツリー編集(例えば、サブツリーの削除や追加)を生成し、部分的に編集されたデータに適用することを学びます。
提案したエディタを2つのソースコード編集データセットで評価した結果,提案する編集エンコーダでは,従来よりも精度が向上していることがわかった。
論文 参考訳(メタデータ) (2021-01-28T16:11:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。