論文の概要: Local Multimodal Music Alignment from Global Supervision
- arxiv url: http://arxiv.org/abs/2607.10023v1
- Date: Fri, 10 Jul 2026 22:59:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.278376
- Title: Local Multimodal Music Alignment from Global Supervision
- Title(参考訳): グローバル・スーパービジョンによるローカルマルチモーダル音楽アライメント
- Abstract要約: FuSiLiは、ローカルイメージパッチとオーディオフレーム機能を直接操作するマルチモーダルコントラスト学習の類似点である。
我々は,FuSiLiが地域関係を効果的に学習し,(ii)グローバルな監視のみを必要とし,(iii)従来のコントラスト的アプローチのグローバルなアライメント能力を維持していることを示す。
- 参考スコア(独自算出の注目度): 11.624620479275734
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding music requires understanding localized relationships across data modalities, e.g., how time in performance audio maps onto position in a score image. Yet supervision for such local correspondences is difficult to obtain-in practice, we often only have access to coarser global supervision like paired segments of audio and images. To address this gap, we propose FuSiLi (Fused Sinkhorn-Localized Similarity), a similarity score for multimodal contrastive learning operating directly on local image patch and audio frame features via Sinkhorn-based soft alignment. We show that FuSiLi (i) effectively learns local relationships, (ii) requires only global supervision, and (iii) retains the global alignment capabilities of conventional contrastive approaches. We fine-tune pretrained CLIP and CLAP encoders on pairs of raw sheet music images and audio using a hybrid contrastive objective combining FuSiLi with conventional global similarity. We evaluate on cross-modal retrieval and frame-level alignment tasks against a range of global and local baselines, showing that our approach outperforms them on local alignment while remaining competitive on retrieval.
- Abstract(参考訳): 音楽を理解するには、データモダリティ間の局所的な関係を理解する必要がある。
しかし、そのようなローカルな通信の監督は実践が難しいため、音声と画像のペア化セグメントのような粗いグローバルな監視にしかアクセスできないことが多い。
このギャップに対処するために,局所的な画像パッチや音声フレーム機能を直接操作するマルチモーダルコントラスト学習のための類似度スコアであるFuSiLi(Fused Sinkhorn-Localized similarity)を提案する。
私たちは、FuSiLiを示します。
(i) 地域関係を効果的に学習する。
(二)グローバルな監督しか必要とせず
(iii)従来のコントラッシブアプローチのグローバルアライメント能力を維持している。
FuSiLiと従来のグローバルな類似性を組み合わせたハイブリッド・コントラクティブ・オブジェクトを用いて、プリトレーニング済みのCLIPとCLAPエンコーダを生の楽譜とオーディオのペアで微調整する。
本研究では, クロスモーダル検索とフレームレベルのアライメントタスクを, グローバルベースライン, ローカルベースラインに対して評価し, 検索において競争力を維持しながら, 局所アライメントにおいて, より優れていたことを示す。
関連論文リスト
- Efficiency Follows Global-Local Decoupling [62.05489838893081]
ConvNeurは、軽量なニューラルメモリブランチがトークンの集合にグローバルなコンテキストを集約する2分岐アーキテクチャである。
学習ゲートは、グローバルなキューが目的を絞ることなく、局所的な特徴を調整できる。
標準的な分類、検出、セグメンテーションのベンチマークでは、ConvNeurは同等または低い計算で同等の選択肢にマッチするか、超えている。
論文 参考訳(メタデータ) (2026-03-20T02:20:16Z) - Complementary and Contrastive Learning for Audio-Visual Segmentation [74.11434759171199]
本稿では,ローカル情報とグローバル情報の両方を処理可能な新しいフレームワークであるComplementary and Contrastive Transformer(CCFormer)を提案する。
提案手法は,S4, MS3, AVSSデータセットにまたがる最先端のベンチマークを新たに設定する。
論文 参考訳(メタデータ) (2025-10-11T06:36:59Z) - Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing [26.317163478761916]
弱教師付き音声視覚ビデオ解析は、時間的アノテーションを使わずに、可聴性、可視性、および音声視覚イベントを検出する。
本稿では,信頼度の高いセグメントレベルのマスクを生成する指数移動平均(EMA)誘導擬似監視フレームワークを提案する。
また,クラス対応のクロスモーダル・アグリーメント(CMA)の損失も提案する。
論文 参考訳(メタデータ) (2025-09-17T15:38:05Z) - CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment [76.32508013503653]
CAV-MAE Sync は,自己教師型音声視覚学習のためのオリジナルの CAV-MAE フレームワークの簡易かつ効果的な拡張として提案する。
音声をグローバルな表現ではなく,映像フレームに整合した時間的シーケンスとして扱うことで,モダリティ間のミスマッチに対処する。
パッチトークンのセマンティック負荷を低減するための学習可能なレジスタトークンを導入することにより,空間的ローカライゼーションを改善する。
論文 参考訳(メタデータ) (2025-05-02T12:59:58Z) - Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization [50.122441710500055]
オーディオ・ビジュアル・イベント(DAVE)のための局所性を考慮したクロスモーダル対応学習フレームワークLoCoについて述べる。
LoCo は局所対応特徴 (LCF) 変調を適用し、モダリティ共有セマンティクスに焦点を合わせるために単調エンコーダを強制する。
さらに、データ駆動方式で注意領域を動的に調整するローカル適応クロスモーダル(LAC)インタラクションをカスタマイズする。
論文 参考訳(メタデータ) (2024-09-12T11:54:25Z) - Learning Global-aware Kernel for Image Harmonization [55.614444363743765]
画像調和は、背景を基準として前景画素を適応的に調整することで、合成画像の視覚的不整合問題を解決することを目的としている。
既存の手法では、前景と背景の間の局所的な色変換や領域マッチングが採用されている。
本稿では,長距離バックグラウンド参照を包括的に考慮した地域調和のための,GKNet(Global-Aware Kernel Network)を提案する。
論文 参考訳(メタデータ) (2023-05-19T13:49:02Z) - Cross-Modal Global Interaction and Local Alignment for Audio-Visual
Speech Recognition [21.477900473255264]
音声・視覚音声認識(AVSR)のための多言語間相互作用と局所アライメント(GILA)アプローチを提案する。
具体的には、A-Vの相補関係をモダリティレベルで捉えるためのグローバル相互作用モデルと、フレームレベルでのA-Vの時間的一貫性をモデル化するための局所アライメントアプローチを設計する。
我々のGILAは、公開ベンチマークのLSS3とLSS2で教師付き学習状況よりも優れています。
論文 参考訳(メタデータ) (2023-05-16T06:41:25Z) - T2VLAD: Global-Local Sequence Alignment for Text-Video Retrieval [59.990432265734384]
テキストビデオ検索は,自然言語記述に基づく関連映像の検索を目的とした課題である。
既存のほとんどのメソッドは、グローバルなクロスモーダル類似性のみを考慮し、ローカルの詳細を見下ろす。
本稿では,効率的なグローバルアライメント手法を設計する。
3つの標準テキスト-ビデオ検索ベンチマークで一貫した改善を達成し、明確なマージンで最先端を上回ります。
論文 参考訳(メタデータ) (2021-04-20T15:26:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。