論文の概要: From Isolated Feature to Orbits: Discovering Music Concepts via Multi-SAE Alignment
- arxiv url: http://arxiv.org/abs/2610.01864v1
- Date: Thu, 01 Oct 2026 15:25:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.223643
- Title: From Isolated Feature to Orbits: Discovering Music Concepts via Multi-SAE Alignment
- Title(参考訳): 孤立した特徴から軌道へ:マルチSAEアライメントによる音楽概念の発見
- Abstract要約: 本研究は,音楽基盤モデルの内的表現が特徴の組織構造として出現するかどうかを問うものである。
ピッチシフトした入力ペアを生成し,それらのSAE表現を整列させて,ピッチ関連特徴の構造化群を発見する。
実験により、この手法は2つの最先端音楽基盤モデルにまたがる和音、鍵、メロディックパターンに対応する軌道構造を復元することを示した。
- 参考スコア(独自算出の注目度): 16.650991076079166
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How can we understand what a music foundation model has learned \textit{internally}? Most interpretability approaches, such as probing and Sparse Autoencoders (SAEs), focus on identifying individual features with minimal structural assumptions. We argue that many concepts are better understood as \textit{structured relations} rather than isolated features. This is especially prominent in music, where tonal structures are organized in the space of pitch and time. For example, concepts such as chords or keys are naturally expressed as structured sets (e.g., the 12 transpositions of a chord or the diatonic system within a key), rather than isolated features. In this study, \textbf{we shift from feature identification to structure-based analysis}, asking whether the learned inner representations of music foundation model emerge as organized structures over features. To this end, we introduce a framework that uses pitch transposition as an inductive bias to induce ordered orbits via multi-view SAE alignment. Concretely, we generate pitch-shifted input pairs and align their SAE representations to discover structured groups of pitch-related features. Experimental results show that this approach recovers orbit structures corresponding to chords, keys, and melodic patterns across two state-of-the-art music foundation models, while requiring only minimal grounding (e.g., a few anchor examples) to interpret entire concept families.
- Abstract(参考訳): 音楽ファンデーションモデルはどのようにしてtextit{internally}を学習したのか?
探索やスパースオートエンコーダ(SAE)のようなほとんどの解釈可能性のアプローチは、最小構造仮定で個々の特徴を特定することに重点を置いている。
我々は、多くの概念が孤立した特徴よりも「textit{structured relations}」として理解されていると論じる。
これは特に音楽において顕著であり、音調構造はピッチと時間の空間で構成される。
例えば、和音や鍵といった概念は、孤立した特徴ではなく、自然に構造化された集合(例えば、和音の12の転置やキー内の音素系)として表現される。
本研究では,音楽ファンデーションモデルの内的表現が特徴上の組織構造として出現するかどうかを問う,特徴識別から構造に基づく分析へ移行する。
この目的のために,多視点SAEアライメントにより秩序軌道を誘導するインダクティブバイアスとしてピッチ変換を用いるフレームワークを提案する。
具体的には、ピッチシフトした入力ペアを生成し、それらのSAE表現を整列させて、ピッチ関連特徴の構造化群を発見する。
実験結果から,本手法は2つの最先端音楽基盤モデルにまたがるコード,キー,メロディックパターンに対応する軌道構造を復元し,最小の接地(例えば,いくつかのアンカー例)しか必要とせず,概念ファミリ全体を解釈することを示した。
関連論文リスト
- FIGMA: Towards FIne-Grained Music retrievAl [65.98380295254817]
自然言語記述による音楽の検索はCLAPのような対照的な音声テキストモデルで改善されているが、現在のシステムはいまだに大まかなセマンティッククエリに限られている。
この制限は、長いキャプションで訓練されているにもかかわらず、CLAPベースのモデルは、最初の数個のトークンのみを効果的に活用する。
本研究では,グローバルな音声テキストアライメントとフレームレベルのトークンアライメントを共同で最適化することで,この制限に対処するマルチビューコントラストアーキテクチャであるFIGMAを提案する。
論文 参考訳(メタデータ) (2026-06-04T18:05:39Z) - StructLens: A Structural Lens for Language Models via Maximum Spanning Trees [52.040177523973334]
StructLensは、内部構造が全体構造とどのように関係しているかを明らかにするために設計された分析フレームワークである。
以上の結果から,StructLensは従来のコサイン類似性とは大きく異なる層間類似性パターンを呈することが明らかとなった。
論文 参考訳(メタデータ) (2026-02-10T11:30:32Z) - Discovering "Words" in Music: Unsupervised Learning of Compositional Sparse Code for Symbolic Music [50.87225308217594]
本稿では,記号的音楽データから「音楽単語」と呼ばれる繰り返しパターンを識別する教師なし機械学習アルゴリズムを提案する。
本稿では,音楽単語発見の課題を統計的最適化問題として定式化し,二段階予測最大化(EM)に基づく学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-29T11:10:57Z) - Text-Queried Audio Source Separation via Hierarchical Modeling [53.94434504259829]
本研究では,HSM-TSSという階層的分解フレームワークを提案し,そのタスクをグローバルな意味誘導特徴分離と構造保存音響再構成に分解する。
Q-Audioアーキテクチャは、事前訓練されたグローバルセマンティックエンコーダとして機能するオーディオとテキストのモダリティを調整するために使用される。
本手法は,複雑な聴覚シーンにおけるクエリとのセマンティック一貫性を保ちながら,データ効率のトレーニングによる最先端の分離性能を実現する。
論文 参考訳(メタデータ) (2025-05-27T11:00:38Z) - Synthesizing Composite Hierarchical Structure from Symbolic Music Corpora [32.18458296933001]
構造時間グラフ(STG)と呼ばれる音楽構造の統一的階層的メタ表現を提案する。
シングルピースの場合、STGは、より微細な構造的音楽的特徴の階層構造とそれらの間の時間的関係を定義するデータ構造である。
論文 参考訳(メタデータ) (2025-02-21T02:32:29Z) - Physics of Language Models: Part 1, Learning Hierarchical Language Structures [51.68385617116854]
トランスフォーマーベースの言語モデルは効率的だが複雑であり、内部の動作や推論メカニズムを理解することは大きな課題である。
本稿では,長文を生成可能な階層規則を生成する合成CFGのファミリーを紹介する。
我々は、GPTのような生成モデルがCFG定義階層を正確に学習し、推論し、それに基づいて文を生成することを実証する。
論文 参考訳(メタデータ) (2023-05-23T04:28:16Z) - Modeling Musical Structure with Artificial Neural Networks [0.0]
音楽構造モデリングのさまざまな側面に対する人工知能の適用について検討する。
Gated Autoencoder(GAE)というコネクショナリストモデルを用いて,楽曲の断片間の変換を学習する方法を示す。
本稿では,ポリフォニック・ミュージックを区間の連続として表現するGAEの特別な予測訓練を提案する。
論文 参考訳(メタデータ) (2020-01-06T18:35:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。