論文の概要: Beyond Binary Instrument QA: Probing Instrument Grounding in Music Audio-Language Models
- arxiv url: http://arxiv.org/abs/2606.31338v1
- Date: Tue, 30 Jun 2026 08:39:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.142627
- Title: Beyond Binary Instrument QA: Probing Instrument Grounding in Music Audio-Language Models
- Title(参考訳): バイナリ・インスツルメンツ・QAを超えて:音楽音響言語モデルにおける楽器グラウンドの探索
- Authors: Yujun Lee, Joonhyeok Shin, Hyoeun Kim, Kyuhong Shim,
- Abstract要約: 音楽音響モデルにおける楽器グラウンド化のためのOpenMICによる診断ベンチマークシークエンスを提案する。
これらの結果から, 単集合精度ではなく, 多軸検定ベンチマークを用いて測定を行う必要があることが示唆された。
- 参考スコア(独自算出の注目度): 10.438946760176787
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent music audio-language models achieve high accuracy on instrument question-answering benchmarks, but it remains unclear whether this reflects robust audio grounding or benchmark-specific shortcuts. In this paper, we introduce an OpenMIC-derived diagnostic benchmark sequence for instrument grounding in music audio-language models, extending binary instrument-presence QA to genre-prior-reduced examples, confusable instrument discrimination, longer audio context, and temporal localization. Across these settings, high binary QA accuracy often fails to predict model behavior: models can exhibit option-position bias, confusable-instrument errors, and temporal response bias. These results suggest that instrument grounding should be evaluated with multi-axis diagnostic benchmarks rather than a single aggregate accuracy.
- Abstract(参考訳): 近年の音響音響言語モデルは,楽器問合せベンチマークにおいて高い精度を達成しているが,頑健な音声グラウンドやベンチマーク固有のショートカットを反映しているかどうかは不明だ。
本稿では,音楽音響モデルにおける楽器のグラウンド化のためのOpenMICによる診断ベンチマークシーケンスを導入し,二分楽器存在度QAをジャンル優先の例に拡張し,楽器の識別を困難にし,音声コンテキストを長くし,時間的ローカライゼーションを行う。
これらの設定全体では、高いバイナリQA精度はモデル動作を予測するのに失敗することが多い。
これらの結果から, 単集合精度ではなく, 多軸検定ベンチマークを用いて測定を行う必要があることが示唆された。
関連論文リスト
- A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models [64.68800440221138]
大規模音声言語モデル(LALM)は、様々な音声理解タスクにおいて高いパフォーマンスを達成するが、時間的推論に苦慮する。
メカニスティック解析のために設計された3つの基礎的タスクに対して,1,657問のベンチマークを導入する。
拡張性に対する注意の重み付けを比較すると、音声トークン間での注意の再分配は、音声の注意を増大させるよりも効果的であることがわかった。
論文 参考訳(メタデータ) (2026-06-16T01:57:56Z) - PitchBench: Measuring Pitch Hearing in Audio-Language Models [9.085153261594623]
音声モデル(ALM)におけるピッチ聴力を測定する評価スイートであるPitchBenchを紹介する。
PitchBenchは、音の大きさ、音の持続時間、音源、時間伸張、背景雑音、その他の音響条件の異なる配列とコード内の絶対的および相対的なピッチ知覚にまたがる28の実験を含む。
ピッチ補聴器の精度は,音源,音符持続時間,表記形式によって著しく変化し,信頼性が低いままである。
論文 参考訳(メタデータ) (2026-05-25T05:37:15Z) - HumMusQA: A Human-written Music Understanding QA Benchmark Dataset [2.7761207021407217]
本稿では,音楽教育の専門家による手書き質問320件の新しいデータセットを提案する。
このデータセットの使用を実証するため、6つの最先端のLALMをベンチマークし、一様ショートカットに対するロバスト性をテストした。
論文 参考訳(メタデータ) (2026-03-29T21:33:07Z) - Adapting Language Balance in Code-Switching Speech [60.296574524609575]
大規模な基礎モデルは、コードスイッチングテストケースといまだに苦労しています。
我々は、世代間のコンテキストバイアスを軽減するために、微分可能なサロゲートを使用します。
アラビア語と中国語による実験では、モデルの切り替え位置をより正確に予測できることが示されている。
論文 参考訳(メタデータ) (2025-10-21T15:23:55Z) - Not in Sync: Unveiling Temporal Bias in Audio Chat Models [59.146710538620816]
大規模音声言語モデル(LALM)は、音声理解やマルチモーダル推論にますます応用されている。
LALMにおける時間バイアスに関する最初の体系的研究を行い,その時間スタンプ予測における重要な限界を明らかにした。
論文 参考訳(メタデータ) (2025-10-14T06:29:40Z) - Thinking While Listening: Simple Test Time Scaling For Audio Classification [61.3564313676731]
本稿では,ニューラルネットワークが日常の音を聴きながら"考える"ことを可能にするフレームワークを提案する。
大規模言語モデルの推論能力の最近の進歩により、我々は2つの中心的な疑問に対処する: (i) 既存の音声分類パイプラインに思考を組み込んで、カテゴリ空間での推論を可能にし、パフォーマンスを向上させる方法、(ii) 思考とテストタイムのスケーリングの両方をサポートするために、新しいアーキテクチャをゼロから設計することができるか。
論文 参考訳(メタデータ) (2025-09-24T01:17:24Z) - Temporal fine-tuning for early risk detection [3.8486074790756506]
Web上の早期リスク検出(ERD)は、社会的および健康的な問題に直面しているユーザを素早く特定することを目的としている。
標準的な分類基準は十分ではなく、正確さと遅延を明示的に考慮する特定の指標に頼っている。
本稿では,時間を明示的に組み込むことで,トランスフォーマーモデルに基づくチューニングを可能にする,時間的微調整という,まったく異なる戦略を提案する。
論文 参考訳(メタデータ) (2025-05-16T14:17:03Z) - Generating Sample-Based Musical Instruments Using Neural Audio Codec Language Models [2.3749120526936465]
サンプルベース楽器の自動生成のためのニューラルオーディオ言語モデルを提案する。
提案手法は,88キーのスペクトル,速度,テキスト/オーディオの埋め込みを併用した音声合成フレームワークを拡張した。
論文 参考訳(メタデータ) (2024-07-22T13:59:58Z) - Eliminating Position Bias of Language Models: A Mechanistic Approach [119.34143323054143]
位置バイアスは現代言語モデル (LM) の一般的な問題であることが証明されている。
我々の力学解析は、ほぼ全ての最先端のLMで使われている2つのコンポーネント(因果的注意と相対的位置エンコーディング)に位置バイアスが関係している。
位置バイアスを排除することによって、LM-as-a-judge、検索強化QA、分子生成、数学推論など、下流タスクのパフォーマンスと信頼性が向上する。
論文 参考訳(メタデータ) (2024-07-01T09:06:57Z) - Investigation of Different Calibration Methods for Deep Speaker
Embedding based Verification Systems [66.61691401921296]
本稿では, ディープスピーカ埋込抽出器のスコアキャリブレーション法について検討する。
この研究のさらなる焦点は、スコア正規化がシステムの校正性能に与える影響を推定することである。
論文 参考訳(メタデータ) (2022-03-28T21:22:22Z) - A Lightweight Instrument-Agnostic Model for Polyphonic Note
Transcription and Multipitch Estimation [6.131772929312604]
楽器の書き起こしのための軽量ニューラルネットワークを提案する。
我々のモデルは、フレームワイドのオンセット、乗算、ノートのアクティベーションを共同で予測するように訓練されている。
ベンチマークの結果、我々のシステムのメモ推定は、同等のベースラインよりもかなり優れていることが示されています。
論文 参考訳(メタデータ) (2022-03-18T12:07:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。