論文の概要: Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)
- arxiv url: http://arxiv.org/abs/2605.04556v1
- Date: Wed, 06 May 2026 06:58:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.685902
- Title: Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)
- Title(参考訳): 大規模音埋め込みベンチマーク(MSEB)におけるLCMのベンチマーク
- Abstract要約: Massive Sound Embedding Benchmark (MSEB) は、音声モデルの機能的幅を評価する標準として登場した。
オーディオネイティブ(audio-native)なLarge Language Models(LLM)への移行は、単一のマルチモーダルバックボーンが複雑なタスク固有のパイプラインを置き換える、新たなパラダイムを示唆している。
- 参考スコア(独自算出の注目度): 10.611072433458268
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The Massive Sound Embedding Benchmark (MSEB) has emerged as a standard for evaluating the functional breadth of audio models. While initial baselines focused on specialized encoders, the shift toward "audio-native" Large Language Models (LLMs) suggests a new paradigm where a single multimodal backbone may replace complex, task-specific pipelines. This paper provides a rigorous empirical evaluation of leading LLMs - including members from the Gemini and GPT families - across the eight core MSEB capabilities to assess their efficacy and audio-text parity. Our results indicate that while a significant modality gap persists regarding performance and robustness, the empirical evidence for an "optimal" modeling approach remains inconclusive. Ultimately, the choice between audionative and cascaded architectures depends heavily on specific use-case requirements and the underlying assumptions regarding latency, cost, and reasoning depth.
- Abstract(参考訳): Massive Sound Embedding Benchmark (MSEB) は、音声モデルの機能的幅を評価する標準として登場した。
初期のベースラインは特殊なエンコーダに重点を置いていたが、"オーディオネイティブ"な大規模言語モデル(LLM)への移行は、単一のマルチモーダルバックボーンが複雑なタスク固有のパイプラインを置き換える新たなパラダイムを示唆している。
本稿は,8つの中核MSEB機能にまたがる主要なLCM(ジェミニ族とGPT族を含む)を厳格に評価し,その有効性と音声テキストの同等性を評価する。
以上の結果から,「最適」なモデリング手法の実証的証拠は,性能とロバスト性に関して有意なモダリティギャップが持続していることが示唆された。
結局のところ、オーディオネイティブアーキテクチャとカスケードアーキテクチャの選択は、特定のユースケース要件と、レイテンシ、コスト、推論の深さに関する基本的な前提に大きく依存する。
関連論文リスト
- JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions [66.71387365429062]
JASTINは命令駆動型オーディオ評価フレームワークである。
自己指示型推論タスクとして音声アセスメントを定式化する。
音声、音、音楽、ドメイン外評価タスクでMLLMを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-06T05:18:42Z) - Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval [8.094136650811459]
本稿では,Omni-Embed-Audio(OEA)について述べる。
我々は,OEAが最先端のM2D-CLAPに匹敵するテキスト・テキスト検索性能を実現することを示す。
AudioCaps、Clotho、MECATの実験では、OEAは最先端のM2D-CLAPに匹敵するテキスト対テキスト検索性能を達成している。
論文 参考訳(メタデータ) (2026-04-20T14:50:33Z) - Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning [24.266987119038134]
音源定位タスクは、音響と視覚の相関を利用して、音の放射する物体の位置を特定することを目的としている。
既存のSSLメソッドの多くは、対照的な学習ベースの特徴マッチングに依存しているが、明確な推論と検証は欠如している。
マルチモーダル大規模言語モデルの本質的な推論機能を利用する訓練不要なSSLフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-08T08:40:33Z) - Massive Sound Embedding Benchmark (MSEB) [12.647736296545224]
マルチモーダルシステムの聴覚成分を評価するためのフレームワークであるMassive Sound Embedding Benchmark (MSEB) を提案する。
MSEBは8つのコアタスクからなる包括的なスイートを提供する。
最初の実験では、実世界のマルチモーダル体験を改善するための重要な機会を浮き彫りにして、明確なパフォーマンスのヘッドルームを確立しました。
論文 参考訳(メタデータ) (2026-02-06T19:33:33Z) - Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition [51.68340973140949]
GMNER(Multimodal Named Entity Recognition)は、テキストベースのエンティティを抽出し、セマンティックカテゴリを割り当て、それらを対応する視覚領域に接地することを目的としている。
MLLMは、視覚バイアスやテキストバイアスを含む$textbfmodality bias$を示す。
本稿では,モダリティを考慮した一貫性推論(bfMCR$)を提案する。
論文 参考訳(メタデータ) (2026-02-04T12:12:49Z) - An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM [15.340075567628466]
本研究は,プロンプト内で音声トークンをインターリーブするMLLMにおいて,インターリーブド・インストラクション・チューニングが与える影響について検討した。
その結果,ゼロショットインターリーブでも推論タスクの性能は向上するが,微調整が少なすぎると結果がさらに改善することがわかった。
論文 参考訳(メタデータ) (2025-11-04T03:54:55Z) - KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues [58.305425399644086]
MT-LFQA(Multi-Turn Long-Form Question Answering)は、知識集約ドメインにおけるLLM(Large Language Models)の重要な応用パラダイムである。
textbfKnowMT-Benchは、知識集約的な分野にわたるLLMのためのMT-LFQAを体系的に評価するために設計された、テキストファーストなベンチマークである。
論文 参考訳(メタデータ) (2025-09-26T04:32:29Z) - Joint Learning using Mixture-of-Expert-Based Representation for Enhanced Speech Generation and Robust Emotion Recognition [54.44798086835314]
音声感情認識(SER)は感情認識音声システム構築において重要な役割を担っているが,その性能は雑音下で著しく低下する。
本稿では, フレームワイド・エキスパート・ルーティングを自己教師付き音声表現に応用した, フレキシブルMTLフレームワークSparse Mixture-of-Experts Representation Integration Technique (Sparse MERIT)を提案する。
MSP-Podcastコーパスの実験では、Sparse MERITはSERとSEの両方のタスクのベースラインモデルより一貫して優れていた。
論文 参考訳(メタデータ) (2025-09-10T10:18:56Z) - StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns [7.60350050736492]
長期記憶は、自律的な知性を達成するために、大規模言語モデルにとって不可欠である。
既存のベンチマークでは、知識保持と動的シーケンシャル推論を評価する上で、課題に直面している。
インタラクティブなフィクションゲームに基づく新しいベンチマークフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-16T10:54:31Z) - $C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction [80.57232374640911]
我々はMask-And-Recover (MAR)と呼ばれるモデルに依存しない戦略を提案する。
MARは、モダリティ間およびモダリティ間コンテキスト相関を統合し、抽出モジュール内の大域的推論を可能にする。
各サンプルの難易度を向上するために, 精細信頼スコア(FCS)モデルを導入する。
論文 参考訳(メタデータ) (2025-04-01T13:01:30Z) - AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs [70.4578433679737]
我々は9つの細工されたタスクにまたがる600万のサンプルからなるAudio-Visual Trustworthiness Assessment Benchmark (AVTrustBench)を紹介する。
ベンチマークを用いて、13の最先端AVLLMを広範囲に評価した。
その結果、既存のモデルのほとんどは、人間のような理解を達成できないことが判明した。
論文 参考訳(メタデータ) (2025-01-03T23:03:24Z) - Large Language Models to Enhance Bayesian Optimization [57.474613739645605]
本稿では,大規模言語モデル(LLM)の能力をベイズ最適化に組み込む新しいアプローチであるLLAMBOを提案する。
高いレベルでは、自然言語のBO問題を枠組み化し、LLMが歴史的評価に照らした有望な解を反復的に提案し、評価することを可能にする。
以上の結果から,LLAMBOはゼロショットウォームスタートに有効であり,サロゲートモデリングや候補サンプリングの促進,特に観察が不十分な場合の探索の初期段階において有効であることが示唆された。
論文 参考訳(メタデータ) (2024-02-06T11:44:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。