論文の概要: MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning
- arxiv url: http://arxiv.org/abs/2607.27109v2
- Date: Thu, 30 Jul 2026 02:37:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.277791
- Title: MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning
- Title(参考訳): MMAC: オーディオキャプションのための多次元ベンチマーク
- Abstract要約: MMACは textbfMassive textbfMulti-dimensional benchmark for textbfAudio textbfCaptioning である。
MMACには、20以上のデータソースから5,638のオーディオクリップが含まれており、6つの機能カテゴリと15の評価次元をカバーしている。
オープンソースおよびプロプライエタリなAudioLLMを評価した。
- 参考スコア(独自算出の注目度): 22.11024893702371
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the development of audio large language models (AudioLLMs), audio captioning needs to move from brief descriptions toward open-ended and fine-grained free-form descriptions. Existing evaluations often focus on generation quality or task performance, making it difficult to diagnose information coverage and description reliability. We propose MMAC, a \textbf{M}assive \textbf{M}ulti-dimensional benchmark for \textbf{A}udio \textbf{C}aptioning. MMAC contains 5,638 audio clips from more than 20 data sources, covering 6 capability categories and 15 evaluation dimensions. Given a model-generated caption, MMAC checks whether it mentions relevant information in the target dimension and whether the mentioned content is consistent with the reference label. We evaluate representative open-source and proprietary AudioLLMs. Results show clear differences across evaluation dimensions, information coverage, and description reliability. We will release the MMAC benchmark and evaluation code.
- Abstract(参考訳): 音声大言語モデル(AudioLLMs)の開発により、音声キャプションは簡潔な記述から、オープンできめ細かい自由な記述へと移行する必要がある。
既存の評価は、しばしば生成品質やタスクパフォーマンスに重点を置いており、情報カバレッジや記述信頼性の診断が困難である。
MMAC, a \textbf{M}assive \textbf{M}ulti-dimensional benchmark for \textbf{A}udio \textbf{C}aptioning。
MMACには、20以上のデータソースから5,638のオーディオクリップが含まれており、6つの機能カテゴリと15の評価次元をカバーしている。
モデル生成キャプションが与えられた場合、MMACはターゲット次元の関連情報に言及しているかどうか、言及されているコンテンツが参照ラベルと一致しているかどうかをチェックする。
オープンソースおよびプロプライエタリなAudioLLMを評価した。
その結果, 評価範囲, 情報カバレッジ, 記述信頼性の相違が明らかとなった。
MMACベンチマークと評価コードをリリースする。
関連論文リスト
- AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech [56.08149157180447]
本稿では,大規模マルチモーダルモデルの音声キャプション機能を評価するベンチマークであるAudioCapBenchを紹介する。
我々は、参照ベースのメトリクス(METEOR、BLEU、ROUGE-L)とLLM-as-Judgeフレームワークを使用して、2つのプロバイダ(OpenAI、Google Gemini)にわたる13のモデルを評価する。
論文 参考訳(メタデータ) (2026-02-27T03:33:37Z) - Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation [79.13636675697096]
Ref-AVSコンテキストにおけるマスク品質評価(MQA-RefAVS)
MQA-RefAVSは、地平線アノテーションに頼ることなく、候補セグメンテーションマスクの品質を評価するタスクである。
本稿では,マルチモーダルな大規模言語モデル(MLLM)に基づく監査ツールMQ-Auditorを提案する。
論文 参考訳(メタデータ) (2026-02-03T07:47:59Z) - JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation [16.067014259345743]
我々は、データセット上で、視覚のみ、音声のみ、およびOmni-LLMを優先的に評価する。
最高性能のOmni-LLMでさえ平均精度は62.6%であり、ユニモーダルベースラインを上回っている。
論文 参考訳(メタデータ) (2025-12-14T17:23:21Z) - AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation [16.047087043580053]
MLLM(Multimodal Large Language Models)は、音声や音楽に広く応用されている。
意味のみのテキストトークンとは異なり、音声トークンはグローバルな意味的コンテンツをキャプチャし、きめ細かい音響的詳細を保存する必要がある。
本稿では,意味的および音響的トークンの適切な定義を提供し,体系的な評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-02T14:15:22Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks [38.51162036564078]
MECATは、細粒度音声理解タスクのためのマルチエキスパートコンストラクトベンチマークである。
専門的な専門家モデルからの分析を、Chain-of-Thoughtの大規模言語モデル推論と統合する。
また,最先端オーディオモデルの包括的評価について述べる。
論文 参考訳(メタデータ) (2025-07-31T12:47:43Z) - AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information? [65.49972312524724]
マルチモーダルな大言語モデル(MLLM)は、視覚とオーディオのモダリティを含む機能を拡張した。
提案したDeafTestは、MLLMが人間にとって簡単なタスクとよく戦っていることを示している。
AV-Odyssey Benchは、これらのMLLMが真にオーディオ視覚情報を理解できるかどうかを評価するために設計された総合的なオーディオ視覚ベンチマークである。
論文 参考訳(メタデータ) (2024-12-03T17:41:23Z) - AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension [95.8442896569132]
AIR-Benchは,Large Audio-Language Models (LALM) の様々な種類の音声信号を理解し,テキスト形式で人間と対話する能力を評価する最初のベンチマークである。
その結果, GPT-4による評価と人間による評価との間には高い一貫性が認められた。
論文 参考訳(メタデータ) (2024-02-12T15:41:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。