論文の概要: MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models
- arxiv url: http://arxiv.org/abs/2608.22236v1
- Date: Sun, 23 Aug 2026 06:23:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.660332
- Title: MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models
- Title(参考訳): MRMAD:大規模オーディオ言語モデルにおける音響劣化知覚評価のためのマルチラウンドマルチオーディオベンチマーク
- Authors: Yize Li, Ningyuan Yang, Sile Yin, Sindhuja Thogarrati, Sung-En Chang, Andrew C. Singer, Xue Lin, Chuan-Che Huang, Shuo Zhang,
- Abstract要約: 大規模音声言語モデル(LALM)における音声劣化知覚と理解のベンチマークであるMRMADを導入する。
MRMADは、音声、音楽、音声にまたがり、複数の音声入力に対するマルチターン対話としての評価を行う。
現在のモデルは、劣化を確実に診断、比較、または理由付けを怠りながら、粗い内容を認識することが多い。
- 参考スコア(独自算出の注目度): 11.14810883033264
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large audio-language models (LALMs) have shown promising progress in understanding speech, music, and general sound events, yet their ability to reason about how audio signals are degraded remains underexplored. Existing benchmarks primarily evaluate semantic understanding, event recognition, or high-level audio reasoning, leaving a basic question unanswered: Do LALMs understand the differences in audio quality? We introduce MRMAD, a Multi-Round Multi-Audio Degradation benchmark for evaluating audio degradation perception and understanding in LALMs. MRMAD spans speech, music, and sound, and frames evaluation as multi-turn dialogues over multiple audio inputs, requiring models to identify degradation types, compare severity, and perceive corruption changes across turns. Unlike current single-turn audio-language benchmarks, MRMAD evaluates whether LALMs can maintain consistent degradation hypotheses with new evidence and explain low-level acoustic phenomena in natural language. Through a systematic evaluation of 18 representative LALMs from non-thinking to reasoning and Omni models, we find that current models often recognize coarse content while failing to diagnose, compare, or reason about degradations reliably. MRMAD reveals an important yet overlooked aspect of audio-language understanding and provides a diagnostic foundation for building future LALMs that are robust to real-world acoustic conditions.
- Abstract(参考訳): 大規模な音声言語モデル (LALM) は、音声、音楽、一般的な音声イベントの理解の進歩を示すが、音声信号の劣化の理由を解明する能力は未解明のままである。
既存のベンチマークでは、セマンティックな理解、イベント認識、あるいはハイレベルな音声推論を主に評価しており、基本的な疑問は未解決のままである。
LALMにおける音声劣化知覚と理解を評価するためのマルチラウンドマルチオーディオ劣化ベンチマークであるMRMADを紹介する。
MRMADは音声、音楽、音声にまたがって評価を行い、複数の音声入力に対するマルチターン対話としての評価を行う。
現在のシングルターンオーディオ言語ベンチマークとは異なり、MRMADはLALMが新しい証拠とともに一貫した劣化仮説を維持できるかどうかを評価し、自然言語の低レベル音響現象を説明する。
18の代表的なLALMを非思考から推論、オムニモデルまで体系的に評価することで、現在のモデルは、診断、比較、劣化の推論に失敗しながら、しばしば粗い内容を認識することがわかった。
MRMADは、音声言語理解の重要な見過ごされた側面を明らかにし、現実の音響条件に対して堅牢な将来のLALMを構築するための診断基盤を提供する。
関連論文リスト
- MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation [56.428467142804756]
MTAVG-Bench 2.0は,マルチトーカーオーディオビデオ生成における映像表現の異常モードの診断のためのベンチマークである。
MTAVG-Bench 2.0はショートドラマとシーンレベルの生成をターゲットとし、演技、物語、雰囲気、音声視覚言語にまたがる高いレベルの障害分類を確立している。
実験により、ジェミニのような商業オムニモデルが他の評価モデルよりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2026-05-27T06:38:54Z) - HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models [30.18524844766061]
HalluAudioは、音声、環境音、音楽の幻覚を評価するための最初の大規模ベンチマークである。
HalluAudioは、5万以上の人間による検証されたQAペアで構成され、バイナリ判断、複数選択推論、属性検証、オープンエンドQAなど、さまざまなタスクタイプにまたがる。
以上の結果から, 音場, 時間的推論, 音楽属性の理解において, 信頼性とロバスト性を考慮したLALMの必要性が示唆された。
論文 参考訳(メタデータ) (2026-04-21T10:05:28Z) - Do Audio-Visual Large Language Models Really See and Hear? [66.8531220331223]
我々は音声と視覚機能がどのように進化し、最終的なテキスト出力を生成するためにAVLLMの異なる層を融合するかを分析する。
AVLLMの基本的なモダリティバイアスを明らかにし、マルチモーダルLLMがオーディオとビジョンをどのように統合するかに関する新しい力学的な洞察を提供する。
論文 参考訳(メタデータ) (2026-04-03T00:48:49Z) - How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation [97.0235251827591]
大規模言語モデル (LLM) は,Large Audio Language Models (LALM) の知識バックボーンとして広く利用されている。
テキストのみの事前学習によって符号化される聴覚知識の量と、それが下流のパフォーマンスに与える影響について検討する。
その結果,家族間で聴覚知識が大きく異なり,テキストのみの結果が音響性能と強く相関していることが判明した。
論文 参考訳(メタデータ) (2026-03-19T17:50:07Z) - SpeakerSleuth: Evaluating Large Audio-Language Models as Judges for Multi-turn Speaker Consistency [12.420484491347073]
LALMがマルチターン対話における話者の一貫性を確実に判断できるかどうかを評価するベンチマークである SpeakerSleuth を提案する。
合成音声と実音声を対象とする4つの多種多様なデータセットを対象とした1,818の人間検証評価インスタンスを構築した。
モデルは音響的不整合を確実に検出するのに苦労している。
論文 参考訳(メタデータ) (2026-01-07T15:45:41Z) - Thinking with Sound: Audio Chain-of-Thought Enables Multimodal Reasoning in Large Audio-Language Models [49.097347801692166]
本稿では,Large Audio-Language ModelsとAudio CoTを併用したThinking-with-Sound(TwS)を提案する。
TwSにより、モデルは音声信号で積極的に考えることができ、数値解析やマルチモーダル推論によるデジタル操作を行うことができる。
実験によると、最先端のLALMはMELD-Hard1kで劇的に性能が低下しており、クリーンオーディオに比べて精度が50%以上低下している。
論文 参考訳(メタデータ) (2025-09-26T01:27:59Z) - WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations [67.6147632074449]
海洋哺乳動物の発声を用いた低レベルの聴覚知覚と認知を評価するために,WoW-Benchベンチマーク(World-of-Whale benchmark)を導入した。
WoW-Benchは、新しい音を分類するための知覚ベンチマークと、ブルームの分類学にインスパイアされた認知ベンチマークで構成され、音の出来事を記憶、理解、応用、分析する能力を評価する。
最先端のLALMを用いた実験は、人間のレベルよりもはるかに低い性能を示し、LALMのより強力な聴覚的接地の必要性を示している。
論文 参考訳(メタデータ) (2025-08-28T16:29:46Z) - When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models [18.160420407067743]
MCR-BENCHは、LALMが一貫性のない音声テキストペアを提示する際にどのように情報を優先するかを評価するために設計された最初のベンチマークである。
モダリティ間に不整合が存在する場合、LALMはテキスト入力に対して有意なバイアスを示す。
この傾向は、オーディオ中心のタスクのパフォーマンスを著しく低下させ、現実世界のアプリケーションにとって重要な信頼性上の懸念を引き起こす。
論文 参考訳(メタデータ) (2025-08-21T09:58:24Z) - Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models [49.87432626548563]
本稿では,一般公開LALMの物体幻覚の程度を評価する手法を提案する。
以上の結果から,LALMは音声コンテンツの理解において,特別な音声キャプションモデルに匹敵するものであることが明らかとなった。
差別的質問に対するLALMの性能を高めるために,迅速なエンジニアリングの可能性を探る。
論文 参考訳(メタデータ) (2024-06-12T16:51:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。