論文の概要: EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$
- arxiv url: http://arxiv.org/abs/2608.23758v1
- Date: Mon, 24 Aug 2026 18:52:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.559577
- Title: EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$
- Title(参考訳): EXAM$^2$: $\underline{Ex}tending$$\underline{A}udio$$Understanding$ $in$\underline{M}ultilingual$$and$\underline{M}ultimodal$$Analysis$
- Authors: Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen,
- Abstract要約: マルチ言語およびマルチモーダル音声理解のためのベンチマークであるEXAM$2$を紹介した。
ヘテロジニアスな音声入力と共に視覚情報を組み込むことで、EXAM$2$はシーン認識音声推論とモーダル横断理解をより現実的な評価を可能にする。
我々は、最先端のオープンソースおよびプロプライエタリなLALMとマルチモーダルLLMを評価し、マルチリンガルおよびクロスモーダル理解において、かなりの性能のギャップを明らかにした。
- 参考スコア(独自算出の注目度): 38.6907338785255
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent large audio language models (LALMs) have achieved impressive progress in audio understanding. However, existing evaluations remain largely constrained to English and narrow audio domains. Prior benchmarks typically focus on a single audio modality, i.e., speech, sound, or music, limiting the systematic investigation into how these models generalize across diverse visual scenarios. In this paper, we introduce EXAM$^2$, a benchmark for multilingual and multimodal audio understanding spanning six languages and multiple modalities, including speech, sound, music, mixed-audio settings, and visual images. By incorporating visual information alongside heterogeneous audio inputs, EXAM$^2$ enables more realistic evaluation of scene-aware audio reasoning and cross-modal comprehension. EXAM$^2$ comprises $5,667$ multiple-choice questions, $22,614$ image instances, and $135,684$ multilingual translations. We evaluate state-of-the-art open-source and proprietary LALMs as well as multimodal LLMs, revealing substantial performance gaps in multilingual and cross-modal understanding. Furthermore, we propose Gemma3n-EXAM$^2$, a lightweight fusion-model fine-tuned on EXAM$^2$-train, achieves up to $12.4\%$ improvement in multilingual settings and $21.7\%$ gains in multimodal evaluation over a strong baseline. Empirical results establish EXAM$^2$ as a challenging benchmark and pioneer future multilingual and multimodal audio intelligence research.
- Abstract(参考訳): 近年の大規模音声言語モデル (LALM) は, 音声理解において顕著な進歩を遂げている。
しかし、既存の評価は英語と狭義のオーディオ領域に大きく制約されている。
以前のベンチマークでは、音声、音、音楽などの単一の音質に重点を置いており、これらのモデルがどのように様々な視覚シナリオにまたがって一般化するかについての体系的な調査を制限している。
本稿では、音声、音声、音楽、混合音響設定、視覚画像などを含む6言語および多言語にまたがる多言語・多モーダル音声理解のためのベンチマークEXAM$^2$を紹介する。
ヘテロジニアスな音声入力とともに視覚情報を組み込むことにより、EXAM$^2$はシーン認識型音声推論とクロスモーダル理解をより現実的な評価を可能にする。
EXAM$^2$は5,667ドル、イメージインスタンスは2,614ドル、多言語翻訳は135,684ドルである。
我々は、最先端のオープンソースとプロプライエタリなLALMとマルチモーダルLLMを評価し、マルチリンガルとクロスモーダルの理解においてかなりの性能差があることを明らかにする。
さらに,EXAM$^2$-trainを微調整した軽量核融合モデルGemma3n-EXAM$^2$を提案する。
EXAM$^2$を挑戦的なベンチマークとして確立し、将来の多言語およびマルチモーダルオーディオインテリジェンス研究の先駆者となる。
関連論文リスト
- Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox [4.088161686930475]
VoxParadoxは2000の検証済みのサンプルを持ち、10のパラ言語的タスクにまたがる逆のベンチマークである。
音場真理の精度は一貫して低く, 言語による回答に追従する傾向が強い。
入力プロンプトに基づいて複数のオーディオ層からの情報を適応的に結合するPrompt-Conditioned Layer Mixer (PCLM)を提案する。
論文 参考訳(メタデータ) (2026-05-26T23:44:23Z) - See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models [24.851643680674474]
AV-SpeakerBenchは、現実世界のビデオにおける話者中心のオーディオヴィジュアル推論に焦点を当てた、3,212のマルチチョイス質問のベンチマークである。
その特徴は,(1)話者中心の場面を中心的推論単位として扱う話者中心の定式化,(2)音声の視覚的依存を質問意味論に組み込む融合型質問設計,(3)時間的精度と横断的妥当性を保証する専門家計算アノテーションである。
論文 参考訳(メタデータ) (2025-12-01T21:57:26Z) - Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models [58.43486430996411]
LALM(Large Audio-Language Models)は、最近、人間との直接の音声交換を可能にする音声対話機能をアンロックした。
オープンエンド音声対話理解におけるLALMの性能を評価するための音声対話理解ベンチマーク(ADU-Bench)を提案する。
ADU-Benchには、LALMの評価のための2万以上のオープンエンドオーディオダイアログが含まれている。
論文 参考訳(メタデータ) (2024-12-06T16:34:15Z) - AudioPaLM: A Large Language Model That Can Speak and Listen [79.44757696533709]
本稿では,音声理解・生成のための大規模言語モデルであるAudioPaLMを紹介する。
AudioPaLMはテキストベースの言語モデルと音声ベースの言語モデルを融合する。
音声認識や音声音声翻訳などの応用により、テキストと音声を処理および生成することができる。
論文 参考訳(メタデータ) (2023-06-22T14:37:54Z) - VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset [34.38377548121313]
マルチモーダル理解と生成のためのビジョン・オーディエンジュ・オムニ・ペセプション事前学習モデル(VALOR)を提案する。
VALORは、視覚、音声、言語の関係をエンドツーエンドで共同でモデル化する。
一連の公開モダリティベンチマークにおいて、最先端のパフォーマンスを新たに達成する。
論文 参考訳(メタデータ) (2023-04-17T15:08:15Z) - Multilingual Multimodal Pre-training for Zero-Shot Cross-Lingual
Transfer of Vision-Language Models [144.85290716246533]
視覚言語モデルのゼロショット言語間移動について検討する。
本稿では,文脈化多言語マルチモーダル埋め込みを学習するトランスフォーマティブモデルを提案する。
論文 参考訳(メタデータ) (2021-03-16T04:37:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。