論文の概要: UniAE-MoE: A Unified Audio Encoder via Mixture of Experts
- arxiv url: http://arxiv.org/abs/2609.39199v2
- Date: Mon, 05 Oct 2026 12:49:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.456613
- Title: UniAE-MoE: A Unified Audio Encoder via Mixture of Experts
- Title(参考訳): UniAE-MoE:専門家の混成による統一オーディオエンコーダ
- Abstract要約: UniAE-MoEは、クロスドメインオーディオ表現をモデル化するために設計された統一オーディオエンコーダである。
これは、Mixture-of-Expertsアーキテクチャを通じて、優れたダウンストリーム理解性能を実現する。
UniAE-MoEは、Interspeech 2026 Audio Capability Challengeで最高レベルのパフォーマンスを提供する。
- 参考スコア(独自算出の注目度): 10.952929961413489
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Audio Language Models (LALMs) rely on effective audio encoders for multi-task performance. We introduce UniAE-MoE, a unified audio encoder designed to model cross-domain audio representations and achieve outstanding downstream understanding performance via a Mixture-of-Experts (MoE) architecture. Specifically, we explore mainstream audio encoders and integrate those from Qwen2-Audio and Audio-Flamingo 3, which demonstrate superior downstream capabilities. To facilitate effective model fusion, we improve our encoder using SwiGLU with shared experts to decouple encoder networks, and we further introduce a two-stage instruction-tuning strategy to better adapt the model to diverse downstream tasks. Moreover, we propose the task-specific data scaling (TSDS) technique to enhance UniAE-MoE's understanding capabilities. On the XARES-LLM benchmark, UniAE-MoE attains a score of 0.802, achieving state-of-the-art performance. It also delivers top-tier performance in the official Interspeech 2026 Audio Encoder Capability Challenge, further demonstrating robust generalization across diverse audio tasks. Together, these results validate the effectiveness of UniAE-MoE for unified audio understanding across speech, music, and general audio domains.
- Abstract(参考訳): 大規模オーディオ言語モデル (LALM) はマルチタスクのパフォーマンスに有効なオーディオエンコーダに依存している。
クロスドメインな音声表現をモデル化し、Mixture-of-Experts (MoE)アーキテクチャを用いて下流理解性能を向上する統合オーディオエンコーダUniAE-MoEを紹介する。
具体的には、主流のオーディオエンコーダを調査し、より優れた下流機能を示すQwen2-AudioとAudio-Flamingo 3のオーディオエンコーダを統合する。
効率的なモデル融合を容易にするために,共有専門家によるSwiGLUを用いてエンコーダネットワークを分離し,より多様な下流タスクにモデルを適用するための2段階の命令チューニング戦略を導入する。
さらに,UniAE-MoEの理解能力を高めるために,タスク固有データスケーリング(TSDS)手法を提案する。
XARES-LLMベンチマークでは、UniAE-MoEは0.802のスコアを獲得し、最先端のパフォーマンスを達成する。
また、Interspeech 2026 Audio Encoder Capability Challengeでもトップレベルのパフォーマンスを提供し、さまざまなオーディオタスクの堅牢な一般化を実証している。
これらの結果から,UniAE-MoEによる音声・音楽・一般音声領域間の統合音声理解の有効性が検証された。
関連論文リスト
- AudioMosaic: Contrastive Masked Audio Representation Learning [53.52371029884106]
一般的な音声理解のためのコントラスト学習型オーディオエンコーダであるtextbfAudioMosaic を紹介する。
AudioMosaicは、構造化された時間周波数マスキングをスペクトログラムパッチに適用することで、正のペアを構成する。
実験によると、AudioMosaicはいくつかの標準オーディオベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-14T00:56:51Z) - Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing [63.573256490583724]
Audio-Omniは、一般的な音、音楽、音声ドメイン間で生成と編集を統合する最初のエンドツーエンドフレームワークである。
高次推論のための凍結型マルチモーダル大言語モデルと高忠実度合成のためのトレーニング可能な拡散変換器を併用する。
AudioEditは100万以上の精巧にキュレートされた編集ペアからなる大規模なデータセットである。
論文 参考訳(メタデータ) (2026-04-12T16:08:20Z) - Eureka-Audio: Triggering Audio Intelligence in Compact Language Models [28.38037427018435]
Eureka-Audioはコンパクトで高性能なオーディオ言語モデルであり,大規模モデルに対する競合性能を実現する。
Eureka-Audioは1.7Bパラメータしか含まないが、自動音声認識(ASR)、音声理解、高密度音声キャプションに強い性能を示す。
パラ言語推論をさらに強化するために,閉ループ音声命令データ合成と検証パイプラインであるDataFluxを導入する。
論文 参考訳(メタデータ) (2026-02-15T02:01:08Z) - Representation-Regularized Convolutional Audio Transformer for Audio Understanding [53.092757178419355]
スクラッチからのブートストラップ表現は計算に高価で、しばしば収束するために広範囲のトレーニングを必要とします。
本稿では,これらの課題に対処するための統合フレームワークであるConvolutional Audio Transformer (CAT)を提案する。
論文 参考訳(メタデータ) (2026-01-29T12:16:19Z) - AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs [53.248502396225724]
AudioMarathonは、ロングフォームオーディオの理解と推論の効率を評価するために設計されたベンチマークである。
我々は、最先端のLALMを評価し、音声の長さが大きくなるにつれて、明らかな性能低下を観察する。
その結果、現在のLALM間での大きなギャップが示され、時間的推論の改善の必要性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-10-08T17:50:16Z) - Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model [85.72664004969182]
本稿では,AQAA(Audio-Audio Answer)タスク用に設計された完全エンドツーエンドのLALMであるStep-Audio-AQAAを紹介する。
このモデルは、言語的特徴抽出と意味的特徴抽出のためのデュアルコードブックオーディオトークンーザを統合している。
我々のポストトレーニングアプローチでは、意味的コヒーレンスを高めるために、テキストとオーディオのインターリーブドトークンアウトプットを用いる。
論文 参考訳(メタデータ) (2025-06-10T16:37:39Z) - MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders [36.528216873338614]
本稿では,弱いエンコーダの混合物をAudioLLMフレームワークに組み込むことを提案する。
MoWEは、ベースエンコーダに比較的軽量なエンコーダのプールを補足し、音声入力に基づいて選択的にアクティベートし、モデルサイズを大幅に増大させることなく特徴抽出を強化する。
実験の結果,MoWEはマルチタスク性能を効果的に向上し,AudioLLMsの多様なオーディオタスクへの適用性を高めた。
論文 参考訳(メタデータ) (2024-09-10T16:46:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。