論文の概要: ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models
- arxiv url: http://arxiv.org/abs/2606.30682v1
- Date: Sat, 27 Jun 2026 03:56:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:18.950512
- Title: ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models
- Title(参考訳): ALM2Vec:大規模オーディオ言語モデルを用いたユニバーサルオーディオ検索のためのオーディオ埋め込み学習
- Authors: Fengjie Lu, Chenang Jiang, Jiarui Hai, Helin Wang, Aaron Yee,
- Abstract要約: ALM2Vecは、事前訓練された大規模音声言語モデル(LALM)から派生した、普遍的なオーディオ埋め込みフレームワークである。
ALM2Vecは、音声理解、命令追従、推論能力の伝達により、オーディオドメインとタスクタイプをまたいだ検索のための統合された埋め込み空間を学習する。
- 参考スコア(独自算出の注目度): 10.50405619906082
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in language--audio retrieval have been largely driven by contrastive dual-encoder architectures that align audio and text in a shared embedding space. While effective, existing retrieval embeddings are primarily optimized for audio--caption matching, limiting their ability to support diverse retrieval objectives and controllable retrieval behaviors. We present ALM2Vec, a universal audio embedding framework derived from pretrained large audio--language models (LALMs). By transferring the audio understanding, instruction-following, and reasoning capabilities acquired through large-scale multimodal training, ALM2Vec learns a unified embedding space for retrieval across audio domains and task types. Beyond conventional text--audio retrieval, ALM2Vec incorporates natural-language instructions into the embedding process, enabling instruction-aware retrieval for scenarios such as audio question answering and aspect-conditioned retrieval. Experimental results show that ALM2Vec achieves competitive performance on standard audio and speech retrieval benchmarks while exhibiting promising compositional and controllable retrieval capabilities, highlighting its potential as a unified audio embedding model for retrieval across domains, tasks, and user intents.
- Abstract(参考訳): 音声検索の最近の進歩は、音声とテキストを共有埋め込み空間で整列するコントラスト的な二重エンコーダアーキテクチャによって大きく推進されている。
ALM2Vecは,事前訓練された大規模音声言語モデル(LALM)から派生した,汎用的な音声埋め込みフレームワークである。
ALM2Vecは、大規模マルチモーダルトレーニングによって得られた音声理解、命令追従、推論能力の伝達により、オーディオドメインとタスクタイプをまたいだ検索のための統合された埋め込み空間を学習する。
従来のテキスト音声検索以外にも、ALM2Vecは自然言語命令を埋め込みプロセスに組み込んで、音声質問応答やアスペクト条件検索などのシナリオに対する命令認識検索を可能にする。
実験結果から,ALM2Vecは,標準音声・音声検索ベンチマークにおいて,有望な合成・制御可能な検索能力を示し,ドメイン,タスク,ユーザ意図をまたいだ検索のための統合音声埋め込みモデルとしての可能性を強調しながら,競争力を発揮することが示された。
関連論文リスト
- ATIR: Towards Audio-Text Interleaved Contextual Retrieval [63.68521448682396]
本稿では,Audio-Text Interleaved contextual Retrieval (ATIR)タスクを導入する。
このベンチマークは、意味検索における既存の音声検索データセットの限界を実質的に解決する。
論文 参考訳(メタデータ) (2026-04-22T07:11:58Z) - Step-Audio 2 Technical Report [120.58375054866815]
Step-Audio 2は、業界における音声理解と音声会話のために設計された、エンドツーエンドのマルチモーダルな大規模言語モデルである。
遅延オーディオエンコーダと推論中心強化学習(RL)を統合することにより、Step-Audio 2は自動音声認識(ASR)および音声理解において有望な性能を達成する。
論文 参考訳(メタデータ) (2025-07-22T14:23:55Z) - From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data [55.2480439325792]
音声対応の大規模言語モデル(ALLM)は近年,音声入力の理解と処理において大きな進歩を遂げている。
これらのモデルは典型的にはテキストベースの大規模言語モデル(LLM)に適応し、音声関連タスクのさらなるトレーニングを行う。
本研究では、現在と欠落した音を区別するALLMの能力を高めるために、コントラッシブな訓練データを生成するデータ生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-26T16:08:41Z) - Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning [50.28566759231076]
高品質なキャプションを持つ音声データセットを構築するための,革新的で自動的なアプローチを提案する。
具体的には、150万以上のオーディオテキストペアからなる、大規模で高品質なオーディオ言語データセットをAuto-ACDとして構築する。
我々はLLMを用いて,抽出したマルチモーダルな手がかりによって導かれる,各音声の連接キャプションを言い換える。
論文 参考訳(メタデータ) (2023-09-20T17:59:32Z) - Contrastive Audio-Language Learning for Music [13.699088044513562]
MusCALLは音楽コントラスト学習のためのフレームワークである。
本手法は,音楽音声と記述文のペアのアライメントを学習するデュアルエンコーダアーキテクチャで構成されている。
論文 参考訳(メタデータ) (2022-08-25T16:55:15Z) - Joint Speech Recognition and Audio Captioning [37.205642807313545]
室内と屋外の両方で録音された音声サンプルは、しばしば二次音源で汚染される。
自動音声キャプション(AAC)の進展する分野と、徹底的に研究された自動音声認識(ASR)を一体化することを目的としている。
本稿では,ASRタスクとAACタスクのエンドツーエンド共同モデリングのためのいくつかのアプローチを提案する。
論文 参考訳(メタデータ) (2022-02-03T04:42:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。