論文の概要: Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models
- arxiv url: http://arxiv.org/abs/2606.15751v1
- Date: Sun, 14 Jun 2026 11:23:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.820575
- Title: Acoustic Prompting via Stage-wise Modulation for Few-Shot Learning in Audio Language Models
- Title(参考訳): ステージワイズ制御による音響プロンプトによる音声モデルにおけるFew-Shot学習
- Abstract要約: 本稿では,タスク固有の音響特徴をキャプチャするために,トレーニング可能なプロンプトをオーディオエンコーダに導入するフレームワークを提案する。
既存のテキスト側アプローチとオーディオ側プロンプト学習を統合することで、少数ショット適応が促進されることを実証する。
- 参考スコア(独自算出の注目度): 57.635707525420884
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio-Language Models (ALMs) have shown remarkable success in zero-shot audio classification by aligning audio waveforms with text. Recent efforts to improve downstream performance focus on learning optimal text prompts. However, previous approaches focus on the text encoder, leaving the potential of learnable prompts within the audio encoder unexplored. In this paper, we propose a novel framework that introduces trainable prompts into the audio encoder to capture task-specific acoustic features. We demonstrate that integrating audio-side prompt learning with existing text-side approaches enhances few-shot adaptation. Through extensive experiments across 11 datasets show that integrating our method as a plug-and-play module alongside existing text prompt tuning generally leads to performance improvements. These findings suggest that explicitly modulating the audio representation space effectively complements text-only prompting approaches. The code is available at https://github.com/hyebin-c/aspl.
- Abstract(参考訳): 音声言語モデル(ALM)は、音声波形をテキストに整列させることにより、ゼロショット音声分類において顕著な成功を収めている。
下流の性能向上に向けた最近の取り組みは、最適なテキストプロンプトの学習に焦点を当てている。
しかし、従来のアプローチではテキストエンコーダに重点を置いており、未探索のオーディオエンコーダ内で学習可能なプロンプトの可能性を秘めている。
本稿では,タスク固有の音響特徴をキャプチャするために,トレーニング可能なプロンプトをオーディオエンコーダに導入する新しいフレームワークを提案する。
既存のテキスト側アプローチとオーディオ側プロンプト学習を統合することで、少数ショット適応が促進されることを実証する。
11のデータセットにわたる広範な実験を通じて、既存のテキストプロンプトチューニングとプラグイン・アンド・プレイモジュールとしてメソッドを統合することで、一般的にパフォーマンスが向上することが示された。
これらの結果は、音声表現空間を明示的に調整することは、テキストのみのプロンプトアプローチを効果的に補完することを示している。
コードはhttps://github.com/hyebin-c/aspl.comから入手できる。
関連論文リスト
- AudioMosaic: Contrastive Masked Audio Representation Learning [53.52371029884106]
一般的な音声理解のためのコントラスト学習型オーディオエンコーダであるtextbfAudioMosaic を紹介する。
AudioMosaicは、構造化された時間周波数マスキングをスペクトログラムパッチに適用することで、正のペアを構成する。
実験によると、AudioMosaicはいくつかの標準オーディオベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-14T00:56:51Z) - SeeingSounds: Learning Audio-to-Visual Alignment via Text [15.011814561603964]
本稿では,音声,言語,視覚の相互作用を利用した画像生成のためのフレームワークであるSeeingSoundsを紹介する。
音声は凍結言語エンコーダを介して意味言語空間に投影され、視覚言語モデルを用いて文脈的に視覚領域に基底される。
このアプローチは認知神経科学にインスパイアされ、人間の知覚で観察される自然な相互関連を反映している。
論文 参考訳(メタデータ) (2025-10-10T18:42:50Z) - Enhancing Retrieval-Augmented Audio Captioning with Generation-Assisted Multimodal Querying and Progressive Learning [0.0]
生成支援型マルチモーダルクエリは入力音声のテキスト記述を生成し、マルチモーダルクエリを可能にする。
我々は,AudioCaps,Clotho,Auto-ACDの実験を行い,現状の成果が得られたことを実証した。
論文 参考訳(メタデータ) (2024-10-14T04:57:32Z) - PALM: Few-Shot Prompt Learning for Audio Language Models [1.6177972328875514]
音声言語モデル(ALM)は近年,ゼロショット音声認識タスクにおいて顕著な成功を収めている。
本稿では,テキストエンコーダブランチの機能空間を最適化する新しい手法であるPrompt Learning in Audio Language Models (PALM)を提案する。
本研究では,11の音声認識データセットに対するアプローチの有効性を実証し,その結果と3つのベースラインを数ショットの学習設定で比較する。
論文 参考訳(メタデータ) (2024-09-29T22:06:07Z) - Improving Text-To-Audio Models with Synthetic Captions [51.19111942748637]
本研究では,テクスタイディオ言語モデルを用いて,高精度で多様な音声キャプションを大規模に合成する音声キャプションパイプラインを提案する。
このパイプラインを利用してAudioSetと命名されたAudioSetの合成キャプションのデータセットを作成し、これらの合成キャプション上でのテキスト音声モデルの事前学習の利点を評価する。
論文 参考訳(メタデータ) (2024-06-18T00:02:15Z) - Exploring the Role of Audio in Video Captioning [59.679122191706426]
本稿では,キャプションの音響モダリティの可能性をフル活用することを目的とした音声視覚フレームワークを提案する。
本稿では,音声とビデオ間の情報交換を改善するため,新たなローカル・グローバル融合機構を提案する。
論文 参考訳(メタデータ) (2023-06-21T20:54:52Z) - CLIPSonic: Text-to-Audio Synthesis with Unlabeled Videos and Pretrained
Language-Vision Models [50.42886595228255]
本稿では,橋梁としての視覚的モダリティを活用して,所望のテキスト・オーディオ対応を学習することを提案する。
我々は、事前訓練されたコントラスト言語画像事前学習モデルによって符号化されたビデオフレームを考慮し、条件付き拡散モデルを用いてビデオの音声トラックを生成する。
論文 参考訳(メタデータ) (2023-06-16T05:42:01Z) - Unsupervised Audiovisual Synthesis via Exemplar Autoencoders [59.13989658692953]
我々は,任意の個人の入力音声を,潜在的に無限に多くの出力スピーカのオーディオ視覚ストリームに変換する教師なしのアプローチを提案する。
我々は、Exemplar Autoencodersを用いて、特定のターゲット音声の音声、スタイリスティックな韻律、視覚的外観を学習する。
論文 参考訳(メタデータ) (2020-01-13T18:56:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。