FuguReport

TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models

著者 Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh, Utathya Aich, Ramani Duraiswami, Dinesh Manocha
所属 University of Maryland / CNH Industrial India
カテゴリ Method / Multi-task Learning / Joint training on speech and music timestamps, Application / Audio Processing / Audio event and speaker timestamping, Task / Temporal Localization / Assigning timestamps to audio events
ライセンス CC BY 4.0

Abstractの概要

本論文は、大規模音声言語モデルにおける主要な限界、すなわち音声クリップ全体を説明することはできても、イベントや話者、音楽要素に正確なタイムスタンプを割り当てられないという問題に対処しています。著者らは、音声、一般音響、音楽にまたがる5つのタスク(複数話者ASR、話者ダイアリゼーション、音声時間グラウンディング、Dense Audio Captioning、タイムスタンプ付き音楽キャプショニング)でタイムスタンプ付き生成を行う統合事後学習フレームワーク「TEMPO」を提案しています。本手法は、アトミックなタイムスタンプトークンを用いた教師あり微調整、実時間情報を音声特徴に注入する時間認識型マルチモーダルプロジェクタ、距離認識型ガウスタイムスタンプ損失を中心とし、合成から実データへのカリキュラムで訓練されます。さらに、検証可能な時間的報酬を用いたGRPOベースの強化学習を改善段階として追加し、約1万件のテスト事例からなるベンチマークでモデルを評価しています。

新規性

本研究は、音声、音響、音楽にわたるタイムスタンプ付与を単一のデコーダおよび出力形式で実現した初の統合型大規模音声言語モデルであるとしています。また、検証可能な時間的報酬を伴う強化学習を統合型マルチタスク音声タイムスタンプ付与に初めて適用し、対象タスクが限られていた、または教師あり学習のみに留まっていた従来システムを拡張しています。

成果

TEMPOは音声タスクにおいて最も顕著な向上を示し、Qwen3-Omniと比較してマルチタスクRLモデルは複数話者ASRのWERを69.7%から43.5%に低減させ、ダイアリゼーションのmIoUを44.4%から71.1%へ、話者ラベル付きF1を31.5%から56.3%へと向上させました。Dense Audio Captioningでもイベント局所化指標でTimeAudioやQwen3-Omniを上回り、マルチタスクRL後にイベントF1で59.3%、mIoUで68.5%を達成しています。アブレーション解析により、性能向上の大部分は教師あり微調整の設計と合成から実データへのカリキュラムに起因しており、強化学習は多くのタスクで補助的な改善段階として機能していることが示されました。

論文の注目点

  1. TEMPOは、共有デコーダとタスクタグ付きプロンプトにより、音声・音響・音楽にまたがる5つのタイムスタンプ付き音声タスクを1つの大規模音声言語モデルに統合している。
  2. アトミックなタイムスタンプトークン、実時間認識型音声投影、距離認識型タイムスタンプ損失を組み合わせ、合成から実データへの2段階カリキュラムで訓練する技術構成を採用している。
  3. 実証的に最も大きな向上は複数話者ASRとダイアリゼーションで確認されており、強化学習は主な改善要因というよりも主に調整・洗練の役割を果たしている。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。