論文の概要: COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation
- arxiv url: http://arxiv.org/abs/2607.08117v1
- Date: Thu, 09 Jul 2026 05:26:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.41734
- Title: COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation
- Title(参考訳): COALA: コントラスト正規化器とバイアススコア推定によるASRのためのロバスト文脈付き音声強調言語モデリング
- Abstract要約: COALAは、複雑な多言語シナリオにおける音声拡張言語モデル(SLM)を強化するために設計されたフレームワークである。
我々は、COALAが様々なバイアスリストスケールで優れたコンテキストバイアス性能を実現することを示す。
- 参考スコア(独自算出の注目度): 16.40789238594682
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Contextual biasing seeks to integrate external knowledge into automatic speech recognition (ASR) systems to accurately recognize domain-specific entities. In this paper, we propose COALA (Contextualized ASR Leveraging Biasing Scoring), a robust framework designed to enhance speech-augmented language models (SLMs) in complex multi-entity scenarios. Considering the inherent context-window limitations of SLMs, identifying relevant target entities from a large-scale biasing list is crucial for effective recognition. To this end, COALA maps SLM latent representations into a specialized discriminative space to quantify the matching intensity between audio segments and candidate entities. Furthermore, we address the training collapse in prior study when handling multi-target utterances-where multiple rare words co-occur. Experimental results on the LibriSpeech benchmark demonstrate that COALA consistently achieves superior contextual biasing performance across various biasing list scales.
- Abstract(参考訳): コンテキストバイアスは、外部知識を自動音声認識(ASR)システムに統合し、ドメイン固有のエンティティを正確に認識しようとする。
本論文では,複雑な多言語シナリオにおける音声拡張言語モデル(SLM)の強化を目的とした,堅牢なフレームワークであるCOALA(Contextualized ASR Leveraging Biasing Scoring)を提案する。
SLMのコンテキストウインドウの制約を考えると、大規模バイアスリストから関連する対象エンティティを特定することは、効果的な認識に不可欠である。
この目的のために、COALAはSLM潜在表現を特殊識別空間にマッピングし、音声セグメントと候補エンティティのマッチング強度を定量化する。
さらに,複数の稀な単語が共起する多目的発話を扱う場合,事前研究における訓練の崩壊に対処する。
LibriSpeechベンチマークの実験結果によると、COALAは様々なバイアスリストスケールにおいて、常に優れたコンテキストバイアス性能を達成している。
関連論文リスト
- WhoSaidIt: Human-LLM Collaborative Annotation for Text-Based Multilingual Speaker-Attribute Classification [2.634639188510826]
本稿では,多言語話者属性ラベルの安定化のための,人間大言語モデル(LLM)協調アノテーションフレームワークを提案する。
このフレームワークを用いて,9つの話者属性ラベルを含む多言語データセットであるWhoSaidItを構築した。
論文 参考訳(メタデータ) (2026-05-25T17:37:45Z) - AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering [97.52852990265136]
音声対応大規模言語モデルの推論機能を活用するバックボーン非依存評価フレームワークであるAQAScoreを紹介する。
AQAScoreは人格関連性、ペア比較、構成推論タスクを含む複数のベンチマークで評価する。
論文 参考訳(メタデータ) (2026-01-21T07:35:36Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - New Insights into Optimal Alignment of Acoustic and Linguistic Representations for Knowledge Transfer in ASR [30.00166986946003]
我々は、アライメントとマッチングを検出問題とみなすために、新たな洞察を得る。
目標は、高精度で意味のある対応を識別し、言語トークンの完全なカバレッジを確保することである。
分布ミスマッチと構造的非対称性を明示的に扱う不均衡な輸送ベースアライメントモデルを提案する。
論文 参考訳(メタデータ) (2025-09-06T05:58:52Z) - I Think, Therefore I Am Under-Qualified? A Benchmark for Evaluating Linguistic Shibboleth Detection in LLM Hiring Evaluations [9.275967682881944]
本稿では,大言語モデルが言語シボレスにどう反応するかを評価するための総合的なベンチマークを提案する。
等価な内容の質にもかかわらず,LLMが言語パターン,特にヘッジ言語を体系的にペナルティ化する方法を実証する。
我々は,複数の言語的側面に沿ったアプローチを検証し,ヘッジドレスポンスが平均25.6%低い評価を受けることを示した。
論文 参考訳(メタデータ) (2025-08-06T23:51:03Z) - SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models [60.72029578488467]
SpeechRは、大規模な音声言語モデルにおける音声に対する推論を評価するための統一的なベンチマークである。
事実検索、手続き推論、規範的判断の3つの重要な側面に沿ったモデルを評価する。
11個の最先端のLALMの評価は、高い転写精度が強い推論能力に変換されないことを示している。
論文 参考訳(メタデータ) (2025-08-04T03:28:04Z) - CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models [23.278483193586887]
本稿では,複数話者の重なり合う音声認識とコンテキストバイアスをひとつのタスクに組み合わせた統合フレームワークを提案する。
提案手法は従来の文脈バイアス法よりも優れており,WERはLibriMixで7.9%,AMI SDMで32.9%を達成している。
論文 参考訳(メタデータ) (2025-05-31T07:26:44Z) - CLAIR-A: Leveraging Large Language Models to Judge Audio Captions [73.51087998971418]
機械生成オーディオキャプションの評価は、様々な要因を検討する必要がある複雑なタスクである。
本稿では,大規模言語モデルのゼロショット機能を活用するシンプルで柔軟なCLAIR-Aを提案する。
我々の評価では、CLAIR-Aは従来のメトリクスと比較して品質の人的判断を良く予測する。
論文 参考訳(メタデータ) (2024-09-19T17:59:52Z) - STAB: Speech Tokenizer Assessment Benchmark [57.45234921100835]
音声を離散トークンとして表現することは、音声をテキストによく似たフォーマットに変換するためのフレームワークを提供する。
Speech Tokenizer Assessment Benchmark(STAB)は,音声トークンを包括的に評価するシステム評価フレームワークである。
我々はSTABのメトリクスを評価し、これを音声タスクやトークン化ツールの選択の範囲でダウンストリームタスクのパフォーマンスと相関付けする。
論文 参考訳(メタデータ) (2024-09-04T02:20:59Z) - SLUE Phase-2: A Benchmark Suite of Diverse Spoken Language Understanding
Tasks [88.4408774253634]
音声言語理解(SLU)タスクは、音声研究コミュニティで何十年にもわたって研究されてきた。
SLUタスクベンチマークはそれほど多くはなく、既存のベンチマークの多くは、すべての研究者が自由に利用できないデータを使っている。
最近の研究は、いくつかのタスクにそのようなベンチマークを導入し始めている。
論文 参考訳(メタデータ) (2022-12-20T18:39:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。