Fugu-MT 論文翻訳(概要): Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study

論文の概要: Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study

arxiv url: http://arxiv.org/abs/2307.06530v1
Date: Thu, 13 Jul 2023 02:31:55 GMT
ステータス: 翻訳完了
システム内更新日: 2023-07-14 15:56:49.137381
Title: Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study
Title（参考訳）: 大規模言語モデルの音声認識システムへの統合を探る:実証的研究
Authors: Zeping Min, Jinbo Wang
Abstract要約: 本稿では,Large Language Models (LLM) と自動音声認識(ASR)システムの統合について検討する。我々の主な焦点は、LLMのコンテキスト内学習機能を用いて、ASRシステムの性能を向上させる可能性を調査することである。
参考スコア（独自算出の注目度）: 0.0
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: This paper explores the integration of Large Language Models (LLMs) into Automatic Speech Recognition (ASR) systems to improve transcription accuracy. The increasing sophistication of LLMs, with their in-context learning capabilities and instruction-following behavior, has drawn significant attention in the field of Natural Language Processing (NLP). Our primary focus is to investigate the potential of using an LLM's in-context learning capabilities to enhance the performance of ASR systems, which currently face challenges such as ambient noise, speaker accents, and complex linguistic contexts. We designed a study using the Aishell-1 and LibriSpeech datasets, with ChatGPT and GPT-4 serving as benchmarks for LLM capabilities. Unfortunately, our initial experiments did not yield promising results, indicating the complexity of leveraging LLM's in-context learning for ASR applications. Despite further exploration with varied settings and models, the corrected sentences from the LLMs frequently resulted in higher Word Error Rates (WER), demonstrating the limitations of LLMs in speech applications. This paper provides a detailed overview of these experiments, their results, and implications, establishing that using LLMs' in-context learning capabilities to correct potential errors in speech recognition transcriptions is still a challenging task at the current stage.
Abstract（参考訳）: 本稿では,Large Language Models (LLM) と自動音声認識 (ASR) システムを統合することにより,転写精度の向上を図る。自然言語処理(NLP)分野において,LLMの高度化,文脈内学習能力,命令追従行動等が注目されている。我々は,環境騒音,話者アクセント,複雑な言語文脈といった課題に直面しているasrシステムの性能向上のために,llmの文脈内学習機能を利用する可能性を検討することを目的とする。 Aishell-1 と LibriSpeech のデータセットを用いて,ChatGPT と GPT-4 を LLM 機能のベンチマークとして設計した。残念ながら、我々の最初の実験では有望な結果が得られず、LLMのコンテキスト内学習をASRアプリケーションに活用することの複雑さが示唆された。様々な設定やモデルによるさらなる探索にもかかわらず、LLMの修正文は高い単語誤り率(WER)をもたらし、LLMの音声応用における限界を示した。本稿では,これらの実験の概要,結果,意味について概説し,音声認識文字起こしにおける潜在的な誤りを訂正するためにLLMの文脈内学習機能を利用することは,現在なお困難な課題であることを示す。

関連論文リスト

RELIC: Evaluating Compositional Instruction Following via Language Recognition [37.49115450182637]
大規模言語モデル(LLM)は、コンテキストで提供されるタスクの仕様に基づいてのみタスクを実行することがますます期待されている。本稿では,言語認識を用いたインコンテキスト認識(RELIC)フレームワークについて紹介する。
論文参考訳（メタデータ） (2025-06-05T16:17:24Z)
LESS: Large Language Model Enhanced Semi-Supervised Learning for Speech Foundational Models [3.5297361401370053]
そこで我々は,Large Language Models (LLMs) を利用した多用途フレームワークを導入し,実データから生成された擬似ラベルを補正する。 LESSフレームワーク内では、教師なしデータのASR(Automatic Speech Recognition)またはAST(Automatic Speech Translation)からの擬似ラベル付きテキストをLLMにより洗練する。マンダリンASRとスペイン語と英語のASTの両タスクの実験は、LESSが3.77%の絶対的なWER削減を達成したことを示している。
論文参考訳（メタデータ） (2025-06-05T03:00:04Z)
Explicit Learning and the LLM in Machine Translation [20.630120942837564]
本研究では,大規模言語モデル(LLM)の明示的学習能力について検討する。制御されたテスト環境として手段によって生成された構築言語を用いて,LLMの文法規則を明示的に学習し適用する能力を評価する実験を設計した。思考の連鎖を微調整することで、LLMのパフォーマンスは著しく向上するが、類型的に新しい言語的特徴やより複雑な言語的特徴への一般化に苦慮する。
論文参考訳（メタデータ） (2025-03-12T14:57:08Z)
Understanding Zero-shot Rare Word Recognition Improvements Through LLM Integration [0.8702432681310401]
本稿では,大規模言語モデル(LLM)と自動音声認識(ASR)システムの統合について検討する。分析の結果,LLMはレアワード誤り率(R-WER)の改善に大きく寄与していることが明らかとなった。広範にわたるアブレーション研究を通じて,LLMの言語能力と音声エンコーダ出力の整合化におけるアダプタ統合の重要性を強調した。
論文参考訳（メタデータ） (2025-02-22T08:30:38Z)
RuAG: Learned-rule-augmented Generation for Large Language Models [62.64389390179651]
本稿では,大量のオフラインデータを解釈可能な一階述語論理規則に自動抽出する新しいフレームワーク,RuAGを提案する。我々は,自然言語処理,時系列,意思決定,産業タスクなど,公共および民間の産業タスクに関する枠組みを評価する。
論文参考訳（メタデータ） (2024-11-04T00:01:34Z)
Beyond Binary: Towards Fine-Grained LLM-Generated Text Detection via Role Recognition and Involvement Measurement [51.601916604301685]
大規模言語モデル(LLM)は、オンライン談話における信頼を損なう可能性のあるコンテンツを生成する。現在の手法はバイナリ分類に重点を置いており、人間とAIのコラボレーションのような現実のシナリオの複雑さに対処できないことが多い。バイナリ分類を超えてこれらの課題に対処するために,LLM生成コンテンツを検出するための新しいパラダイムを提案する。
論文参考訳（メタデータ） (2024-10-18T08:14:10Z)
Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data [84.01401439030265]
最近のエンドツーエンド言語モデル(SLM)は、大規模言語モデル(LLM)の機能に拡張されている。音声とテキストのペアデータを生成するための,シンプルで効果的な自動処理手法を提案する。本モデルでは,音声教育データを必要としない音声関連タスクの汎用性を示す。
論文参考訳（メタデータ） (2024-09-30T07:01:21Z)
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing [56.75702900542643]
大規模言語モデルの自己改善のためのAlphaLLMを紹介する。モンテカルロ木探索(MCTS)とLLMを統合し、自己改善ループを確立する。実験の結果,AlphaLLM は付加アノテーションを使わずに LLM の性能を大幅に向上することがわかった。
論文参考訳（メタデータ） (2024-04-18T15:21:34Z)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts [10.929547354171723]
本稿では,言語モデルロールアウト(KALM)の知識エージェントを紹介する。大規模言語モデル(LLM)から、オフラインの強化学習手法によってエージェントが容易に学習できる想像上のロールアウトの形で知識を抽出する。未確認の目標を持つタスクの実行において46%の成功率を達成し、ベースラインメソッドによって達成された26%の成功率を大幅に上回る。
論文参考訳（メタデータ） (2024-04-14T13:19:40Z)
Large Language Models are Efficient Learners of Noise-Robust Speech Recognition [65.95847272465124]
大規模言語モデル(LLM)の最近の進歩は、自動音声認識(ASR)のための生成誤り訂正(GER)を促進している。本研究では,このベンチマークをノイズの多い条件に拡張し,GERのデノナイジングをLLMに教えることができるかを検討する。最新のLLM実験では,単語誤り率を最大53.9%改善し,新たなブレークスルーを実現している。
論文参考訳（メタデータ） (2024-01-19T01:29:27Z)
Towards ASR Robust Spoken Language Understanding Through In-Context Learning With Word Confusion Networks [68.79880423713597]
本稿では,トップ仮説のみに頼るのではなく,ASRシステムの格子出力を利用する手法を提案する。音声質問応答と意図分類を網羅した文脈内学習実験により,LLMの音声書き起こしに対する弾力性について明らかにした。
論文参考訳（メタデータ） (2024-01-05T17:58:10Z)
Supervised Knowledge Makes Large Language Models Better In-context Learners [94.89301696512776]
大規模言語モデル(LLM)は、素早い工学を通して、文脈内学習能力の出現を示す。自然言語理解と質問応答におけるLLMの一般化性と事実性の向上という課題は、まだ未解決のままである。本研究では, LLM の信頼性を高める枠組みを提案する。1) 分布外データの一般化,2) 差別モデルによる LLM のメリットの解明,3) 生成タスクにおける幻覚の最小化。
論文参考訳（メタデータ） (2023-12-26T07:24:46Z)
Generative Speech Recognition Error Correction with Large Language Models and Task-Activating Prompting [32.70214938434769]
本稿では,大規模言語モデル(LLM)の音声認識後処理機能について検討する。我々は、ゼロショットと少数ショットのインコンテキスト学習と、新しいタスクアクティベーション・プロンプト法という、異なるプロンプト方式を評価する。凍結LDMを用いた文脈内学習でのみ再構成を行うことで、ドメインチューニングLMによる再構成と競合する結果が得られることを示す。
論文参考訳（メタデータ） (2023-09-27T13:36:03Z)
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition [23.172469312225694]
自動音声認識(ASR)におけるテキスト生成プロセスの指導に,命令調整付き大言語モデル(LLM)を用いることを提案する。提案手法はCTCとアテンションアーキテクチャを併用し,LLMはデコーダのフロントエンド特徴抽出器として機能する。実験結果から,LLM誘導モデルによる単語誤り率の相対的な増加率は,主要なベンチマークで約13%であった。
論文参考訳（メタデータ） (2023-09-19T11:10:50Z)
Leveraging Large Language Models for Exploiting ASR Uncertainty [16.740712975166407]
大規模な言語モデルは、書き起こしのための既製の音声認識システムに依存するか、あるいは内蔵された音声モダリティを備える必要がある。我々は,高い単語誤り率でLLMの発話意図を理解する能力を制限する音声意図分類タスクに取り組む。我々は,誤り発生1-best仮説に代えて,ASR仮説のn-bestリストでLLMを推し進めることを提案する。
論文参考訳（メタデータ） (2023-09-09T17:02:33Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。