論文の概要: AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach
- arxiv url: http://arxiv.org/abs/2607.28175v1
- Date: Thu, 30 Jul 2026 13:12:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.573915
- Title: AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach
- Title(参考訳): AgenticASR:エージェントアプローチによる実世界のシナリオにおける音声認識の精製
- Abstract要約: Agentic Speech Recognition (AgenticASR) は、音声からクリーンテキストのタスクである。
障害を取り除き、自己補正を解決し、書式を正規化する。
AgenticASRは評価システムの中でAASR-Benchスコアが最も高い。
- 参考スコア(独自算出の注目度): 15.617770133323077
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic speech recognition (ASR) has achieved substantial gains in transcription accuracy, yet verbatim transcription does not necessarily produce readily usable text. It retains fillers, repetitions, false starts, and self-corrections that increase reading effort, obscure the speaker's final intent, and propagate unresolved or abandoned content to downstream tasks. Existing spoken-to-written methods process completed audio or transcripts but cannot revise emitted text when later speech changes how preceding content should be interpreted. We therefore formulate Agentic Speech Recognition (AgenticSR), an audio-to-clean-text task that removes disfluencies, resolves self-corrections, and normalizes written form while preserving the speaker's final intent. AgenticASR implements this task through an ASR--Refiner architecture that repeatedly transforms a bounded active context and replaces its corresponding output span as audio arrives. This enables continual emission and revision over streams of arbitrary duration. We also introduce AASR-Bench, a bilingual benchmark with fine-grained atomic rubrics. Across multiple ASR front ends, AgenticASR attains the highest AASR-Bench scores among evaluated systems. A human--AI agreement study shows that rubric-based judgments align with independent expert assessments. Ablations characterize Refiner capacity, context length, and the quality--latency trade-off between online and offline inference. Together, these results establish AgenticASR as a practical framework for intent-preserving clean transcription during ongoing speech. Code, AASR-Bench, and a demo will be released at https://github.com/AnXMuy/AgenticASR.
- Abstract(参考訳): 自動音声認識(ASR)は、文字の精度を大幅に向上させたが、動詞の書き起こしが必ずしも容易に利用できるテキストを生成するとは限らない。
充足、繰り返し、偽りの開始、自己訂正を保ち、読み込みの労力を増やし、話者の最終意図を曖昧にし、未解決または放棄されたコンテンツを下流のタスクに伝達する。
既存の音声書き起こし方式は、完了した音声や書き起こしを処理しているが、後続の音声が先行する内容の解釈方法を変更すると、出力されたテキストを書き換えることはできない。
そこで我々は,音声からクリーンテキストへのタスクであるエージェント音声認識(AgenticSR)を定式化し,分散を除去し,自己補正を解消し,話者の最終的な意図を維持しながら書式を正規化する。
AgenticASR はこのタスクを ASR-Refiner アーキテクチャを通じて実装する。
これにより、任意の期間のストリームに対する連続的なエミッションとリビジョンが可能になる。
AASR-Benchも導入しています。
複数のASRフロントエンドにまたがって、AgenticASRは評価システムの中で最も高いASR-Benchスコアを達成している。
人間-AI合意研究は、ルーリックに基づく判断が独立した専門家評価と一致していることを示している。
アブレーションはRefinerのキャパシティ、コンテキストの長さ、オンラインとオフラインの推論間の品質-レイテンシのトレードオフを特徴付ける。
これらの結果は,現在進行中の音声におけるクリーンな書き起こしを意図的に保存するための実践的枠組みとして,AgenticASRを確立した。
Code, AASR-Bench, そしてデモはhttps://github.com/AnXMuy/AgenticASR.comで公開される。
関連論文リスト
- Rethinking Speech-LLM Integration for ASR: Effective Joint Speech-Text Training by Interleaving [54.66679099886108]
音声-LLM統合は、広範囲なテキスト事前学習を活用することで有望な結果を示しているが、自動音声認識(ASR)の具体的な利点はいまだ不明である。
本稿では,単語レベルとセグメントレベルのインターリーブ付き音声テキストシーケンスを構成するASR指向の事前学習戦略であるJSTIPを提案する。
ASRデータの38k時間の実験では、ASRのみのトレーニングベースラインと共同音声テキストトレーニングベースラインと比較して、一貫したエンティティ精度が向上した。
論文 参考訳(メタデータ) (2026-07-02T05:42:01Z) - Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation [53.844308305341166]
単一パスのASRフロントエンドと意味的訂正,意図のルーティング,推論に基づく編集を組み合わせた閉ループフレームワークである textbfAgentic ASR を提案する。
複数言語、名前付き集中型、コードスイッチングベンチマークの実験は、反復的相互作用が意味的誤りを一貫して減少させることを示している。
論文 参考訳(メタデータ) (2026-05-28T06:23:31Z) - From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants [0.0]
顧客向け産業向けの信頼できる会話AIアシスタントの構築は、ノイズの多い会話データ、断片化された知識、正確なヒューマンハンドオフの必要性により、依然として困難である。
本稿では,履歴書から直接対話型AIアシスタントを構築し,評価するためのエンドツーエンドフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-26T07:44:47Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - Towards Unsupervised Speech Recognition Without Pronunciation Models [57.222729245842054]
本稿では,ペア音声とテキストコーパスを使わずにASRシステムを開発するという課題に取り組む。
音声合成とテキスト・テキスト・マスクによるトークン埋込から教師なし音声認識が実現可能であることを実験的に実証した。
この革新的なモデルは、レキシコンフリー環境下での以前の教師なしASRモデルの性能を上回る。
論文 参考訳(メタデータ) (2024-06-12T16:30:58Z) - Streaming Speaker-Attributed ASR with Token-Level Speaker Embeddings [53.11450530896623]
本稿では,「誰が何を話したか」を認識可能な,ストリーミング話者対応自動音声認識(SA-ASR)モデルを提案する。
本モデルは,最近提案されたマルチトーカー音声をストリーミング形式で書き起こすためのトークンレベルシリアライズアウトプットトレーニング(t-SOT)に基づいている。
提案モデルでは,従来のストリーミングモデルよりも精度が大幅に向上し,最先端のオフラインSA-ASRモデルに匹敵する,あるいは時として優れた結果が得られる。
論文 参考訳(メタデータ) (2022-03-30T21:42:00Z) - Hallucination of speech recognition errors with sequence to sequence
learning [16.39332236910586]
プレーンテキストデータを使用して話し言葉理解やASRのためのシステムのトレーニングを行う場合、証明された戦略は、ASR出力が金の転写を与えるであろうものを幻覚することです。
本稿では,asr語列の幻覚的出力,入力語列の条件づけ,対応する音素列を直接予測する新しいエンドツーエンドモデルを提案する。
これにより、ドメイン内ASRシステムの未確認データの転写からのエラーのリコール、およびドメイン外ASRシステムの非関連タスクからのオーディオの転写の以前の結果が改善されます。
論文 参考訳(メタデータ) (2021-03-23T02:09:39Z) - End-to-end speech-to-dialog-act recognition [38.58540444573232]
本稿では,音声を直接ダイアログに変換するエンド・ツー・エンドのモデルを提案する。
提案モデルでは,対話行動認識ネットワークは,その潜在層において,音声から単語へのASRモデルと結合する。
ネットワーク全体がエンドツーエンドで微調整されている。
論文 参考訳(メタデータ) (2020-04-23T18:44:27Z) - Improving Readability for Automatic Speech Recognition Transcription [50.86019112545596]
我々は、可読性のためのASRポストプロセッシング(APR)と呼ばれる新しいNLPタスクを提案する。
APRは、ノイズの多いASR出力を、話者の意味を保ちながら、人間や下流タスクのための読みやすいテキストに変換することを目的としている。
我々は,いくつかのオープンソースモデルと適応型事前学習モデルに基づく微調整モデルと,従来のパイプライン手法との比較を行った。
論文 参考訳(メタデータ) (2020-04-09T09:26:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。