論文の概要: REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing
- arxiv url: http://arxiv.org/abs/2607.05364v2
- Date: Wed, 15 Jul 2026 17:16:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 14:31:40.655187
- Title: REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing
- Title(参考訳): REDDIT: Replay-based Distribution Editing を使用せずに ASR におけるモデル生成タイムスタンプドリフトの補正
- Authors: Cheng-Kang Chou, Ming-To Chuang, Ke-Han Lu, Chan-Jan Hsu, Hung-yi Lee,
- Abstract要約: 自己回帰型ASRシステムは、タイムスタンプをデコードされたトークンとして出力することができ、フレームレベルや推論後処理なしでタイムスタンプによる書き起こしを可能にする。
これらのタイムスタンプは、長い非音声スパンを漂うことができることを示す。
ReDDIT(REplay-based Distribution eDITing)は,タイムスタンプの修正を行う軽量な2段階後トレーニングフレームワークである。
- 参考スコア(独自算出の注目度): 46.75114860324604
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern autoregressive ASR systems can emit timestamps as decoded tokens, enabling timestamped transcription without frame-level aligners or inference-time post-processing. We show that these generated timestamps can drift across long non-speech spans: the transcript may remain plausible, but the decoded time axis drifts away from the audio. We study this non-speech-induced timestamp drift with self-built gap and long-gap benchmarks across 15 evaluated timestamp-producing ASR and audio-language systems. Naive timestamp-corrected fine-tuning improves alignment but can severely degrade non-target ASR behavior, exposing a forgetting problem. We propose REDDIT(REplay-based Distribution eDITing), a lightweight two-stage post-training framework that corrects timestamps while avoiding this catastrophic forgetting: it first edits timestamp targets under the model's own replayed decoder context while matching the frozen base distribution on non-timestamp tokens, then applies a short edited-prefix refinement stage. In this framework, we construct correction supervision without human transcripts or human timestamp annotations by combining VAD-trimmed speech spans with inserted non-speech gaps and known concatenation offsets. On Whisper-tiny, 34.9 hours of targeted correction audio used and only 1.6% of model parameters updated, raising long-gap mIoU from 38.7% to 95.0% and reducing mixed-gap out-of-domain AAS from 2752 ms to 223 ms while preserving CV-en MER at 41.3% (versus 524.2% for ordinary SFT decoder tuning).
- Abstract(参考訳): 現代の自己回帰型ASRシステムは、タイムスタンプをデコードされたトークンとして出力することができ、フレームレベルの整列子や推論後処理を使わずにタイムスタンプによる書き起こしを可能にする。
生成したタイムスタンプは、長い非音声スパンにわたってドリフト可能であることを示し、転写文字は可塑性のままであるが、復号された時間軸はオーディオから遠ざかっている。
我々は,この非音声によるタイムスタンプドリフトを,自己構築ギャップと長ギャップベンチマークで評価した15のタイムスタンプ生成ASRおよび音声言語システムを用いて検討した。
直近のタイムスタンプ補正ファインチューニングはアライメントを改善するが、ターゲット外のASR動作を著しく低下させ、忘れる問題を露呈する。
本稿では,まず,非タイムスタンプトークン上の凍結ベース分布を一致させながら,モデル自身のリプレイデコーダコンテキスト下でタイムスタンプターゲットを編集し,短い編集前修正段階を施すという,この惨事的忘れを回避しつつ,タイムスタンプの修正を行う軽量2段階後トレーニングフレームワークREDDIT(REplay-based Distribution eDITing)を提案する。
本研究では,VADトリミング音声スパンを挿入した非音声間隙と既知の連結オフセットとを組み合わせて,人間の転写文や人間のタイムスタンプアノテーションを使わずに補正管理を構築する。
Whisper-tinyでは34.9時間の目標修正オーディオを使用し、モデルパラメータの1.6%しか更新されず、ロングギャップのmIoUを38.7%から95.0%に引き上げ、混合ギャップのAASを2752msから223msに減らし、CV-en MERを41.3%保存した(通常のSFTデコーダチューニングでは524.2%)。
関連論文リスト
- Topic-to-Timestamp Alignment by Constrained Evidence Selection [5.582495870293832]
自然言語のトピックとタイムスタンプによるミーティングの書き起こしが与えられた場合、そのトピックが議論される時間を返すことが目標である。
標準的なRAGセットアップは、関連するトランスクリプトの抜粋を検索できるが、それでも言語モデルにタイムスタンプを生成するよう要求する。
我々はタイムスタンプ予測を時間的候補選択の制約として再放送する。
論文 参考訳(メタデータ) (2026-06-18T19:38:57Z) - In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions [51.236148875603185]
我々は既存の音声認識言語モデルを拡張して、文字起こしと直接タイムスタンプを予測する。
認識品質を維持しつつアライメントの堅牢性を向上する,新しい軽量なトレーニング戦略を導入する。
論文 参考訳(メタデータ) (2026-04-14T20:56:24Z) - TimeStampEval: A Simple LLM Eval and a Little Fuzzy Matching Trick to Improve Search Accuracy [0.0]
TimeStampEvalは、非バーバティムな引用を与えられた長い書き起こしから正確にミリ秒のタイムスタンプを取得するためのベンチマークである。
簡単な2段階法では,推論コストを90%以上削減しながら,検索精度を劇的に向上させる。
モチベーションのユースケースは、議会記録のクリップをAIがホストする動詞のナレーションにまとめる、自動化されたロングフォームポッドキャストである。
論文 参考訳(メタデータ) (2025-10-27T21:54:56Z) - Word Level Timestamp Generation for Automatic Speech Recognition and Translation [28.176210372699618]
カナリアモデルにおいて,単語レベルのタイムスタンプ予測を可能にするためのデータ駆動型手法を提案する。
提案手法は,4言語で20~120msのタイムスタンプ予測誤差を用いて,80%から90%の精度とリコール率を示す。
論文 参考訳(メタデータ) (2025-05-21T15:24:29Z) - Timestamped Embedding-Matching Acoustic-to-Word CTC ASR [2.842794675894731]
組込み型単語レベル接続性時間分類(CTC)自動音声認識(ASR)の学習方法について述べる。
単語タイムスタンプは、テスト時に二次モデルや強制アライメントプロセスに頼ることなく、ASRが単語セグメンテーションと単語混乱ネットワークを出力することを可能にする。
論文 参考訳(メタデータ) (2023-06-20T11:53:43Z) - Achieving Timestamp Prediction While Recognizing with Non-Autoregressive
End-to-End ASR Model [39.892106056198614]
本稿では,連続的な統合火災(CIF)機構を用いて認識しながら,タイムスタンプ予測(TP)を行う手法を提案する。
実験の結果,提案手法はCIFタイムスタンプの精度を大幅に向上することがわかった。
論文 参考訳(メタデータ) (2023-01-29T03:47:59Z) - Iterative pseudo-forced alignment by acoustic CTC loss for
self-supervised ASR domain adaptation [80.12316877964558]
特定のドメインからの高品質なデータラベリングはコストと人的時間を要する。
本稿では,反復的擬力アライメントアルゴリズムに基づく自己教師付きドメイン適応手法を提案する。
論文 参考訳(メタデータ) (2022-10-27T07:23:08Z) - FastCorrect: Fast Error Correction with Edit Alignment for Automatic
Speech Recognition [90.34177266618143]
編集アライメントに基づく新しいNAR誤り訂正モデルであるFastCorrectを提案する。
fastcorrectは推論を6-9倍高速化し、自己回帰補正モデルと比較して精度を8-14%向上させる。
ニューラルマシン翻訳で採用されている一般的なNARモデルの精度を、大きなマージンで上回っています。
論文 参考訳(メタデータ) (2021-05-09T05:35:36Z) - Advanced Long-context End-to-end Speech Recognition Using
Context-expanded Transformers [56.56220390953412]
コンフォーメータアーキテクチャを導入することで、精度をさらに向上させ、以前の作業を拡張します。
拡張トランスフォーマーは、最先端のエンドツーエンドのASR性能を提供する。
論文 参考訳(メタデータ) (2021-04-19T16:18:00Z) - FastEmit: Low-latency Streaming ASR with Sequence-level Emission
Regularization [78.46088089185156]
ストリーム自動音声認識(ASR)は、仮説化された単語を可能な限り迅速かつ正確に出力することを目的としている。
既存のアプローチでは、シーケンストランスデューサモデルにおいて、トーケン単位またはフレーム単位の確率予測を演算することで、発光遅延をペナルティ化する。
本稿では,訓練用トランスデューサモデルにおいて,シーケンス毎の確率に遅延正規化を直接適用する,FastEmitというシーケンスレベルのエミッション正規化手法を提案する。
論文 参考訳(メタデータ) (2020-10-21T17:05:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。