論文の概要: Scaling Forced Alignment to End-User Devices
- arxiv url: http://arxiv.org/abs/2609.21145v1
- Date: Thu, 17 Sep 2026 23:22:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.793349
- Title: Scaling Forced Alignment to End-User Devices
- Title(参考訳): エンドユーザーデバイスへの強制アライメントのスケーリング
- Abstract要約: Viterbiアルゴリズムは以前、オンラインリソースからトレーニングデータをマイニングするために、音声とテキストを強制的にアライメントするために使用されてきた。
まず,線形メモリを用いたアライメントを実現するためにHirschbergアルゴリズムを適用した。
第二に、音声とテキストのアライメントを制約付きランダムウォークとしてモデル化し、任意の自信で検索空間を創り出すことができる。
- 参考スコア(独自算出の注目度): 0.6247277302575499
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The Viterbi algorithm has been previously used to perform forced alignment of audio to text to mine training data from online resources. However, many existing implementations have quadratic time and space complexity, scaling poorly to long input sequences. We propose two optimizations to address this issue. First, we apply the Hirschberg algorithm to perform the alignment in place using linear memory. Second, we model the alignment between speech and text as a constrained random walk, allowing us to prune the search space with arbitrary confidence while accounting for transcription errors. The Hirschberg optimization reduces memory usage from 140 GB to 5 MB for three-hour inputs while producing identical alignments in one-third the time of torchaudio when both run on a CPU. We achieve an additional 2x speedup with pruning on inputs longer than 20 minutes while preserving alignment accuracy in more than 98% of tested cases.
- Abstract(参考訳): Viterbiアルゴリズムは以前、オンラインリソースからトレーニングデータをマイニングするために、音声とテキストを強制的にアライメントするために使用されてきた。
しかし、既存の実装の多くは2次時間と空間の複雑さを持ち、長い入力シーケンスにはスケールが不十分である。
この問題に対処する2つの最適化を提案する。
まず,線形メモリを用いたアライメントを行うためにHirschbergアルゴリズムを適用する。
第二に、音声とテキストのアライメントを制約付きランダムウォークとしてモデル化し、書き起こし誤りを考慮しつつ任意の自信で検索空間を創り出すことができる。
Hirschbergの最適化は、メモリ使用量を3時間の入力で140GBから5MBに減らし、両方がCPU上で実行されるときのトーチャウディの3分の1で同じアライメントを生成する。
テストケースの98%以上でアライメント精度を保ちながら,入力を20分以上プルーニングすることで,さらに2倍のスピードアップを実現した。
関連論文リスト
- Replicable Learning of Large-Margin Halfspaces [46.91303295440005]
我々は,大マージンハーフスペースを学習する問題に対して,効率的なアルゴリズムを提供する。
Impagliazzo, Lei, Pitassi, Sorrellによるアルゴリズム [STOC 2022] の改良を行った。
論文 参考訳(メタデータ) (2024-02-21T15:06:51Z) - Fast offset corrected in-memory training [0.0]
インメモリコンピューティングのための新しいアルゴリズムと改良アルゴリズムを2つ提案する。
Chopped-TTv2 (c-TTv2) と Analog Gradient Accumulation with Dynamic Reference (AGAD) は同じランタイムの複雑さを維持しているが、チョッパーを使用した残りのオフセットに対して正しい。
論文 参考訳(メタデータ) (2023-03-08T17:07:09Z) - Fast and parallel decoding for transducer [25.510837666148024]
本研究では,トランスデューサ損失の制約付きバージョンを導入し,シーケンス間のモノトニックアライメントを厳密に学習する。
また、時間毎に出力できるシンボルの数を制限することで、標準の欲求探索とビーム探索アルゴリズムを改善した。
論文 参考訳(メタデータ) (2022-10-31T07:46:10Z) - Iterative pseudo-forced alignment by acoustic CTC loss for
self-supervised ASR domain adaptation [80.12316877964558]
特定のドメインからの高品質なデータラベリングはコストと人的時間を要する。
本稿では,反復的擬力アライメントアルゴリズムに基づく自己教師付きドメイン適応手法を提案する。
論文 参考訳(メタデータ) (2022-10-27T07:23:08Z) - Rapid Person Re-Identification via Sub-space Consistency Regularization [51.76876061721556]
Person Re-Identification (ReID) は、歩行者を分離したカメラで識別する。
実値特徴記述子を用いた既存のReID法は精度が高いが、ユークリッド距離計算が遅いため効率が低い。
本稿では,ReID 処理を 0.25 倍高速化するサブスペース一貫性規則化 (SCR) アルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-07-13T02:44:05Z) - Improve Sentence Alignment by Divide-and-conquer [1.431550176075561]
本稿では,文のアライメント速度を改善するための分割・コンカレントアルゴリズムを提案する。
我々は外部のバイリンガル文の埋め込みを用いて、並列テキストが整列する正確なハードを見つける。
私たちのアルゴリズムは実際にVecalignよりも高速です。
論文 参考訳(メタデータ) (2022-01-18T12:25:04Z) - FastCorrect 2: Fast Error Correction on Multiple Candidates for
Automatic Speech Recognition [92.12910821300034]
本稿では,複数のASR候補を入力として取り込んだ誤り訂正モデルFastCorrect 2を提案する。
FastCorrect 2は、カスケードされた再描画と修正パイプラインよりも優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2021-09-29T13:48:03Z) - Displacement-Invariant Cost Computation for Efficient Stereo Matching [122.94051630000934]
ディープラーニング手法は、前例のない不一致の精度を得ることによって、ステレオマッチングのリーダーボードを支配してきた。
しかし、その推測時間は一般的に540p画像の秒数で遅い。
本研究では,4次元特徴量を必要としないEmphdisplacement-invariant cost moduleを提案する。
論文 参考訳(メタデータ) (2020-12-01T23:58:16Z) - BEAR: Sketching BFGS Algorithm for Ultra-High Dimensional Feature
Selection in Sublinear Memory [13.596664481933875]
現在の大規模スケッチアルゴリズムは、スケッチされた領域における不可逆的な衝突とノイズの蓄積により、メモリ精度のトレードオフが低いことを示す。
我々はBEARを開発し、著名なブロイデン=フレッチャー=ゴールドファーブ=シャノン(BFGS)アルゴリズムに2階勾配を格納することで余分な衝突を避ける。
実世界のデータセットの実験により、BEARは1次スケッチアルゴリズムと同一の分類精度を達成するために最大で3桁のメモリスペースを必要とすることが示された。
論文 参考訳(メタデータ) (2020-10-26T18:31:27Z) - Exact, Parallelizable Dynamic Time Warping Alignment with Linear Memory [0.0]
我々は,O(M+N)メモリを用いて,正確な大域的最適DTWアライメントを計算する分割・征服アルゴリズムを提案する。
我々のアルゴリズムは、同じメモリ制約でmin(M, N)の係数まで並列化できるので、十分なGPUで教科書版よりも効率的に実行できる。
論文 参考訳(メタデータ) (2020-08-04T15:00:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。