論文の概要: Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech Synthesizer
- arxiv url: http://arxiv.org/abs/2607.18662v1
- Date: Sun, 19 Jul 2026 11:20:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.300336
- Title: Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech Synthesizer
- Title(参考訳): フローマッチ型テキスト音声教師の段階的深度処理蒸留:小型ヒンディー語音声合成装置
- Authors: Sivateja Trikutam,
- Abstract要約: 本稿では, 高精度なデータ予算の下で, コンパクトなHindiテキスト音声合成モデルを構築するための実践的レシピを提案する。
教師の幅, テキスト次元, 注意頭, メル/テキストI/Oを固定したまま, 奥行きのみを刻むことで, 教師から学生を温め始める。
この方法は6GBのラップトップGPUでリアルタイムで動く高品質のヒンディー語音声を生成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a practical recipe for building a compact Hindi text-to-speech (TTS) model by distilling a large flow-matching teacher (IndicF5, 337M-parameter DiT) under a severe data budget (~17.6 hours). Training a small model from scratch on this much data fails outright. Instead we warm-start the student from the teacher by pruning depth only: keeping the teacher's width, text dimension, attention heads, and mel/text I/O fixed so all non-block tensors copy one-to-one, and retaining an evenly-spaced subset of transformer blocks. We first measure how much depth the teacher tolerates (it remains near-functional at -27% blocks but collapses past -50%), then descend gradually (22 -> 16 -> 12 -> 8 -> 6 blocks), re-fine-tuning after each prune, with each step gated by an objective ASR word-error-rate (WER) check. The resulting students reach WER 0.00 on unseen sentences at 249M and 190M parameters, and remain robust down to 131M; at 102M we observe a clear capacity cliff that we attribute to the data budget rather than the recipe. We also document two train/inference feature- and library-parity failures (mel filterbank and rotary-embedding library versions) that silently degrade audio, and a version-independent fix. The method yields a high-quality Hindi voice that runs in real time on a 6 GB laptop GPU. An independent 50-sentence FLEURS benchmark compares the released 190M student against its teacher and MMS-TTS-hin.
- Abstract(参考訳): 本研究では,大規模なフローマッチング教師(IndicF5, 337M-parameter DiT)をデータ予算(約17.6時間)で蒸留することにより,コンパクトなHindi text-to-speech(TTS)モデルを構築するための実践的レシピを提案する。
この大量のデータをスクラッチから小さなモデルをトレーニングすることは、完全に失敗する。
教師の幅、テキスト寸法、アテンションヘッド、およびメル/テキストI/Oを固定しておくことで、すべての非ブロックテンソルが1対1をコピーし、変圧器ブロックの均等に区切られたサブセットを保持する。
まず,教師がどれだけの深さで耐えられるか(約27%のブロックで機能するが,約50%のブロックで崩壊する)を測定し,その後徐々に降下し(22 -> 16 -> 12 -> 8 -> 6 ブロック),各プルーンの後に再度微調整を行い,各ステップは客観的な ASR 単語エラーレート (WER) チェックによってゲートされる。
得られた学生は、249Mと190Mの未確認文でWER 0.00に到達し、131Mまで頑健に保ちます。
また、音声を無音で劣化させる2つの列車/推論機能とライブラリパリティ障害(メルフィルタバンクとロータリー埋め込みライブラリバージョン)と、バージョンに依存しない修正を文書化する。
この方法は6GBのラップトップGPUでリアルタイムで動く高品質のヒンディー語音声を生成する。
独立した50文のFLEURSベンチマークは、リリースした1億9000万人の学生とMMS-TTS-hinを比較している。
関連論文リスト
- Robust Assamese Speech Recognition through Controlled Fine-Tuning of Whisper Models [1.4095958360608893]
本稿ではMozilla Common Voice 24.0-Assamese corpusで学習したWhisper-based Assamese ASRシステムについて述べる。
ハードウェア対応の最適化トレーニングパイプラインは、リソース制約のある環境向けに実装されている。
論文 参考訳(メタデータ) (2026-07-19T09:54:52Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation [0.0]
文の埋め込みはセマンティック検索、クラスタリング、分類、検索強化生成のための基礎的なコンポーネントである。
本稿では,768次元のL2正規化ベクトルを生成するトルコの文埋め込みモデルであるembeddingmagibu-200mについて述べる。
論文 参考訳(メタデータ) (2026-05-28T14:24:50Z) - Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling [52.02344262645619]
本稿では,新しいトランス層を凍結テキストLLMに挿入し,付加層のみを音声データに基づいて訓練するマルチモーダル深さアップスケーリングを提案する。
SmolLM2-360MとSmolLM2-1.7Bによる48k時間の英語自動音声認識(ASR)データによる実験により、深度アップスケーリングは完全な微調整に匹敵するASRを実現することが示された。
さらに,テキストの劣化を75%以上低減し,トレーニング可能なパラメータを60%少なく抑えながら,大規模モデルの完全微調整に適合あるいは超越したASRを実現するために,音声認識用に設計されたアーキテクチャであるE-Branchformerを組み込むことが示される。
論文 参考訳(メタデータ) (2026-04-01T05:16:06Z) - RosettaSpeech: Zero-Shot Speech-to-Speech Translation from Monolingual Data [30.27234062544891]
本稿では,ゼロショット音声音声翻訳(S2ST)のための新規かつ簡易なフレームワークであるRosettaSpeechを紹介する。
本手法はテキストベースのNMTモデルに固有の言語知識を活用するが,パラレル音声対の必要性を極端に排除する。
我々のモデルは、トレーニング中にテキストを中間ブリッジとして使用するが、推論時に直接エンドツーエンドの音声合成モデルとして機能する。
論文 参考訳(メタデータ) (2025-11-26T02:02:20Z) - SeamlessM4T: Massively Multilingual & Multimodal Machine Translation [90.71078166159295]
音声から音声への翻訳,音声からテキストへの翻訳,テキストからテキストへの翻訳,最大100言語の自動音声認識をサポートする単一モデルSeamlessM4Tを紹介する。
我々は、音声とテキストの両方に英語を翻訳できる最初の多言語システムを開発した。
FLEURSでは、SeamlessM4Tが複数のターゲット言語への翻訳の新しい標準を設定し、音声からテキストへの直接翻訳において、以前のSOTAよりも20%BLEUの改善を実現している。
論文 参考訳(メタデータ) (2023-08-22T17:44:18Z) - The USYD-JD Speech Translation System for IWSLT 2021 [85.64797317290349]
本稿では,シドニー大学とJDが共同でIWSLT 2021低リソース音声翻訳タスクを提出したことを述べる。
私たちは、公式に提供されたASRとMTデータセットでモデルをトレーニングしました。
翻訳性能の向上を目的として, バック翻訳, 知識蒸留, 多機能再構成, トランスダクティブファインタニングなど, 最新の効果的な手法について検討した。
論文 参考訳(メタデータ) (2021-07-24T09:53:34Z) - From Universal Language Model to Downstream Task: Improving
RoBERTa-Based Vietnamese Hate Speech Detection [8.602181445598776]
汎用のRoBERTa言語モデルを特定のテキスト分類タスクであるベトナムのヘイト音声検出に適応させるパイプラインを提案する。
実験の結果,提案パイプラインの性能が著しく向上し,0.7221 f1のベトナム人ヘイトスピーチ検出キャンペーンが達成された。
論文 参考訳(メタデータ) (2021-02-24T09:30:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。