論文の概要: Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs
- arxiv url: http://arxiv.org/abs/2606.18323v1
- Date: Tue, 16 Jun 2026 15:41:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-18 17:16:50.825755
- Title: Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs
- Title(参考訳): ASR自己検証と蒸留による信頼性の高いニューラルコーデックテキスト音声合成:モデルとコーデック間の近ゼロ破滅的故障
- Authors: Ali Asaria, Tony Salomone, Deep Gandhi,
- Abstract要約: 最良NSR自己検証は失敗をほぼゼロに導くことを示す。
モデルに自己検証された動作ロバスト性を蒸留することにより、予測時に修正を自由にする。
- 参考スコア(独自算出の注目度): 0.08599681538174887
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Open autoregressive neural-codec text-to-speech (TTS) models sound excellent on typical inputs yet suffer stochastic catastrophic failures: on a meaningful fraction of utterances they emit silence, terminate early, or collapse into repetitive or hallucinated content. We show this failure mode is cheap to remove. Under a single format-robust metric (a catastrophic-failure rate via an ASR round-trip), best-of-N ASR self-verification drives failures to near-zero: no observed failures remain by N=2 on a standard corpus (LibriSpeech) and by N=4 on a hard prompt set. This is not an artifact of one model: the reduction replicates across four open codec-TTS systems and three neural codecs (XCodec2, SNAC, Mimi), reaching the near-zero floor by N=2 on three of the four. We then make the fix free at inference time by distilling the self-verified behaviour into the model, which recovers much of the robustness in single-shot decoding, closing ~52-58% of the failure mass on hard inputs at no test-time cost. The distillation gain concentrates where it is needed (hard inputs); on already-reliable prose there is no headroom and no detectable change. A controlled comparison adds a clean negative: offline direct preference optimization (DPO/IPO) does not beat plain supervised distillation, and an online iterative variant is promising but not statistically separable at our evaluation size. We report honestly the one model that resists (a larger Llasa where scale did not obviously help) and a rare-word capability ceiling that no self-distillation method overcomes
- Abstract(参考訳): オープン・オートレグレッシブ・ニューラル・コーデック・テキスト・トゥ・スポーチ(TTS)モデルは、典型的な入力では優れた音質であるが、確率論的破滅的な失敗に苦しむ。
この障害モードは、取り除くのが安くなります。
単一形式ロバスト計量(ASRのラウンドトリップによる破滅的な失敗率)の下では、ベスト・オブ・NのASR自己検証は失敗をほぼゼロに駆動する:標準コーパス(LibriSpeech)ではN=2、ハードプロンプトセットではN=4で観測された失敗は残らない。
この還元は4つのオープンコーデック-TTSシステムと3つのニューラルコーデック(XCodec2, SNAC, Mimi)で複製され、4つのうち3つでN=2のほぼゼロ階に達する。
次に、単発デコードにおけるロバスト性の多くを回復し、テストタイムのコストを伴わずにハードインプットの約52~58%を閉じる自己検証動作をモデルに蒸留することにより、推論時に修正を自由にする。
蒸留利得は必要な場所(ハードインプット)に集中し、既に信頼性の高い散文では、ヘッドルームがなく、検出可能な変更もない。
オフライン直接選好最適化(DPO/IPO)は、通常の監督蒸留に勝らず、オンライン反復変種は有望だが、我々の評価サイズでは統計的に分離できない。
正直なところ、抵抗する1つのモデル(スケールが明らかに役に立たない大型のLlasa)と、自己蒸留法が克服できない希少な単語能力天井を報告する。
関連論文リスト
- Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models [0.0]
小型のコードモデルは、しばしばプラルーシブル・ブライト・プログラムを出力する。
意味論的ポストホック演算子が役立つかどうかを測定する。
ここで唯一の精度向上である式層リカバリ(M1)は、標準抽出器が破棄した正しいプログラムを復元する。
論文 参考訳(メタデータ) (2026-06-15T17:36:23Z) - Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics [49.443264461057645]
拡散および連続フローベースの言語モデルは、言語モデリングに対する非自己回帰的な主要な代替手段として現れている。
両方のパラダイムの進歩は、生成的複雑度(gen-PPL)によって圧倒的に追跡される。
我々は、この指標は正しくないと主張している。構築により、gen-PPLは、文法性やセマンティックコヒーレンスではなく、スコアARの下でのみ予測可能性を測定する。
論文 参考訳(メタデータ) (2026-06-07T02:35:56Z) - Characterizing the Fault Response of the Intel Neural Compute Stick 2 Under Single-Pulse Electromagnetic Fault Injection [3.2913641623634913]
ImageNetをトレーニングした3つのニューラルネットワークを動作させるNAS2の単一パルス電磁欠陥注入キャンペーンを報告した。
単一のパルスは、4つの再現可能な結果クラスを生成する。
本稿では,デバイスファームウェアやOpenVINOランタイムを変更することなく,アプリケーションレベルで実装可能な機構に焦点をあてて,クラスごとの緩和戦略について議論する。
論文 参考訳(メタデータ) (2026-05-21T13:06:26Z) - Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation [50.55853275866995]
リアルタイムのインタラクティブなビデオ生成には、低レイテンシ、ストリーミング、コントロール可能なロールアウトが必要である。
本稿では,フレームワイドの自己回帰を1~2ステップのサンプリングで行うという,よりアグレッシブな設定について検討する。
原理的かつスケーラブルなパイプラインである textbfCausal Forcing++ を提案する。
論文 参考訳(メタデータ) (2026-05-14T17:46:36Z) - Hallucination as an Anomaly: Dynamic Intervention via Probabilistic Circuits [6.667596224057802]
LLM残差ストリーム上のトラクタブル密度推定器として訓練された確率回路PCNETを提案する。
本手法は,実数多様体上の幾何学的異常として幻覚を検出する。
PCNETは、CoQA、SQuAD v2.0、TriviaQAのほぼ完全な幻覚検出を実現し、AUROCは99%に達する。
論文 参考訳(メタデータ) (2026-05-07T10:02:27Z) - The Last Fingerprint: How Markdown Training Shapes LLM Prose [0.0]
私たちは、エムダッシュが散文にマークダウンリークしていることを提案します。
トレーニングデータ構成,構造的内部化,エムダッシュの二重登録状態,訓練後の増幅を結合する5段階の系譜を提案する。
論文 参考訳(メタデータ) (2026-03-27T21:42:06Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Understanding Model Robustness to User-generated Noisy Texts [2.958690090551675]
NLPでは、スペルエラーなどの自然発生ノイズによってモデル性能が劣化することが多い。
本稿では,文法的誤り訂正コーパスから統計的に誤りをモデル化する。
論文 参考訳(メタデータ) (2021-10-14T14:54:52Z) - Preventing Posterior Collapse with Levenshtein Variational Autoencoder [61.30283661804425]
我々は,エビデンス・ロー・バウンド(ELBO)を最適化し,後部崩壊を防止できる新しい目的に置き換えることを提案する。
本稿では,Levenstein VAEが後方崩壊防止のための代替手法よりも,より情報的な潜伏表現を生成することを示す。
論文 参考訳(メタデータ) (2020-04-30T13:27:26Z) - REST: Robust and Efficient Neural Networks for Sleep Monitoring in the
Wild [62.36144064259933]
ニューラルネットワークの逆トレーニングとLipschitz定数の制御を通じて、両問題に同時に対処する新しい方法であるRESTを提案する。
私たちは、RESTがノイズの存在下で、オリジナルのフルサイズのモデルを大幅に上回る、ロバストで効率的なモデルを生成することを実証しています。
これらのモデルをスマートフォン上のAndroidアプリケーションにデプロイすることにより、RESTによってモデルが最大17倍のエネルギー削減と9倍高速な推論を達成することができることを定量的に観察する。
論文 参考訳(メタデータ) (2020-01-29T17:23:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。