論文の概要: Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment
- arxiv url: http://arxiv.org/abs/2607.08256v1
- Date: Thu, 09 Jul 2026 09:01:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.477825
- Title: Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment
- Title(参考訳): ASRファミリーアライメントによるTTS評価のBest-of-N$
- Abstract要約: Best-of-N$推論はゼロショットテキスト音声におけるコンテントの一貫性を改善する。
検証者の明らかな品質は、ASRファミリーの判断に強く依存する。
- 参考スコア(独自算出の注目度): 0.42254522489176316
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Best-of-$N$ (BoN) inference improves content consistency in zero-shot text-to-speech by selecting from $N$ candidates with an automatic speech recognition (ASR) verifier. We identify an underexplored evaluation confound: a verifier's apparent quality depends strongly on which ASR family judges it. On LibriSpeech-PC test-clean~\citep{librispeechpc} with F5-TTS~\citep{f5tts}, verifier rankings reverse across Whisper, wav2vec~2.0, and HuBERT evaluators, and same-family verifier-evaluator pairs recover 2-3$\times$ more oracle headroom than cross-family pairs despite near-identical representations (linear CKA $0.978$) -- a pattern consistent with identity- or lineage-level coupling rather than representational overlap. We propose two \textbf{cross-family rank ensembles} (rank-averaging and conjunctive max-rank) that attain the lowest mean WER across three independent evaluators -- $1.61\%$ at $N{=}10$ ($-12\%$ relative to F5-TTS) -- with no measurable degradation under automatic SIM-o/UTMOS metrics; the best single verifier drives WER from $2.06\%$ to $1.72\%$ ($-16.5\%$) under the official F5-TTS evaluator. We recommend cross-evaluator triangulation as default reporting practice.
- Abstract(参考訳): Best-of-N$ (BoN)推論は、自動音声認識(ASR)検証器でN$候補から選択することで、ゼロショットテキスト音声におけるコンテントの一貫性を向上させる。
検証者の明らかな品質は、ASRファミリーの判断に強く依存する。
LibriSpeech-PC test-clean~\citep{librispeechpc} with F5-TTS~\citep{f5tts}, verifier rankings reverse across Whisper, wav2vec~2.0, and HuBERT evaluator, and same- Family verifier-evaluator pairs recovery 2-3\times$ more oracle headroom than cross- Family pairs (linear CKA $0.978$) -- このパターンは、表現の重なりよりもアイデンティティや階層レベルの結合に一貫性がある。
1.61 %$ at $N{=}10$$$-12\%$(F5-TTS) -- 自動SIM-o/UTMOS測定値による測定可能な劣化を伴わず、WERを2.06 %から1.72 %$$(-16.5 %$)まで、公式なF5-TTS評価値の下で駆動する。
我々は、デフォルトレポートのプラクティスとして、クロス評価器の三角測量を推奨する。
関連論文リスト
- Reference-Based Bias Detection in LLMs via Relative Representations of Hidden States [4.505185728893222]
本稿では,関連するモデル変種にまたがる隠れ状態表現のバイアスを監査する参照ベース手法を提案する。
微調整されたリサップ表現幾何学のため、絶対的な隠れ状態は直接的に同値ではない。
対象群が正・負の属性とどのように関連するかを測定する。
論文 参考訳(メタデータ) (2026-09-09T11:33:35Z) - Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation [51.56484100374058]
以前の作業では、アクティブフィルタの背後にライブのGeminiバックエンドを追加することで、測定可能なカバレッジが得られなかった。
L_4$-real(Gemini-2.5-flash, token-budget cap, rate limit, output scrub)と同様の$L_5$-no-regexを導入するが、9パターンフィルタは無効である。
3つのサブ言語にまたがる敵対的プローブに対して評価を行った。
論文 参考訳(メタデータ) (2026-06-12T18:54:24Z) - $τ$-Rec: A Verifiable Benchmark for Agentic Recommender Systems [6.146935144379057]
$$-Recはエージェントレコメンデーションシステムのベンチマークである。
主観評価を、検証可能な報酬と明らかにタグ付けされた引き起こしメカニズムに置き換える。
$$-Recは一貫性のある推論のための体系的なテストを提供する。
論文 参考訳(メタデータ) (2026-06-08T20:35:45Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation [53.844308305341166]
単一パスのASRフロントエンドと意味的訂正,意図のルーティング,推論に基づく編集を組み合わせた閉ループフレームワークである textbfAgentic ASR を提案する。
複数言語、名前付き集中型、コードスイッチングベンチマークの実験は、反復的相互作用が意味的誤りを一貫して減少させることを示している。
論文 参考訳(メタデータ) (2026-05-28T06:23:31Z) - MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks [68.78064578688809]
MTR-Suiteは、監査、合成、ベンチマーク検索のための統合されたフレームワークである。
1)従来のベンチマークでアライメントギャップを定量化するためのLCMベースの監査装置であるMTR-Eval,(2)グリーディクラスタリングを用いたマルチエージェントシステムであるMTR-Pipeline,(3)厳格な一般ベンチマークであるMTR-Benchなどが特徴である。
論文 参考訳(メタデータ) (2026-05-20T05:26:35Z) - SimEval-IR: A Unified Toolkit and Benchmark Suite for Evaluating User Simulators and Search Sessions [1.1105673928718571]
オープンソースのツールキットとベンチマークスイートであるSimEval-IRについて述べる。
SimEval-IR は,(1) セッション検索と対話を統一する標準セッションスキーマ,(2) 行動リアリズム,RATE スタイルの推定によるテスタの信頼性,および2つの言語と4つのシミュレーターファミリーの4つの実データセットのベースライン結果に関する3つのベンチマークを提供する。
論文 参考訳(メタデータ) (2026-04-30T13:56:18Z) - Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations [4.032680910442999]
LLM-as-judge フレームワークは NLG の自動評価にますます利用されているが、そのインスタンスごとの信頼性はよく分かっていない。
SummEvalに応用した2段階の診断ツールキットについて述べる。 $textbf(1)$ 推移性解析により,低集合的違反率で隠蔽されるインプット毎の不整合の広範性を明らかにする。
4人の審査員と4つの基準で、どちらの診断も一致している。
論文 参考訳(メタデータ) (2026-04-16T17:58:21Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Probabilistically Tightened Linear Relaxation-based Perturbation Analysis for Neural Network Verification [83.25968588249776]
本稿では,LiRPAに基づく手法とサンプリングに基づく手法を組み合わせることで,厳密な中間到達性集合を計算できる新しいフレームワークを提案する。
無視可能な計算オーバーヘッドでは、$textttPT-LiRPA$は推定された到達可能な集合を利用し、ニューラルネットワークの出力の上下線形境界を著しく締め付ける。
論文 参考訳(メタデータ) (2025-07-07T18:45:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。