論文の概要: Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
- arxiv url: http://arxiv.org/abs/2609.01246v1
- Date: Tue, 01 Sep 2026 13:44:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.691148
- Title: Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
- Title(参考訳): TTS対応テキスト生成のためのLLMの調整
- Authors: Thibaut Thonet, Jos Rozen, Laurent Besacier,
- Abstract要約: 現在のLarge Language Models (LLMs) は主にテキストに最適化されており、文法的に正しいが、テキスト・トゥ・スペーチ(TTS)による音声配信には適さない出力を生成することが多い。
本研究では, LLM が TTS に優しいテキストを生成する方法について検討する。
我々は、異なるターゲットドメインにまたがる2つの選好データセット、CORAとRecipeを導入する。
- 参考スコア(独自算出の注目度): 16.8983983115275
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Current Large Language Models (LLMs) are primarily optimized for written text, often producing outputs that are grammatically correct and helpful yet poorly suited for spoken delivery via Text-to-Speech (TTS). In this work, we study how to make LLMs natively generate TTS-friendly text, which we frame as a preference alignment problem: instead of relying on downstream rewriting modules, we directly align LLMs to generate text optimized for spoken delivery. We introduce two preference datasets spanning different target domains, CORA and Recipe, which contain paired TTS-friendly and TTS-unfriendly responses. We further propose an evaluation suite combining a pattern-based heuristic metric, a TTS$\to$ASR evaluation pipeline, and a MUSHRA listening study with human judges. Our experiments compare the recently proposed Feature-aware Sampling and Tuning (FaST) framework -- leveraging interpretable features instead of a black-box reward model -- against an array of alignment baselines on the TTS-friendly generation task. Notably, we found that FaST achieves the best overall tradeoff between TTS-friendliness and helpfulness across various settings. We also identified a strong correlation between our different metrics, highlighting the ability to reliably assess TTS-friendliness via an efficient heuristic.
- Abstract(参考訳): 現在のLarge Language Models (LLM) は主にテキストに最適化されており、文法的に正しいが、テキスト・トゥ・スペーチ (TTS) による音声配信には適さない出力を生成することが多い。
そこで本研究では,LLMを音声配信に最適化したテキストを生成するために,下流の書き換えモジュールに頼らず,直接LLMをアライメントすることで,TTSフレンドリなテキストをネイティブに生成する方法について検討する。
我々は、異なるターゲットドメインにまたがる2つの選好データセット、CORAとRecipeを導入する。
さらに,パターンに基づくヒューリスティック・メトリック,TS$\to$ASR評価パイプライン,およびMUSHRA聴取実験を組み合わせた評価スイートを提案する。
我々の実験は、最近提案されたFeature-Aware Sampling and Tuning (FaST)フレームワーク(ブラックボックス報酬モデルの代わりに解釈可能な機能を活用する)と、TSフレンドリーな生成タスクのアライメントベースラインの配列を比較した。
特に、FaSTは、TSフレンドリさと様々な設定における有用性の間で、最高の全体的なトレードオフを達成できることがわかった。
また、異なるメトリクス間の強い相関関係も確認し、効率的なヒューリスティックによってTS-フレンドリ性を確実に評価する能力を強調しました。
関連論文リスト
- Revisiting Direct Speech-to-Text Translation with Speech LLMs: Better Scaling than CoT Prompting? [13.202203902821333]
音声からテキストへの変換(S2TT)データの増加にともなって,Chain-of-Thought(CoT)とDirect prompting(ダイレクトプロンプト)を体系的に比較した。
以上の結果から,データ量の増加に伴いDirectはより一貫した改善を行い,より大きなS2TTリソースが生成されるにつれて,より効果的なアプローチになる可能性が示唆された。
論文 参考訳(メタデータ) (2025-10-03T15:23:32Z) - EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge [25.51206687438354]
我々は6つのTSシナリオをカバーする包括的なベンチマークである$textitEmergentTTS-Evalを紹介した。
我々のフレームワークはテストケースの生成と評価の両方を自動化するので、ベンチマークが容易にアクセスできます。
我々は、EmergentTTS-Eval上で、11Labs、Deepgram、OpenAIの4o-mini-TTSといった最先端のオープンソースおよびプロプライエタリなTSシステムを評価した。
論文 参考訳(メタデータ) (2025-05-29T02:36:24Z) - TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling [46.60911294356232]
本稿では,テキスト適応型音声トークン化と埋め込み(TASTE)を導入し,トークン化段階における音声トークンと対応するテキストの書き起こしを一致させる。
我々は広範囲な実験を行い、TASTEはトークン列の長さを劇的に減らしながら重要なパラ言語情報を保持することができることを示す。
実験の結果,TASTEを用いたSLMはSALMONやStoryClozeに匹敵する性能を示した。
論文 参考訳(メタデータ) (2025-04-09T17:14:33Z) - Evaluating Text Style Transfer Evaluation: Are There Any Reliable Metrics? [9.234136424254261]
テキスト・スタイル・トランスファー(テキスト・スタイル・トランスファー、英: Text style transfer、TST)は、テキストを変換して、元のコンテンツを保持しながら特定のスタイルを反映するタスクである。
人間の評価は理想的であるが、他の自然言語処理(NLP)タスクと同様にコストがかかる。
本稿では,TST評価のためのNLPタスクから,既存のメトリクスと新しいメトリクスのセットについて検討する。
論文 参考訳(メタデータ) (2025-02-07T07:39:17Z) - Preference Alignment Improves Language Model-Based TTS [76.70693823683091]
選好アライメントアルゴリズムは、報酬モデルの嗜好に合わせてLMを調整し、生成されたコンテンツの望ましさを高める。
1.15B のパラメータ LM に基づく TTS モデルを用いて、嗜好の整合性は常に知性、話者類似性、代用主観的評価スコアを向上することを示した。
論文 参考訳(メタデータ) (2024-09-19T01:58:19Z) - Blending LLMs into Cascaded Speech Translation: KIT's Offline Speech Translation System for IWSLT 2024 [61.189875635090225]
大規模言語モデル (LLM) は現在,自動音声認識 (ASR) や機械翻訳 (MT) ,さらにはエンドツーエンド音声翻訳 (ST) など,さまざまなタスクを探索中である。
論文 参考訳(メタデータ) (2024-06-24T16:38:17Z) - Prefix Text as a Yarn: Eliciting Non-English Alignment in Foundation Language Model [50.339632513018934]
教師付き微調整(SFT)は、基礎大言語モデル(LLM)の出力を特定の嗜好に合わせるための単純なアプローチである。
我々はこの仮説を言語間タスクの範囲内で批判的に検証する。
タスク関連トークンを最小化するPreTTYという新しいトレーニングフリーアライメント手法を提案する。
論文 参考訳(メタデータ) (2024-04-25T17:19:36Z) - Speech Translation with Large Language Models: An Industrial Practice [64.5419534101104]
LLM-STは,事前学習型大言語モデル(LLM)に基づいて構築された,新規で効果的な音声翻訳モデルである。
大規模言語モデル(LLM)を音声エンコーダと統合し、マルチタスクの命令チューニングを利用することで、LLM-STは正確なタイムスタンプと翻訳を生成することができる。
英語と中国語のデータセットの厳密な実験を通じて,LLM-STの異常な性能を示す。
論文 参考訳(メタデータ) (2023-12-21T05:32:49Z) - Improving Text Generation with Student-Forcing Optimal Transport [122.11881937642401]
トレーニングモードとテストモードで生成されたシーケンスに最適なトランスポート(OT)を提案する。
テキストシーケンスの構造的および文脈的情報に基づいて、OT学習を改善するための拡張も提案されている。
提案手法の有効性は,機械翻訳,テキスト要約,テキスト生成タスクにおいて検証される。
論文 参考訳(メタデータ) (2020-10-12T19:42:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。