論文の概要: HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech
- arxiv url: http://arxiv.org/abs/2606.28249v1
- Date: Fri, 26 Jun 2026 16:35:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.541568
- Title: HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech
- Title(参考訳): HPRO:感情テキスト音声の優先抽出による階層的プログレッシブ・リワード最適化
- Abstract要約: 我々は,テキスト音声最適化のための階層的プログレッシブ報酬フレームワークHPROを紹介する。
HPROでは,HD-Emoを情報競合を解決するための新たな識別可能な報酬モデルとして紹介する。
この構造化された嗜好空間の上に構築されたHPROは、フレーム、単語、文レベルの目的を段階的に整列することで、スケールギャップを橋渡しする。
- 参考スコア(独自算出の注目度): 29.42691950362827
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, Large Language Model (LLM)-based Text-to-Speech (TTS) models have achieved remarkable naturalness. However, the standard Supervised Fine-Tuning paradigm often converges to statistically averaged prosody, limiting emotional expressiveness. While preference-driven optimization offers a promising alternative, existing approaches suffer from two structural mismatches: information conflict, where content and emotion in a shared latent space produce conflicting gradients, leading to reward hacking and semantic degradation; and scale gap, where sparse sentence-level rewards struggle to guide dense frame-level generation. To overcome these challenges, we propose HPRO, a hierarchical progressive reward optimization framework. Within HPRO, we introduce the HD-Emo codec as a novel differentiable reward model to resolve the information conflict. It extracts speech into distinct content and style preference tokens, structurally isolating emotional optimization from semantic content. Building upon this structured preference space, HPRO bridges the scale gap by progressively aligning frame-, word- and sentence-level objectives. Experiments demonstrate that HPRO significantly enhances emotional expressiveness, while effectively preserving linguistic intelligibility. The code and audio samples are publicly available at https://xxh333.github.io/hpro-demo/.
- Abstract(参考訳): 近年,Large Language Model (LLM) ベースの Text-to-Speech (TTS) モデルが顕著な自然性を実現している。
しかし、標準的なSupervised Fine-Tuningパラダイムは、しばしば統計的に平均化された韻律に収束し、感情的な表現性を制限する。
優先順位駆動最適化は有望な代替手段を提供するが、既存のアプローチでは、情報競合(information conflict)、共有潜在空間におけるコンテンツと感情が矛盾する勾配を生じ、ハックとセマンティックな劣化をもたらす、スケールギャップ(scal gap)という2つの構造的ミスマッチに悩まされている。
これらの課題を克服するために,階層的プログレッシブ報酬最適化フレームワークHPROを提案する。
HPROでは,HD-Emoコーデックを情報競合を解決するための新たな識別可能な報酬モデルとして紹介する。
音声を異なる内容とスタイルの嗜好トークンに抽出し、セマンティックコンテンツから感情的最適化を構造的に分離する。
この構造化された嗜好空間の上に構築されたHPROは、フレーム、単語、文レベルの目的を段階的に整列することで、スケールギャップを橋渡しする。
実験により,HPROは言語的知能を効果的に保ちながら,感情的表現性を著しく向上させることが示された。
コードとオーディオサンプルはhttps://xxh333.github.io/hpro-demo/で公開されている。
関連論文リスト
- CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models [66.56549019393042]
ビデオ言語モデル(VLM)は、強いマルチモーダル理解を実現するが、特に行動や時間秩序を推論する場合、幻覚を起こす傾向にある。
本稿では,シーンコンテキストを保ちながら,アクションや時間構造が異なる映像を合成する,対物映像生成のためのスケーラブルなフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-08T10:03:07Z) - Diverse Text-to-Image Generation via Contrastive Noise Optimization [60.48914865049489]
テキスト・ツー・イメージ(T2I)拡散モデルは高忠実度画像の生成において顕著な性能を示した。
既存のアプローチは通常、推論中に中間の潜伏状態やテキスト条件を最適化する。
本稿では,多様性問題に異なる視点から対処する簡易かつ効果的な手法であるContrastive Noise Optimizationを紹介する。
論文 参考訳(メタデータ) (2025-10-04T13:51:32Z) - Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization [5.96632248469088]
EASPO(Emotion-Aware Stepwise Preference Optimization, EASPO)は、拡散性TTSと微妙な感情的嗜好を中間認知ステップで一致させる学習後フレームワークである。
提案手法の中心となるのは、雑音の多い中間音声状態を記録し、自動選好ペア構築を可能にする時間条件付きモデルであるEASPMである。
実験は、表現性と自然性の両方において、既存の方法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2025-09-29T19:19:42Z) - Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model [76.06585781346601]
音声言語モデル(Speech LMs)は、単一のモデル内でエンドツーエンドの音声テキストモデリングを可能にする。
音声テキストの共同復号パラダイムの選択は、性能、効率、アライメント品質において重要な役割を担っている。
論文 参考訳(メタデータ) (2025-06-04T23:53:49Z) - InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO [73.33751812982342]
InfLVGは、追加のロングフォームビデオデータを必要としないコヒーレントなロングビデオ生成を可能にする推論時フレームワークである。
InfLVGはビデオ長を最大9$times$まで拡張でき、シーン間の一貫性とセマンティック忠実性を実現することができる。
論文 参考訳(メタデータ) (2025-05-23T07:33:25Z) - EmoPro: A Prompt Selection Strategy for Emotional Expression in LM-based Speech Synthesis [19.221477017213466]
音声合成モデルは、素早い入力に基づいて生成された音声の内容、音色、感情を制御することができる。
本稿では,感情制御可能な音声合成に特化して設計された2段階のプロンプト選択戦略であるEmoProを提案する。
論文 参考訳(メタデータ) (2024-09-27T07:46:52Z) - SpeechAlign: Aligning Speech Generation to Human Preferences [51.684183257809075]
本稿では,言語モデルと人間の嗜好を一致させる反復的自己改善戦略であるSpeechAlignを紹介する。
我々は、SpeechAlignが分散ギャップを埋め、言語モデルの継続的自己改善を促進することができることを示す。
論文 参考訳(メタデータ) (2024-04-08T15:21:17Z) - DurFlex-EVC: Duration-Flexible Emotional Voice Conversion Leveraging Discrete Representations without Text Alignment [34.19748360507656]
DurFlex-EVCは、テキストやアライメント情報を必要とせずに動作する、持続的フレキシブルなECVフレームワークである。
本稿では,テキスト・テキスト・アライメントの不要さを解消し,コンテントを表す個別の単位に音声をアライメントすることで,文脈情報をモデル化するユニット・アライメント手法を提案する。
また、音声の感情特性を正確に操作できるように、コンテンツと感情のスタイルを効果的に切り離すスタイルオートエンコーダを設計する。
論文 参考訳(メタデータ) (2024-01-16T03:39:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。