論文の概要: A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models
- arxiv url: http://arxiv.org/abs/2607.00946v1
- Date: Wed, 01 Jul 2026 13:46:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.920992
- Title: A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models
- Title(参考訳): 音声合成モデルにおける構成可能な感情ステアリングの幾何学的視点
- Abstract要約: 本稿では,混合感情音声合成のためのアクティベーションステアリングサイトとして,言語モデル(SLM)と条件付きフローマッチングモジュールの比較を行った。
以上の結果から,SLMは低次元のクリーンで低次元の感情特異的な部分空間であり,CFMは話者・感情の絡み合いによる低次元のクロススピーカーの一般化を示した。
- 参考スコア(独自算出の注目度): 17.011586874604742
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While prior work has explored emotion control in hybrid text-to-speech systems, the geometric properties of these modules, and their implications for steerability, remain poorly understood. We present the first comparative study of speech language model (SLM) and conditional flow-matching (CFM) modules as activation steering sites for mixed emotion speech synthesis. We first characterize emotion representations using linear probing and local intrinsic dimensionality (LID), and then evaluate single-site and joint steering for mixed-emotion synthesis. Our results show that SLM offers a clean, low-dimensional emotion-specific subspace with strong speaker--emotion disentanglement, while CFM exhibitspoor cross-speaker generalization due to speaker--emotion entanglement. Joint steering increases emotion intensity but degrades proportional control and speech quality on in-distribution data. These findings provide practical guidance for multi-site activation steering in hybrid TTS systems and highlight the importance of representation geometry in controllable speech generation.
- Abstract(参考訳): 従来の研究は、ハイブリッド音声合成システムにおける感情制御を探求してきたが、これらのモジュールの幾何学的性質と、その聴取性への影響は、いまだに理解されていない。
本稿では,混合感情音声合成のためのアクティベーションステアリングサイトとして,言語モデル(SLM)と条件付きフローマッチング(CFM)モジュールの比較を行った。
まず、線形探索と局所内在性次元(LID)を用いて感情表現を特徴付け、その後、混合感情合成のための単一部位および関節ステアリングを評価する。
以上の結果から,SLMは低次元のクリーンで低次元の感情特異的な部分空間であり,CFMは話者・感情の絡み合いによる低次元のクロススピーカーの一般化を示した。
ジョイントステアリングは感情強度を増加させるが、分配データの比例制御と音声品質を低下させる。
これらの知見は、ハイブリッドTSシステムにおけるマルチサイトアクティベーションステアリングのための実用的なガイダンスを提供し、制御可能な音声生成における表現幾何学の重要性を強調している。
関連論文リスト
- EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation [51.04910642896281]
会話におけるマルチモーダル感情認識(MERC)は、対話に多モーダル情報と文脈情報を統合することで正確な予測を行う。
現在のMERCアプローチは、情動シフトにおける文脈的感情的慣性の影響を見落とし、準最適パフォーマンスをもたらす。
本研究では, 時間的ウィンドウ内に慣性の影響のあるサンプルを構築することで, コントラスト学習モジュール (EII-SCL) を提案する。
論文 参考訳(メタデータ) (2026-07-19T18:09:54Z) - Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS [61.29502937013759]
声道運動と調音疑似ラベルで訓練されたフローマッチングに基づく音声合成モデルを提案する。
提案モデルでは,声の努力や調音の連続的・不整合的な制御を実現するとともに,発話の特定のセグメントを明確にするための単語レベルの強調を可能にする。
論文 参考訳(メタデータ) (2026-06-22T11:14:22Z) - Sparse Autoencoders for Interpretable Emotion Control in Text-to-Speech [11.976178882036466]
我々は,大規模言語モデル (LLM) に基づく音声合成システムにおける意味的隠蔽状態の感情関連変動を分析した。
分析の結果、感情の変化は複数のスパースな潜在特徴に分散し、小さなサブセットに介入することで、解釈可能な感情制御が可能であることが判明した。
バックボーンパラメータを変更することなく、双方向の感情誘導と抑制のための特徴レベル介入フレームワークを導入する。
論文 参考訳(メタデータ) (2026-05-31T22:39:45Z) - ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment [52.31881685769569]
ImmersiveTTSは環境コンテキストにシームレスに統合された自然な音声を生成する環境対応テキスト音声合成(TTS)モデルである。
本モデルは,マルチモーダル拡散変換器上に構築され,テキスト条件付き環境コンテキストでテキスト対応音声を融合する。
実験結果から,ImmersiveTTSは既存手法よりも自然性,知性,音声の忠実度が高いことがわかった。
論文 参考訳(メタデータ) (2026-05-29T07:58:54Z) - CoCoEmo: Composable and Controllable Human-Like Emotional TTS via Activation Steering [25.10244503397448]
人間の言論における感情表現はニュアンス的で構成的であり、しばしば複数の矛盾する感情的な手がかりを含む。
ほとんどの表現力のあるテキスト音声システムは、単一の発話レベルの感情を強制し、感情の多様性を崩壊させ、混合あるいはテキスト感情のミスマッチした表現を抑制する。
本稿では,構成可能な混合感情合成と信頼性のあるテキスト感情ミスマッチ合成を可能にする定量的かつ制御可能なステアリングフレームワークとマルチレータ評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-02-03T11:45:00Z) - Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement [37.959531845352274]
実験結果から,本手法は自然な,感情的に豊かな音声を生成する上で,ベースラインTSシステムよりも優れていた。
この研究は、感情的なTSシステムの品質と柔軟性を向上する上で、絡み合った、きめ細かな表現の可能性を強調している。
論文 参考訳(メタデータ) (2025-10-02T07:03:50Z) - Contrastive Decoupled Representation Learning and Regularization for Speech-Preserving Facial Expression Manipulation [58.189703277322224]
音声保存表情操作(SPFEM)は、特定の参照感情を表示するために話頭を変更することを目的としている。
参照およびソース入力に存在する感情とコンテンツ情報は、SPFEMモデルに対して直接的かつ正確な監視信号を提供することができる。
コントラスト学習による指導として、コンテンツと感情の事前学習を提案し、分離されたコンテンツと感情表現を学習する。
論文 参考訳(メタデータ) (2025-04-08T04:34:38Z) - GatedxLSTM: A Multimodal Affective Computing Approach for Emotion Recognition in Conversations [35.63053777817013]
GatedxLSTMは、会話におけるマルチモーダル感情認識(ERC)モデルである。
話者と会話相手の双方の声と書き起こしを考慮し、感情的なシフトを駆動する最も影響力のある文章を特定する。
4クラスの感情分類において,オープンソース手法間でのSOTA(State-of-the-art)性能を実現する。
論文 参考訳(メタデータ) (2025-03-26T18:46:18Z) - UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts [64.02363948840333]
UMETTSは、複数のモーダルからの感情的手がかりを利用して、表現力が高く感情的に共鳴する音声を生成する新しいフレームワークである。
EP-Alignは対照的な学習を用いて、テキスト、オーディオ、視覚的モダリティをまたいだ感情的特徴を整合させ、マルチモーダル情報のコヒーレントな融合を保証する。
EMI-TTSは、アライメントされた感情埋め込みと最先端のTSモデルを統合し、意図した感情を正確に反映した音声を合成する。
論文 参考訳(メタデータ) (2024-04-29T03:19:39Z) - Attention-based Interactive Disentangling Network for Instance-level
Emotional Voice Conversion [81.1492897350032]
感情音声変換(Emotional Voice Conversion)は、非感情成分を保存しながら、与えられた感情に応じて音声を操作することを目的とする。
本稿では,音声変換にインスタンスワイドな感情知識を活用する,意図に基づく対話型ディスタングネットワーク(AINN)を提案する。
論文 参考訳(メタデータ) (2023-12-29T08:06:45Z) - ZET-Speech: Zero-shot adaptive Emotion-controllable Text-to-Speech
Synthesis with Diffusion and Style-based Models [83.07390037152963]
ZET-Speech はゼロショット適応型 TTS モデルである。
ユーザは、短い中性音声セグメントとターゲットの感情ラベルのみを使用して、任意の話者の感情音声を合成することができる。
実験の結果,ZET-Speechは自然音声と感情音声の合成に成功していることがわかった。
論文 参考訳(メタデータ) (2023-05-23T08:52:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。