論文の概要: Tracing a Sparse Emotion-Control Circuit in LLM-Based Text-to-Speech
- arxiv url: http://arxiv.org/abs/2610.05080v1
- Date: Sun, 04 Oct 2026 09:24:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 23:38:14.477719
- Title: Tracing a Sparse Emotion-Control Circuit in LLM-Based Text-to-Speech
- Title(参考訳): LLM音声音声におけるスパース感情制御回路の追跡
- Abstract要約: LLMベースのテキスト音声モデルは感情的に表現的な音声を生成することができる。
参照感情がモデルを通してどのようにルートされ、デコードされた音声で実現されるかは、まだ不明である。
- 参考スコア(独自算出の注目度): 10.108585415754623
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based text-to-speech (TTS) models can generate emotionally expressive speech, but how reference emotion is routed through the model and realized in decoded speech remains unclear. We introduce two emotion-sensitive metrics for matched neutral and emotional syntheses---a codec trajectory score and a late residual direction score---and use them to score activation-patching interventions. Under controlled matched-reference conditions, this analysis identifies a sparse source-to-readout component-level circuit: 23--27 attention heads and MLPs per emotion, roughly 5% of the components considered, recover or suppress 74--88% of the late emotion-readout shift on held-out cases. The circuit combines a shared component backbone with emotion-specific components; cross-emotion activation swaps reduce the target readout in 47 of 48 cases. In decoded speech, the same intervention produces consistent changes in pitch, energy, and spectral brightness over 24 matched pairs per emotion. A readout-matched residual-direction baseline produces only 17--27% of the intervention's pitch effect, showing that internal readout movement alone does not explain the decoded acoustic changes. These results trace a compact causal route from reference-derived prefix information to emotion-relevant properties of generated speech.
- Abstract(参考訳): LLM-based text-to-speech (TTS) モデルは感情表現型音声を生成することができるが、どのように参照感情がモデルを通してルーティングされ、デコードされた音声で実現されるかは未だ不明である。
一致した中性・感情的な合成のための2つの感情感受性指標、コーデック軌跡スコアと遅延残留方向スコアを導入し、それらを用いてアクティベーション・パッチング介入を評価する。
制御された一致参照条件下では、この分析は、23-27の注目ヘッドと感情毎のMLP、約5%のコンポーネントが考慮され、回復し、または抑制される、緩やかなソース対読み出しコンポーネントレベル回路を識別する。
回路は、共有コンポーネントのバックボーンと感情固有のコンポーネントを組み合わせる。
復号音声では、同じ介入により、24対の感情に対してピッチ、エネルギー、スペクトルの明るさが一貫した変化を生じる。
リードアウト整合残留方向ベースラインは、介入のピッチ効果の17~27%しか生成せず、内部のリードアウト運動だけではデコードされた音響変化を説明できない。
これらの結果は、参照由来のプレフィックス情報から生成された音声の感情関連特性まで、コンパクトな因果経路を辿る。
関連論文リスト
- EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis [1.5803208833562954]
EmotionAIは完全にローカルな計算インテリジェンスパイプラインで、音声認識と生成的推論を結合する。
話者ダイアリゼーション、Whisper Automatic Speech Recognition (ASR)、およびwav2vec2感情分類器は、セグメントごとの感情的証拠を生成する。
このコントリビューションは最先端のSERではなく、不完全な感情的証拠を監査可能なプライバシー保護の基盤となる会話分析に統合したものだ。
論文 参考訳(メタデータ) (2026-06-22T20:45:49Z) - AIPsy-Affect: A Keyword-Free Clinical Stimulus Battery for Mechanistic Interpretability of Emotion in Language Models [0.0]
AIPsy-Affect(エイプシー・アフエフェクト)は480イテムの臨床刺激電池で、刺激レベルのコンファウンドを除去する。
線形プローブ、アクティベーションパッチ、SAE特徴解析、因果アブレーション、ステアリングベクトル抽出をサポートする。
論文 参考訳(メタデータ) (2026-04-26T14:03:55Z) - Causal Prosody Mediation for Text-to-Speech:Counterfactual Training of Duration, Pitch, and Energy in FastSpeech2 [0.0]
本稿では,音声合成のための因果韻律調律フレームワークを提案する。
我々のアプローチは、明示的な感情条件付けでFastSpeech2アーキテクチャを拡張します。
我々は、話者間で感情を伝達する際に、より優れた知性(低WER)と話者の一貫性を観察する。
論文 参考訳(メタデータ) (2026-03-12T08:48:01Z) - VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs [54.75016325571445]
音声大言語モデル (LLM) は, 音声の感情認識において, 生成インタフェースを介する大きな可能性を示す。
クローズドセットからオープンテキスト生成へのシフトは、ゼロショット性を導入し、プロンプトに非常に敏感な評価を与える。
本稿では,VoxEmoについて紹介する。VoxEmoは音声LLMのための15言語に35の感情コーパスを含む総合的なSERベンチマークである。
論文 参考訳(メタデータ) (2026-03-09T21:10:34Z) - ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools -- From Consensus Learning to Ambiguity-Driven Emotion Reasoning [67.22219034602514]
ADEPT(Agentic Decoding of Emotion via Evidence Probing Tools)は,感情認識をマルチターン探索プロセスとして再構成するフレームワークである。
ADEPTはSLLMを進化する候補感情を維持するエージェントに変換し、専用のセマンティックおよび音響探査ツールを適応的に呼び出す。
ADEPTは、ほとんどの設定において主感情の精度を向上し、微妙な感情の特徴を著しく改善することを示した。
論文 参考訳(メタデータ) (2026-02-13T08:33:37Z) - Plug-and-Play Emotion Graphs for Compositional Prompting in Zero-Shot Speech Emotion Recognition [3.1649536621597973]
大規模音声言語モデル(LALM)は、音声タスク全体で強いゼロショット性能を示すが、音声感情認識(SER)に苦慮している。
そこで我々は,感情推論におけるLALMを微調整なしでガイドするための,感情推論のためのCCoT-Emo(Compositional Chain-of-Thought Prompting for Emotion Reasoning)を提案する。
論文 参考訳(メタデータ) (2025-09-29T20:06:03Z) - DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech [49.128847336227636]
音声合成における話者間感情伝達は、正確な感情モデリングのための話者非依存感情埋め込みの抽出に依存する。
本研究では,感情情報の損失を最小限に抑え,話者のアイデンティティを保持する自己教師型蒸留法であるDiEmo-TTSを提案する。
論文 参考訳(メタデータ) (2025-05-26T08:47:39Z) - Attention-based Interactive Disentangling Network for Instance-level
Emotional Voice Conversion [81.1492897350032]
感情音声変換(Emotional Voice Conversion)は、非感情成分を保存しながら、与えられた感情に応じて音声を操作することを目的とする。
本稿では,音声変換にインスタンスワイドな感情知識を活用する,意図に基づく対話型ディスタングネットワーク(AINN)を提案する。
論文 参考訳(メタデータ) (2023-12-29T08:06:45Z) - Textless Speech Emotion Conversion using Decomposed and Discrete
Representations [49.55101900501656]
我々は、音声を、コンテンツ単位、F0、話者、感情からなる離散的、非絡み合いの学習表現に分解する。
まず、内容単位を対象の感情に翻訳し、その単位に基づいて韻律的特徴を予測することによって、音声内容を変更する。
最後に、予測された表現をニューラルボコーダに入力して音声波形を生成する。
論文 参考訳(メタデータ) (2021-11-14T18:16:42Z) - VAW-GAN for Disentanglement and Recomposition of Emotional Elements in
Speech [91.92456020841438]
変分自己符号化ワッサーシュタイン生成対向ネットワーク(VAW-GAN)による音声の感情要素のアンタングル化と再分解について検討する。
本稿では,2つのVAW-GANパイプライン,1つはスペクトル変換,もう1つは韻律変換を含む話者依存型ECVフレームワークを提案する。
提案手法の有効性を客観評価と主観評価の両方で検証した。
論文 参考訳(メタデータ) (2020-11-03T08:49:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。