論文の概要: Steering Follows Geometry, Not Labels: Emotion Directions in a Full-Duplex Speech Model
- arxiv url: http://arxiv.org/abs/2610.08887v1
- Date: Tue, 06 Oct 2026 15:29:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.525496
- Title: Steering Follows Geometry, Not Labels: Emotion Directions in a Full-Duplex Speech Model
- Title(参考訳): ステアリングはラベルではなく幾何学を追従する:全二重音声モデルにおける感情方向
- Abstract要約: モシの残射流から感情が直線的に退避可能であることを示すが,アクティベーションステアリングは部分的には達成できない。
また、3つの感情が全ての感情から平等に投影できないことを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Full-duplex voice agents need to modulate emotion and delivery during real-time conversations, when de-escalating a complaint, carrying urgency in dispatch, softening a clinical result. Emotion and delivery control is well studied for TTS and turn based models through prompt-conditioned synthesis, reference-conditioned synthesis and activation steering; PersonaPlex controls identity in a duplex model but not affect. We study emotion steering in Moshi, a fully open sourced full-duplex speech language model, across four emotions, using mean-difference activation steering, which costs only a few vector additions per frame and no retraining. We show that emotion is linearly decodable from Moshi's residual stream, but activation steering is only partially achievable, and unevenly so; as happy, angry and surprise steer towards a shared direction while sad is distinctly steerable. We also show that the shared component across the three emotions cannot simply be projected away from all the emotions equally.
- Abstract(参考訳): フルデュプレックス音声エージェントは、苦情をエスカレートし、ディスパッチに緊急性を持ち、臨床結果を軟化する際に、リアルタイムの会話中に感情や配信を調節する必要がある。
TTSやターンベースモデルでは、即時条件付き合成、参照条件付き合成、アクティベーションステアリングを通じて感情とデリバリの制御がよく研究されている。
完全オープンソースの全二重言語モデルであるMoshiにおける感情ステアリングについて,平均差アクティベーションステアリングを用いて検討した。
モシの残流から感情が直線的に退避可能であることを示すが、アクティベーションステアリングは部分的には達成可能であり、不均一である。
また、3つの感情にまたがる共有コンポーネントは、すべての感情から平等に投影できないことも示しています。
関連論文リスト
- EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis [9.119202339209307]
EmoInstruct-TTSは感情音声合成のためのデュアルパス命令誘導フレームワークである。
Emo2embedは48の感情状態をカバーする教師付き意味音響的感情埋め込みである。
論文 参考訳(メタデータ) (2026-06-08T06:54:55Z) - CoCoEmo: Composable and Controllable Human-Like Emotional TTS via Activation Steering [25.10244503397448]
人間の言論における感情表現はニュアンス的で構成的であり、しばしば複数の矛盾する感情的な手がかりを含む。
ほとんどの表現力のあるテキスト音声システムは、単一の発話レベルの感情を強制し、感情の多様性を崩壊させ、混合あるいはテキスト感情のミスマッチした表現を抑制する。
本稿では,構成可能な混合感情合成と信頼性のあるテキスト感情ミスマッチ合成を可能にする定量的かつ制御可能なステアリングフレームワークとマルチレータ評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-02-03T11:45:00Z) - Do LLMs "Feel"? Emotion Circuits Discovery and Control [54.57583855608979]
本研究では、感情表現を引き起こす内部メカニズムと、生成したテキストにおける感情の制御について検討する。
これは、大きな言語モデルで感情回路を発見し、検証する最初の体系的な研究である。
論文 参考訳(メタデータ) (2025-10-13T12:24:24Z) - EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering [40.298056212942726]
EmoSteer-TTSは、きめ細かい音声感情制御を実現するための、新しい訓練不要のアプローチである。
EmoSteer-TTSは、音声感情のきめ細かな、解釈可能な、連続的な制御を可能にし、最先端(SOTA)よりも優れている
論文 参考訳(メタデータ) (2025-08-05T15:12:49Z) - DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech [49.128847336227636]
音声合成における話者間感情伝達は、正確な感情モデリングのための話者非依存感情埋め込みの抽出に依存する。
本研究では,感情情報の損失を最小限に抑え,話者のアイデンティティを保持する自己教師型蒸留法であるDiEmo-TTSを提案する。
論文 参考訳(メタデータ) (2025-05-26T08:47:39Z) - UDDETTS: Unifying Discrete and Dimensional Emotions for Controllable Emotional Text-to-Speech [61.989360995528905]
制御可能な感情的TTSのための離散的感情と次元的感情を統一する普遍的なフレームワークであるUDDETTSを提案する。
このモデルは、次元的感情記述のための解釈可能なArousal-Dominance-Valence(ADV)空間を導入し、離散的な感情ラベルまたは非線形に定量化されたADV値によって駆動される感情制御をサポートする。
実験の結果, UDDETTSは3次元の線形感情制御を実現し, エンドツーエンドの感情音声合成能力に優れていた。
論文 参考訳(メタデータ) (2025-05-15T12:57:19Z) - EmoKnob: Enhance Voice Cloning with Fine-Grained Emotion Control [7.596581158724187]
EmoKnob(エモノブ)は、任意の感情の少数の実証的なサンプルを用いて、音声合成におけるきめ細かい感情制御を可能にするフレームワークである。
我々の感情制御フレームワークは、音声に感情を効果的に埋め込んで、商用TTSサービスの感情表現性を超越していることを示す。
論文 参考訳(メタデータ) (2024-10-01T01:29:54Z) - Attention-based Interactive Disentangling Network for Instance-level
Emotional Voice Conversion [81.1492897350032]
感情音声変換(Emotional Voice Conversion)は、非感情成分を保存しながら、与えられた感情に応じて音声を操作することを目的とする。
本稿では,音声変換にインスタンスワイドな感情知識を活用する,意図に基づく対話型ディスタングネットワーク(AINN)を提案する。
論文 参考訳(メタデータ) (2023-12-29T08:06:45Z) - Speech Synthesis with Mixed Emotions [77.05097999561298]
異なる感情の音声サンプル間の相対的な差を測定する新しい定式化を提案する。
次に、私たちの定式化を、シーケンスからシーケンスまでの感情的なテキストから音声へのフレームワークに組み込む。
実行時に、感情属性ベクトルを手動で定義し、所望の感情混合を生成するためにモデルを制御する。
論文 参考訳(メタデータ) (2022-08-11T15:45:58Z) - Emotion Intensity and its Control for Emotional Voice Conversion [77.05097999561298]
感情音声変換(EVC)は、言語内容と話者のアイデンティティを保ちながら、発話の感情状態を変換しようとする。
本稿では,感情の強さを明示的に表現し,制御することを目的とする。
本稿では,話者スタイルを言語内容から切り離し,連続した空間に埋め込み,感情埋め込みのプロトタイプを形成するスタイルに符号化することを提案する。
論文 参考訳(メタデータ) (2022-01-10T02:11:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。