論文の概要: Conversation Coach: A Voice-enabled AI System that Helps Practice Difficult Workplace Conversations
- arxiv url: http://arxiv.org/abs/2609.00441v1
- Date: Mon, 31 Aug 2026 22:26:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.109767
- Title: Conversation Coach: A Voice-enabled AI System that Helps Practice Difficult Workplace Conversations
- Title(参考訳): 会話コーチ:職場での会話の難しさを実践するAIシステム
- Authors: Fanyou Wu, Suraj Maharjan, Ainur Yessenalina, Dennis Xu Chen, Rahul Srivastava, Srinivasan H. Sengamedu,
- Abstract要約: 本稿では,音声ファーストのAIシステムであるConversation Coachを提案する。
エンドツーエンドの音声合成モデルと,音声認識,大規模言語モデル,テキスト音声合成を組み合わせたケースドアプローチを比較した。
運用環境にカスケードアーキテクチャをデプロイし,6ヶ月で4万を越えるマネージャが使用しました。
- 参考スコア(独自算出の注目度): 4.641200603156741
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Effective manager-employee communication is critical for retaining high performers and developing underperformers, yet training managers in these skills remains costly. Text-based chatbots offer a scalable approach but cannot provide realistic rehearsal: managers need to practice speaking aloud to build confidence before high-stakes conversations. In this paper, we propose Conversation Coach, a voice-first AI system that enables managers to rehearse difficult workplace conversations in a realistic spoken format. The system addresses three challenges: achieving low-latency interactions with strong language understanding, enabling adaptive conversations through configurable bot personalities that simulate different employee types, and generating personalized feedback on content and policy compliance. We compare an end-to-end speech-to-speech model with a cascaded approach combining automatic speech recognition, a large language model, and text-to-speech synthesis. The end-to-end approach achieves 3$\times$ lower median (P50) latency with native barge-in capability at an estimated 8$\times$ lower cost, while the cascaded approach offers superior reasoning essential for coaching quality. We deployed the cascaded architecture in production, where 40,000+ managers used it over six months, with adoption patterns indicating selective use for difficult conversations.
- Abstract(参考訳): 効果的なマネージャと従業員のコミュニケーションは、ハイパフォーマーを維持し、パフォーマンスの低い人材を育成するために重要ですが、これらのスキルのトレーニングマネージャはコストがかかります。
テキストベースのチャットボットはスケーラブルなアプローチを提供するが、現実的なリハーサルを提供することはできない。
本稿では,経営陣が困難な職場会話を現実的な音声形式でリハーサルできるようにする音声ファーストAIシステムであるConversation Coachを提案する。
システムは3つの課題に対処する: 強い言語理解による低レイテンシなインタラクションの実現、異なる従業員タイプをシミュレートする設定可能なボットパーソナリティによる適応的な会話の実現、コンテンツとポリシーコンプライアンスに対するパーソナライズされたフィードバックの生成。
エンドツーエンドの音声合成モデルと,音声認識,大規模言語モデル,テキスト音声合成を組み合わせたケースドアプローチを比較した。
エンドツーエンドのアプローチでは、3$\times$低い中央値(P50)レイテンシと8$\times$低いコストでネイティブバージイン機能を実現する。
運用環境にカスケードアーキテクチャをデプロイし,6ヶ月で4万を越えるマネージャが使用しました。
関連論文リスト
- Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO [18.561388308227556]
雑音の多い社会環境における多話者音声対話モデリングのための音声フレームワークであるCocktail-Talkerを紹介する。
Cocktail-Talkerは教師付き微調整と強化学習によって訓練され、適切なアクショントークンを生成する。
また,LLMベースのデータパイプラインであるCocktail-DialogGenを開発した。
論文 参考訳(メタデータ) (2026-07-30T06:53:15Z) - Covo-Audio Technical Report [61.09708870154148]
7BバックエンドのLALMであるCovo-Audioは、連続的なオーディオ入力を直接処理し、単一の統一アーキテクチャ内でオーディオ出力を生成する。
対話指向の変種であるCovo-Audio-Chatは、意味的に強い会話能力を示す。
論文 参考訳(メタデータ) (2026-02-10T14:31:11Z) - F-Actor: Controllable Conversational Behaviour in Full-Duplex Models [70.48189107402145]
典型的な学術的制約下で効率的に訓練できる,第1にオープンかつ命令追従型全段階会話音声モデルを提案する。
我々のモデルは、大規模な事前訓練や多段階事前訓練に頼ることなく、わずか2000時間のデータしか必要としない。
モデルとトレーニングコードの両方がリリースされ、制御可能なフルステージ音声システムに関する再現可能な研究が可能になる。
論文 参考訳(メタデータ) (2026-01-16T14:25:57Z) - Chain-of-Thought Training for Open E2E Spoken Dialogue Systems [57.77235760292348]
エンド・ツー・エンド(E2E)音声対話システムは完全な識別性を保ち、非音声情報をキャプチャする。
我々は,多モーダル言語モデルと密接に一致した会話データによる学習を確実にするためのチェーン・オブ・シント(CoT)の定式化を提案する。
提案手法はベースラインよりも1.5ROUGE-1の改善を実現し,一般公開された人間と人間の会話データセット上で音声対話システムの訓練に成功している。
論文 参考訳(メタデータ) (2025-05-31T21:43:37Z) - How Managers Perceive AI-Assisted Conversational Training for Workplace Communication [6.329725088805596]
本研究では,マネージャがコミュニケーションスキルの向上を支援する上で,AIが果たす役割について考察する。
我々は、AIを使ってコミュニケーションスキルを実践するマネージャの予測方法を理解するために、会話型ロールプレイシステムであるCommCoachを機能的プローブとして設計した。
論文 参考訳(メタデータ) (2025-05-20T14:51:27Z) - Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data [33.85748258158527]
共感的対話は人間とコンピュータの自然な相互作用に不可欠である。
大規模言語モデル(LLM)は、その強力な能力を活用して対話生成に革命をもたらした。
本稿では,質問応答データの必要性を回避する新しい手法を提案する。
論文 参考訳(メタデータ) (2025-01-19T04:10:53Z) - Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations [58.65755268815283]
多くの実際の対話は対話的であり、つまりエージェントの発話が会話の相手に影響を与えるか、情報を引き出すか、意見を変えるかである。
この事実を利用して、既存の最適データを書き直し、拡張し、オフライン強化学習(RL)を介してトレーニングする。
実際の人間によるユーザ調査の結果、我々のアプローチは既存の最先端の対話エージェントを大きく上回っていることがわかった。
論文 参考訳(メタデータ) (2024-11-07T21:37:51Z) - OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation [53.7173034249361]
エンド・ツー・エンドのGPTベースモデルであるOmniFlattenは、低レイテンシで自然な会話に固有の複雑な振る舞いを効果的にモデル化することができる。
提案手法は, 簡便なモデリング手法と, より効率的かつ自然な対話システムを構築するための研究の方向性を提供する。
論文 参考訳(メタデータ) (2024-10-23T11:58:58Z) - "How Robust r u?": Evaluating Task-Oriented Dialogue Systems on Spoken
Conversations [87.95711406978157]
本研究は、音声タスク指向会話における新しいベンチマークを示す。
マルチドメイン対話状態追跡と知識基底型対話モデルについて検討する。
我々のデータセットは,タスク指向対話システムの音声によるベンチマークを可能にする。
論文 参考訳(メタデータ) (2021-09-28T04:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。