論文の概要: Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO
- arxiv url: http://arxiv.org/abs/2607.27756v1
- Date: Thu, 30 Jul 2026 06:53:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.426102
- Title: Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO
- Title(参考訳): Cocktail-Talker:Turn Action GRPOを用いた騒々しい社会環境におけるマルチ話者対話モデリング
- Authors: Xilin Jiang, Riki Shimizu, Sukru Samet Dindar, Junkai Wu, Zhongweiyang Xu, Nima Mesgarani,
- Abstract要約: 雑音の多い社会環境における多話者音声対話モデリングのための音声フレームワークであるCocktail-Talkerを紹介する。
Cocktail-Talkerは教師付き微調整と強化学習によって訓練され、適切なアクショントークンを生成する。
また,LLMベースのデータパイプラインであるCocktail-DialogGenを開発した。
- 参考スコア(独自算出の注目度): 18.561388308227556
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spoken dialog systems are typically designed for clean, dyadic interactions in which a single user and an assistant take turns speaking. Real-world social conversations, however, are often more ambiguous: multiple speakers may participate in the same conversation amid irrelevant speech and background noise. Each utterance may be directed to the assistant, addressed to another speaker, or completely irrelevant. In such settings, the assistant must decide not only what to say, but also whether to speak at all. In this paper, we introduce Cocktail-Talker, a speech LLM framework for multi-speaker spoken dialog modeling in noisy social environments. We model the assistant's behavior with three action tokens: <|respond|>, <|listen|>, and <|ignore|>, placed before a response or silence. Cocktail-Talker is trained via supervised finetuning and reinforcement learning to generate the appropriate action token and, only in <|respond|> mode, a speech response. To prepare the training data, we develop Cocktail-DialogGen, an LLM-based data pipeline that simulates realistic multi-speaker dialogs with speaker roles across diverse social settings. Together, these components take a step toward spoken dialog systems that interact more naturally and selectively in complex social environments.
- Abstract(参考訳): 音声対話システムは、通常、一人のユーザーとアシスタントが交互に話す、クリーンでダイアディックな対話のために設計されている。
複数の話者が、無関係なスピーチや背景雑音の中で同じ会話に参加することがある。
各発話はアシスタントに向けられ、他の話者に宛てられるか、全く無関係である。
このような設定では、アシスタントは何を言うべきかだけでなく、話すかどうかも判断しなければならない。
本稿では,多話者音声対話モデリングのための音声LLMフレームワークであるCocktail-Talkerについて紹介する。
応答や沈黙の前に配置された,<| correspond|>,<|listen|>,<|ignore|>の3つのアクショントークンで,アシスタントの動作をモデル化する。
Cocktail-Talkerは教師付き微調整と強化学習によって訓練され、適切なアクショントークンを生成し、<| correspond|>モードでのみ音声応答を行う。
トレーニングデータを作成するために,LLMベースのデータパイプラインであるCocktail-DialogGenを開発した。
これらのコンポーネントは、複雑な社会環境において、より自然かつ選択的に対話する音声対話システムに向けて一歩前進する。
関連論文リスト
- F-Actor: Controllable Conversational Behaviour in Full-Duplex Models [70.48189107402145]
典型的な学術的制約下で効率的に訓練できる,第1にオープンかつ命令追従型全段階会話音声モデルを提案する。
我々のモデルは、大規模な事前訓練や多段階事前訓練に頼ることなく、わずか2000時間のデータしか必要としない。
モデルとトレーニングコードの両方がリリースされ、制御可能なフルステージ音声システムに関する再現可能な研究が可能になる。
論文 参考訳(メタデータ) (2026-01-16T14:25:57Z) - Aligning Spoken Dialogue Models from User Interactions [55.192134724622235]
本稿では,ユーザの対話からリアルタイム会話における音声対話モデルを改善するための新しい嗜好アライメントフレームワークを提案する。
AIフィードバックを付加した生のマルチターン音声会話から15万以上の好みペアのデータセットを作成する。
本研究は, 自然なリアルタイム音声対話システムにおいて重要な, 様々な力学におけるバランスの整合性の重要性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-26T16:45:20Z) - DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations [18.419225973482423]
既存の3Dトーキングヘッドジェネレーションモデルは、話すことや聞くことのみに焦点を当てている。
本稿では,3次元音声ヘッド生成のためのマルチラウンドデュアルスピーカインタラクションを提案する。
我々は、話者とリスナーの動的挙動を統合する新しい統合フレームワークであるDualTalkを紹介する。
論文 参考訳(メタデータ) (2025-05-23T16:49:05Z) - OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation [53.7173034249361]
エンド・ツー・エンドのGPTベースモデルであるOmniFlattenは、低レイテンシで自然な会話に固有の複雑な振る舞いを効果的にモデル化することができる。
提案手法は, 簡便なモデリング手法と, より効率的かつ自然な対話システムを構築するための研究の方向性を提供する。
論文 参考訳(メタデータ) (2024-10-23T11:58:58Z) - Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation [55.043492250775294]
本稿では,新しい対面音声対話モデルを提案する。
ユーザ入力から音声視覚音声を処理し、応答として音声視覚音声を生成する。
また,最初の大規模マルチモーダル音声対話コーパスであるMultiDialogを紹介する。
論文 参考訳(メタデータ) (2024-06-12T04:48:36Z) - "How Robust r u?": Evaluating Task-Oriented Dialogue Systems on Spoken
Conversations [87.95711406978157]
本研究は、音声タスク指向会話における新しいベンチマークを示す。
マルチドメイン対話状態追跡と知識基底型対話モデルについて検討する。
我々のデータセットは,タスク指向対話システムの音声によるベンチマークを可能にする。
論文 参考訳(メタデータ) (2021-09-28T04:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。