論文の概要: DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues
- arxiv url: http://arxiv.org/abs/2607.26178v1
- Date: Tue, 28 Jul 2026 18:36:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.450843
- Title: DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues
- Title(参考訳): DuplexGen:人間とAIのターンタイキング対話の適応的合成
- Abstract要約: ターンテイクは完全な適応的相互作用の中心的なコンポーネントであるが、現在のモデルは文脈に関係なく適用される。
本稿では,人間の嗜好アノテーションの少数のセットに対する予測を校正することで,シナリオのターンテイクを伴う対話を生成する枠組みを提案する。
これらの結果から, 人間のキャリブレーションは, アクセラレーションや設計の促進ではなく, ターンテイク合成をシナリオ固有のものにすることが示唆された。
- 参考スコア(独自算出の注目度): 49.82200425774426
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Turn-taking is a central component of full-duplex interaction. Which turn-taking behaviors are appropriate varies with the scenario, yet current models apply a single norm regardless of context. This limitation originates in their training data: human-human speech corpora capture natural timing phenomena but provide little role grounding or scenario-specific norms, while heuristic or prompted synthesis methods inject turn-taking behaviors without basing them on human preferences. We introduce DuplexGen, a framework for generating dialogues with scenario-adaptive turn-taking by calibrating LLM predictions against a small set of slot-level human preference annotations. In six cooperative and competitive tasks, human turn-taking preferences differ systematically, and DuplexGen aligns substantially more closely with those preferences than uncalibrated prompting or training solely on generic human-human data; a full-duplex model trained on DuplexGen-generated data exhibits distinctive, human-preferred turn-taking behaviors. These results show that human calibration, not corpus scale or prompt design alone, is what allows turn-taking synthesis to be scenario-specific.
- Abstract(参考訳): ターンテイクは全二重相互作用の中心的な構成要素である。
どのターンテイク行動が適切なのかはシナリオによって異なるが、現在のモデルは文脈に関係なく単一の規範を適用している。
この制限は、人間の音声コーパスが自然のタイミング現象を捉えつつも、役割の基盤やシナリオ固有の規範をほとんど提供しないのに対して、ヒューリスティックまたは刺激的な合成法は、人間の好みに基づかずにターンテイクの振る舞いを注入する。
我々は,LLM予測をスロットレベルの人間嗜好アノテーションの小さなセットに対して校正することにより,シナリオ適応型ターンテイクによる対話を生成するフレームワークであるDuplexGenを紹介する。
6つの協調的・競争的なタスクにおいて、人間のターンテイクの嗜好は体系的に異なり、DuplexGenは、一般的な人間と人間のデータにのみ依存しないプロンプトやトレーニングよりも、はるかに緊密である。
これらの結果は、コーパススケールやプロンプトデザインのみではなく、人間のキャリブレーションが、ターンテイク合成をシナリオ固有のものにしていることを示している。
関連論文リスト
- Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models [53.470209949659115]
RLによる全音声対話モデルを改善する訓練後アライメント手法を提案する。
対話性の4つの標準軸(ターンテイキング、バックチャネル一時停止、ユーザ中断)に対処する。
応答品質に対する追加ベースの報酬は、セマンティックな劣化を防ぐ。
論文 参考訳(メタデータ) (2026-06-09T17:46:55Z) - Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models [80.28579390566298]
テキスト条件付き自己回帰拡散モデルであるInteract2Arを導入する。
ハンドキネマティクスは専用のパラレルブランチを通じて組み込まれ、高忠実度フルボディ生成を可能にする。
我々のモデルは、時間的動きの合成、外乱へのリアルタイム適応、ディヤディックからマルチパーソンシナリオへの拡張など、一連のダウンストリームアプリケーションを可能にする。
論文 参考訳(メタデータ) (2025-12-22T18:59:50Z) - Text2Interact: High-Fidelity and Diverse Text-to-Two-Person Interaction Generation [39.67266918328847]
本研究では,現実的なテキスト・ヒューマンインタラクションを生成するためのText2フレームワークを提案する。
本稿では,対話記述と強いシングルパーソン動作を協調する合成合成パイプラインであるInterComposeを提案する。
また,トークンレベルの手がかりを保存した単語レベルの条件付きテキスト対話モデルであるInterActorを提案する。
論文 参考訳(メタデータ) (2025-10-07T22:41:23Z) - FLEXI: Benchmarking Full-duplex Human-LLM Speech Interaction [49.83226596963294]
音声とコンピュータの対話によりリアルタイム音声対話システムを実現する。
これらのモデルのモデリングとベンチマークは、依然として根本的な課題である。
フルヒューマン音声対話のための最初のベンチマークであるFLEXIを紹介する。
論文 参考訳(メタデータ) (2025-09-26T11:57:42Z) - Combo: Co-speech holistic 3D human motion generation and efficient customizable adaptation in harmony [69.24392732966905]
共同音声合成のための新しいフレームワークComboを提案する。
特に、興味の生成モデルにおけるマルチインプット・マルチプル・アウトプットの性質として、基本的な課題があげられる。
コンボは高品質な動きを生み出すのに非常に効果的であるが、アイデンティティや感情の伝達にも効果的である。
論文 参考訳(メタデータ) (2024-08-18T07:48:49Z) - Improving Personality Consistency in Conversation by Persona Extending [22.124187337032946]
本稿では,Persona Retrieval Model(PRM)とPosterior-Scored Transformer(PS-Transformer)の2つのサブコンポーネントからなる新しい検索・予測パラダイムを提案する。
提案モデルでは,自動測定と人的評価の両面で大幅に改善されている。
論文 参考訳(メタデータ) (2022-08-23T09:00:58Z) - Bilateral Personalized Dialogue Generation with Dynamic Persona-Aware
Fusion [3.5433229509828155]
マルチタスク・トランスファー・ラーニングによる動的ペルソナ・アウェア・フュージョンを用いた双方向対話生成手法を提案する。
実験の結果,提案手法は自動評価と手動評価の両面で,いくつかの最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2021-06-15T03:21:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。