論文の概要: TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue
- arxiv url: http://arxiv.org/abs/2607.01345v2
- Date: Sun, 05 Jul 2026 19:53:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.857902
- Title: TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue
- Title(参考訳): TurnNat:Dyadic Spoken Dialogueにおけるターンタイキング自然性の自動評価
- Authors: Hao Zhang, Thomas Thebaud, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez,
- Abstract要約: 2チャンネル音声対話におけるターンテイク自然度自動評価のための可能性に基づくフレームワークを提案する。
自然な会話に基づいて訓練された因果的ターンテイク予測モデルは、将来の2話者音声活動状態を推定し、観測された将来の活動の負の対数類似度(NLL)は、タイミング非定型性を測定する。
- 参考スコア(独自算出の注目度): 10.164891376119321
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Turn-taking naturalness is central to full-duplex spoken dialogue systems, yet its automatic evaluation remains limited. Existing evaluations often rely on human judgments or behavior-specific timing metrics, making it difficult to compare heterogeneous timing failures within a unified framework. We propose TurnNat, a likelihood-based framework for automatic turn-taking naturalness evaluation in two-channel spoken dialogue. A causal turn-taking prediction model trained on natural conversations estimates future two-speaker voice-activity states, and the negative log-likelihood (NLL) of the observed future activity measures timing atypicality. TurnNat pools frame-level NLLs over turn-taking boundary units (TBUs) extracted from utterance onsets and offsets, and aggregates mean and tail TBU scores into a dialogue-level naturalness score. We further construct a controlled perturbation benchmark of paired natural and perturbed dialogue clips, validated by human naturalness judgments. Experiments on this benchmark show that TurnNat successfully identifies unnatural turn-taking perturbations across heterogeneous timing failures.
- Abstract(参考訳): ターンテイキング自然性は、全二重音声対話システムの中心であるが、その自動評価は限られている。
既存の評価は、しばしば人間の判断や行動固有のタイミングメトリクスに依存しており、統一されたフレームワーク内での不均一なタイミング障害を比較することは困難である。
2チャンネル音声対話におけるターンテイク自然性評価のための可能性に基づくフレームワークであるTurnNatを提案する。
自然な会話に基づいて訓練された因果的ターンテイク予測モデルは、将来の2話者音声活動状態を推定し、観測された将来の活動の負の対数類似度(NLL)は、タイミング非定型性を測定する。
TurnNatは、発話のオンセットとオフセットから抽出されたターンテイク境界単位(TBU)上でフレームレベルのNLLをプールし、平均とテールのTBUスコアを対話レベルの自然度スコアに集約する。
さらに、人間の自然性判定によって検証された、対の自然性および摂動性対話クリップの制御摂動ベンチマークを構築した。
このベンチマーク実験により、TurnNatは不均一なタイミング障害における不自然な旋回摂動の特定に成功した。
関連論文リスト
- Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities [93.09944267871163]
FullDuplexBenchは、重要なインタラクティブな振る舞いを体系的に評価するベンチマークである。
ベンチマークコードを公開することによって、音声対話モデリングの進歩と、より自然で魅力的なSDMの開発を目指しています。
論文 参考訳(メタデータ) (2025-03-06T18:59:16Z) - DynaEval: Unifying Turn and Dialogue Level Evaluation [60.66883575106898]
統合された自動評価フレームワークDynaEvalを提案する。
ターンレベルの評価を行うことができるが、対話全体の品質を公平に考慮することもできる。
実験の結果,DynaEvalは最先端の対話コヒーレンスモデルよりも優れていた。
論文 参考訳(メタデータ) (2021-06-02T12:23:18Z) - I like fish, especially dolphins: Addressing Contradictions in Dialogue
Modeling [104.09033240889106]
DialoguE Contradiction Detection Task(DECODE)と、人間とロボットの矛盾した対話の両方を含む新しい会話データセットを紹介します。
次に、事前学習したトランスフォーマーモデルを用いて、定型的非構造的アプローチと矛盾検出を行う構造的発話に基づくアプローチを比較する。
論文 参考訳(メタデータ) (2020-12-24T18:47:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。