論文の概要: Neither Silence nor Overlap Is Failure: Intent-Conditioned Evaluation of Turn-Taking in Full-Duplex Spoken Dialogue Models
- arxiv url: http://arxiv.org/abs/2609.27372v1
- Date: Wed, 23 Sep 2026 05:21:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.89616
- Title: Neither Silence nor Overlap Is Failure: Intent-Conditioned Evaluation of Turn-Taking in Full-Duplex Spoken Dialogue Models
- Title(参考訳): サイレンスもオーバーラップも失敗しない:全二重音声対話モデルにおけるターンタイキングのインテントコンディションによる評価
- Abstract要約: 我々は5つのダイアドコーパスから9,728エピソードのベンチマークであるTACTを紹介する。
各エピソードは、対話履歴、話者ごとのメモリプロファイル、およびアノテーションから派生した6つの意図クラスを含む。
TACTは、Spearman 0.81の人間による判断と、バイナリメトリクスの0.46と一致している。
- 参考スコア(独自算出の注目度): 0.33054385258808067
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Benchmarks for full-duplex spoken dialogue models score turn-taking with binary fixed-window rules that reward immediate response or silence by completeness of the prior turn. We argue that the appropriateness of a response offset, whether delayed silence or anticipatory overlap, is conditional on the speaker's latent intent, identifiable only from that speaker's behavior. We introduce TACT, a benchmark of 9,728 episodes and 73.2 hours from five dyadic corpora; each episode carries dialogue history, a per-speaker memory profile, and an annotator-derived posterior over six intent classes. Scoring replaces binary windows with a strictly proper threshold-weighted continuous ranked probability score whose weights are intent-conditioned timing kernels fitted to human floor-transfer-offset distributions, proving boundedness, consistency, and binary reduction. Across eleven systems the best model reaches 0.47 against a human topline of 0.86, is nearly invariant to speaker profiles, and TACT agrees with human judgments at Spearman 0.81 versus 0.46 for binary metrics.
- Abstract(参考訳): フル二重音声対話モデルのベンチマークは、前のターンの完全性によって即時応答や沈黙を報いるバイナリ固定ウィンドウルールでターンテイクをスコアする。
応答オフセットの適切性は、遅れた沈黙であれ予測的な重複であれ、話者の潜在意図に条件付きであり、その話者の行動からのみ識別可能であると論じる。
5つのダイアドコーパスから9,728エピソードと73.2時間のベンチマークであるTACTを導入し、各エピソードは対話履歴、話者ごとのメモリプロファイル、アノテーション由来のインテントクラスを6つ以上含んでいる。
スコリングは、厳密なしきい値重み付き連続ランクの確率スコアに置き換え、その重みが人間のフロア・トランスファー・オフセット分布に適合する意図条件付きタイミングカーネルであり、境界性、一貫性、二項還元を証明している。
11のシステムで最高のモデルが0.47と0.86のトポラインに到達し、話者プロファイルにほぼ不変であり、TACTはSpearman 0.81と0.46の2進数で人間の判断に同意している。
関連論文リスト
- SteerDuplex: Steerable Duplex Speech Dialogue Models [47.277615720741046]
音声対話モデルは、指示、発声、推論、対話を対象とする自然な会話や合成対話を微調整する。
2段階強化学習(RL)とハイブリッド報酬を併用し、検証可能な相互作用チェックと判断に基づくフィードバックを組み合わせて応答継続性を向上させる。
さらにRLはソースクリーン割り込み反応を72.5%から82.5%に引き上げ、合成停止バージインを26.5%から9%に減少させる。
論文 参考訳(メタデータ) (2026-09-11T09:22:46Z) - DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents [67.07361089429757]
6つのリアルタイム音声システムを用いて, 実時間床の付着度を測定した。
アーキテクチャに依存したトレードオフを見つけます。
GPT-Realtime, Mini-o Duplex, Fun-Audio-Chatはペルソナ一貫性のあるコンテンツに強く固執する。
論文 参考訳(メタデータ) (2026-09-03T06:28:02Z) - TurnBench: A Multi-Domain Benchmark for Turn-Taking Dynamics in Spoken Dialogue [79.83228182492354]
自然な会話の話し手は、話と聞き取りを交互に行い、いつ床をつかむか、保持するか、または譲るかをリアルタイムで決める。
そこで本研究では,30時間の人的会話を手作業でラベル付けしたコーパスを,エンド・オブ・ターンと割り込み検出のための標準評価プロトコルと組み合わせたベンチマークTurnBenchを提案する。
一方、割り込み偽陽性は強く型依存的であり、バックチャネル・デンス相互作用スタイルに集中している。
論文 参考訳(メタデータ) (2026-08-25T23:14:36Z) - What You Can't See Is What You Learn: Slot-Selective Evidence Masking Favors Compositional Generalization in Shared-Genome Language-Model Societies [0.0]
我々は、アテンションマスクを除いて、10個のマッチした制限付き/グロバルペアを訓練する。
制限された視認性社会は、両深度で少なくとも20ポイント以上の視認性双生児を上回っている。
ホック選択後の6つの制限された社会では、正しく答えられた保留エピソードに対するパケットの介入は、およそ値インデクシングされたリレー状態と一致している。
論文 参考訳(メタデータ) (2026-08-20T13:51:45Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Proactive Dialogue Model with Intent Prediction [16.47519576020766]
本稿では,対話データから導出され,推論時にシステムプロンプトに注入される軽量なインテント・トランジションについて紹介する。
我々は、MultiWOZ 2.2におけるターン毎のインテントアノテーションを訓練したテンポラルベイズネットワーク(T-BN)を用いて、この前をインスタンス化する。
200回以上の対話において、BN誘導世代はカバレッジAUCを0.742から0.856に改善し、75%の意図的カバレッジを3.95から2.73に到達させるために必要なターン数を減少させる。
論文 参考訳(メタデータ) (2026-04-30T03:46:49Z) - Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment [53.72927532626824]
わずか50個のサンプル(0.3%のデータ)のサブセットは、完全なベンチマークスコアと0.93以上のピアソン相関を達成可能であることを示す。
選好をより良く予測するために、選択したサブセットの回帰モデルを訓練し、0.98の相関を達成した。
これは回帰モデリングにおいて、よく計算されたサブセットが完全なベンチマークを予測し、量を超える品質を示すことを示している。
論文 参考訳(メタデータ) (2026-04-20T00:57:31Z) - ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models [49.18708573170585]
経験的な評価は、ASPIRinがターンテイキング、バックチャネル、一時停止処理をまたいで対話性を最適化していることを示している。
ASPIRin degrade turn to say when when when to fall when. ASPIRin degrade turn to say when when to say。
論文 参考訳(メタデータ) (2026-04-11T07:07:08Z) - Automatically measuring speech fluency in people with aphasia: first
achievements using read-speech data [55.84746218227712]
本研究の目的は,言語習得の分野で開発された信号処理algorithmの関連性を評価することである。
論文 参考訳(メタデータ) (2023-08-09T07:51:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。