論文の概要: Same Words, Different Actions: Paired Turn-Taking Evaluation under Rewritten Dialogue Contexts
- arxiv url: http://arxiv.org/abs/2609.17360v2
- Date: Thu, 24 Sep 2026 14:25:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.247814
- Title: Same Words, Different Actions: Paired Turn-Taking Evaluation under Rewritten Dialogue Contexts
- Title(参考訳): 同じ言葉と異なる行動: 書き直された対話文脈下でのペア化されたターンタイキング評価
- Abstract要約: 中国のターンテイク評価のためのペア診断ベンチマークECHOを導入する。
ECHOは、同じ重複書き起こしで例をペアリングするが、先行するマルチターン対話コンテキストとは対照的である。
4つの音声システムの実験では、3つの重度の過剰収差が示される。
- 参考スコア(独自算出の注目度): 19.857222937196745
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-time spoken dialogue systems must distinguish interruptions that require yielding the floor from backchannels that permit continued speaking. Existing benchmarks typically score events independently and may therefore assign high scores to systems with fixed action preferences rather than context-sensitive decision policies. We introduce ECHO, a paired diagnostic benchmark for Chinese turn-taking evaluation. ECHO pairs examples with the same overlap transcript but contrasting preceding multi-turn dialogue contexts, with one requiring Yield and the other Keep. It additionally includes off-talk examples for diagnosing unnecessary yielding. We introduce pair accuracy, which requires correct decisions on both members of a pair and assigns no credit to constant-action policies. Experiments on four speech systems show that three exhibit a severe over-yielding bias: they correctly keep the floor on fewer than 13% of backchannels, resulting in near-zero pairwise success rates equal or less than 4%. While the remaining system remains comparatively balanced across contexts, these findings broadly demonstrate that interruption-only evaluation can severely overestimate practical turn-taking reliability.
- Abstract(参考訳): リアルタイム音声対話システムは、床を連続的な会話を可能にするバックチャネルから引き出す必要がある割り込みを区別しなければならない。
既存のベンチマークは通常、独立してイベントをスコアするので、文脈に敏感な決定ポリシーではなく、一定の行動選好を持つシステムに高いスコアを割り当てることができる。
中国のターンテイク評価のためのペア診断ベンチマークECHOを導入する。
ECHOは、同じ重複書き起こしで例をペアリングするが、先行する複数ターンの対話コンテキストとは対照的であり、一方はYieldともう一方のKeepを必要とする。
また、不要な収量診断のためのオフトーク例も含んでいる。
ペアの両メンバに対して正しい判断をする必要のあるペアの精度を導入し、一定のアクションポリシーにクレジットを割り当てない。
4つの音声システムでの実験では、3つの重度の収量バイアスが示され、13%未満のバックチャネルで床を正しく保ち、ほぼゼロのペアの成功率は4%以下である。
残りのシステムは、状況によって相対的にバランスが保たれているが、これらの知見は、割り込みのみの評価が実用的なターンテイク信頼性を著しく過大評価できることを広く示している。
関連論文リスト
- ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling [62.983372215479925]
ストリーミングと生成システムは、部分的なオーディオから漸進的な推定を必要とする。
多分解能オートレタスクとしてインクリメンタルアセスメントを改良したANCHORを提案する。
2秒プレフィックスの48%のPLCMOSエラー削減を含む、部分入力下でのかなりの堅牢性を示す実験。
論文 参考訳(メタデータ) (2026-06-08T22:46:30Z) - Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction [4.273094752480624]
本稿では,対話的証明理論に基づく推論時間プロトコルであるPVDを導入する。
PVDは回答と構造化された信頼判定の両方を生成し、システムは不確実なケースを棄却しながら高信頼の回答を報告できる。
論文 参考訳(メタデータ) (2026-05-24T15:23:27Z) - Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought [49.53567098922619]
モーダル間干渉を低減するための音声・視覚的推論フレームワークとして, 分離ファースト, ファウズ・レイト (SFFL) を提案する。
SFFLは、モーダリティ固有の連鎖推論を強制し、別々の音声および視覚的推論トレースを生成し、答えのエビデンスを統合する。
実験では精度と頑健さの両面で一貫した改善が示され、一般的なAVQAベンチマークでは5.16%、クロスモーダル幻覚ベンチマークでは11.17%の平均的な相対的な増加が得られた。
論文 参考訳(メタデータ) (2026-05-11T02:50:27Z) - To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition [87.22988227382329]
マルチモーダル感情認識(MER)は、テキスト、音声、視覚を組み合わせることで恩恵を受けるが、標準的な融合は、モダリティが相反する場合に失敗することが多い。
我々は,いつフューズするか,いつモダリティを落とすのかを学習する統合フレームワークであるDual-Path Conflict Resolution (DCR)を提案する。
論文 参考訳(メタデータ) (2026-05-06T13:11:33Z) - BiCon-Gate: Consistency-Gated De-colloquialisation for Dialogue Fact-Checking [9.866690791407464]
本稿では,段階的非論理化による各応答クレームに対する保守的書き直し候補を提案する。
次に、対話コンテキストで意味的にサポートされている場合にのみ書き直し候補を選択するセマンティックス対応整合ゲートであるBiCon-Gateを紹介する。
このゲート選択は、下流の事実チェックを安定化させ、証拠検索と事実検証の両方で利益を得る。
論文 参考訳(メタデータ) (2026-04-15T20:06:24Z) - Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness [45.06366615980232]
SDiaReward-Datasetでトレーニングしたエンドツーエンドのマルチターン報酬モデルであるSDiaRewardを紹介する。
完全なマルチターン音声エピソードで直接動作し、ペアワイズ・プライオリティ・インスペクションに最適化されている。
実験により、SDiaRewardは最先端のペアの選好精度を達成することが示された。
論文 参考訳(メタデータ) (2026-03-16T06:39:30Z) - Measuring Language Model Hallucinations Through Distributional Correctness [7.106986689736826]
この問題を解決するために,新しい評価基準である分布補正スコア(DCS)を導入した。
DCSは、誤った回答における有害な過信と、棄権によって表される不確実性を区別し、解釈可能なデフォルト範囲でスコアを提供する。
DCSは、推測よりも真に不確実性を表現するモデルにインセンティブを与える、よりニュアンスで整列した評価パラダイムを提供する。
論文 参考訳(メタデータ) (2025-10-05T17:50:42Z) - Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems [82.70507055599093]
本稿では,Duplex SDS のための Streaming Chain-of-Thought (CoT) フレームワークを提案する。
ブロック毎に中間的ターゲットアライメントされたユーザ書き起こしとシステム応答を作成します。
実験により,本手法は既存の二重解法よりもコヒーレントで解釈可能な応答を生成することが示された。
論文 参考訳(メタデータ) (2025-10-02T14:33:05Z) - Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities [93.09944267871163]
FullDuplexBenchは、重要なインタラクティブな振る舞いを体系的に評価するベンチマークである。
ベンチマークコードを公開することによって、音声対話モデリングの進歩と、より自然で魅力的なSDMの開発を目指しています。
論文 参考訳(メタデータ) (2025-03-06T18:59:16Z) - End-to-end contextual asr based on posterior distribution adaptation for
hybrid ctc/attention system [61.148549738631814]
エンドツーエンド(E2E)音声認識アーキテクチャは、従来の音声認識システムのすべてのコンポーネントを単一のモデルに組み立てる。
これはASRシステムを単純化するが、文脈的ASRの欠点を導入している: E2Eモデルは、頻繁な固有名詞を含む発話に対して、より悪い性能を持つ。
本稿では,文脈的単語認識能力を向上させるために,文脈バイアスアテンション(CBA)モジュールをアテンションベースエンコーダデコーダ(AED)モデルに追加することを提案する。
論文 参考訳(メタデータ) (2022-02-18T03:26:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。