論文の概要: ECHO: A Matched-Contrast Benchmark for Context-Sensitive Turn-Taking in Full-Duplex Dialogue
- arxiv url: http://arxiv.org/abs/2609.17360v1
- Date: Tue, 15 Sep 2026 15:58:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.613
- Title: ECHO: A Matched-Contrast Benchmark for Context-Sensitive Turn-Taking in Full-Duplex Dialogue
- Title(参考訳): ECHO: 全二重対話における文脈感性ターンタイキングのための一致したコントラストベンチマーク
- Abstract要約: そこで我々は,中国語のフル音声対話対対の診断ベンチマークを開発した。
ペアの両メンバに対して適切な判断をする必要のあるペアの精度を導入し,一定のアクションポリシにクレジットを割り当てない。
これらの結果から,割り込みのみの評価が実際のターンテイク信頼性を識別できることが示唆された。
- 参考スコア(独自算出の注目度): 19.857222937196745
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Full-duplex spoken dialogue systems must distinguish interruptions that require yielding the floor from backchannels that permit continued speaking. Existing benchmarks typically evaluate events independently and may therefore reward fixed action preferences rather than context-sensitive decisions. We introduce ECHO, a paired diagnostic benchmark for Chinese full-duplex turn-taking. ECHO pairs examples with the same overlap transcript but contrasting preceding multi-turn dialogue contexts, with one requiring Yield and the other Keep. It additionally includes off-talk examples for diagnosing unnecessary yielding. We introduce pair accuracy, which requires correct decisions on both members of a pair and assigns no credit to constant-action policies. Experiments on multiple full-duplex systems show that most exhibit a pronounced bias toward \textsc{Yield}, performing substantially better on interruptions than on backchannels, while another system remains comparatively balanced. These findings demonstrate that interruption-only evaluation can overestimate practical turn-taking reliability. ECHO and its metadata will be publicly released.
- Abstract(参考訳): 全二重音声対話システムは、床を連続的な会話を許すバックチャネルから引き出す必要がある割り込みを区別しなければならない。
既存のベンチマークは通常、イベントを独立して評価するので、文脈に敏感な決定よりも、固定されたアクションの選好に報いる可能性がある。
中国全二重転倒の診断ベンチマークECHOを紹介する。
ECHOは、同じ重複書き起こしで例をペアリングするが、先行する複数ターンの対話コンテキストとは対照的であり、一方はYieldともう一方のKeepを必要とする。
また、不要な収量診断のためのオフトーク例も含んでいる。
ペアの両メンバに対して正しい判断をする必要のあるペアの精度を導入し、一定のアクションポリシーにクレジットを割り当てない。
複数の全二重系に関する実験では、ほとんどの系は \textsc{Yield} に対して顕著な偏りを示し、バックチャネルよりも割り込みがかなり良く、他の系は比較的バランスが取れている。
これらの結果から,割り込みのみの評価が実用的なターンテイク信頼性を過大評価する可能性が示唆された。
ECHOとそのメタデータは、公開される。
関連論文リスト
- ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling [62.983372215479925]
ストリーミングと生成システムは、部分的なオーディオから漸進的な推定を必要とする。
多分解能オートレタスクとしてインクリメンタルアセスメントを改良したANCHORを提案する。
2秒プレフィックスの48%のPLCMOSエラー削減を含む、部分入力下でのかなりの堅牢性を示す実験。
論文 参考訳(メタデータ) (2026-06-08T22:46:30Z) - Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction [4.273094752480624]
本稿では,対話的証明理論に基づく推論時間プロトコルであるPVDを導入する。
PVDは回答と構造化された信頼判定の両方を生成し、システムは不確実なケースを棄却しながら高信頼の回答を報告できる。
論文 参考訳(メタデータ) (2026-05-24T15:23:27Z) - Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought [49.53567098922619]
モーダル間干渉を低減するための音声・視覚的推論フレームワークとして, 分離ファースト, ファウズ・レイト (SFFL) を提案する。
SFFLは、モーダリティ固有の連鎖推論を強制し、別々の音声および視覚的推論トレースを生成し、答えのエビデンスを統合する。
実験では精度と頑健さの両面で一貫した改善が示され、一般的なAVQAベンチマークでは5.16%、クロスモーダル幻覚ベンチマークでは11.17%の平均的な相対的な増加が得られた。
論文 参考訳(メタデータ) (2026-05-11T02:50:27Z) - To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition [87.22988227382329]
マルチモーダル感情認識(MER)は、テキスト、音声、視覚を組み合わせることで恩恵を受けるが、標準的な融合は、モダリティが相反する場合に失敗することが多い。
我々は,いつフューズするか,いつモダリティを落とすのかを学習する統合フレームワークであるDual-Path Conflict Resolution (DCR)を提案する。
論文 参考訳(メタデータ) (2026-05-06T13:11:33Z) - BiCon-Gate: Consistency-Gated De-colloquialisation for Dialogue Fact-Checking [9.866690791407464]
本稿では,段階的非論理化による各応答クレームに対する保守的書き直し候補を提案する。
次に、対話コンテキストで意味的にサポートされている場合にのみ書き直し候補を選択するセマンティックス対応整合ゲートであるBiCon-Gateを紹介する。
このゲート選択は、下流の事実チェックを安定化させ、証拠検索と事実検証の両方で利益を得る。
論文 参考訳(メタデータ) (2026-04-15T20:06:24Z) - Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness [45.06366615980232]
SDiaReward-Datasetでトレーニングしたエンドツーエンドのマルチターン報酬モデルであるSDiaRewardを紹介する。
完全なマルチターン音声エピソードで直接動作し、ペアワイズ・プライオリティ・インスペクションに最適化されている。
実験により、SDiaRewardは最先端のペアの選好精度を達成することが示された。
論文 参考訳(メタデータ) (2026-03-16T06:39:30Z) - Measuring Language Model Hallucinations Through Distributional Correctness [7.106986689736826]
この問題を解決するために,新しい評価基準である分布補正スコア(DCS)を導入した。
DCSは、誤った回答における有害な過信と、棄権によって表される不確実性を区別し、解釈可能なデフォルト範囲でスコアを提供する。
DCSは、推測よりも真に不確実性を表現するモデルにインセンティブを与える、よりニュアンスで整列した評価パラダイムを提供する。
論文 参考訳(メタデータ) (2025-10-05T17:50:42Z) - Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems [82.70507055599093]
本稿では,Duplex SDS のための Streaming Chain-of-Thought (CoT) フレームワークを提案する。
ブロック毎に中間的ターゲットアライメントされたユーザ書き起こしとシステム応答を作成します。
実験により,本手法は既存の二重解法よりもコヒーレントで解釈可能な応答を生成することが示された。
論文 参考訳(メタデータ) (2025-10-02T14:33:05Z) - Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities [93.09944267871163]
FullDuplexBenchは、重要なインタラクティブな振る舞いを体系的に評価するベンチマークである。
ベンチマークコードを公開することによって、音声対話モデリングの進歩と、より自然で魅力的なSDMの開発を目指しています。
論文 参考訳(メタデータ) (2025-03-06T18:59:16Z) - End-to-end contextual asr based on posterior distribution adaptation for
hybrid ctc/attention system [61.148549738631814]
エンドツーエンド(E2E)音声認識アーキテクチャは、従来の音声認識システムのすべてのコンポーネントを単一のモデルに組み立てる。
これはASRシステムを単純化するが、文脈的ASRの欠点を導入している: E2Eモデルは、頻繁な固有名詞を含む発話に対して、より悪い性能を持つ。
本稿では,文脈的単語認識能力を向上させるために,文脈バイアスアテンション(CBA)モジュールをアテンションベースエンコーダデコーダ(AED)モデルに追加することを提案する。
論文 参考訳(メタデータ) (2022-02-18T03:26:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。