論文の概要: "How Robust r u?": Evaluating Task-Oriented Dialogue Systems on Spoken
Conversations
- arxiv url: http://arxiv.org/abs/2109.13489v1
- Date: Tue, 28 Sep 2021 04:51:04 GMT
- ステータス: 処理完了
- システム内更新日: 2021-09-29 14:48:41.509071
- Title: "How Robust r u?": Evaluating Task-Oriented Dialogue Systems on Spoken
Conversations
- Title(参考訳): 「どうロバスト r u?」:音声対話におけるタスク指向対話システムの評価
- Authors: Seokhwan Kim, Yang Liu, Di Jin, Alexandros Papangelis, Karthik
Gopalakrishnan, Behnam Hedayatnia, Dilek Hakkani-Tur
- Abstract要約: 本研究は、音声タスク指向会話における新しいベンチマークを示す。
マルチドメイン対話状態追跡と知識基底型対話モデルについて検討する。
我々のデータセットは,タスク指向対話システムの音声によるベンチマークを可能にする。
- 参考スコア(独自算出の注目度): 87.95711406978157
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most prior work in dialogue modeling has been on written conversations mostly
because of existing data sets. However, written dialogues are not sufficient to
fully capture the nature of spoken conversations as well as the potential
speech recognition errors in practical spoken dialogue systems. This work
presents a new benchmark on spoken task-oriented conversations, which is
intended to study multi-domain dialogue state tracking and knowledge-grounded
dialogue modeling. We report that the existing state-of-the-art models trained
on written conversations are not performing well on our spoken data, as
expected. Furthermore, we observe improvements in task performances when
leveraging n-best speech recognition hypotheses such as by combining
predictions based on individual hypotheses. Our data set enables speech-based
benchmarking of task-oriented dialogue systems.
- Abstract(参考訳): 対話モデリングにおけるほとんどの作業は、既存のデータセットが原因で書かれた会話に費やされてきた。
しかし, 音声対話システムにおいて, 音声対話の性質と潜在的な音声認識誤差を十分に把握するには, 文章対話では不十分である。
本研究は,多領域対話状態追跡と知識基底対話モデルの研究を目的とした,音声タスク指向会話の新しいベンチマークを提案する。
本報告では,既存の会話訓練モデルが音声データに対して期待通りに動作していないことを報告する。
さらに,個々の仮説に基づく予測を組み合わせることで,n-best音声認識仮説を利用する場合のタスク性能の改善を観察する。
このデータセットはタスク指向対話システムの音声ベースベンチマークを可能にする。
関連論文リスト
- WavChat: A Survey of Spoken Dialogue Models [66.82775211793547]
GPT-4oのようなシステムで実証された音声対話モデルの最近の進歩は、音声領域において大きな注目を集めている。
これらの高度な音声対話モデルは、音声、音楽、その他の音声関連の特徴を理解するだけでなく、音声のスタイリスティックな特徴や音節的な特徴も捉える。
音声対話システムの進歩にもかかわらず、これらのシステムを体系的に組織化し分析する包括的調査が欠如している。
論文 参考訳(メタデータ) (2024-11-15T04:16:45Z) - SPECTRUM: Speaker-Enhanced Pre-Training for Long Dialogue Summarization [48.284512017469524]
マルチターン対話は、その長さとターンテイクな会話の存在によって特徴づけられる。
伝統的な言語モデルは、しばしばそれらの対話の特徴を通常のテキストとして扱うことによって見落としている。
長文対話要約のための話者強化事前学習手法を提案する。
論文 参考訳(メタデータ) (2024-01-31T04:50:00Z) - Adapting Text-based Dialogue State Tracker for Spoken Dialogues [20.139351605832665]
本稿では,DSTC11における音声認識対話システム技術課題トラックに参画した,高度に成功を収めたモデルの構築に向けた技術的取り組みについて述べる。
本モデルは,(1)音声音声とテキスト音声のギャップを埋める自動音声認識誤差補正,(2)スロット記述を用いてスロットと値を推定するテキストベース対話システム(D3ST),(3)推定スロット値の誤差を復元する後処理の3つの主要モジュールから構成される。
論文 参考訳(メタデータ) (2023-08-29T06:27:58Z) - STRUDEL: Structured Dialogue Summarization for Dialogue Comprehension [42.57581945778631]
抽象的な対話要約は、自然言語処理における重要なスタンドアロンタスクとみなされてきた。
本稿では,新たな対話要約タスクであるSTRUctured DiaLoguE Summarizationを提案する。
変換器エンコーダ言語モデルの対話理解性能を大幅に向上させることができることを示す。
論文 参考訳(メタデータ) (2022-12-24T04:39:54Z) - End-to-end Spoken Conversational Question Answering: Task, Dataset and
Model [92.18621726802726]
音声による質問応答では、システムは関連する音声書き起こしの中に連続したテキストスパンからの質問に答えるように設計されている。
本稿では,複雑な対話フローをモデル化することを目的とした音声対話型質問応答タスク(SCQA)を提案する。
本研究の目的は,音声記録に基づく対話型質問に対処するシステムを構築することであり,情報収集システムによる様々なモダリティからより多くの手がかりを提供する可能性を探ることである。
論文 参考訳(メタデータ) (2022-04-29T17:56:59Z) - TOD-DA: Towards Boosting the Robustness of Task-oriented Dialogue
Modeling on Spoken Conversations [24.245354500835465]
本稿では,音声対話におけるタスク指向対話モデリングの堅牢性を高めるために,新しいモデルに依存しないデータ拡張パラダイムを提案する。
本手法は,音声対話におけるタスク指向対話モデリングのベンチマークであるDSTC10 Track2の両タスクにおいて,第1位となった。
論文 参考訳(メタデータ) (2021-12-23T10:04:25Z) - Dialogue-Based Relation Extraction [53.2896545819799]
本稿では,人間による対話型関係抽出(RE)データセットDialogREを提案する。
我々は,対話型タスクと従来のREタスクの類似点と相違点の分析に基づいて,提案課題において話者関連情報が重要な役割を担っていると論じる。
実験結果から,ベストパフォーマンスモデルにおける話者認識の拡張が,標準設定と会話評価設定の両方において向上することが示された。
論文 参考訳(メタデータ) (2020-04-17T03:51:57Z) - TOD-BERT: Pre-trained Natural Language Understanding for Task-Oriented
Dialogue [113.45485470103762]
本研究では,言語モデリングのためのタスク指向対話データセットを,人間とマルチターンの9つに統合する。
事前学習時の対話動作をモデル化するために,ユーザトークンとシステムトークンをマスク付き言語モデルに組み込む。
論文 参考訳(メタデータ) (2020-04-15T04:09:05Z) - Interview: A Large-Scale Open-Source Corpus of Media Dialog [11.28504775964698]
本稿では,ニュースインタビューの書き起こしから収集した大規模(105Kの会話)メディアダイアログデータセット「Interview」を紹介する。
既存の会話データに対する大規模プロキシと比較して、我々のデータセットでトレーニングされた言語モデルは、ドメイン外のゼロショットのパフォーマンスが向上する。
「インタービュー」には各ターンの話者ロールアノテーションが含まれており、エンゲージメント・レスポンシブ・ダイアログシステムの開発を容易にする。
論文 参考訳(メタデータ) (2020-04-07T02:44:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。