論文の概要: A Model-based Testing Technique for Amazon Lex Task-based Chatbots
- arxiv url: http://arxiv.org/abs/2607.01094v1
- Date: Wed, 01 Jul 2026 15:48:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.972767
- Title: A Model-based Testing Technique for Amazon Lex Task-based Chatbots
- Title(参考訳): Amazon Lexタスクベースチャットボットのモデルベーステスト手法
- Abstract要約: LexTesterは、Amazon Lexチャットボットのためのモデルベースの自動テスト技術である。
可能なすべてのインタラクションのダイアロググラフを生成し、そこから実行可能なテストスイートを生成する。
- 参考スコア(独自算出の注目度): 46.12795846459242
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Task-based chatbots are nowadays widely adopted software systems, usually integrated into real-world applications and communication channels, designed to assist users in completing tasks through conversational interfaces. Like any other software, even chatbots are prone to bugs. Despite their increasing pervasiveness in everyday activities, existing techniques for assessing their quality still exhibit several limitations, such as the simplicity of generated test scenarios and oracle weaknesses. In this paper, we present LexTester, an automated model-based testing technique for Amazon Lex chatbots. The technique explores the conversational space of the chatbot under test to generate a Dialog Graph of all possible interactions, from which an executable test suite is generated according to different coverage strategies. LexTester was evaluated against the state-of-the-practice chatbot testing tool Botium on five Amazon Lex chatbots, consistently outperforming it in all subjects, generating more tests with nearly double complexity, achieving overall 83-95% coverage of conversational elements, and improving fault detection effectiveness by up to four times at comparable time costs.
- Abstract(参考訳): タスクベースのチャットボットは、現在広く採用されているソフトウェアシステムであり、通常は現実世界のアプリケーションやコミュニケーションチャネルに統合され、ユーザーが会話インターフェイスを通じてタスクを完了するのを助けるように設計されている。
他のソフトウェアと同様、チャットボットもバグを起こしやすい。
日常的な活動における普及にもかかわらず、それらの品質を評価する既存のテクニックは、生成したテストシナリオの単純さやオラクルの弱点など、いくつかの制限をまだ示している。
本稿では,Amazon Lexチャットボットの自動モデルベーステスト技術であるLexTesterを紹介する。
この技術は、テスト中のチャットボットの会話空間を探索し、可能なすべてのインタラクションのダイアロググラフを生成し、異なるカバレッジ戦略に基づいて実行可能なテストスイートを生成する。
LexTesterは5つのAmazon Lexチャットボット上での最先端のチャットボットテストツールBotiumに対して評価され、一貫してパフォーマンスを向上し、ほぼ2倍の複雑さでテストを生成するとともに、全体的な83~95%の会話要素のカバレッジを実現し、フォールト検出効率を同等の時間コストで最大4倍改善した。
関連論文リスト
- WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing [57.7131457251794]
エンドツーエンドの自動Webテストを評価するベンチマークであるWebTestBenchを紹介します。
テストプロセスを2つのカスケードサブタスク、チェックリストの生成と欠陥検出に分解し、WebTesterを提案する。
以上の結果から,現在のコンピュータ利用エージェント能力と産業レベルの展開要求との間に大きなギャップがあることが判明した。
論文 参考訳(メタデータ) (2026-03-26T09:27:29Z) - Automated Testing of Task-based Chatbots: How Far Are We? [5.64612424709862]
タスクベースのチャットボット(英: Task-based chatbots)は、ユーザーが会話インターフェイスを通じてタスクを完了するのを助けるソフトウェアである。
本稿では,GitHubからタスクベースのチャットボットをキュレートした選択に対する最先端テスト手法の有効性を評価する。
論文 参考訳(メタデータ) (2026-02-13T16:32:50Z) - Assessing Task-based Chatbots: Snapshot and Curated Datasets for Dialogflow [5.64612424709862]
本稿では、GitHubから1,788個のダイアログフローチャットボットのスナップショットであるTOFU-Dと、185個の検証済みチャットボットを含むTOFU-DのキュレートされたサブセットであるCODについて述べる。
BotiumテストフレームワークとBandit静的アナライザを使用した事前評価では、いくつかのチャットボットでテストカバレッジと頻繁なセキュリティ脆弱性のギャップが明らかになった。
論文 参考訳(メタデータ) (2026-01-27T16:49:56Z) - Towards Multi-Platform Mutation Testing of Task-based Chatbots [5.64612424709862]
我々はMUTABOTを複数のプラットフォーム(DialogflowとRasa)に拡張する。
MUTABOTは、会話中の欠陥を注入するための突然変異試験手法である。
我々は、Botiumの最先端テストジェネレータによって生成されるテストスイートの弱点を明らかにするために、突然変異テストをどのように利用できるかを示す。
論文 参考訳(メタデータ) (2025-09-01T11:36:06Z) - Test Case Generation for Dialogflow Task-Based Chatbots [3.488620810035772]
Test Generator (CTG) はタスクベースのチャットボット向けに設計された自動テスト技術である。
我々はCTGと最先端のBOTiumおよびCHARMツールの比較実験を行った。
CTGは、堅牢性と有効性という点でライバルより優れていた。
論文 参考訳(メタデータ) (2025-03-07T16:39:27Z) - X-TURING: Towards an Enhanced and Efficient Turing Test for Long-Term Dialogue Agents [56.64615470513102]
チューリングテストは、自然言語の会話においてAIが人間のような振る舞いを示すかどうかを調べる。
従来の設定では、各参加者は一度に1つのメッセージに制限される。
本稿では,textitburstダイアログパターンを用いて,元のテストを強化するtextbftextscX-Turingを提案する。
論文 参考訳(メタデータ) (2024-08-19T09:57:28Z) - MutaBot: A Mutation Testing Approach for Chatbots [3.811067614153878]
MutaBotは、会話フロー、インテント、コンテキストを含む、複数のレベルでの突然変異に対処する。
ツールを3つのDialogflowチャットボットとBotiumで生成されたテストケースで評価し、テストスイートの弱点を明らかにする。
論文 参考訳(メタデータ) (2024-01-18T20:38:27Z) - Train Offline, Test Online: A Real Robot Learning Benchmark [113.19664479709587]
Train Offline, Test Online (TOTO)は、リモートユーザに対して、共通タスクのメソッドを評価するための共有ロボティックハードウェアへのアクセスを提供する。
本研究は、TOTOにおける5つの事前訓練された視覚表現と4つのオフラインポリシー学習ベースラインを比較し、遠隔で5つの機関に貢献した。
ハードウェアやデータ収集を必要とせずに、いくつかのメソッドと簡単に直接比較できる。
論文 参考訳(メタデータ) (2023-06-01T17:42:08Z) - Towards Robust Online Dialogue Response Generation [62.99904593650087]
これは、トレーニングと実世界のテストの相違によって引き起こされる可能性がある、と私たちは主張する。
本稿では, 発話レベルサンプリングと半発話レベルサンプリングの両方からなる階層的サンプリング手法を提案する。
論文 参考訳(メタデータ) (2022-03-07T06:51:41Z) - Put Chatbot into Its Interlocutor's Shoes: New Framework to Learn
Chatbot Responding with Intention [55.77218465471519]
本稿では,チャットボットに人間のような意図を持つための革新的なフレームワークを提案する。
我々のフレームワークには、ガイドロボットと人間の役割を担うインターロケータモデルが含まれていた。
本フレームワークを3つの実験的なセットアップを用いて検討し,4つの異なる指標を用いた誘導ロボットの評価を行い,柔軟性と性能の利点を実証した。
論文 参考訳(メタデータ) (2021-03-30T15:24:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。