論文の概要: Large-Scale ChatBot Validation Through Customer Digital Twin Simulations
- arxiv url: http://arxiv.org/abs/2607.26060v1
- Date: Fri, 15 May 2026 15:40:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.084256
- Title: Large-Scale ChatBot Validation Through Customer Digital Twin Simulations
- Title(参考訳): ディジタルツインシミュレーションによる大規模チャットボット検証
- Abstract要約: デジタル双生児として高忠実な合成顧客エージェント(SCA)を作成する手法を提案する。
我々は,自動LLM-as-a-Judge評価,ヒューマンエキスパートテスト,敵対的探索を組み合わせたSCAベースの検証フレームワークを開発した。
- 参考スコア(独自算出の注目度): 2.163639266428698
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based chatbots are transforming customer service in regulated domains such as banking, but scalable and cost-effective validation remains a critical barrier to safe deployment. We present a two-part contribution for large-scale chatbot validation. First, we introduce a methodology for creating high-fidelity synthetic customer agents (SCAs) as digital twins, grounded in real transactional and conversational data, that enables automatic generation and behavioral conditioning to simulate diverse customer profiles and interaction styles. Evaluation demonstrates that SCAs achieve high semantic alignment with real customers, low hallucination rates, and successful personality trait reproduction with controllable interventions. Second, we develop an SCA-based validation framework combining automated LLM-as-a-Judge evaluation, human expert testing, and adversarial probing. Scenario-based validation across emotional states, demographic groups, and linguistic factors confirms robust performance. Our approach was used to validate a customer facing chatbot at a leading UK bank, providing financial institutions with a scalable pathway toward regulatory compliance.
- Abstract(参考訳): LLMベースのチャットボットは、銀行のような規制されたドメインでカスタマーサービスを変革しているが、スケーラブルで費用対効果の高い検証は、安全なデプロイメントにとって重要な障壁である。
大規模なチャットボットの検証に2つの貢献をする。
まず、実取引データと会話データに基づくデジタルツインとして高忠実な合成顧客エージェント(SCA)を作成する手法を紹介し、多様な顧客プロファイルやインタラクションスタイルをシミュレートするための自動生成と行動条件付けを可能にする。
評価は、SCAが実際の顧客と高いセマンティックアライメントを実現し、幻覚率を低くし、コントロール可能な介入でパーソナリティ特性の再現に成功したことを示す。
第2に、自動LCM-as-a-Judge評価、ヒューマンエキスパートテスト、および逆探索を組み合わせたSCAベースの検証フレームワークを開発する。
感情状態、人口統計学的グループ、言語的要因にわたるシナリオベースの検証は、堅牢なパフォーマンスを裏付ける。
当社のアプローチは、英国の主要銀行でチャットボットに直面する顧客を検証するために使用され、金融機関に規制コンプライアンスへのスケーラブルな経路を提供しました。
関連論文リスト
- FERA: Uncertainty-Aware Federated Reasoning for Large Language Models [60.52562148874846]
我々は、サーバがプライベートなデモンストレーションを行う異種クライアントと協調することで、多段階推論を改善するフェデレーション推論について研究する。
重要な課題は、クライアントの信頼性がクエリ依存であるのに対して、サーバはクライアントデータを検査して、どのコントリビューションが信頼できるかを判断できません。
本稿では,サーバクライアントの反復的コリファインメントに基づくトレーニングフリーフレームワークである Uncertainty-Aware Federated Reasoning (FERA) を提案する。
論文 参考訳(メタデータ) (2026-05-11T07:04:51Z) - Helping Customers in Distress: An LLM-powered Agent that Converses, Probes, and Routes [0.8738446148742723]
銀行は毎年数百万件の詐欺、詐欺、紛争の報告を受け取っている。
この問題に対処するため、顧客向けAI駆動トリアージエージェントを開発した。
マルチターン会話を行い、関連する質問をし、正確でポリシーを導いたルーティングのケースを分類する。
論文 参考訳(メタデータ) (2026-03-31T15:07:20Z) - ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders [48.83868690303791]
このギャップに対処するために設計された、人間とAIの会話の新しいデータセットであるConvApparelを紹介します。
そのユニークなデュアルエージェントデータ収集プロトコル -- "よい" と "悪い" のレコメンデータを使用する -- は、偽物検証を可能にする。
本稿では,統計的アライメント,人間的類似度スコア,および対実的検証を組み合わせた総合的検証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-18T23:00:21Z) - Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems [54.916243942641444]
大規模言語モデル(LLM)は、通信などの分野において、自動化の鍵となる存在として浮上している。
本研究では,問合せパイプラインによる意思決定を支援する,エッジクラウドに精通したLLMベースの知識システムについて検討する。
論文 参考訳(メタデータ) (2025-12-23T03:10:09Z) - AI-Salesman: Towards Reliable Large Language Model Driven Telemarketing [79.0112532518727]
我々はTeleSalesCorpusをリリースした。
次に、デュアルステージアーキテクチャを特徴とする新しいフレームワークであるAI-Salesmanを提案する。
提案したAI-Salesmanは,自動測定と総合的な人的評価の両方において,ベースラインモデルを大幅に上回ることを示す。
論文 参考訳(メタデータ) (2025-11-15T09:44:42Z) - OlaMind: Towards Human-Like and Hallucination-Safe Customer Service for Retrieval-Augmented Dialogue [24.141708335708387]
OlaMindは人型で幻覚に敏感な対話用フレームワークである。
本手法は,幻覚やビジネス上の重要なリスクを効果的に軽減しつつ,人間の類似性と自然性を著しく向上させる。
論文 参考訳(メタデータ) (2025-10-25T03:29:55Z) - MADS: Multi-Agent Dialogue Simulation for Diverse Persuasion Data Generation [10.585352489359684]
エージェントによるマルチターン対話を生成するスケーラブルなフレームワークMADS(Multi-Agent Dialogue Simulation)を提案する。
MADSには3つの調整されたエージェントがある: ユーザエージェントは、Zodiac SignsやMBTIタイプのようなパーソナライズ記号を活用することで、多様なペルソナ駆動の振る舞いをシミュレートするように設計されている。
さらに,ユーザによるCoA(Chain-of-Attitude)モデリングとLLMのパーサーション評価を通じて,その有効性を検証する。
論文 参考訳(メタデータ) (2025-09-30T06:55:39Z) - Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection [108.5042835056188]
この作業では,2つの基本的な問題に対処するため,Agent4FaceForgeryを導入している。
人間の偽造の多様な意図と反復的なプロセスを捉える方法。
ソーシャルメディアの偽造に付随する複雑な、しばしば敵対的な、テキストと画像のインタラクションをモデル化する方法。
論文 参考訳(メタデータ) (2025-09-16T01:05:01Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - Comprehensive Framework for Evaluating Conversational AI Chatbots [0.0]
本稿では,認知的・会話的知性,ユーザエクスペリエンス,運用効率,倫理的・規制的コンプライアンスの4つの側面にまたがるチャットボットの評価を行う,新たな評価フレームワークを提案する。
高度なAI方法論と金融規制を統合することで、このフレームワークは理論的基盤と現実のデプロイメント課題を橋渡しする。
論文 参考訳(メタデータ) (2025-02-10T02:27:34Z) - Evaluating Cultural and Social Awareness of LLM Web Agents [113.49968423990616]
CASAは,大規模言語モデルの文化的・社会的規範に対する感受性を評価するためのベンチマークである。
提案手法は,標準に違反するユーザクエリや観察を検知し,適切に応答するLLMエージェントの能力を評価する。
実験により、現在のLLMは非エージェント環境で大幅に性能が向上していることが示された。
論文 参考訳(メタデータ) (2024-10-30T17:35:44Z) - Augmenting Compliance-Guaranteed Customer Service Chatbots: Context-Aware Knowledge Expansion with Large Language Models [12.934175064411845]
検索ベースのチャットボットは、人間の検証されたQ&A知識を利用して、正確で検証可能な応答を提供する。
多様な顧客からの問い合わせを効果的に処理するために、セマンティックな意味を保持する「類似の質問」で知識ベースを増強することはコスト効率のよい戦略である。
本研究は,文脈認識型アプローチにより,包括的意味探索とソース・問合せ・問合せ関係の整合性を高めることを提案する。
論文 参考訳(メタデータ) (2024-10-16T10:48:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。