論文の概要: Screen Before You Serve: Simulation for Production Customer Experience AI Agents at 140M Scale
- arxiv url: http://arxiv.org/abs/2609.30137v1
- Date: Thu, 24 Sep 2026 17:07:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.14139
- Title: Screen Before You Serve: Simulation for Production Customer Experience AI Agents at 140M Scale
- Title(参考訳): 顧客体験AIエージェントを1億4000万スケールでシミュレーションする「Screen Before You Serve」
- Abstract要約: 提案手法は,候補CXエージェントをデプロイ前にスクリーニングするための仮説駆動シミュレーションワークフローを提案する。
我々は、NubankのCard DeliveryエージェントにSnowglobeシミュレータを使用し、その拡張後継であるCard Managementを使用します。
4つのデプロイされたバージョンにまたがって、シミュレートされたバージョンレベルのバイナリ評価器スコアは高い相関性を示している。
- 参考スコア(独自算出の注目度): 6.610417132503325
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Customer experience (CX) agents use tools and large language models to address customer requests and guide conversational interactions with an organization's products. Improving these agents, especially in regulated industries, is difficult: they must detect intent, follow complex operational policies and use tools reliably. Manual end-to-end testing offers limited coverage, while live experiments expose customers to failures that can erode trust. We present a hypothesis-driven simulation workflow for screening candidate CX agents before deployment. Synthetic customers react to agent responses and simulated tool outputs enable multi-step agentic workflows without invoking production backends. We use the Snowglobe simulator on Nubank's Card Delivery agent and its expanded successor, Card Management - Nubank's highest-volume chat-support agent in Brazil. Across 4 deployed versions, simulated and production version-level binary evaluator scores show high correlation. Simulation-guided iteration increased transactional net promoter score (tNPS) by 36.69 points in a live A/B test. We also screened open-weight configurations in over 16,000 simulated conversations. In a subsequent live A/B test, the selected model increased self-service rate (SSR) by 8.82 percentage points to the highest level observed at Nubank, with no statistically significant change in tNPS. Simulation made broad exploration of models, reasoning settings, and prompts feasible without customer exposure, enabling production improvements that would have been impractical to pursue through live experimentation alone.
- Abstract(参考訳): 顧客エクスペリエンス(CX)エージェントは、顧客の要求に対処し、組織の製品との対話をガイドするために、ツールと大きな言語モデルを使用する。
これらのエージェントの改善、特に規制された業界では、意図を検出し、複雑な運用方針に従い、確実にツールを使用する必要がある。
手動のエンドツーエンドテストは、限定的なカバレッジを提供する一方で、ライブ実験は、顧客が信頼を損なう可能性のある障害を露呈する。
提案手法は,候補CXエージェントをデプロイ前にスクリーニングするための仮説駆動シミュレーションワークフローを提案する。
シンセティックな顧客はエージェントの応答に反応し、シミュレートされたツール出力はプロダクションバックエンドを呼び出すことなく、多段階のエージェントワークフローを可能にする。
我々は、NubankのCard DeliveryエージェントにSnowglobeシミュレータを使用し、その拡張後継であるCard ManagementをブラジルにおけるNubankの最高額のチャットサポートエージェントとして使用しています。
4つのデプロイされたバージョンにまたがって、シミュレートされたバージョンレベルのバイナリ評価器スコアは高い相関性を示している。
シミュレーション誘導繰り返しは、実動A/Bテストでトランザクショナルネットプロモータースコア(tNPS)を36.69ポイント増加させた。
また、16,000以上のシミュレートされた会話で、オープンウェイトな設定をスクリーニングしました。
その後のライブA/Bテストでは、選択されたモデルがNubankで観測された最高レベルの8.82ポイントの自己サービス率(SSR)を上昇させたが、統計的に有意な変化はなかった。
シミュレーションは、モデル、推論設定を幅広く探究し、顧客の露出なしに実現できるようにし、ライブ実験だけでは実行不可能な生産改善を可能にした。
関連論文リスト
- AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems [82.01232437066487]
AgentXはプロダクションデプロイされたマルチエージェントシステムで、このプロダクション機能を再構築する。
自律的に生成し、実装し、評価し、レコメンデーション実験から学ぶ。
AgentXは4つの密結合したステージをクローズドループでオーケストレーションする。
論文 参考訳(メタデータ) (2026-06-25T10:42:28Z) - SalesSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators [63.68151307455963]
本稿では,マルチモーダル大規模言語モデル(MLLM)の現実的,ペルソナ主導の顧客行動のシミュレート能力を評価するためのフレームワークとテストベッドであるSalesSimを紹介する。
我々は,シミュレータの動作とペルソナ仕様との整合性,および会話品質を測定する。
実験により,UserGRPOは,会話品質を改善しつつ,ベースラインモデルの整合性を13.8%向上させることを示した。
論文 参考訳(メタデータ) (2026-05-08T17:59:23Z) - AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts [35.52607495764441]
大規模言語モデル(LLM)に基づく自律エージェントは、経済的生産に大きく貢献する多面的能力を示す。
我々は、毎日のAI使用から派生したベンチマークであるAgentBenchを紹介し、32の現実シナリオにわたる6つのコアエージェント能力を評価した。
これらのシナリオでは、平均90のツールコール、100万のトークン、解決に必要な実行時間が必要です。
論文 参考訳(メタデータ) (2026-01-16T07:22:20Z) - Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing [54.456400601801704]
A/Bテストのためのマルチモーダルユーザエージェント(A/Bエージェント)を提案する。
具体的には、A/Bテストのためのレコメンデーションサンドボックス環境を構築し、マルチモーダルおよびマルチページインタラクションを実現する。
モデル,データ,機能という3つの観点から,従来のA/Bテストに代わるエージェントの可能性を検証する。
論文 参考訳(メタデータ) (2026-01-08T03:33:43Z) - How can we assess human-agent interactions? Case studies in software agent design [52.953425368394306]
我々は,人間とエージェントの相互作用の厳密な評価に向けて,二つの大きな一歩を踏み出した。
エージェント設計のより効率的な人間中心評価のためのフレームワークであるPULSEを提案する。
私たちは、オープンソースのソフトウェアエージェントOpenHandsを中心に構築された大規模なWebプラットフォームにフレームワークをデプロイします。
論文 参考訳(メタデータ) (2025-10-10T19:04:28Z) - Configurable multi-agent framework for scalable and realistic testing of llm-based agents [7.459112445054928]
大言語モデル(LLM)エージェントは複雑で文脈に敏感な振る舞いを示す。
我々は,LLMベースのシステムの現実的マルチターン評価を自動化するフレームワークであるNeoを提案する。
論文 参考訳(メタデータ) (2025-07-19T17:51:25Z) - MASS: Muli-agent simulation scaling for portfolio construction [17.363056358369143]
本稿では,マルチエージェント・スケーリング・シミュレーション(MASS)を紹介する。
MASSの中核は、不均一なエージェントの最適分布を動的に学習するために、後方最適化プロセスを採用する。
エージェントの数が指数関数的に増加するにつれて(最大512まで)、集約された決定は徐々に過剰なリターンを増大させる。
論文 参考訳(メタデータ) (2025-05-15T13:27:18Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。