論文の概要: CUEing User Simulators: Calibrated User Embeddings for Multi-Turn Benchmarking
- arxiv url: http://arxiv.org/abs/2610.02460v1
- Date: Thu, 01 Oct 2026 20:34:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.079683
- Title: CUEing User Simulators: Calibrated User Embeddings for Multi-Turn Benchmarking
- Title(参考訳): CUEing User Simulator: マルチスレッドベンチマークのためのキャリブレーションされたユーザ埋め込み
- Abstract要約: Calibrated User Embeddings (CUE)は、観察されたセッションをエンコードし、継続的な表現をサンプルし、それらをペルソナコマンドにデコードするフレームワークである。
2ドルのBenchでは、CUEdシミュレータは、シミュレータが分散したエラーが少なく、より忠実に実ユーザエージェントのエラーモードを再現する。
主にカスタマーサポートのインタラクションに適合した後、同じCUEdシミュレータはドキュメント作成、数学の学習、カジュアルな会話に一般化する。
- 参考スコア(独自算出の注目度): 5.827387573634597
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent benchmarks rely on user simulators to evaluate AI agents in multi-turn interaction. While existing simulation techniques demonstrate surface fidelity to human style and behavior, ecologically valid interactive benchmarking also requires alignment in when and how agents fail across simulated and real user populations. We find that existing simulators lack outcome calibration: agreement with observed success rates and failure patterns when real users interact with the same agent. We introduce Calibrated User Embeddings (CUE), a framework that both encodes observed sessions and samples continuous representations, then decodes them into persona commands to steer LLMs to act as user simulators without training. Through this, we evaluate user-conditioned replay of past sessions and aggregate metric agreement when sampling novel personas for the same tasks. On $τ^2$-Bench, CUEd simulators commit fewer simulator-attributed errors and more faithfully reproduce real-user agent failure modes, aggregate success rates, and outcomes for specific task-user pairs than other persona-based simulation methods. These gains coexist with competitive user fidelity as measured using metrics established in prior work. After being fit to mostly customer support interactions, the same CUEd simulators generalize to document creation, math tutoring, and casual conversation, and remain effective across different simulator LLMs without CUE retraining.
- Abstract(参考訳): 最近のベンチマークでは、マルチターンインタラクションにおいてAIエージェントを評価するために、ユーザシミュレータに依存している。
既存のシミュレーション技術は、人間のスタイルや行動に対する表面の忠実さを示すが、生態学的に有効なインタラクティブなベンチマークでは、エージェントがシミュレーションされた実際のユーザ集団にまたがってどのように失敗するかを調整する必要がある。
既存のシミュレータには結果のキャリブレーションがなく、実際のユーザが同じエージェントと対話する場合に観測された成功率と失敗パターンに一致している。
Calibrated User Embeddings (CUE)は、観察されたセッションをエンコードし、連続表現をサンプルするフレームワークで、それらをペルソナコマンドにデコードし、LCMを操り、トレーニングなしでユーザーシミュレーターとして機能させる。
そこで我々は,過去のセッションのユーザ・コンディショニングによるリプレイと,同じタスクに対して新規なペルソナをサンプリングする場合のメトリック・アグリート・アグリート・アグリート・アグリーメントを評価する。
τ^2$-Benchでは、CUEdシミュレータはシミュレータが分散したエラーが少なく、より忠実に実際のユーザエージェントのエラーモード、成功率、特定のタスクユーザペアの結果を他のペルソナベースのシミュレーション手法よりも再現する。
これらは、以前の作業で確立されたメトリクスを使用して測定された、競争力のあるユーザ忠実さと共存する。
主にカスタマーサポートのインタラクションに適合した後、同じCUEdシミュレータはドキュメント作成、数学のチュータリング、カジュアルな会話に一般化され、CUEの再トレーニングなしで異なるシミュレータLLMで有効である。
関連論文リスト
- TRACER: Trajectory-Aligned Learning for Multi-Turn User Simulation [13.030102131786906]
ユーザ意図の進化をモデル化し,シミュレーションされた軌跡を実物と整合させるマルチターンユーザシミュレータTRACERを提案する。
リファレンスコホートに組織された実際のカスタマーサービスセッションでは、TRACER-7Bが11.4の変換F1ポイントで最強のベースラインを越えた。
人間のチューリングテストでは、アノテータはTRACERの会話をほぼ精度で識別した。
論文 参考訳(メタデータ) (2026-09-23T18:30:12Z) - Measuring and Mitigating the Distributional Gap Between Real and Simulated User Behaviors [61.610957638373826]
本研究では,実際のユーザ行動とシミュレーションユーザ行動の分布ギャップを計測する手法を提案する。
実会話とシミュレーション会話のデータセットが与えられた場合,本手法は各会話からユーザ行動の表現を抽出する。
ほとんどのシミュレータも同様に振る舞うが、いくつかは独立している。
論文 参考訳(メタデータ) (2026-05-08T15:09:25Z) - Mind the Sim2Real Gap in User Simulation for Agentic Tasks [101.69142591891234]
ユーザシミュレーションにおけるSim2Realのギャップを形式化し、実際の人間に対して$$$-benchプロトコルを実行する最初の研究を示す。
LLMシミュレータは過度に協調的であり、スタイリスティックに均一であり、現実的なフラストレーションや曖昧さを欠いている。
これらの知見は, LLMベースのユーザシミュレータをエージェント開発サイクルで使用する際の人間による検証の重要性を強調した。
論文 参考訳(メタデータ) (2026-03-11T19:12:31Z) - Metaphorical User Simulators for Evaluating Task-oriented Dialogue
Systems [80.77917437785773]
タスク指向対話システム(TDS)は、主にオフラインまたは人間による評価によって評価される。
本稿では,エンド・ツー・エンドのTDS評価のためのメタファ型ユーザシミュレータを提案する。
また,異なる機能を持つ対話システムなどの変種を生成するためのテスタベースの評価フレームワークを提案する。
論文 参考訳(メタデータ) (2022-04-02T05:11:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。