論文の概要: Data-Driven Persona-Conditioned Agents for A/B Test Simulation
- arxiv url: http://arxiv.org/abs/2609.01038v1
- Date: Tue, 01 Sep 2026 10:35:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.58054
- Title: Data-Driven Persona-Conditioned Agents for A/B Test Simulation
- Title(参考訳): A/Bテストシミュレーションのためのデータ駆動型ペルソナ調整エージェント
- Authors: Ziyad Benomar, Weronika Łajewska, Leonardo Perelli, Saab Mansour,
- Abstract要約: データ駆動型ペルソナに条件付きLLMエージェントを用いて,A/Bテスト結果を予測するシミュレーションフレームワークを提案する。
合成または規則に基づくペルソナに依存する以前の作業とは異なり、エージェントは匿名化された行動データアクティビティーパターンから構築される。
最適構成は, 試験量に応じて0.75-0.90の方向精度を達成できる。
- 参考スコア(独自算出の注目度): 14.4702522133194
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A/B testing is the gold standard for evaluating product changes, but each experiment requires real user traffic, engineering effort, and weeks of measurement. We propose a simulation framework that predicts A/B test outcomes using LLM-powered agents conditioned on data-driven personas grounded in real user behavioral signals. Unlike prior work that relies on synthetic or rule-based personas, our agents are constructed from anonymized behavioral data-activity patterns, engagement signals, and inferred demographics-enabling more faithful population modeling. We frame A/B test simulation as a structured question task and systematically study (i) question design formats, (ii) the impact of persona data source and domain alignment, (iii) the trade-off between per-persona behavioral depth and population diversity, and (iv) efficient population subsampling. On a benchmark of 40 A/B tests spanning two metric types, our best configuration achieves 0.75-0.90 directional accuracy depending on the test metric, demonstrating that data-driven personas are a viable path toward fast, low-cost experiment pre-screening.
- Abstract(参考訳): A/Bテストは製品変更を評価するためのゴールドスタンダードですが、それぞれの実験には実際のユーザトラフィック、エンジニアリングの努力、数週間の計測が必要です。
実ユーザ行動信号に基づくデータ駆動型ペルソナを条件としたLCMエージェントを用いて,A/Bテスト結果を予測するシミュレーションフレームワークを提案する。
人工的あるいは規則に基づくペルソナに依存する以前の作業とは異なり、エージェントは匿名化された行動データ活動パターン、エンゲージメントシグナル、そしてより忠実な人口モデルによって構成されます。
構造化質問課題としてのA/Bテストシミュレーションと系統的研究
(i)質問デザイン形式
(II)ペルソナデータソースとドメインアライメントの影響
三 個人ごとの行動深度と人口多様性のトレードオフ
(4)効率的な人口サブサンプリング。
2つの測定基準にまたがる40のA/Bテストのベンチマークでは、テスト基準に依存する方向精度0.75-0.90を実現し、データ駆動型ペルソナが高速で低コストな実験前スクリーニングに向けた有効な道であることを実証した。
関連論文リスト
- Should I Use This Synthetic Dataset for Training? How to Test with Minimal Real Data [73.19814469893088]
デジタルツインと学習された世界モデルは、エンジニアリングシステムにおける人工知能(AI)モデルのトレーニングに利用可能な、少ない実際のデータセットを増大させる合成データを生成するために、ますます使われています。
本稿では,拡張データセットのトレーニングが真の,人口レベルのパフォーマンスを向上する一方で,実際のテストデータポイントを可能な限り少なく消費するかどうかを論じる。
合成データ分類タスク、DT支援無線パケットスケジューリングタスク、および無線マップ予測タスクにおいて、aeSFTは平均ベースのシーケンシャルテストよりもはるかに少ない実検サンプルを用いて有用な合成データを識別することを示す。
論文 参考訳(メタデータ) (2026-08-28T07:05:38Z) - SimAB: Simulating A/B Tests with Persona-Conditioned AI Agents for Rapid Design Evaluation [3.609531017498719]
我々は、ペルソナ条件のAIエージェントを用いた高速なプライバシー保護シミュレーションとしてA/Bテストを再構成するシステムであるSimABを提案する。
デザインのスクリーンショットと変換の目標が与えられたら、SimABはユーザーペルソナを生成し、それらを好みを述べ、結果を集約し、合理性を合成するエージェントとしてデプロイする。
論文 参考訳(メタデータ) (2026-03-01T10:08:27Z) - HumanStudy-Bench: Towards AI Agent Design for Participant Simulation [11.906370453952265]
大規模言語モデル (LLMs) は、社会科学実験のシミュレーション参加者としてますます使われている。
HUMANSTUDY-BENCHは、LLMベースのエージェントを編成し、人体実験を再構築するベンチマークおよび実行エンジンである。
科学的推論のレベルでの忠実度を評価するために,人間とエージェントの行動がどの程度一致しているかを定量化するための新しい指標を提案する。
論文 参考訳(メタデータ) (2026-01-31T12:07:42Z) - Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing [54.456400601801704]
A/Bテストのためのマルチモーダルユーザエージェント(A/Bエージェント)を提案する。
具体的には、A/Bテストのためのレコメンデーションサンドボックス環境を構築し、マルチモーダルおよびマルチページインタラクションを実現する。
モデル,データ,機能という3つの観点から,従来のA/Bテストに代わるエージェントの可能性を検証する。
論文 参考訳(メタデータ) (2026-01-08T03:33:43Z) - PUB: An LLM-Enhanced Personality-Driven User Behaviour Simulator for Recommender System Evaluation [9.841963696576546]
Personality-driven User Behaviour Simulator (PUB)は、パーソナライズされたユーザの振る舞いをモデル化するために、Big Fiveのパーソナリティ特性を統合している。
PUBは、行動ログ(例えば、評価、レビュー)とアイテムメタデータからユーザーの個性を動的に推論し、その後、実際のデータに対する統計的忠実性を保存するための合成相互作用を生成する。
Amazonレビューデータセットの実験では、PUBが生成したログは実際のユーザの行動と密接に一致し、パーソナリティ特性とレコメンデーション結果の間に有意義な関連性を明らかにする。
論文 参考訳(メタデータ) (2025-06-05T01:57:36Z) - TestAgent: An Adaptive and Intelligent Expert for Human Assessment [62.060118490577366]
対話型エンゲージメントによる適応テストを強化するために,大規模言語モデル(LLM)を利用したエージェントであるTestAgentを提案する。
TestAgentは、パーソナライズされた質問の選択をサポートし、テストテイカーの応答と異常をキャプチャし、動的で対話的なインタラクションを通じて正確な結果を提供する。
論文 参考訳(メタデータ) (2025-06-03T16:07:54Z) - AgentA/B: Automated and Scalable Web A/BTesting with Interactive LLM Agents [35.8650712223701]
A/Bテストは、ヒトの大規模でライブなトラフィックに依存しているため、依然として制限されている。
本稿では,ユーザインタラクション行動と実際のWebページを自動的にシミュレートする新しいシステムであるAgentA/Bを提案する。
以上の結果から, エージェントA/Bは人間の行動パターンをエミュレートできる可能性が示唆された。
論文 参考訳(メタデータ) (2025-04-13T21:10:56Z) - Downstream-Pretext Domain Knowledge Traceback for Active Learning [138.02530777915362]
本稿では、下流知識と事前学習指導のデータ相互作用をトレースするダウンストリーム・プレテキスト・ドメイン知識トレース(DOKT)手法を提案する。
DOKTは、トレースバックの多様性指標とドメインベースの不確実性推定器から構成される。
10のデータセットで行った実験は、我々のモデルが他の最先端の手法よりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-20T01:34:13Z) - ASPEST: Bridging the Gap Between Active Learning and Selective
Prediction [56.001808843574395]
選択予測は、不確実な場合の予測を棄却する信頼性のあるモデルを学ぶことを目的としている。
アクティブラーニングは、最も有意義な例を問うことで、ラベリングの全体、すなわち人間の依存度を下げることを目的としている。
本研究では,移動対象領域からより情報のあるサンプルを検索することを目的とした,新たな学習パラダイムである能動的選択予測を導入する。
論文 参考訳(メタデータ) (2023-04-07T23:51:07Z) - Delving into Identify-Emphasize Paradigm for Combating Unknown Bias [52.76758938921129]
同定精度を高めるため,有効バイアス強調スコアリング法(ECS)を提案する。
また, マイニングされたバイアスアライメントとバイアスコンプリケート試料のコントリビューションのバランスをとるために, 勾配アライメント(GA)を提案する。
様々な環境で複数のデータセットで実験を行い、提案されたソリューションが未知のバイアスの影響を軽減することを実証した。
論文 参考訳(メタデータ) (2023-02-22T14:50:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。