論文の概要: Can AI Agents Simulate A/B Test Outcomes? A Validation Framework for Agentic Experimentation
- arxiv url: http://arxiv.org/abs/2608.02345v1
- Date: Mon, 03 Aug 2026 14:58:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.61225
- Title: Can AI Agents Simulate A/B Test Outcomes? A Validation Framework for Agentic Experimentation
- Title(参考訳): AIエージェントはA/Bテストの結果をシミュレートできるか?エージェント実験のための検証フレームワーク
- Abstract要約: A/Bテストは、テクノロジ業界における新機能の標準であり続けている。
AIエージェントは、行動プロファイルと介入のコンテキスト記述に基づいて、--- 実際のトラフィックをコミットする前に、候補者の処置を精査するのに十分な結果をシミュレートできますか?
我々は,この問題をEmphSimulated Randomized Controlled Trial (S-RCT) として定式化し,エージェント近似誤差をサブサンプリング誤差から分離する2層誤差分解を導出する。
- 参考スコア(独自算出の注目度): 1.4180331276028662
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A/B testing remains the standard for rolling out new features in the technology industry. Each experiment, however, consumes real traffic, engineering effort, and weeks of wall-clock time. Can AI agents---conditioned on behavioral profiles and contextual descriptions of the intervention---simulate outcomes accurately enough to vet candidate treatments before committing live traffic? We formalize this question as a \emph{Simulated Randomized Controlled Trial} (S-RCT) and derive a two-layer error decomposition that separates agent approximation error from subsampling error, enabling targeted improvements to each. The framework is agent-agnostic: any behavioral model---from a fine-tuned specialist to a general-purpose foundation model---can serve as the simulation engine. Validated on 67 historical marketing A/B tests, a baseline S-RCT using an off-the-shelf foundation model captures directional signal (sign overlap 0.70) but systematically overshoots effect magnitudes. A two-phase pre-period calibration protocol reduces the squared prediction error (after removing irreducible measurement noise) by ${\sim}77\times$; a within-subject design---where each agent is exposed to both arms---reduces standard errors by ${\sim}2.4\times$. We discuss limitations of the current approach and identify applications where experimenters stand to benefit from agentic signals.
- Abstract(参考訳): A/Bテストは、テクノロジ業界における新機能の標準であり続けている。
しかし、それぞれの実験では、実際の交通量、エンジニアリングの労力、数週間のウォールタイムを消費する。
AIエージェントは、行動プロファイルと介入のコンテキスト記述に基づいて、--- 実際のトラフィックをコミットする前に、候補者の処置を精査するのに十分な結果をシミュレートできますか?
本稿では,この問題を<emph{Simulated Randomized Controlled Trial} (S-RCT) として定式化し,エージェント近似誤差をサブサンプリング誤差から分離する2層誤差分解を導出し,それぞれを目標とした改善を可能にする。
微調整されたスペシャリストから汎用的なファンデーションモデルまで、どんな行動モデルでも、シミュレーションエンジンとして機能します。
67の歴史的マーケティングA/Bテストで検証され、既製の基礎モデルを用いたベースラインのS-RCTは方向信号(符号オーバーラップ0.70)をキャプチャするが、体系的には効果の大きさをオーバーシュートする。
二相前周期キャリブレーションプロトコルは、正方形の予測誤差を${\sim}77\times$, in-subjectデザインで減らし、各エージェントを両腕に露出させる---- 標準エラーを${\sim}2.4\times$で還元する。
我々は,現状のアプローチの限界について議論し,エージェント信号の恩恵を受ける実験者がいるアプリケーションを特定する。
関連論文リスト
- Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems [47.66236392009794]
LLM(Large Language Model)ベースのエージェントは、様々な複雑な対話的タスクにおいて、例外的なパフォーマンスを示す。
textitTrajectory Graph Copilot は LLM エージェントの副操縦士' として機能する新しいフレームワークで,実行前に潜在的な動作エラーを診断する。
論文 参考訳(メタデータ) (2026-07-29T20:14:43Z) - Toward Auditable Fraud Detection: Combining Graph Features, Model Explanations, and Agentic Case Investigation [0.0]
不正検出システムは、説明可能でレビュー可能なまま、トランザクションボリュームの上昇とともにスケールする必要がある。
本研究では,勾配ブースト型分類器,グラフに基づく構造特徴,オートエンコーダに基づく異常信号,および調査エージェントを組み合わせた層状パイプラインについて検討する。
我々は,各コンポーネントは特定の条件下でのみ寄与し,調査エージェントからのもっともらしい根拠は,よりよい判断の証拠ではないと結論づける。
論文 参考訳(メタデータ) (2026-07-21T16:37:41Z) - Interventional Causal Circuits for Safe Robot Action Testing and Failure Recovery [4.492262382019958]
運動パラメータの形式的テストは計算に費用がかかり、コストはアクション空間の次元に悪影響を及ぼす。
本稿では,JPT(Joint Probability Tree)とMarginal-Deterministic Variable Tree(Marginal-Deterministic Variable Tree)から派生した因果回路を結合した閉ループフレームワークを提案する。
このフレームワークは、ロボットが動作を開始する前に全ての介入クエリのトラクタビリティを検証し、サポート外候補を自動的に検出し、修正から除外する。
論文 参考訳(メタデータ) (2026-07-16T10:41:20Z) - Conformal Agent Error Attribution [12.400746451700945]
本稿では,共形予測(CP)に基づく誤り帰属の枠組みを提案する。
エージェントトラジェクトリなどのシーケンシャルデータ用に設計されたフィルタベースCPの新しいアルゴリズムを提案する。
我々の全体的なアプローチはモデルに依存しないものであり、MASエラーの帰属に対する原則的不確実性層を提供する。
論文 参考訳(メタデータ) (2026-05-07T18:00:07Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z) - Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents [58.00130492861884]
TraitBasisは、AIエージェントを体系的にストレステストするための軽量でモデルに依存しない方法である。
TraitBasisは、ステアブルなユーザ特性に対応するアクティベーション空間で方向を学習する。
We observed on average a 2%-30% performance degradation on $tau$-Trait across frontier model。
論文 参考訳(メタデータ) (2025-10-06T05:03:57Z) - Reliability, Embeddedness, and Agency: A Utility-Driven Mathematical Framework for Agent-Centric AI Adoption [0.0]
我々は,マルチステップタスクを実行するエージェント中心のAIシステムの採用を継続するための3つの公理を定式化する。
我々は、崩壊するノベルティ用語と成長するユーティリティ用語の和として、採用をモデル化する。
論文 参考訳(メタデータ) (2025-08-18T12:53:38Z) - Detecting Rewards Deterioration in Episodic Reinforcement Learning [63.49923393311052]
多くのRLアプリケーションでは、トレーニングが終了すると、エージェント性能の劣化をできるだけ早く検出することが不可欠である。
我々は,各エピソードにおける報酬が独立でもなく,同一に分散した,マルコフでもない,エピソード的枠組みを考察する。
平均シフトは、時間信号の劣化(報酬など)に対応する方法で定義し、最適な統計的パワーでこの問題の試行を導出する。
論文 参考訳(メタデータ) (2020-10-22T12:45:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。