論文の概要: Synthetic Data in Marketing Research: How to Evaluate and When to Trust
- arxiv url: http://arxiv.org/abs/2609.13995v2
- Date: Sat, 19 Sep 2026 14:12:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 03:38:27.33698
- Title: Synthetic Data in Marketing Research: How to Evaluate and When to Trust
- Title(参考訳): マーケティング研究における総合データ : 評価と信頼の方法
- Abstract要約: マーケティング研究における合成データに関する議論は、大きな言語モデル(LLM)が人間の不履行を時代遅れにするという主張と、それらを完全に回避するよう呼びかける主張との間を分断している。
総合的な回答者が働くかどうかではなく、いつ働くのか。
まず、我々は3種類の合成データを区別し、それぞれがサポートできる決定にマップする。
第2に, 精度測定の4つの家系の分類法を開発し, ほぼ完全から近精度まで, 報告された2つの精度の幅広い範囲が, 測定方法の質よりも測定対象の差異を反映していることが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Debate over synthetic data in marketing research has polarized between claims that large language models (LLMs) make human respondents obsolete and calls to avoid them entirely. We argue that both positions obscure the more useful question: not whether synthetic respondents work, but when. Building on Brand, Israeli, and Ngwe (2026), we make three contributions. First, we distinguish three types of synthetic data (ungrounded LLM responses, segment-level personas, and individual-level digital twins) and map each to the decisions it can support. Second, we develop a taxonomy of four families of accuracy measures and suggest that the wide range of reported twin accuracy, from near-perfect to near-chance, largely reflects differences in what is being measured rather than in method quality. Aggregate measures often perform well even when little information is supplied to the LLM, and can mask a complete absence of respondent-level differentiation. Third, we introduce the forgotten question problem, in which a question is omitted from a fielded study, as a setting for twin-based augmentation of existing data. We propose an ex-ante answerability diagnostic that requires no ground truth: the R^2 of a random forest predicting twin outputs from the data used to construct the twins. Across 108 attitude questions from a nationally representative survey (N = 3,063), screening at R^2 above 0.7 raises the mean twin-human individual-level correlation by 15% and reduces the share of poorly answered questions from 25.9% to 4.3%. Embedding similarity and experienced-researcher judgment provide correlated but weaker screens.
- Abstract(参考訳): マーケティング研究における合成データに関する議論は、大きな言語モデル(LLM)が人間の不履行を時代遅れにするという主張と、それらを完全に回避するよう呼びかける主張との間を分断している。
総合的な回答者が働くかどうかではなく、いつ働くのか。
Brand, Israel, and Ngwe(2026年)をベースとして3つのコントリビューションを行います。
まず,3種類の合成データ(LLM応答のアングラウンド化,セグメントレベルのペルソナ,個人レベルのディジタルツイン)を識別し,それぞれが支援できる決定にマップする。
第2に, 精度測定の4家系の分類法を開発し, ほぼ完全から近精度まで, 報告された双子の精度の幅広い範囲が, 測定方法の品質よりも測定対象の差異を反映していることが示唆された。
集約測度は、LLMにほとんど情報が供給されていない場合でもよく機能し、応答レベルの分化の完全な欠如を隠蔽することができる。
第3に、既存のデータのツインベース拡張の設定として、フィールドスタディから質問を省略する、忘れられた問題を導入する。
そこで本研究では,無作為林のR^2が双生児構築データから双生児のアウトプットを予測する手法を提案する。
全国的に代表される調査(N = 3,063)の108問中、R^2で0.7以上を検定すると、平均的な対人レベルの相関が15%上昇し、回答不足の質問のシェアが25.9%から4.3%に減少する。
類似性と経験的調査者の判断を組み込むことは、相関性はあるが弱い画面を提供する。
関連論文リスト
- FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect [69.8983512616053]
大規模な言語モデルは、しばしばユーザによる暗黙のスタンスと一致する微妙な言い換えに応答を変更する。
これによってユーザーは、根拠となる事実ではなく、どのようにして質問を言い表したかというアドバイスをユーザーに残すことができる。
FramingQAは、法律、医学、ファイナンス、ロボットシミュレーションにまたがるフレーミングに疑問を呈するモデル感度を測定するベンチマークである。
論文 参考訳(メタデータ) (2026-09-07T12:56:44Z) - Silicon Sampling via Cross-Survey Transfer [0.0]
シリコンサンプリングを利用した大規模言語モデル(LLMs)は、従来の調査研究を拡大するための有望なアプローチとして、人間の調査回答者をシミュレートする。
我々は,LLMが一つの質問に対して応答者の回答を与え,その回答を同じ質問から完全に異なる質問に対して予測する,より厳密な評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-03T08:22:18Z) - (Human) Attention Is (Still) All You Need: Human oversight makes AI-assisted social science reliable [15.442870614597451]
我々は、AI支援研究の信頼性は、モデル能力だけでなく、人間と機械の間で認知労働がどのように構成されているかにもかかっていると論じる。
我々は,この問題を,事前コミット,意思決定シーケンシング,説明責任,注意配分に基づく意思決定アーキテクチャであるHLER(Human-in-the-Loop Economic Research)を通じて研究する。
論文 参考訳(メタデータ) (2026-06-11T03:22:24Z) - Synthetic Personalities: How Well Can LLMs Mimic Individual Respondents Using Socio-Economic Microdata? [0.0]
我々はドイツ社会経済パネルから詳細な個別レベルの双子を構築した。
建設工法グリッドの3倍の5倍の2倍の2倍の3倍の評価を行う。
論文 参考訳(メタデータ) (2026-06-03T08:30:03Z) - Rectification Difficulty and Optimal Sample Allocation in LLM-Augmented Surveys [0.0]
大規模言語モデルは低コストで総合的なサーベイ応答を生成することができるが、その精度は質問によって予測不可能に変化する。
各タスクに安価なLCM予測が利用できる場合, 評価タスク全体にわたって, ヒトの定型予算を割り当てる設計問題について検討する。
まず、予測パワー推論に基づいて、推定器のばらつきがヒトのサンプルサイズでどれだけ早く減少するかを判断する、疑問特異的な補正の難しさを特徴付ける。
第2に,LLMの信頼性が低いタスクに対して,より人間的なラベルを指示するクローズドフォームの最適アロケーションルールを導出する。
論文 参考訳(メタデータ) (2026-04-19T05:45:37Z) - Emulating Public Opinion: A Proof-of-Concept of AI-Generated Synthetic Survey Responses for the Chilean Case [0.0]
大規模言語モデル (LLMs) は、調査研究における方法論的および応用的な革新のための有望な道を提供する。
チリの世論確率論的調査から, LLM生成型人工サーベイ応答の信頼性を評価する。
論文 参考訳(メタデータ) (2025-09-11T21:43:59Z) - Beyond Memorization: Reasoning-Driven Synthesis as a Mitigation Strategy Against Benchmark Contamination [77.69093448529455]
本稿では,arXiv論文から直接研究レベルのQAを合成するために,無限にスケーラブルなフレームワークを用いて実証的研究を行う。
各種サイズ,開発者,リリース日といったモデルについて,知識カットオフ日に近い性能劣化の欠如を評価した。
合成パイプラインで要求される多段階の推論は、浅い記憶よりも深い複雑さをもたらしたと仮定する。
論文 参考訳(メタデータ) (2025-08-26T16:41:37Z) - Retrieval-Augmented Generation with Conflicting Evidence [57.66282463340297]
大規模言語モデル (LLM) エージェントは、応答の事実性を改善するために、検索強化世代 (RAG) をますます採用している。
実際には、これらのシステムは曖昧なユーザクエリを処理し、複数のソースからの情報に衝突する可能性がある。
RAMDocs(Retrieval with Ambiguity and Misinformation in Documents)は,ユーザクエリのエビデンスを矛盾させるような,複雑で現実的なシナリオをシミュレートする新しいデータセットである。
論文 参考訳(メタデータ) (2025-04-17T16:46:11Z) - Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations [63.330182403615886]
大きな言語モデル(LLM)の実践的デプロイに対する大きな障壁は、信頼性の欠如である。
このことが特に顕著な3つの状況は、正しさ、未解決の質問に対する幻覚、安全性である。
人間のように、不確実性を理解する能力があるため、私たちが知らない質問への答えを控えるべきです。
論文 参考訳(メタデータ) (2024-04-16T23:56:38Z) - Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data [64.93285984013833]
我々は,ベルマンを使わずに,値関数を実現可能なオフライン強化学習の問題を再考する。
Xie と Jiang (2021) と Foster et al. (2022) による以前の研究は、軌道に基づくオフラインデータとともに集中係数が有界標本複雑性を統一するかどうかという疑問を解き放った。
論文 参考訳(メタデータ) (2024-03-25T18:28:45Z) - Composed Image Retrieval with Text Feedback via Multi-grained
Uncertainty Regularization [73.04187954213471]
粗い検索ときめ細かい検索を同時にモデル化する統合学習手法を提案する。
提案手法は、強いベースラインに対して+4.03%、+3.38%、+2.40%のRecall@50精度を達成した。
論文 参考訳(メタデータ) (2022-11-14T14:25:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。