論文の概要: Data-Driven Personas for Survey Simulation: Insights into Simulation Alignment Across Data-Access Regimes
- arxiv url: http://arxiv.org/abs/2610.05828v2
- Date: Tue, 06 Oct 2026 07:14:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.393937
- Title: Data-Driven Personas for Survey Simulation: Insights into Simulation Alignment Across Data-Access Regimes
- Title(参考訳): サーベイ・シミュレーションのためのデータ駆動型ペルソナ:データ・アクセス・レジーム間のシミュレーションアライメントの考察
- Abstract要約: 異質な行動データ条件の匿名化エージェントから誘導される人物を対象とする集団レベルの調査シミュレーションについて検討した。
ドメイン外ソースから誘導されるペルソナは、基本的な人口統計情報にのみ条件付けされたシミュレーションを上回ることは滅多にない。
よりリッチな行動証拠は、より安定したペルソナ特性推定を可能にし、より良い未確認質問のシミュレーションアライメントに転送することができると結論付けている。
- 参考スコア(独自算出の注目度): 9.695429033693229
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) offer new opportunities for public opinion research by enabling early prediction of survey responses, potentially reducing the cost and time of traditional surveys. However, many existing steering approaches rely on target-domain human data for fine-tuning or prompting that is costly to collect and raises privacy concerns. In this paper, we study demographic group-level survey simulation, where personas induced from heterogeneous, anonymized public behavioral data condition agents that simulate responses of individuals from specific demographic groups. We examine whether representative personas can be induced from diverse sources and analyze how the domain, scale, and granularity of the source data affect survey simulation alignment. We find that personas induced from out-of-domain sources rarely outperform simulations conditioned only on basic demographic information, largely due to population mismatch. However, when personas are accurately assigned to the target demographic groups, alignment improves substantially. Finally, personas induced from target-domain survey data generalize better as more survey question history becomes available, suggesting that richer behavioral evidence enables more stable persona trait inference that transfers to better unseen questions simulation alignment.
- Abstract(参考訳): 大規模言語モデル(LLM)は、調査回答の早期予測を可能にし、従来の調査のコストと時間を削減することによって、世論調査の新しい機会を提供する。
しかし、多くの既存のステアリングアプローチは、細かい調整やプライバシー上の懸念を収集し上げるのにコストがかかるような、ターゲットドメインの人間データに依存している。
本稿では、異質な匿名化行動データ条件エージェントから誘導される人物が、特定の人口集団からの個人の反応をシミュレートする、人口集団レベルの調査シミュレーションについて検討する。
多様な情報源から代表的ペルソナを誘導できるかどうかを検証し,対象データの領域,規模,粒度が調査シミュレーションのアライメントに与える影響を分析する。
地域外情報源から引き起こされたペルソナは,人口ミスマッチが原因で,基本的な人口統計情報にのみ条件付けされたシミュレーションを上回ることは滅多にない。
しかし、対象の人口集団にペルソナを正確に割り当てると、アライメントは大幅に改善する。
最後に、対象領域調査データから誘導されるペルソナは、より多くのサーベイ質問履歴が利用可能になるにつれてより一般化され、よりリッチな行動証拠により、より安定したペルソナ特性推定が可能となり、より良い未確認質問シミュレーションアライメントへと移行することが示唆された。
関連論文リスト
- Generating Public Health Responses using Survey-Augmented Large Language Models [0.46906883107634084]
疫学モデルは、個人が健康に関する意思決定を行う方法を表すために、調査データに依存することが多い。
本研究では,大規模言語モデルが実人口で観測されたパターンを再現する合成サーベイ応答を生成できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-06-20T01:11:49Z) - Assessing the Reliability of Persona-Conditioned LLMs as Synthetic Survey Respondents [0.4277616907160855]
我々は、ペルソナ条件のシミュレーションの影響を評価するために、米国のマイクロデータの大規模なデータセットを使用します。
その結果,ペルソナ・プロンプトはサーベイアライメントにおいて明確な総合的改善を得られず,多くの場合,性能が著しく低下することがわかった。
本研究は,現在のペルソナ・シミュレーション・プラクティスの重大な影響を浮き彫りにするものである。
論文 参考訳(メタデータ) (2026-02-06T15:13:59Z) - Overstating Attitudes, Ignoring Networks: LLM Biases in Simulating Misinformation Susceptibility [7.616305266104683]
大規模言語モデル (LLM) は、計算社会科学における人間の判断のためのプロキシとして、ますます使われている。
LLMを模擬した調査の回答者が、誤情報信念と共有の人間のパターンを再現できるかどうかを検証した。
論文 参考訳(メタデータ) (2026-02-04T15:48:05Z) - Prompts to Proxies: Emulating Human Preferences via a Compact LLM Ensemble [46.82793004650415]
大規模言語モデル(LLM)は、様々なタスクにまたがる人間のような応答をエミュレートする可能性を実証している。
本研究では,LLMをエージェントプロキシとして扱う新しいアライメントフレームワークを提案する。
我々は、構造化されたプロンプトエンジニアリング、エントロピーに基づくサンプリング、回帰に基づく選択を用いて、LLMエージェントを代表的行動パターンに向けて操るシステムであるP2Pを紹介する。
論文 参考訳(メタデータ) (2025-09-14T15:08:45Z) - Population-Aligned Persona Generation for LLM-based Social Simulation [58.84363795421489]
本稿では,社会シミュレーションのための高品質な集団対応ペルソナ集合を合成するための体系的枠組みを提案する。
我々のアプローチは、長期のソーシャルメディアデータから物語的ペルソナを生成するために、大きな言語モデルを活用することから始まる。
特定のシミュレーションコンテキストのニーズに対処するために,対象のサブポピュレーションに対してグローバルに整合したペルソナを適応させるタスク固有モジュールを提案する。
論文 参考訳(メタデータ) (2025-09-12T10:43:47Z) - Human Preferences in Large Language Model Latent Space: A Technical Analysis on the Reliability of Synthetic Data in Voting Outcome Prediction [5.774786149181393]
大規模言語モデル(LLM)における人口統計特性と即時変動が潜在世論マッピングに与える影響を解析する。
LLMが生成したデータは、実世界の人間の反応で観測された分散を再現できないことがわかった。
政治分野では、ペルソナ・ツー・パーティのマッピングは限定的な分化を示しており、結果として、調査データに見られる意見の微妙な分布に欠ける合成データとなる。
論文 参考訳(メタデータ) (2025-02-22T16:25:33Z) - Specializing Large Language Models to Simulate Survey Response Distributions for Global Populations [49.908708778200115]
我々は,調査応答分布をシミュレートする大規模言語モデル (LLM) を最初に開発した。
テストベッドとして、我々は2つの世界文化調査の国レベルの結果を使用します。
予測された応答分布と実際の応答分布のばらつきを最小限に抑えるために, ファースト・ツーケン確率に基づく微調整法を提案する。
論文 参考訳(メタデータ) (2025-02-10T21:59:27Z) - Generative Agent Simulations of 1,000 People [56.82159813294894]
本稿では,1,052人の実人の態度と行動をシミュレートする新しいエージェントアーキテクチャを提案する。
生成エージェントは一般社会調査の参加者の回答を85%の精度で再現する。
我々のアーキテクチャは、人種的およびイデオロギー的グループにおける正確さのバイアスを、人口統計学的記述のエージェントと比較して低減する。
論文 参考訳(メタデータ) (2024-11-15T11:14:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。